MiMo v2.6 Pro, до переделки
Храните не только первичные данные, но и производные: что не получилось и почему. Тогда агент прочитает историю и не повторит чужую ошибку.
Факты и производные в одном месте накапливают ошибки: пара неточностей порождает следующие. Операционный опыт (что получалось, что нет) держите в скиллах…
Это рассказ участника о своей базе знаний. Модель подала его как мой совет. Абзацем ниже она же советует обратное.
Та же MiMo v2.6 Pro, после
Один из участников потока ведёт вики по методу LLM Wiki. … Там же живёт вторичный опыт: что не получилось и каким путём пошли дальше. Серёжа называет это альтернативой с другим подходом.
У Серёжи был негативный опыт, когда факты и производные лежали в одном месте. Как только он переставал контролировать процесс, ошибки копились как снежный ком. Поэтому операционный опыт он держит в скиллах…
Чьи это слова, видно сразу. Серёжа в конспекте это я.
Этот кусок взят из конспекта моей встречи с участниками программы. Первый вариант написала недорогая модель MiMo v2.6 Pro, и она приписала мне чужой совет. Второй написала та же модель после того, как агент за ночь переделал пайплайн, по которому она работает. Агент раз за разом запускал девять моделей, звал модели-судей и откатывал то, что не помогало. Я дал задачу, выбрал модели из своих подписок и несколько раз спросил, что значат его цифры.
Почему модель ошиблась. Она не знала, кто из говорящих я. В расшифровке голоса подписаны метками S0, S1, S2, а в задании модели прямо стояло: «метки: это голоса, не имена». Вот она и подала опыт участника как мой совет.
Этот гайд для тех, кто отдаёт модели разбирать записи встреч, переписку или документы. Вы не знаете, какую модель взять и почему она ошибается, а про эвалы не слышали. Здесь мало технических подробностей и много объяснений: какие ошибки модель делает чаще всего, какую работу у неё можно забрать совсем и как проверить модели на своей задаче. В конце короткий ответ, какую модель брать, и шаги, чтобы повторить замер у себя.
Чтобы было меньше, эффективней и быстрее, и модель по качеству почти любая делала хорошо.
Моя задача агенту. С неё всё началось
Что вообще произошло
У меня есть программа Personal Corp. Раз в неделю я отвечаю на вопросы участников в прямом эфире, это называется Office Hours. Запись потом превращается в страницу: конспект, главы видео, описание. С октября это делает мой сервер сам, без человека. А читают конспект люди, которые встречу не видели, и действуют по нему.
Это задача на знания, пожалуй, самая частая работа, которую сейчас отдают моделям. Модель читает длинный источник и пишет текст, по которому люди будут действовать. Конспект встречи здесь частный случай. Сюда же протокол созвона, сводка рабочего чата за неделю, выжимка из договора, разбор отзывов клиентов, ответ на вопрос по базе знаний. Ошибки в таких текстах тихие. Смысл чуть сдвинут, или слова одного человека приписаны другому. Ошибку не заметит никто: текст для того и пишут, чтобы запись не пересматривать.
Чаще всего модель ошибалась одинаково. Она берёт рассказ участника и подаёт его как мой совет. На первом экране как раз такой случай. Участник рассказал, как устроена его база знаний, и в конспекте это стало правилом «храните». Я на встрече говорил обратное, и абзацем ниже модель это честно пересказала. Ученик получил бы два совета, которые спорят друг с другом. Редакторы называют это ошибкой атрибуции: слова одного человека приписаны другому.
Раньше конспект писал агент: программа на основе модели, которая сама открывает файлы, читает инструкции и пишет результат. Это удобно, но дорого и непредсказуемо. Как именно он работал, я покажу ниже. Какая модель справляется лучше, я знал только по ощущениям.
Почему поправить это можно именно сейчас. В марте 2026 года Андрей Карпатый выложил autoresearch. Это агент, который за ночь сам ставит около сотни опытов над обучением маленькой модели. Каждый опыт он меряет одной и той же линейкой. Стало лучше, правка остаётся. Стало хуже, откатывается. Человек правит только один файл с целью и запретами. Тот же приём работает и на обычной офисной задаче вроде пересказа встречи. Для этого хватает подписок на модели и одной ночи.
Несколько слов, которые встретятся дальше:
Что нам понадобилось
Девять моделей из четырёх подписок, которые я и так оплачиваю. Токены: сколько текста модели прочитали за все попытки, без работы судей.
- Две настоящие записи. Две встречи Office Hours, час и полтора часа разговора. Плюс один конспект, который я выправил руками: по нему видно, как должно быть.
- Сервер. Недорогие модели писали конспекты на моём сервере, по десять сразу. Так попытки идут параллельно и не занимают мой компьютер: если свой не тянет десяток одновременно, их берёт сервер. Агент следил, чтобы замер не тормозил соседние сервисы.
- Два судьи из разных семей. Opus от Anthropic и Codex от OpenAI. Каждый конспект читали оба, итог считался по двум.
- Одна ночь. Агент запускал попытки до утра, всего их вышло больше двухсот.
- Человек на четыре решения. Цель, список моделей, правила замера и вопрос «а что значат эти цифры». Остальное агент сделал сам.
Как мы это сделали
Зачем замер. Без него любая переделка держится на ощущении: прочитал пару конспектов, вроде стало лучше. Модель каждый раз пишет по-разному, и на глаз удачную попытку от улучшения не отличить. Замер, он же эвал из словарика, даёт одно число до переделки. С ним сравнивается каждая следующая версия пайплайна.
Работа шла в два хода. Сначала замер старого пайплайна. Потом переделки по одной, и после каждой тот же замер.
Сначала замер. Агент запустил старый пайплайн на всех девяти моделях. Каждая писала конспект обеих встреч по два раза: модель каждый раз пишет по-разному, и одна попытка ничего не доказывает. Потом оба судьи читали каждый конспект рядом с записью и выписывали правки. У каждой правки свой вид: выдумка, искажённый смысл, ошибка атрибуции, неверное название, глава не на своём месте.
Результат меня отрезвил. Из 36 конспектов судьи пропустили бы без серьёзных правок ровно один. Даже у Opus оставалось около восьми мест, которые стоило поправить. В первых цифрах у него было 11. Я не понял, что это значит, и спросил:
Что такое 11 правок для человека?
моё сообщение агенту, когда пришли первые цифры
Агент разложил один конспект по строкам. Половина правок в нём была про то, чьи это слова.
Потом линейка. Я вспомнил про autoresearch Карпатого и спросил, не то же ли это самое. Оказалось, та же идея: одна мерка, замороженная проверка и правило «стало хуже, верни как было». Потом спросил, ничего ли, что замер ведёт тот же агент, который улучшает пайплайн. Он ведь может «улучшить» результат, подкрутив судью. Поэтому линейку заморозили: записи встреч, инструкцию судей и проверки больше никто не трогает. Цель и правила лежат в одном файле, и правлю его только я.
Дальше переделка. Главная мысль простая: модели остаётся только смысл. Чтобы было видно, что это значит, покажу, как пайплайн работал раньше и как работает теперь.
Как было. Модель получала короткое задание и список адресов файлов, которые нужно прочитать. Два скилла целиком: как писать конспект и правила письма со словарём. Конспект прошлой встречи как образец. Словарь терминов. Расшифровку записи, причём дважды: со временем каждой реплики и абзацами. И чат встречи. Модель работала агентом. Сама открывала каждый файл, читала и сама писала пять файлов: исправленную расшифровку, конспект, главы, заголовок страницы и описание для YouTube.
Это дорого. Агент на каждом шаге заново отправляет модели всё, что уже прочитал. Открыл десятый файл, и модель снова получает первые девять. Так набегало от одного до десяти миллионов токенов на один конспект. Токены: кусочки текста, по ним подписка считает лимит. И отсюда путаница из примера в начале: кто из говорящих я, модель не знала.
Как стало. Файлы читает программа и берёт из каждого только нужное. Из скилла правил письма остаётся список слов, которые надо писать иначе. Из словаря терминов остаётся список правильных названий. Скилл про конспект и образец больше не нужны: короткие правила и шаблон ответа теперь в задании. Всё это программа складывает в один промпт вместе с чатом и расшифровкой. Промпт: текст, который модель получает целиком за один раз. В нём прямо сказано: S0 это Серёжа, остальные участники, а что рассказал участник, пиши как его опыт. Какая метка моя, программа определяет сама: на своих встречах больше всех говорю я.
Модель отвечает обычным текстом из трёх частей: конспект, главы строками «время, название» и описание для YouTube. Файлов она не открывает и не пишет. Остальное делает обычная программа. Правит названия в расшифровке по словарю, ставит время каждой главы на начало настоящей реплики, собирает файлы страницы и проверяет форму. Было «вот адреса, иди читай и делай файлы». Стало «вот всё в одном промпте, ответь текстом».
Подробнее новый пайплайн выглядит так. Три шага делает модель, три обычная программа.
После модели работают двое проверяющих. Если программа нашла ошибку, модель исправляет только эти строки и больше ничего не трогает. Потом ещё одна модель, критик, вычитывает текст и присылает замены: вот фрагмент, вот как надо. Вставляет их программа. Если замена что-то сломала, текст откатывается к версии до критика.
Как агент искал новый пайплайн: что пробовал и что вышло. Переделки шли по одной, и после каждой тот же замер на всех моделях. Замер оценивается баллами: сколько стоит довести конспект. Мелкая правка стоит 1 балл. Серьёзная, которая собьёт читателя, стоит 3. Критичная, которая даст ему ложь или чужие личные данные, стоит 10. Баллы двух судей усредняются. У модели берётся середина её попыток, у замера середина по девяти моделям. Меньше значит лучше.
| Что поменяли | Что стало |
|---|---|
| Модель получает всё одним промптом и отвечает текстом. В задании правила про личные подробности, названия и «не усиливать сказанное» | правок заметно меньше: 29 → 15,5 балла |
| Проверка конспекта всегда по кускам | качество то же, токенов вчетверо больше: откатили |
| Две починки для отдельных моделей, которые сбоили | на общий результат почти не повлияли |
Первые три переделки в одной строке. Баллы: критичная правка × 10, серьёзная × 3, мелкая × 1, медиана по девяти моделям
Что показал замер. Сравниваю старый пайплайн с тем, что сейчас работает на сервере. Ошибка атрибуции стала редкой. У GLM 5.3 таких мест было около восьми на конспект, стало около одного. У Sonnet было шесть, осталось меньше одного.
| Модель | Атрибуция | Искажение смысла | Серьёзные | Критичные |
|---|---|---|---|---|
| Codex 6.1 Sol | 1,6→0,1 | 1,4→0,9 | 1,5→0,6 | 0,0→0,0 |
| Opus 5.5 | 3,4→0,4 | 3,0→0,6 | 3,5→0,4 | 0,0→0,2 |
| Sonnet 5.5 | 6,4→0,2 | 6,2→3,2 | 5,9→1,5 | 0,0→0,1 |
| GLM 5.3 | 7,9→1,1 | 6,6→4,9 | 8,8→2,9 | 0,2→0,5 |
| GLM 5.3 Flash | 6,1→1,4 | 7,2→4,8 | 7,0→2,5 | 0,2→0,0 |
| MiMo v2.6 Pro | 8,5→1,4 | 6,9→4,6 | 9,6→3,0 | 0,2→0,6 |
| MiMo v2.6 Flash | 6,5→1,7 | 9,6→5,8 | 9,0→4,2 | 0,1→0,0 |
| DeepSeek v4 Pro | 4,0→1,1 | 4,6→4,2 | 6,0→2,6 | 0,0→0,2 |
| DeepSeek v4.1 Flash | 3,4→1,0 | 4,2→3,5 | 5,6→3,9 | 0,2→0,9 |
До переделок → после. Среднее правок на текст, оба судьи. Серьёзная правка собьёт читателя, критичная даст ему ложь или чужие личные данные
Сильные модели стали почти чистыми. По оценке судей Opus и Codex, Opus и Codex оставляют около четырёх правок на конспект. В половине их конспектов судьи не нашли ни одной серьёзной. Пишут они за три-четыре минуты.
Модель перестала читать запись по кругу. Всего прочитанного стало в десятки раз меньше. Почти всё старое было повторным чтением одного и того же, а повторное чтение подписка считает намного дешевле нового текста. Поэтому настоящий выигрыш скромнее: нового текста модель читает в два-пять раз меньше.
| Модель | Весь вход, тыс. токенов | Без кэша, тыс. токенов | Минут |
|---|---|---|---|
| Codex 6.1 Sol | 1 711→117в 15 раз | 148→59 | 6,7→4,1 |
| Opus 5.5 | 2 130→79в 27 раз | 159→79 | 4,6→3,1 |
| Sonnet 5.5 | 1 207→81в 15 раз | 155→81 | 3,7→2,7 |
| GLM 5.3 | 2 528→51в 50 раз | 259→51 | 20,1→20,7 |
| GLM 5.3 Flash | 3 196→51в 63 раза | 270→51 | 29,9→21,3 |
| MiMo v2.6 Pro | 7 009→168в 42 раза | 295→168 | 51,0→38,3 |
| MiMo v2.6 Flash | 10 025→214в 47 раз | 346→214 | 41,2→38,5 |
| DeepSeek v4 Pro | 5 878→56в 105 раз | 364→56 | 15,4→15,0 |
| DeepSeek v4.1 Flash | 4 177→402в 10 раз | 320→402 | 11,5→23,6 |
До переделок → после. Медиана по попыткам на один конспект. Без кэша: весь вход минус повторное чтение кэша
Недорогие модели подтянулись, но до сильных не дошли. У GLM, MiMo и DeepSeek осталось от 12 до 18 правок на конспект. Чаще всего они слегка сдвигают смысл сказанного. Так что цель «почти любая модель» пока взята наполовину.
Какую модель брать. Это выводы на моих двух встречах, на ваших задачах цифры будут другими.
| Модель и подписка | Правок на текст | Минут на встречу | Как есть | Когда брать |
|---|---|---|---|---|
| Codex 6.1 SolChatGPT | 4,0 | 4,1 | 2 из 4 | Текст уйдёт людям после беглой вычитки |
| Opus 5.5Claude Max | 4,5 | 3,1 | 2 из 4 | То же, и быстрее всех из точных |
| Sonnet 5.5Claude Max | 8,0 | 2,7 | 0 из 4 | Быстрый черновик, который вы вычитаете |
| GLM 5.3Z.ai Coding Plan | 11,8 | 20,7 | 0 из 4 | Черновик без подписок Claude и ChatGPT, вычитка обязательна |
| GLM 5.3 FlashZ.ai Coding Plan | 12,2 | 21,3 | 0 из 4 | Как GLM 5.3: в замере разницы почти нет |
| MiMo v2.6 ProOpenCode Go | 14,2 | 38,3 | 0 из 4 | Если время не важно. Проверяйте личные подробности |
| DeepSeek v4 ProOpenCode Go | 15,8 | 15,0 | 0 из 4 | Черновик. Проверяйте личные подробности |
| DeepSeek v4.1 FlashOpenCode Go | 17,2 | 23,6 | 0 из 4 | Под эту задачу я бы не брал: после оптимизации стал хуже |
| MiMo v2.6 FlashOpenCode Go | 17,5 | 38,5 | 0 из 3 | Медленно и много правок |
Правок: медиана по попыткам, в каждой попытке среднее двух судей. Минут: время всего пайплайна на одну встречу, медиана. Как есть: попытки, которые оба судьи пропустили бы без серьёзных правок. У MiMo v2.6 Flash три попытки из четырёх.
Какую модель брать под задачу на знания (sereja.tech/kak-proverit-neyroset, замер 02.10.2026) Модель | правок на текст | минут на встречу | как есть | когда брать Codex 6.1 Sol (ChatGPT) | 4,0 | 4,1 | 2 из 4 | текст уйдёт людям после беглой вычитки Opus 5.5 (Claude Max) | 4,5 | 3,1 | 2 из 4 | то же, и быстрее всех из точных Sonnet 5.5 (Claude Max) | 8,0 | 2,7 | 0 из 4 | быстрый черновик, который вы вычитаете GLM 5.3 (Z.ai Coding Plan) | 11,8 | 20,7 | 0 из 4 | черновик без подписок Claude и ChatGPT, вычитка обязательна GLM 5.3 Flash (Z.ai Coding Plan) | 12,2 | 21,3 | 0 из 4 | как GLM 5.3 MiMo v2.6 Pro (OpenCode Go) | 14,2 | 38,3 | 0 из 4 | если время не важно; проверяйте личные подробности DeepSeek v4 Pro (OpenCode Go) | 15,8 | 15,0 | 0 из 4 | черновик; проверяйте личные подробности DeepSeek v4.1 Flash (OpenCode Go) | 17,2 | 23,6 | 0 из 4 | под эту задачу не брать MiMo v2.6 Flash (OpenCode Go) | 17,5 | 38,5 | 0 из 3 | медленно и много правок Правка: место, которое редактор поправил бы до показа людям. Правок: медиана по попыткам, в попытке среднее двух судей (Opus 5.5 и Codex 6.1 Sol). Минут: время всего пайплайна на одну встречу, медиана. Как есть: попытки, которые оба судьи пропустили бы без серьёзных правок.
Какие принципы мы использовали
Конспекты тут скорее повод. Ниже то, что работает для любой задачи на знания и вообще для любой работы, которую вы отдаёте модели.
Модели только смысл
Всё, что можно проверить без понимания текста, отдайте программе: названия, даты, время, форму. Модель меньше читает и реже ошибается. Как с бухгалтером: столбик он считает на калькуляторе, а голову тратит на то, чего калькулятор не умеет.
Скажите модели, кто есть кто
Модель не видит лиц и не узнаёт голоса. Подпишите в задании, кто ведущий, кто участники и чьи слова считаются советом. Как со стенографисткой на совещании: ей заранее дают список, кто есть кто, иначе в протоколе все станут «выступающими».
Спрашивайте, кто это сказал
Модель охотно превращает рассказ одного человека в общее правило. Проверяйте каждый совет в готовом тексте: кто его на самом деле дал. Как в протоколе собрания: «Петров предложил» и «решили» записывают разными строками.
Меряйте на своей задаче
Рейтинги моделей меряют чужие задачи. Две-три ваши настоящие записи скажут больше, особенно если вы уже знаете, каким должен быть ответ. Как с новым сотрудником: резюме читают, но берут после тестового задания.
Линейку не трогают
Записи, инструкцию для судьи и правила подсчёта замораживают до начала замера. Иначе улучшение может оказаться подкрученной линейкой. Как с весами на рынке: гирю между покупателями не подпиливают.
Проверяет чужой
Судья из той же семьи, что и автор, может быть к нему мягче. Берите двух судей от разных компаний и смотрите, где они расходятся. Как с аудитом: бухгалтерия саму себя не проверяет.
По одной правке, с откатом
Меняйте одну вещь за раз и сразу меряйте. Не стало лучше, верните как было. Как с диетой: поменяете всё сразу и не поймёте, что сработало.
На чём мы споткнулись
Судья наказывал за то, чего требует сайт. В первом замере судья ставил правку за раздел «Цели урока», хотя без него страница не собирается. Пришлось поправить инструкцию судьи и пересчитать замер. После этого линейку и заморозили.
Одна переделка стоила вчетверо дороже. Критику дали читать текст по частям. Качество осталось прежним, а прочитал он вчетверо больше. Эту переделку откатили.
DeepSeek стал хуже. Та же переделка, что помогла семи моделям, двум версиям DeepSeek навредила: у них выросли ошибки формы и названий. Один пайплайн на все модели не гарантирует, что каждой станет лучше.
Недорогие модели упираются в провайдера. Claude и Codex стали заметно быстрее. Недорогие модели по-прежнему пишут конспект от пятнадцати до сорока минут: они ждут ответа своего сервиса. Z.ai отвечает ошибкой «слишком много запросов» уже на восьми запросах сразу, так что попытки модели GLM шли по одной.
OpenCode грузит процессор. Около половины ядра на процесс. 16 процессов подняли нагрузку сервера до 16 при моей границе 14: рядом работают другие сервисы.
Разброс между попытками большой. У Opus в четырёх попытках после переделок правок от двух до шестнадцати. Решение по одной паре попыток будет решением по шуму.
Личные подробности. Имён участников в конспектах не осталось. А подробности проскакивают: страна, привычки, детали чужого проекта. Дешёвые модели переносят их из расшифровки, хотя задание это запрещает. Проверяйте личное в каждом тексте, даже когда остальные проверки зелёные.
Судьи могли подыгрывать своим. Судили Opus и Codex, и лучшие оценки получили тоже Opus и Codex. Возможно, судья мягче к своей семье. Поэтому я позвал третьего судью из другой семьи, GLM 5.3, и он заново оценил 60 конспектов.
Что сказал третий судья. Улучшение он подтвердил: после переделки у всех пяти моделей, которые он оценивал, правок стало в два-три раза меньше. А разрыва между дорогими и недорогими моделями он не увидел. У него Codex и GLM 5.3 Flash оставляют по четыре правки, Opus около пяти. Он мягче остальных: на 60 текстов ни одной критичной правки. И каждый судья мягче к своей семье. Так что переделка помогла по-настоящему. А насколько сильные модели лучше недорогих, зависит от того, кто судит. Цифры правок в этой статье, кроме этого абзаца, поставили судьи Opus и Codex.
Оговорка про судей
Каждый судья строже к чужим текстам:
| Тексты | Судья Opus | Судья Codex |
|---|---|---|
| Opus 5.5 | 4,5 | 3,8 |
| Codex 6.1 Sol | 7,0 | 2,5 |
После переделок, среднее правок на текст по четырём попыткам. Судья Opus ставит Opus выше Codex, судья Codex наоборот. Независимая проверка идёт.
Частые вопросы
Подходит ли это для протокола созвона или сводки переписки?
Да. Это тот же тип задачи: длинный источник на входе, текст для людей на выходе. Виды ошибок те же. Цифры правок в замере получены только на конспектах встреч.
Какую модель брать, если нет подписок Claude и ChatGPT?
В замере ближе всех GLM 5.3 по Z.ai Coding Plan: около 12 правок на текст и 20 минут на встречу. Закладывайте вычитку человеком.
Зачем два судьи разных семей?
Судья мягче к своей семье. Судья Codex нашёл в текстах Codex 2,5 правки на текст, судья Opus в тех же текстах 7,0. Два судьи разных семей гасят часть перекоса.
Сколько попыток нужно на модель?
У меня по четыре на модель, по два на каждую встречу. Разброс между попытками большой, меньше двух на вход я бы не брал.
Ссылки
- karpathy/autoresearchпетля "опыт, метрика, оставить или откатить", первоисточник
- Разбор autoresearch на DataCampкак устроены три файла и цикл
- Как расшифровать видео и аудиопервый шаг того же пайплайна: запись в текст
- Пеликан на велосипедедругое сравнение моделей: время, токены, как повторить
- Как агент ведёт мои делапрошлый гайд
Пайплайны вроде этого и замеры на своих задачах собираем в Personal Corp. Подробнее в боте.
Замер Карпатого: autoresearch на GitHub и разбор DataCamp. Модели: Claude, Codex, GLM, OpenCode. Пример на первом экране взят из настоящего конспекта, имён участников в нём нет. Мои реплики агенту слегка отредактированы: убраны опечатки.