У меня оплачены ElevenLabs Creator и GLM Coding Plan. Встречи Personal Corp расшифровывает Scribe v2 со словарём, конспект составляет GLM-5.3. Я хотел проверить, что дают эти подписки и сколько тот же разбор стоил бы по API.
Я дал одну запись Office Hours пяти вариантам распознавания. Затем передал один транскрипт, текст разговора, трём моделям конспекта. Scribe со словарём верно записал 92,51% найденных терминов. По прайсу распознавание стоит $0,27, или 22,80 ₽ за час звука.
В эксперименте одна встреча. Эталон для подсчёта ошибок слов (WER) тоже составил Scribe, поэтому его WER занижен. На главном графике сравниваю цену и верные написания терминов. Для этой метрики эталон не нужен.
Как проверяю текст и конспект перед публикацией
Для третьего потока Personal Corp я собираю цепочку автоматической публикации встреч. Scribe расшифровывает звук в реплики с таймкодами. Модель составляет конспект и главы. Затем код проверяет файлы, язык и совпадение глав с началом реплик.
30.09.2026 цепочка прошла пробный прогон на Office Hours 1 без публикации. Распознавание прошло на сервере. Первый конспект Claude сделал на Mac. Затем GLM составил и проверил конспект на сервере через тот же Claude Code.
Проверено без публикации. Цепочка подготовила конспект, главы и результаты проверок. Загрузку на YouTube, публикацию на платформе и пост в группу я пропустил. Полную автоматическую публикацию этот прогон не проверял.
Для меня "опубликовано" означает страницу встречи с видео, главами и конспектом плюс сообщение группе со ссылкой. Цепочка разрешает публикацию только после проверок кодом и моделью-критиком. При серьёзных ошибках она останавливается и сообщает мне.
В пробном прогоне нашёлся пропуск в проверках: код проверял язык конспекта, но пропускал названия глав. В одной главе осталось английское сокращение названия штаба. После добавления проверки глав модель исправила сокращение.
Я отдельно проверяю распознавание и конспект. Верное написание имени помогает модели сохранить смысл. Затем нужно проверить, насколько точно конспект передаёт разговор.
Сколько стоит разбор и что расходует подписка
В таблицах указаны цены по прайсу API. С моей подписки Creator Scribe со словарём списал 2231 кредит, без словаря 1859. GLM и Claude тоже работали по подпискам. Для сравнения я посчитал, сколько их токены стоили бы по API.
Цены взяты на 30.09.2026. Для Яндекса использована страница ru-kz с рублёвыми ценами: RU-страница отвечала капчей. Перед покупкой сверьте цену для своего аккаунта.
| Вариант | Цена часа | Что удалось проверить |
|---|---|---|
| Whisper turbo через OpenRouter | $0,0120около 1,01 ₽ | Цена из списка моделей. Успешного прогона через OpenRouter нет. |
| Gemini 3.8 Flash через OpenRouter | 15,21 ₽$0,1801, оценка | Оценка по аудиотокенам и предполагаемому объёму ответа. Запрос вернул HTTP 402: баланс исчерпан. |
| GPT Audio Mini через OpenRouter | Нет замера | Запрос вернул HTTP 402. Без успешного прогона цену часа не считал. |
| Yandex SpeechKit, асинхронно | 47,60 ₽$0,5638 по пересчёту | Цена для двухканального звука. Для прогона нужен ключ Yandex Cloud. |
| SaluteSpeech для юрлиц | 36,00 ₽$0,4264 по пересчёту | Минимальный платёж по тарифу: 15 000 ₽ в месяц. Ключа нет. С 15.07.2026 тарифы закрыты новым клиентам. |
В таблице цены по прайсу и оценка по токенам. Качество и скорость этих сервисов я не проверял. Источники и допущения собраны в prices.json.
В срезе списка моделей OpenRouter Scribe отсутствовал. Я вызываю Scribe напрямую через ElevenLabs. Распознавание через OpenRouter ещё нужно проверить успешным прогоном.
GigaAM и Whisper распознают речь локально. Их цена на графике показывает долю уже оплаченного сервера, которую заняла задача. Покупку сервера и обслуживание эта цифра не покрывает.
Для работы из России я отдельно проверил бы доступ к провайдеру и способ оплаты. Доступность API из российской сети этот стенд не проверял. Цена Yandex SpeechKit есть в таблице, качество на моём аудио пока неизвестно. SaluteSpeech закрыл продажи новым клиентам.
Как получить конспект: три модели на одном тексте
Всем моделям я дал транскрипт Scribe со словарём. Запуск и задания одинаковые: Claude Code без интерфейса, создание файлов, проверка кодом, затем модель-критик. Настройки пользователя исключены. Готовый конспект этой встречи модели не получали.
Модель готовит конспект, главы и файлы для страницы встречи. Она выполняет несколько шагов и читает кэш. Цена одного запроса с коротким транскриптом требует отдельного замера.
| Автор конспекта | Время автора, мин | Прайс API, ₽/ч записи | Критичные / важные / мелкие |
|---|---|---|---|
| GLM-5.3-Flash | 18,00 мин | 25,21 ₽/чZ.ai · | 0 / 0 / 8Claude · pass |
| GLM-5.3 | 15,54 мин | 95,13 ₽/чZ.ai · | 0 / 0 / 4Claude · pass |
| Claude Opus 5.5 | 3,90 мин | 103,17 ₽/чAnthropic · | 0 / 0 / 1GLM-5.3 · pass |
Модели отсортированы по цене работы автора. Полоски начинаются с нуля; масштаб одинаковый внутри каждого столбца. Цена пересчитана на час записи, время указано для всей встречи. Стоимость проверки конспекта посчитана отдельно.
Все варианты прошли проверки кодом без исправлений и получили pass от критика. Claude Opus 5.5 подготовил конспект быстрее остальных. Работа GLM-5.3-Flash стоила меньше по прайсу API и заняла больше всего времени.
При выборе модели я учитываю разброс оценок критика. В отдельном пробном прогоне PC3 GLM-критик пропустил часть замечаний, которые затем нашёл Claude. Поэтому конспект проверяет другой движок, когда доступны оба.
Работу автора и критика я считаю отдельно. Весь прогон автора GLM-5.3-Flash оценён в $0,349, проверка критиком Claude в $0,5748. При оплате по API проверка может стоить дороже самого конспекта.
Что можно узнать по одной записи
- В выборке одна запись. Это русскоязычная встреча с терминами про агентов. Другой микрофон, язык или разговор могут изменить результат.
- Эталон сделан Scribe. Его WER занижен. Для следующего сравнения нужен отрезок, дословно проверенный человеком.
- Термины измерены отдельно. Доля верных терминов показывает только правильность найденных написаний. Точность всей речи и пропущенные упоминания она не оценивает.
- Говорящих нужно проверить отдельно. Scribe запускался с диаризацией, разделением речи по участникам. Точность этого разделения я не оценивал.
- Скорость зависит от стенда. На CPU одновременно работали другие задачи. Время API включает передачу файла.
- Оценки критика меняются. Статус pass и число замечаний дополняют проверки кодом. Распределение ошибок по многим прогонам я не измерял.
- Часть вариантов осталась без успешного прогона. Запросы к OpenRouter остановились из-за исчерпанного баланса. Для Yandex и SaluteSpeech нужны ключи. Прогон Whisper large-v3 без turbo на CPU был остановлен.
Я уже повторяю эксперимент на последних версиях моделей и обновлю замеры по результатам. Пока в таблицах срез 30.09.2026.
Что я выбираю для встреч Personal Corp
Для встреч Personal Corp я пока оставляю Scribe со словарём и GLM-5.3. Они прошли пробный прогон на сервере. Мне важны верные термины в конспекте, подписки уже оплачены. Когда доступен второй движок, он проверяет результат как критик.
Если нужно локальное распознавание, я начал бы проверку с GigaAM. На этой записи он быстрее CPU-Whisper и занимает меньшую долю стоимости сервера. Названия инструментов придётся проверять: верных найденных терминов меньше, чем у Scribe со словарём.
При оплате каждого запроса я проверил бы GLM-5.3-Flash по своим критериям конспекта. В этом эксперименте его работа стоила меньше остальных по прайсу API. К полной цене нужно прибавить распознавание и отдельного критика.
Яндекс оставляю кандидатом для следующего прогона с ключом. Сейчас по прайсу можно посчитать бюджет. Качество на моей записи ещё нужно измерить.
Как сравнить модели на своей записи
- Выберите свою запись. Сохраните исходный файл и его длительность. Передавайте всем движкам один файл.
- Подготовьте словарь и эталон. Впишите названия, которые модели искажают. Прослушайте выбранный отрезок и вручную проверьте его текст для подсчёта WER.
- Настройте эксперимент. Возьмите task.example.json из публичного скилла. Укажите свой файл и адрес локального сервиса. Ключи храните в переменных окружения.
- Сначала проверьте распознавание. Сохраните время, текст и расход. Посчитайте WER относительно проверенного человеком эталона и точность своих терминов.
- Передайте моделям один транскрипт. Подключите адаптер своей цепочки. Сохраните задание и проверки кодом. Назначьте другую модель критиком.
- Сравните результаты и цену. Пересчитайте стоимость на час записи. Сохраните прайс с датой и отдельно укажите расход подписки.
# Из папки skills/benchmark, после настройки своей задачи
python3 scripts/asr.py --task task.json --out runs/my-meeting
python3 scripts/llm.py --task task.json --out runs/my-meeting --stage author
python3 scripts/llm.py --task task.json --out runs/my-meeting --stage judge
python3 scripts/score.py --task task.json --out runs/my-meeting --prices prices.json
python3 scripts/report.py --results runs/my-meeting/results.json --out report.htmlДля повторения доступны метрики и срез прайсов. Запись участников и текст их разговора здесь не опубликованы. На своей записи вы получите новый эксперимент по тем же правилам.
График и таблица моделей взяты из разбора эксперимента в стиле Тафти. Данные встроены в HTML, поэтому диаграммы и таблицы работают без сетевых запросов.