СР
Вайбкодинг · AI · агенты
Гайды • Свой эксперимент
УРОКИ · СОЗВОНЫ · ГОЛОСОВЫЕ

Как расшифровать видео и аудио:
на своём Mac или через API

Запись урока, созвона или голосовое сообщение превращаем в текст и конспект. Для расшифровки есть инструменты на своём Mac и сервисы с API. Замер сделан на русской речи с английскими терминами.

70,12минут в записи
5вариантов распознавания
3модели конспекта
30 сентября 2026 · запись Office Hours 1

Я уже повторяю эксперимент на последних версиях моделей. По результатам обновлю таблицы.

У меня оплачены ElevenLabs Creator и GLM Coding Plan. Встречи Personal Corp расшифровывает Scribe v2 со словарём, конспект составляет GLM-5.3. Я хотел проверить, что дают эти подписки и сколько тот же разбор стоил бы по API.

Я дал одну запись Office Hours пяти вариантам распознавания. Затем передал один транскрипт, текст разговора, трём моделям конспекта. Scribe со словарём верно записал 92,51% найденных терминов. По прайсу распознавание стоит $0,27, или 22,80 ₽ за час звука.

В эксперименте одна встреча. Эталон для подсчёта ошибок слов (WER) тоже составил Scribe, поэтому его WER занижен. На главном графике сравниваю цену и верные написания терминов. Для этой метрики эталон не нужен.

01

Словарь помогает Scribe записывать термины

Все варианты получают одну запись от 24.09.2026: русский разговор, 70,12 минуты. В словаре 50 терминов, которые переданы как 51 подсказка. Scribe получает их в поле keyterms, Whisper в начальном промпте initial_prompt.

Цена часа записи и доля верно записанных терминов Логарифмическая шкала цены, линейная шкала доли верных терминов. У каждой модели указаны цена, доля верных терминов, время всей записи и источник. Scribe v2 · словарь: 22,80 рублей за час, 92,51 процентов, 49,13 с; Scribe v2 · без словаря: 18,57 рублей за час, 78,57 процентов, 59,90 с; GigaAM: 0,17 рублей за час, 47,48 процентов, 5,10 мин; Whisper turbo · без промпта: 0,90 рублей за час, 47,45 процентов, 35,58 мин; Whisper turbo · промпт: 0,90 рублей за час, 46,00 процентов, 34,26 мин Верно записанные термины, % 0 25 50 75 100 0,1 1 10 100 Цена часа записи, ₽ · логарифмическая шкала Scribe v2 · словарь 22,80 ₽/ч · 92,51% 49,13 с на всю запись ElevenLabs · 30.09.2026https://elevenlabs.io/pricing/api; срез 30.09.2026 Scribe v2 · без словаря 18,57 ₽/ч · 78,57% 59,90 с на всю запись ElevenLabs · 30.09.2026https://elevenlabs.io/pricing/api; срез 30.09.2026 GigaAM 0,17 ₽/ч · 47,48% 5,10 мин на всю запись расчёт¹ · 30.09.2026#server-cost; срез 30.09.2026 Whisper turbo · без промпта 0,90 ₽/ч · 47,45% 35,58 мин на всю запись расчёт¹ · 30.09.2026#server-cost; срез 30.09.2026 Whisper turbo · промпт 0,90 ₽/ч · 46,00% 34,26 мин на всю запись расчёт¹ · 30.09.2026#server-cost; срез 30.09.2026 Цена часа записи и доля верно записанных терминов Логарифмическая шкала цены, линейная шкала доли верных терминов. У каждой модели указаны цена, доля верных терминов, время всей записи и источник. Scribe v2 · словарь: 22,80 рублей за час, 92,51 процентов, 49,13 с; Scribe v2 · без словаря: 18,57 рублей за час, 78,57 процентов, 59,90 с; GigaAM: 0,17 рублей за час, 47,48 процентов, 5,10 мин; Whisper turbo · без промпта: 0,90 рублей за час, 47,45 процентов, 35,58 мин; Whisper turbo · промпт: 0,90 рублей за час, 46,00 процентов, 34,26 мин Верно записанные термины, % 0 25 50 75 100 0,1 1 10 100 Цена часа записи, ₽ · логарифмическая шкала Scribe v2 · словарь 22,80 ₽/ч · 92,51% 49,13 с ElevenLabs · 30.09.2026https://elevenlabs.io/pricing/api; срез 30.09.2026 Scribe v2 · без словаря 18,57 ₽/ч · 78,57% 59,90 с ElevenLabs · 30.09.2026https://elevenlabs.io/pricing/api; срез 30.09.2026 GigaAM 0,17 ₽/ч 5,10 мин · 47,48% расчёт¹ · 30.09.2026#server-cost; срез 30.09.2026 Whisper turbo 0,90 ₽/ч · 47,45% без промпта · 35,58 мин расчёт¹ · 30.09.2026#server-cost; срез 30.09.2026 Whisper turbo 0,90 ₽/ч · 46,00% промпт · 34,26 мин расчёт¹ · 30.09.2026#server-cost; срез 30.09.2026
У каждой модели указано время всей записи. Цена пересчитана на час звука. Шкала цены логарифмическая: равные промежутки показывают одинаковое отношение цен. Срез: 30.09.2026.
Движок₽/ч записи$/ч записиВерные терминыВремя всей записи
Scribe v2 · словарь 22,80 ₽прайс API $0,2700 92,51% 0,82 мин
Scribe v2 · без словаря 18,57 ₽прайс API $0,2200 78,57% 1,00 мин
GigaAM v3 e2e RNNT 0,17 ₽доля сервера $0,0020 47,48% 5,10 мин
Whisper turbo · без промпта 0,90 ₽доля сервера $0,0106 47,45% 35,58 мин
Whisper turbo · промпт 0,90 ₽доля сервера $0,0107 46,00% 34,26 мин

Все пять вариантов обработали запись. GigaAM и Whisper работали на CPU, Scribe через API. Для пересчёта в рубли взяты данные ЦБ на 30.09.2026: 84,4283 ₽ за доллар.

Без словаря Scribe верно записал 78,57% найденных терминов. Со словарём число известных искажений снизилось с 36 до 14. Эти слова пришлось бы исправлять в конспекте.

В исходном эталоне осталось "Cloud" вместо "Claude". Подсказки исправили это написание. У Whisper с тем же словарём верны 46,00% найденных терминов, без промпта 47,45%. В этом прогоне словарь не улучшил результат Whisper.

GigaAM обработал запись за 5,10 минуты, Whisper turbo без промпта за 35,58 минуты. Для GigaAM доля стоимости сервера составила 0,17 ₽ за час записи. Верно записаны 47,48% найденных терминов.

Сколько ошибок по WER: сравнение с эталоном Scribe

WER показывает долю замен, пропусков и лишних слов относительно эталона. Замена названия модели другим словом тоже считается ошибкой.

ДвижокWER
Scribe v2 · словарь4,03%
Scribe v2 · без словаря3,30%
GigaAM v3 e2e RNNT12,74%
Whisper turbo · без промпта12,50%
Whisper turbo · промпт12,02%

Эталон сделан тем же Scribe без словаря. Человек дословно его не проверял. Поэтому WER Scribe занижен. Вариант без словаря ближе к эталону, который он сам создал. Эти числа показывают расхождение с конкретным текстом.

GigaAM и Whisper можно сравнить по WER на этой записи: их значения близки. Для общего рейтинга нужны проверенный человеком эталон и несколько записей. Точность разделения речи по участникам здесь отдельно не измерена.

02

Как проверяю текст и конспект перед публикацией

Для третьего потока Personal Corp я собираю цепочку автоматической публикации встреч. Scribe расшифровывает звук в реплики с таймкодами. Модель составляет конспект и главы. Затем код проверяет файлы, язык и совпадение глав с началом реплик.

30.09.2026 цепочка прошла пробный прогон на Office Hours 1 без публикации. Распознавание прошло на сервере. Первый конспект Claude сделал на Mac. Затем GLM составил и проверил конспект на сервере через тот же Claude Code.

Проверено без публикации. Цепочка подготовила конспект, главы и результаты проверок. Загрузку на YouTube, публикацию на платформе и пост в группу я пропустил. Полную автоматическую публикацию этот прогон не проверял.

Для меня "опубликовано" означает страницу встречи с видео, главами и конспектом плюс сообщение группе со ссылкой. Цепочка разрешает публикацию только после проверок кодом и моделью-критиком. При серьёзных ошибках она останавливается и сообщает мне.

В пробном прогоне нашёлся пропуск в проверках: код проверял язык конспекта, но пропускал названия глав. В одной главе осталось английское сокращение названия штаба. После добавления проверки глав модель исправила сокращение.

Я отдельно проверяю распознавание и конспект. Верное написание имени помогает модели сохранить смысл. Затем нужно проверить, насколько точно конспект передаёт разговор.

03

Сколько стоит разбор и что расходует подписка

В таблицах указаны цены по прайсу API. С моей подписки Creator Scribe со словарём списал 2231 кредит, без словаря 1859. GLM и Claude тоже работали по подпискам. Для сравнения я посчитал, сколько их токены стоили бы по API.

Цены взяты на 30.09.2026. Для Яндекса использована страница ru-kz с рублёвыми ценами: RU-страница отвечала капчей. Перед покупкой сверьте цену для своего аккаунта.

ВариантЦена часаЧто удалось проверить
Whisper turbo через OpenRouter$0,0120около 1,01 ₽Цена из списка моделей. Успешного прогона через OpenRouter нет.
Gemini 3.8 Flash через OpenRouter15,21 ₽$0,1801, оценкаОценка по аудиотокенам и предполагаемому объёму ответа. Запрос вернул HTTP 402: баланс исчерпан.
GPT Audio Mini через OpenRouterНет замераЗапрос вернул HTTP 402. Без успешного прогона цену часа не считал.
Yandex SpeechKit, асинхронно47,60 ₽$0,5638 по пересчётуЦена для двухканального звука. Для прогона нужен ключ Yandex Cloud.
SaluteSpeech для юрлиц36,00 ₽$0,4264 по пересчётуМинимальный платёж по тарифу: 15 000 ₽ в месяц. Ключа нет. С 15.07.2026 тарифы закрыты новым клиентам.

В таблице цены по прайсу и оценка по токенам. Качество и скорость этих сервисов я не проверял. Источники и допущения собраны в prices.json.

В срезе списка моделей OpenRouter Scribe отсутствовал. Я вызываю Scribe напрямую через ElevenLabs. Распознавание через OpenRouter ещё нужно проверить успешным прогоном.

GigaAM и Whisper распознают речь локально. Их цена на графике показывает долю уже оплаченного сервера, которую заняла задача. Покупку сервера и обслуживание эта цифра не покрывает.

Для работы из России я отдельно проверил бы доступ к провайдеру и способ оплаты. Доступность API из российской сети этот стенд не проверял. Цена Yandex SpeechKit есть в таблице, качество на моём аудио пока неизвестно. SaluteSpeech закрыл продажи новым клиентам.

04

Как получить конспект: три модели на одном тексте

Всем моделям я дал транскрипт Scribe со словарём. Запуск и задания одинаковые: Claude Code без интерфейса, создание файлов, проверка кодом, затем модель-критик. Настройки пользователя исключены. Готовый конспект этой встречи модели не получали.

Модель готовит конспект, главы и файлы для страницы встречи. Она выполняет несколько шагов и читает кэш. Цена одного запроса с коротким транскриптом требует отдельного замера.

Автор конспектаВремя автора, минПрайс API, ₽/ч записиКритичные / важные / мелкие
GLM-5.3-Flash 18,00 мин 25,21 ₽/чZ.ai · 0 / 0 / 8Claude · pass
GLM-5.3 15,54 мин 95,13 ₽/чZ.ai · 0 / 0 / 4Claude · pass
Claude Opus 5.5 3,90 мин 103,17 ₽/чAnthropic · 0 / 0 / 1GLM-5.3 · pass

Модели отсортированы по цене работы автора. Полоски начинаются с нуля; масштаб одинаковый внутри каждого столбца. Цена пересчитана на час записи, время указано для всей встречи. Стоимость проверки конспекта посчитана отдельно.

Все варианты прошли проверки кодом без исправлений и получили pass от критика. Claude Opus 5.5 подготовил конспект быстрее остальных. Работа GLM-5.3-Flash стоила меньше по прайсу API и заняла больше всего времени.

При выборе модели я учитываю разброс оценок критика. В отдельном пробном прогоне PC3 GLM-критик пропустил часть замечаний, которые затем нашёл Claude. Поэтому конспект проверяет другой движок, когда доступны оба.

Работу автора и критика я считаю отдельно. Весь прогон автора GLM-5.3-Flash оценён в $0,349, проверка критиком Claude в $0,5748. При оплате по API проверка может стоить дороже самого конспекта.

05

Что можно узнать по одной записи

Я уже повторяю эксперимент на последних версиях моделей и обновлю замеры по результатам. Пока в таблицах срез 30.09.2026.

06

Что я выбираю для встреч Personal Corp

Для встреч Personal Corp я пока оставляю Scribe со словарём и GLM-5.3. Они прошли пробный прогон на сервере. Мне важны верные термины в конспекте, подписки уже оплачены. Когда доступен второй движок, он проверяет результат как критик.

Если нужно локальное распознавание, я начал бы проверку с GigaAM. На этой записи он быстрее CPU-Whisper и занимает меньшую долю стоимости сервера. Названия инструментов придётся проверять: верных найденных терминов меньше, чем у Scribe со словарём.

При оплате каждого запроса я проверил бы GLM-5.3-Flash по своим критериям конспекта. В этом эксперименте его работа стоила меньше остальных по прайсу API. К полной цене нужно прибавить распознавание и отдельного критика.

Яндекс оставляю кандидатом для следующего прогона с ключом. Сейчас по прайсу можно посчитать бюджет. Качество на моей записи ещё нужно измерить.

07

Как сравнить модели на своей записи

  1. Выберите свою запись. Сохраните исходный файл и его длительность. Передавайте всем движкам один файл.
  2. Подготовьте словарь и эталон. Впишите названия, которые модели искажают. Прослушайте выбранный отрезок и вручную проверьте его текст для подсчёта WER.
  3. Настройте эксперимент. Возьмите task.example.json из публичного скилла. Укажите свой файл и адрес локального сервиса. Ключи храните в переменных окружения.
  4. Сначала проверьте распознавание. Сохраните время, текст и расход. Посчитайте WER относительно проверенного человеком эталона и точность своих терминов.
  5. Передайте моделям один транскрипт. Подключите адаптер своей цепочки. Сохраните задание и проверки кодом. Назначьте другую модель критиком.
  6. Сравните результаты и цену. Пересчитайте стоимость на час записи. Сохраните прайс с датой и отдельно укажите расход подписки.
# Из папки skills/benchmark, после настройки своей задачи
python3 scripts/asr.py --task task.json --out runs/my-meeting
python3 scripts/llm.py --task task.json --out runs/my-meeting --stage author
python3 scripts/llm.py --task task.json --out runs/my-meeting --stage judge
python3 scripts/score.py --task task.json --out runs/my-meeting --prices prices.json
python3 scripts/report.py --results runs/my-meeting/results.json --out report.html
Скрипты из публичного скилла Benchmark. Адаптер PC3 работает с моей цепочкой. Для своей задачи подключите адаптер по примеру из скилла.

Для повторения доступны метрики и срез прайсов. Запись участников и текст их разговора здесь не опубликованы. На своей записи вы получите новый эксперимент по тем же правилам.

Распознавание речи · Scribe · GigaAM · Whisper · конспекты

График и таблица моделей взяты из разбора эксперимента в стиле Тафти. Данные встроены в HTML, поэтому диаграммы и таблицы работают без сетевых запросов.