# Бенчмарк записи встречи: методика и границы

Дата прогона и срез цен: 30.09.2026. Публичная копия метрик исходного эксперимента.
Приватные транскрипты, идентификаторы встреч, пути серверов и тексты замечаний судей исключены.

## Вход

- Одна запись Office Hours 1 третьего потока Personal Corp от 24.09.2026.
- Длительность 4207,1 с (70,12 мин), M4A AAC, 48 кГц, стерео.
- Эталон: 9598 нормализованных слов. Scribe v2 без словаря, частичная правка терминов, без дословной проверки человеком.
- Словарь: 50 терминов, 51 keyterm.

## Распознавание

Scribe v2 со словарём и без него: API с диаризацией.
GigaAM v3 e2e RNNT: отдельный сервис, 12 потоков CPU, куски по 24 с.
Whisper large-v3-turbo: faster-whisper 1.2.1, int8, 8 потоков CPU, VAD, beam 5.
Вариант со словарём получает его в initial_prompt.
API-время включает загрузку файла; CPU-время зависит от соседей на общем хосте.

WER/CER: jiwer 4.0; нижний регистр, ё заменена на е, пунктуация и метки спикеров удалены.
Дефис считается пробелом, числа словами и цифрами не уравниваются.
WER Scribe занижен, поскольку эталон сделан тем же движком.
Попарный WER показывает расхождение текстов, направление сравнения влияет на знаменатель.

term_accuracy = term_canon / (term_canon + term_distortions).
Знаменатель содержит найденные написания из словаря и известные искажения.
Пропущенные упоминания в него не входят; метрика оценивает только термины.
DER и точность разделения спикеров не измерены.

## Конспект

Всем авторам передан один транскрипт Scribe со словарём.
Claude Code 2.1.285, claude -p с --setting-sources project,local.
Один харнес и одинаковые брифы; меняется только модель.
GLM-5.3 и GLM-5.3-Flash работали на стенде через Coding Plan.
Claude Opus 5.5 работал на Mac по подписке.
Автор создаёт конспект и главы, затем идут проверки кодом и независимый критик.
Все три варианта прошли проверки кодом, fix_rounds=0.
GLM-конспекты судил Claude, конспект Claude судил GLM-5.3.
pass: нет critical и не больше двух major; minor публикацию не останавливают.
Повторная оценка одного конспекта Claude: pass 0/1/3, затем pass 0/0/4.
Первый JSON утрачен, результат сохранён в методике эксперимента.
Число замечаний не является общей шкалой между разными судьями.

## Стоимость

Курс ЦБ на 30.09.2026: USD/RUB 84,4283; EUR/RUB 96,0625.
Scribe: прайс API × длительность. Фактически списаны кредиты Creator, 2231 со словарём, 1859 без него.
GLM: измеренные токены × прайс Z.ai, включая чтение кэша.
Claude: reported total_cost_usd по прайсу Anthropic, включая кэш.
Авторы работали по подпискам; это API-эквивалент для сравнения, отдельного списания денег за конспект нет.
Судьи учтены отдельно в results.json; в таблицу авторов не включены.
Свой сервер: CPU-секунды / (20 потоков × секунд в месяце) × 60 €/мес.
Это доля уже оплаченного сервера, без отдельного замера добавочного платежа, обслуживания и капитальных затрат.
У self_hosted нет отдельного источника тарифа и даты; это допущение владельца стенда.

## Неполные варианты

- OpenRouter Gemini 3.8 Flash и GPT Audio Mini: HTTP 402, исчерпан баланс, нет успешного прогона.
- Yandex SpeechKit: нет ключа; цена со страницы ru-kz, RU-страница отвечала капчей.
- SaluteSpeech: нет ключа; новые тарифы закрыты новым клиентам с 15.07.2026.
- Whisper large-v3 без turbo: CPU-прогон остановлен, метрик нет.

## Повторение

Скрипты: https://github.com/serejaris/personal-corp-os/tree/main/skills/benchmark
В task.example.json укажите собственную запись, словарь, проверенный транскрипт и варианты.
Ключи держите в переменных окружения. Адрес локального сервиса замените своим.
Для LLM подключите собственный адаптер по examples/adapter_example.py: исходный адаптер PC3 использует приватную цепочку.
Одна запись и один прогон дают наблюдение, статистическую уверенность этот набор не измеряет.
