СЕРЕЖА РИС

СтатьиLLM

TypeSafe выпустила Jev для быстрых решений в программах

Содержание
TypeSafe выпустила Jev для быстрых решений в программах

Программа получила обращение и должна выбрать отдел: поддержка, продажи или платежи. Jev возвращает выбранный вариант и вероятности. Это модель TypeSafe для решений внутри приложений.

Обращение: “Платёж не проходит третий день”. Программа выбирает отдел и срочность. Jev возвращает заданный вариант и вероятности для дальнейших действий кода.

15 сентября 2026 TypeSafe представила Jev для коротких решений внутри приложений.

Jev: состояние на входе, решения на выходе Стилизованная перфокарта Jev: неструктурированное состояние входит слева, из карты выходят выбор и вероятности. АНОНС TYPESAFE · 15.09.2026 состояние JEV 0 1 1 0 0 1 1 0 1 0 0 1 1 0 0 1 0 1 0 1 0 1 1 0 1 1 0 0 0 1 0 0 1 1 1 0 1 0 1 0 0 1 решения вариант вероятности

Jev получает состояние программы и вопросы

Состояние описывает происходящее: обращение, заказ или страницу браузера. Вопрос задаёт решение и разрешённые ответы. Документация API называет эти части state и questions; результат приходит в answers.

Типы вопросов:

Тип Пример вопроса Что получает программа
Choice, выбор В какой отдел передать обращение? Вариант из списка и вероятности всех вариантов
Noul, да/нет Сообщает ли человек о срочной проблеме? Вероятность ответа “да” от 0 до 1
Score, оценка Насколько человек недоволен по заданной шкале? Оценку, вычисленную по вероятностям уровней

TypeSafe называет подход System One, обучение RLCD: обучение с подкреплением для калиброванных решений. Контракт API не доказывает внутреннюю архитектуру.

Заданный тип ответа помогает коду, правильность проверяется отдельно

Если приложение разрешило три отдела, ответ должен содержать один из этих вариантов. TypeSafe заявляет гарантию соответствия схеме. Модель при этом способна выбрать неверный отдел: допустимое значение ещё может быть смысловой ошибкой.

Другие языковые модели тоже возвращают данные по схеме. Сравнение требует одинаковых задач, схем и настроек.

Показатель confidence у Choice и Score вычисляется из распределения вероятностей; Noul его отдельно не возвращает. Калибровка означает соответствие вероятностей частоте верных ответов на выборке, требует проверки на своих данных и не гарантирует отдельного решения.

Почему проверке агента нужен контекст всей работы

Классификатор выбирает заданную категорию по смыслу входа. Обещание отправить письмо ещё не подтверждает отправку: проверке агента нужны доказательства выполненных действий.

В Agent Trace Observability от TypeSafe проверяется журнал работы агента поддержки. На входе: инструкции, разговор, вызовы инструментов с аргументами и результатами, финальное сообщение и оставленный пользователем отзыв. Разбор начинается с необратимых действий: разрешение оценивается на момент каждого действия. Нарушение сразу вызывает дежурного. Затем отдельно определяются выполнение задачи и удовлетворённость пользователя. Дальнейший вопрос определяет маршрут: закрыть случай, поставить в очередь, завести ошибку или передать человеку.

Обвязка приложения собирает достаточно релевантный контекст. Проверке отправки письма нужны просьба, действовавшие разрешения, адресат, аргументы и результат инструмента. Удовлетворённости: последующие сообщения и отзыв. Отдельные вопросы сохраняют необходимые связи и доказательства. Полный журнал служит источником этих связей; вход каждого вопроса определяется задачей.

Недостающие данные нужно получить. Если необходимая цепочка не помещается во вход, в приложении можно предусмотреть передачу модели с большим контекстом или человеку. Отсутствующие доказательства исключают успешный вердикт.

Тест TypeSafe сравнивает ответы с эталоном. В одном примере все три модели расходятся с эталоном. Совпадение с разметкой не устанавливает фактическую правильность эталона: она требует проверки человеком.

Множители TypeSafe относятся к четырём собственным тестам

В анонсе TypeSafe команда заявляет 193,6× ускорения и 444,6× снижения стоимости в своих workflow evals, то есть проверках целых процессов. Знаменатель и расчёт не раскрыты. Эти результаты не устанавливают выигрыш на других задачах.

На странице тестов показаны четыре процесса: разбор инцидента безопасности, проверка работы агента поддержки, обработка счёта и обслуживание клиента. Код выполняет фиксированные правила, модель отвечает на отдельные вопросы. График усредняет точность, цену и время четырёх процессов с равным весом.

Ориентир для ответов получен усреднением GPT-6 Astra и Fable 5.1 с высоким уровнем размышления. Остальные модели используют настройки размышления провайдера по умолчанию и обёртку для структурированных вероятностей. Эталон ответов не задаёт базу множителей скорости и цены.

Сравнение требует времени и полной стоимости одинаковых процессов, включая дополнительные модели. Тесты подготовила команда TypeSafe; в анонсе она также отмечает возможное смещение и запуск с ноутбуков на западном побережье США.

Применение начинается с повторяющегося выбора

Карта сценариев TypeSafe предлагает выбор инструмента агентом, маршрутизацию, оценку срочности и проверку ответов. Каждому сценарию нужна проверка данных, ошибок и риска.

Вызов Jev внутри обычного кода Состояние поступает в Jev, решение возвращается в код: инструмент, развилка, срочность или проверка ответа. Состояние текст или данные Jev выбор и вероятности Решение ответ по схеме Инструмент выбор следующего шага Развилка продолжить или остановиться Оценка срочность и риск до действия Проверка качество ответа по критериям
Интерфейс Jev: состояние программы, вопрос по заданной схеме и ответ для кода. Правильность выбора требует проверки на данных приложения.

В демо Doom команды TypeSafe Jev выбирает действия по структурированному текстовому состоянию игры. Распознавание пикселей этим демо не показано. Десять вызовов в секунду и около семи долларов в час являются оценками команды. Перенос оценки требует учёта размера входа, частоты и дополнительных расходов.

TypeSafe / Diogo Almeida, 15 сентября: Jev выбирает действия по текстовому состоянию Doom. Оригинальная запись, без сокращения.

В Wikiracing команды TypeSafe Jev выбирает ссылку для перехода от одной статьи Wikipedia к другой. Таймер исключает загрузку страницы; более 255 ссылок требуют двухэтапного выбора. Оптимальный маршрут не гарантирован.

Первые проверки имеют собственные условия

В раннем внутреннем тесте команды fx проверяли 70 размеченных случаев классификации команд по три раза. Jev дала 207 верных решений из 210, GPT-5.6 Luna дала 203. Медиана задержки составила 312 мс против 1458 мс, около 4,7× на этой выборке. Повторы зависимы; маркетинговые 193,6× и 444,6× здесь не воспроизводятся.

В демо Browser Use поиск рейсов Цюрих → Лондон занял 7,073 секунды. По описанию измерения таймер начинается после первичного наблюдения страницы; начальная навигация и независимая проверка результата находятся за его пределами. Jev выбирает действие и элемент, Mercury генерирует строки с городами. Покупки билетов нет.

Авторы ограничивают статистические выводы сравнения трёх пар прогонов. Двухмодельный сценарий не устанавливает надёжность для произвольных сайтов.

У модели есть ограничения, у цены есть дата

TypeSafe описывает ограничения Jev 1.13: математика, даты, косвенные связи, противоречивые критерии и длинное нерелевантное состояние могут приводить к ошибкам. Несколько зависимых решений требуют проверки всего процесса, включая поведение после неверного ответа.

Цена прямого API на 17 сентября: $0,042 за миллион входных токенов, выход бесплатный. Диапазон 70-500 мс за вызов является заявлением TypeSafe о задержке. Устойчивость цены не установлена; компания не исключает субсидию.

Проверка на своей задаче даёт основание для внедрения

В разборе голосового браузера Jev выбирает действие по распознанной команде и подписям элементов страницы.

Сравни Jev и текущую модель на одинаковых размеченных случаях: ошибки, задержку, полную стоимость и последствия неверного выбора. Учти дополнительные модели и обращения к человеку.

До автоматического действия задай условия остановки и передачи человеку. Порог уверенности проверь на фактических ошибках с учётом риска.

Источники