Jev против ChatGPT, Claude и Gemini — что выбрать

Обновлено

Jev не конкурирует с ChatGPT напрямую — они решают разные задачи. Но на классификации и маршрутизации их сравнивают постоянно. Собрали заявления разработчика, его собственные тесты и независимые проверки.

Коротко

Jev ChatGPT / Claude / Gemini
Что возвращает Решение с вероятностями Текст
Время ответа 70–500 мс От секунд до минут
Цена ввода $0,042 за 1 млн токенов В 5–240 раз дороже
Цена вывода Бесплатно Платно, обычно дороже ввода
Формат ответа Гарантирован схемой Нужны парсинг и валидация
Вероятности В каждом ответе Только по запросу, часто завышены
Объяснение решения Нет Да
Генерация текста и кода Нет Да
Изображения на входе Пока нет Да

Цифры и оценки в таблице приводит TypeSafe. По её данным, передовые LLM отвечают за время от 3 до 329 секунд.

Разные инструменты для разных задач

ChatGPT, Claude и Gemini в терминах TypeSafe — модели «Системы 2»: они рассуждают, пишут и ведут диалог. Jev — «Система 1»: быстро выносит узкое суждение, которое программа сразу использует. Сравнивать их имеет смысл только там, где задачи пересекаются: классификация, маршрутизация, оценка, проверки. Подробно о самой модели — в статье «Что такое Jev».

Классифицировать умеют и LLM, особенно со structured outputs, а вероятности давно выдают классические модели машинного обучения. Как заметило издание heise, TypeSafe пытается объединить эти подходы в одной модели. Отличие от JSON mode в том, что там гарантирован только формат, а откалиброванных вероятностей, на которые можно поставить порог, нет. Подробное сравнение — в статье «Jev или structured outputs».

Почему Jev быстрее и дешевле

LLM генерирует ответ последовательно: каждый следующий токен зависит от предыдущего. Даже короткий JSON с категорией — это несколько десятков токенов, сгенерированных по одному, а модели с рассуждениями перед ответом ещё и «думают» токенами, поэтому они медленнее и дороже. Jev, по описанию TypeSafe, считает все ответы параллельно за один проход и не пишет ни одного лишнего слова. Поэтому время ответа почти не зависит от числа вопросов, а платить за вывод не нужно.

У такого устройства есть оборотная сторона. Модель, которая не рассуждает вслух, хуже справляется с задачами на несколько шагов логики, со счётом и сравнением дат. TypeSafe сама перечисляет это среди слабых мест Jev.

Что показывают тесты самой TypeSafe

Компания опубликовала сравнение на четырёх рабочих сценариях: разбор инцидентов безопасности, мониторинг работы агента поддержки, обработка счетов и обслуживание клиентов. Эталоном служило среднее ответов GPT-6 Astra и Claude Fable 5.1 на высоком уровне рассуждений. Средние результаты:

Модель Совпадение с эталоном Цена одного случая Время
Jev 67,8% $0,0004 0,4 с
GPT-5.6 Terra 67,9% $0,0304 10,1 с
Claude Sonnet 5 67,8% $0,1174 78,1 с
Claude Opus 5 73,1% $0,1761 37,8 с
Claude Haiku 4.5 53,6% $0,0195 12,5 с

Лучшая модель OpenAI в тесте набрала 74,1%. В пересчёте на миллион таких случаев разница в деньгах выглядит так: около $400 у Jev, около $30 тыс. у GPT-5.6 Terra и около $176 тыс. у Claude Opus 5.

Картина понятная: Jev не точнее передовых LLM, а примерно на уровне средних, зато дешевле на два порядка и быстрее в десятки раз. По сценариям разброс заметный: в обслуживании клиентов Jev почти догнала лидера (76,0% против 78,3%), а в сверке счетов с заказами и поставками отстала сильнее всего (61,8% против 79,1%).

Оговорки важны. Сценарии составляла команда TypeSafe, эталон построен на моделях OpenAI и Anthropic, а заявленные компанией 193,6-кратное ускорение и 444,6-кратная экономия, по её же словам, — верхняя граница реальной выгоды. В демонстрации на сайте Jev ответила за 0,114 секунды, GPT-5.6 Terra — за 8,566. Но запрос там упрощён и короток, что, как признаёт TypeSafe, играет в пользу Jev.

Что показывают независимые тесты

В пользу Jev:

  • Vercel использовала Jev как классификатор безопасности команд и, по данным TechCrunch, получила результат в 5–18 раз быстрее и точнее, чем с моделью OpenAI.
  • В тесте Bryo AI на классификации деловых писем Gemini оказалась немного точнее, но в 10–20 раз дороже. Технический директор компании отметил, что Jev — единственная из моделей, которая возвращает настоящую вероятность.

Не в пользу Jev:

  • На 1565 деловых письмах на немецком и английском Gemini показала более высокую точность при классификации по десяти категориям.
  • На 2000 фишинговых писем лучше справилась Claude Haiku 4.5.
  • Локальный классификатор GLiNER 2.5 после 51 минуты дообучения примерно на 10 тысячах примеров обогнал Jev на 9 процентных пунктов и работал в 8 раз быстрее.

Все три случая описаны на Хабре. Это единичные эксперименты, а не бенчмарки: код и логи опубликованы не везде. Вывод: Jev — сильный вариант «из коробки» без обучения. Но под конкретную задачу специализированная модель или LLM могут оказаться точнее. Подробнее — в статьях «Jev или свой классификатор» и «Отзывы разработчиков о Jev».

Что обычно переносят с LLM на Jev

Задача Как было на LLM Как на Jev
Разбор тикетов Промпт просит вернуть JSON с отделом Choice по отделам и Score срочности
Модерация LLM пишет вердикт и объяснение Noul на каждый вид нарушения
Выбор инструмента агентом Модель генерирует вызов функции Choice среди доступных инструментов
Проверка команды перед запуском Второй вызов LLM Noul «команда необратима?»
Маршрутизация моделей Дешёвая LLM оценивает сложность Score сложности, выбор модели в коде

Во всех случаях LLM остаётся в системе там, где нужен текст, а Jev забирает на себя частые короткие решения.

Правило выбора

Выбирайте Jev, если:

  • LLM у вас уже выбирает категорию или действие из конечного списка, а объяснение вы всё равно выбрасываете;
  • важна задержка — интерфейс, реальное время, агент с множеством шагов;
  • нужен большой объём дешёвых решений;
  • результат можно дёшево проверить в коде.

Оставайтесь на LLM, если:

  • нужен новый текст, код или план;
  • решение требует многошаговых рассуждений, арифметики или сравнения дат;
  • нужно объяснение для аудита — Jev не объясняет свои решения;
  • данные нельзя отправлять во внешнее облако;
  • ошибку сложно заметить, а действие необратимо.

Узкий стабильный домен с тысячами размеченных примеров — повод присмотреться к дообученному классификатору. Он может оказаться и точнее, и быстрее обеих моделей.

Гибридная схема

Самый практичный вариант — не выбирать. Jev обрабатывает поток и отвечает сама, когда уверена. Сомнительные случаи с низкой уверенностью уходят в LLM или к человеку. Так вы платите за дорогую модель только там, где она действительно нужна.

TypeSafe показывает такую связку в демо умного дома. Jev разбирает каждую команду пользователя. Если команда составная, например «выключи свет и закрой шторы», LLM разбивает её на простые, и каждую снова оценивает Jev. Если человек просто хочет поговорить, запрос уходит в чат-модель. По словам TypeSafe, Jev отвечает так быстро, что почти не добавляет задержки к ответу LLM.

Ещё один вариант — Jev как охрана для LLM: одна проверка на входе ищет попытки взломать промпт, вторая на выходе оценивает ответ модели. По оценке TypeSafe, такая проверка стоит малую долю цены самого вызова LLM. Схемы разбираем в статьях о каскаде Jev и LLM и об уверенности Jev.

Как сравнить на своих данных

  1. Соберите 200–500 реальных примеров и разметьте их вручную.
  2. Прогоните выборку через Jev и через LLM, которую используете сейчас.
  3. Сравните точность, задержку и полную стоимость цепочки, а не одного вызова.
  4. Для Jev постройте зависимость точности от confidence и выберите порог, выше которого ответы можно принимать автоматически.
  5. Посчитайте, какая доля потока уходит в LLM при этом пороге. Это и есть реальная экономия.

Цены для расчёта — в статье о стоимости Jev. Минусы, которые стоит учесть заранее, — в статье об ограничениях Jev.

Частые вопросы

Jev лучше ChatGPT?

Для генерации текста, кода и рассуждений — нет, Jev их просто не делает. Для классификации, маршрутизации и быстрых проверок Jev быстрее и дешевле в десятки раз, а по точности бывает сопоставима, хотя не всегда.

Можно ли использовать Jev вместе с ChatGPT или Claude?

Да, это самый популярный сценарий. Jev принимает быстрые микрорешения — какой инструмент вызвать, безопасна ли команда, — а LLM пишет текст и планирует.

Может ли Jev заменить ChatGPT в классификации текстов?

Во многих задачах — да, если ответ выбирается из заранее известного списка. Но в независимых тестах Gemini и Claude Haiku 4.5 местами оказывались точнее, поэтому сравните модели на своей размеченной выборке.

Чем Jev отличается от structured outputs и JSON mode?

JSON mode гарантирует только валидный формат, внутри остаётся ответ обычной LLM без откалиброванных вероятностей. Jev выбирает из заданных вариантов и возвращает распределение вероятностей, на которое можно ставить пороги.

Какая LLM ближе всего к Jev по качеству?

По тестам самой TypeSafe — GPT-5.6 Terra, у неё 67,9% совпадений с эталоном против 67,8% у Jev. Но в тех же тестах Terra обходилась примерно в 76 раз дороже и работала в 25 раз медленнее.

Источники