Jev против ChatGPT, Claude и Gemini — что выбрать
Jev не конкурирует с ChatGPT напрямую — они решают разные задачи. Но на классификации и маршрутизации их сравнивают постоянно. Собрали заявления разработчика, его собственные тесты и независимые проверки.
Коротко
| Jev | ChatGPT / Claude / Gemini | |
|---|---|---|
| Что возвращает | Решение с вероятностями | Текст |
| Время ответа | 70–500 мс | От секунд до минут |
| Цена ввода | $0,042 за 1 млн токенов | В 5–240 раз дороже |
| Цена вывода | Бесплатно | Платно, обычно дороже ввода |
| Формат ответа | Гарантирован схемой | Нужны парсинг и валидация |
| Вероятности | В каждом ответе | Только по запросу, часто завышены |
| Объяснение решения | Нет | Да |
| Генерация текста и кода | Нет | Да |
| Изображения на входе | Пока нет | Да |
Цифры и оценки в таблице приводит TypeSafe. По её данным, передовые LLM отвечают за время от 3 до 329 секунд.
Разные инструменты для разных задач
ChatGPT, Claude и Gemini в терминах TypeSafe — модели «Системы 2»: они рассуждают, пишут и ведут диалог. Jev — «Система 1»: быстро выносит узкое суждение, которое программа сразу использует. Сравнивать их имеет смысл только там, где задачи пересекаются: классификация, маршрутизация, оценка, проверки. Подробно о самой модели — в статье «Что такое Jev».
Классифицировать умеют и LLM, особенно со structured outputs, а вероятности давно выдают классические модели машинного обучения. Как заметило издание heise, TypeSafe пытается объединить эти подходы в одной модели. Отличие от JSON mode в том, что там гарантирован только формат, а откалиброванных вероятностей, на которые можно поставить порог, нет. Подробное сравнение — в статье «Jev или structured outputs».
Почему Jev быстрее и дешевле
LLM генерирует ответ последовательно: каждый следующий токен зависит от предыдущего. Даже короткий JSON с категорией — это несколько десятков токенов, сгенерированных по одному, а модели с рассуждениями перед ответом ещё и «думают» токенами, поэтому они медленнее и дороже. Jev, по описанию TypeSafe, считает все ответы параллельно за один проход и не пишет ни одного лишнего слова. Поэтому время ответа почти не зависит от числа вопросов, а платить за вывод не нужно.
У такого устройства есть оборотная сторона. Модель, которая не рассуждает вслух, хуже справляется с задачами на несколько шагов логики, со счётом и сравнением дат. TypeSafe сама перечисляет это среди слабых мест Jev.
Что показывают тесты самой TypeSafe
Компания опубликовала сравнение на четырёх рабочих сценариях: разбор инцидентов безопасности, мониторинг работы агента поддержки, обработка счетов и обслуживание клиентов. Эталоном служило среднее ответов GPT-6 Astra и Claude Fable 5.1 на высоком уровне рассуждений. Средние результаты:
| Модель | Совпадение с эталоном | Цена одного случая | Время |
|---|---|---|---|
| Jev | 67,8% | $0,0004 | 0,4 с |
| GPT-5.6 Terra | 67,9% | $0,0304 | 10,1 с |
| Claude Sonnet 5 | 67,8% | $0,1174 | 78,1 с |
| Claude Opus 5 | 73,1% | $0,1761 | 37,8 с |
| Claude Haiku 4.5 | 53,6% | $0,0195 | 12,5 с |
Лучшая модель OpenAI в тесте набрала 74,1%. В пересчёте на миллион таких случаев разница в деньгах выглядит так: около $400 у Jev, около $30 тыс. у GPT-5.6 Terra и около $176 тыс. у Claude Opus 5.
Картина понятная: Jev не точнее передовых LLM, а примерно на уровне средних, зато дешевле на два порядка и быстрее в десятки раз. По сценариям разброс заметный: в обслуживании клиентов Jev почти догнала лидера (76,0% против 78,3%), а в сверке счетов с заказами и поставками отстала сильнее всего (61,8% против 79,1%).
Оговорки важны. Сценарии составляла команда TypeSafe, эталон построен на моделях OpenAI и Anthropic, а заявленные компанией 193,6-кратное ускорение и 444,6-кратная экономия, по её же словам, — верхняя граница реальной выгоды. В демонстрации на сайте Jev ответила за 0,114 секунды, GPT-5.6 Terra — за 8,566. Но запрос там упрощён и короток, что, как признаёт TypeSafe, играет в пользу Jev.
Что показывают независимые тесты
В пользу Jev:
- Vercel использовала Jev как классификатор безопасности команд и, по данным TechCrunch, получила результат в 5–18 раз быстрее и точнее, чем с моделью OpenAI.
- В тесте Bryo AI на классификации деловых писем Gemini оказалась немного точнее, но в 10–20 раз дороже. Технический директор компании отметил, что Jev — единственная из моделей, которая возвращает настоящую вероятность.
Не в пользу Jev:
- На 1565 деловых письмах на немецком и английском Gemini показала более высокую точность при классификации по десяти категориям.
- На 2000 фишинговых писем лучше справилась Claude Haiku 4.5.
- Локальный классификатор GLiNER 2.5 после 51 минуты дообучения примерно на 10 тысячах примеров обогнал Jev на 9 процентных пунктов и работал в 8 раз быстрее.
Все три случая описаны на Хабре. Это единичные эксперименты, а не бенчмарки: код и логи опубликованы не везде. Вывод: Jev — сильный вариант «из коробки» без обучения. Но под конкретную задачу специализированная модель или LLM могут оказаться точнее. Подробнее — в статьях «Jev или свой классификатор» и «Отзывы разработчиков о Jev».
Что обычно переносят с LLM на Jev
| Задача | Как было на LLM | Как на Jev |
|---|---|---|
| Разбор тикетов | Промпт просит вернуть JSON с отделом | Choice по отделам и Score срочности |
| Модерация | LLM пишет вердикт и объяснение | Noul на каждый вид нарушения |
| Выбор инструмента агентом | Модель генерирует вызов функции | Choice среди доступных инструментов |
| Проверка команды перед запуском | Второй вызов LLM | Noul «команда необратима?» |
| Маршрутизация моделей | Дешёвая LLM оценивает сложность | Score сложности, выбор модели в коде |
Во всех случаях LLM остаётся в системе там, где нужен текст, а Jev забирает на себя частые короткие решения.
Правило выбора
Выбирайте Jev, если:
- LLM у вас уже выбирает категорию или действие из конечного списка, а объяснение вы всё равно выбрасываете;
- важна задержка — интерфейс, реальное время, агент с множеством шагов;
- нужен большой объём дешёвых решений;
- результат можно дёшево проверить в коде.
Оставайтесь на LLM, если:
- нужен новый текст, код или план;
- решение требует многошаговых рассуждений, арифметики или сравнения дат;
- нужно объяснение для аудита — Jev не объясняет свои решения;
- данные нельзя отправлять во внешнее облако;
- ошибку сложно заметить, а действие необратимо.
Узкий стабильный домен с тысячами размеченных примеров — повод присмотреться к дообученному классификатору. Он может оказаться и точнее, и быстрее обеих моделей.
Гибридная схема
Самый практичный вариант — не выбирать. Jev обрабатывает поток и отвечает сама, когда уверена. Сомнительные случаи с низкой уверенностью уходят в LLM или к человеку. Так вы платите за дорогую модель только там, где она действительно нужна.
TypeSafe показывает такую связку в демо умного дома. Jev разбирает каждую команду пользователя. Если команда составная, например «выключи свет и закрой шторы», LLM разбивает её на простые, и каждую снова оценивает Jev. Если человек просто хочет поговорить, запрос уходит в чат-модель. По словам TypeSafe, Jev отвечает так быстро, что почти не добавляет задержки к ответу LLM.
Ещё один вариант — Jev как охрана для LLM: одна проверка на входе ищет попытки взломать промпт, вторая на выходе оценивает ответ модели. По оценке TypeSafe, такая проверка стоит малую долю цены самого вызова LLM. Схемы разбираем в статьях о каскаде Jev и LLM и об уверенности Jev.
Как сравнить на своих данных
- Соберите 200–500 реальных примеров и разметьте их вручную.
- Прогоните выборку через Jev и через LLM, которую используете сейчас.
- Сравните точность, задержку и полную стоимость цепочки, а не одного вызова.
- Для Jev постройте зависимость точности от
confidenceи выберите порог, выше которого ответы можно принимать автоматически. - Посчитайте, какая доля потока уходит в LLM при этом пороге. Это и есть реальная экономия.
Цены для расчёта — в статье о стоимости Jev. Минусы, которые стоит учесть заранее, — в статье об ограничениях Jev.
Частые вопросы
Jev лучше ChatGPT?
Для генерации текста, кода и рассуждений — нет, Jev их просто не делает. Для классификации, маршрутизации и быстрых проверок Jev быстрее и дешевле в десятки раз, а по точности бывает сопоставима, хотя не всегда.
Можно ли использовать Jev вместе с ChatGPT или Claude?
Да, это самый популярный сценарий. Jev принимает быстрые микрорешения — какой инструмент вызвать, безопасна ли команда, — а LLM пишет текст и планирует.
Может ли Jev заменить ChatGPT в классификации текстов?
Во многих задачах — да, если ответ выбирается из заранее известного списка. Но в независимых тестах Gemini и Claude Haiku 4.5 местами оказывались точнее, поэтому сравните модели на своей размеченной выборке.
Чем Jev отличается от structured outputs и JSON mode?
JSON mode гарантирует только валидный формат, внутри остаётся ответ обычной LLM без откалиброванных вероятностей. Jev выбирает из заданных вариантов и возвращает распределение вероятностей, на которое можно ставить пороги.
Какая LLM ближе всего к Jev по качеству?
По тестам самой TypeSafe — GPT-5.6 Terra, у неё 67,9% совпадений с эталоном против 67,8% у Jev. Но в тех же тестах Terra обходилась примерно в 76 раз дороже и работала в 25 раз медленнее.
Источники
- TechCrunch — A new kind of AI model from a ChatGPT inventor
- Хабр — Jev — как устроен его API решений
- TypeSafe AI — Introducing System One Models & Jev
- TypeSafe — Workflow evals
- TypeSafe Docs — Jev 1.13 jaggedness
- TypeSafe Docs — Example use cases
- TypeSafe Docs — Smart home assistant demo
- The Register — TypeSafe AI debuts model for machines that plays Doom
- heise online — AI model Jev to make machines decide faster