Ограничения и минусы Jev — честный разбор

Обновлено

Вокруг Jev много восторгов, но и критики хватает. Собрали ограничения, о которых стоит знать до внедрения, — и те, что признаёт сама TypeSafe, и те, что нашли независимые разработчики.

Не генерирует ничего

Jev не пишет текст, код, резюме и объяснения. Это не недоработка, а принцип: модель намеренно отказалась от генерации строк ради скорости и надёжности формата.

Из этого следуют два практических минуса. Во-первых, извлечь значение из текста Jev может только одним способом — выбрать его из готовых кандидатов. TypeSafe советует находить кандидатов регулярным выражением или генеративной моделью, а Jev оставлять выбор. Во-вторых, модель не объясняет, почему приняла решение. Издание heise заметило, что чем больше таких решений принимается внутри программ, тем острее вопрос, насколько их поведение можно понять и проконтролировать. Для аудита в регулируемых отраслях это минус.

«Не галлюцинирует» — не значит «не ошибается»

Jev не может выдумать категорию вне вашего списка, это гарантирует схема ответа. Но выбрать неверный вариант из допустимых она может. The Register назвал обещание работы «без галлюцинаций» не совсем честным сравнением: ответ Jev — не текст на естественном языке, а структурированный формат не исключает ошибки. Договор TypeSafe с клиентами тоже прямо говорит, что ответы могут быть неточными, а оценивать их должен сам клиент. Подробнее — в статье о галлюцинациях Jev.

Точность не всегда лучше

В независимых тестах, собранных на Хабре, Gemini оказалась точнее на деловых письмах, а Claude Haiku 4.5 — на фишинге. Дообученный локальный классификатор GLiNER 2.5 обогнал Jev на 9 процентных пунктов и работал в 8 раз быстрее. Когда узкий классификатор выгоднее, разбираем в статье «Jev или свой классификатор».

Даже в собственных тестах TypeSafe на четырёх рабочих сценариях Jev совпадает с эталоном в 67,8% случаев. Это уровень средних передовых моделей, а лучшие набирают 73–74%. Сильнее всего Jev отстаёт на сверке счетов с заказами и поставками: 61,8% против 79,1% у лидера. Компания признаёт, что сценарии составляла её команда, а заявленное ускорение — верхняя граница реальной выгоды. Сравнение с LLM целиком — в статье «Jev против ChatGPT, Claude и Gemini».

Слабые места, которые признаёт TypeSafe

Для версии 1.13 компания опубликовала список известных проблем и обещает исправить многие из них в следующих версиях:

Проблема Что делать
Буквальное чтение инструкций Писать точное условие и описывать каждый вариант
Арифметика, подсчёт, числа Считать в коде
Сравнение дат Извлекать части даты, сравнивать в коде
Косвенные вопросы и двойные отрицания Спрашивать прямо, указывать нужное поле состояния
Большой state с лишними деталями Фильтровать заранее, отправлять только нужное
Враждебный текст внутри state Точные критерии и тесты на крайних случаях
Противоречие между инструкцией и вариантами Согласовать формулировки
Нет «логичных» связей между вопросами Не ждать, что ответы сложатся арифметически
Генерация текста Использовать генеративную модель

Пункт о враждебном тексте важен для модерации и защиты агентов. По умолчанию Jev не считает состояние враждебным, и внедрённая в текст инструкция может сдвинуть ответ. TypeSafe обещает улучшить это в будущих версиях.

Пункт о связях между вопросами легко недооценить. В примере TypeSafe вопрос «клиент просит возврат?» получил 0,72, а вопрос «клиент просит что-то кроме возврата?» — 0,47. В сумме 1,19, хотя интуитивно ждёшь единицу. Пороги, подобранные для Noul, нельзя переносить на Choice, даже если вопрос тот же. Изменения текущей версии — в статье о Jev 1.13.

Русский язык

Основной язык обучения Jev — английский, и на нём, по данным TypeSafe, точность сейчас лучше всего. Другие языки модель принимает, но работает с ними хуже. Компания советует тестировать Jev на своих текстах, прежде чем полагаться на неё в неанглоязычной задаче, и внимательно следить за confidence. Есть и ценовой нюанс: русский текст занимает больше токенов, чем английский той же длины.

Закрытая модель и облако

Архитектура, веса, обучающие данные и подробности метода RLCD не опубликованы. Алмейда в интервью TechCrunch не стал раскрывать устройство модели, а сторонние наблюдатели предполагают, что она построена поверх открытой LLM. Договор TypeSafe запрещает обратную разработку сервиса и обучение на ответах Jev модели, которая копирует её поведение.

Дообучить Jev под себя тоже нельзя: одни и те же веса обслуживают все аккаунты. Подстроить модель под свою предметную область можно только через state, инструкции и описания вариантов.

Работает Jev только в облаке, через API. Сервис TypeSafe размещён в одном регионе на Западном побережье США, и свои замеры скорости компания делала оттуда же. Из России сетевая задержка будет больше. TypeSafe обещает не обучать модели на запросах клиентов, но конкретного срока хранения данных для обычного аккаунта в её документах нет — только формулировка «сколько необходимо». Нулевое хранение (ZDR) компания предлагает корпоративным клиентам. Для персональных данных граждан РФ это упирается в требования 152-ФЗ — подробнее в статье о Jev в России.

Технические ограничения

Параметр Лимит
Токенов на запрос 64 000
state плюс самый длинный вопрос 32 000 токенов
Запросов в минуту 1200
Входных токенов в секунду 250 000
Вариантов в одном Choice До 255
Уровней в Score От 2 до 10
Вход Только текст: строка, JSON или массив

Лимит в 32 000 токенов на состояние вместе с самым длинным вопросом означает, что длинный договор или большую переписку придётся резать на части или заранее отбирать нужные фрагменты. Как уложить состояние в лимит и не потерять точность — в статье о state в Jev.

Молодой сервис

Jev вышла в сентябре 2026 года, и это видно. Прямой доступ пока ранний, через лист ожидания. В первые дни после релиза API временами был недоступен из-за наплыва пользователей, а лимиты, по словам TypeSafe, меняются без уведомления, пока компания справляется со спросом.

Цена тоже не проверена временем. TypeSafe сама пишет, что не может доказать, что тариф не субсидирован, хотя ожидает снижения цен, а не роста. Поэтому не стройте систему так, будто Jev доступна всегда и по нынешней цене. Предусмотрите запасной путь: очередь, повтор, простое правило или другую модель.

Экономика цепочек

Дешёвый запрос не гарантирует дешёвую систему. В браузерном агенте, который разобрали на Хабре, на Jev пришлось 98% расходов на модели: агент заново отправлял большое состояние на каждом шаге. В другом стороннем тесте конфигурация с Jev оказалась быстрее, но на 38–51% дороже. Считайте полную цепочку, а не один вызов.

Уверенность требует калибровки

Показатель confidence удобен, но его нельзя читать как вероятность правильного ответа без проверки на своих данных. У Noul его нет вовсе: само значение noul — вероятность ответа «да». Калибровка, по определению TypeSafe, описывает группы предсказаний, а не отдельный ответ. Ещё одна деталь: алиас jev-latest переключится на новую версию модели, и пороги, подобранные под 1.13, придётся проверить заново. Как подбирать пороги, описано в статье об уверенности Jev.

Как снизить риски

  • Сравните Jev с текущим решением на своей размеченной выборке, а не на демо.
  • Заведите серую зону: ответы с низкой уверенностью отправляйте человеку или LLM.
  • Считайте, сравнивайте даты и подсчитывайте элементы в коде.
  • Фильтруйте state: только поля, нужные для конкретного вопроса.
  • Закрепите версию модели, под которую подбирали пороги.
  • Необратимые действия подтверждайте правилом или человеком.
  • Обезличивайте персональные данные перед отправкой.

Итог

Jev — хороший инструмент для потока быстрых решений с понятной проверкой результата. Если вы ждёте от неё «умнее GPT», разочаруетесь. Если ждёте «быстрее и дешевле GPT на классификации при сопоставимом качестве», скорее всего, получите именно это. Что говорят те, кто уже попробовал, — в подборке отзывов о Jev.

Частые вопросы

Какие главные минусы у Jev?

Jev не генерирует текст и не объясняет решения, принимает только текст, слабо справляется с арифметикой и датами и работает только через облачный API. По точности она не всегда догоняет передовые LLM и дообученные классификаторы.

Может ли Jev ошибаться?

Да. Схема гарантирует только форму ответа, вариант вне списка модель не вернёт. Но неверный допустимый вариант она выбрать может, поэтому проверки и пороги уверенности остаются на вас.

Можно ли запустить Jev локально?

Нет. TypeSafe не публиковала веса и архитектуру модели, Jev доступна только через API — напрямую или через площадки-партнёры.

Хорошо ли Jev понимает русский язык?

Понимает, но основной язык обучения — английский. TypeSafe предупреждает, что на других языках точность пока ниже, поэтому качество на русском нужно проверить на своих данных.

Использует ли TypeSafe мои запросы для обучения?

По документации и договору TypeSafe — нет, без согласия клиента его данные в обучение не попадают. Но срок хранения запросов для обычного аккаунта не опубликован, а нулевое хранение предлагают только корпоративным клиентам.

Справляется ли Jev с арифметикой и датами?

Плохо. TypeSafe прямо советует считать, сравнивать даты и подсчитывать элементы в коде, а модели оставлять смысловые суждения — например, извлечь из текста месяц и число.

Источники