Отзывы разработчиков о Jev: что хвалят и за что критикуют
За первую неделю о Jev написали десятки изданий и разработчиков. Мы собрали отзывы с проверяемыми источниками — от восторгов по поводу цены до сомнений в цифрах TypeSafe — и разложили их по темам.
Кто что написал
| Источник | Автор | Оценка | Главная мысль |
|---|---|---|---|
| TechCrunch | Тим Фернхольц | Позитивная | Разработчики в восторге, первые кейсы — Vercel и Bryo AI |
| Хабр | «Контролируемые галлюцинации» | Взвешенная | Интерфейс удачный, доказательств пока мало |
| Substack | Энтони Майо | Взвешенная | Сильнее всего идея, а не алгоритм |
| Medium | Мехул Гупта | Позитивная | Слой быстрых решений рядом с LLM |
| vc.ru | Артём Субботин | Прагматичная | Ставить Jev фильтром перед дорогой моделью |
| flaviocopes.com | Флавио Копес | Прагматичная | «Умный if», внедрять по одной ветке |
| heise | Томислав Безмалинович | Осторожная | Оценки делала сама компания, решения без объяснений |
| The Register | Томас Клэберн | Скептичная | «Без галлюцинаций» — некорректное сравнение |
| Tom’s Hardware | Бруно Феррейра | Осторожно-позитивная | Может снять главное препятствие для ИИ в софте |
Что хвалят
Скорость и цена на реальных задачах
Самые конкретные отзывы собрал TechCrunch. Инженер Vercel Пранит Шарма рассказал, что компания проверяла команды на безопасность классификатором на ChatGPT Luna 5.6. После замены на Jev результаты стали приходить в 5–18 раз быстрее и оказались точнее.
Технический директор Bryo AI Никхил Мудхолкар сравнил Jev с Gemini на классификации деловых писем. Gemini оказалась чуть точнее, но в 10–20 раз дороже. Больше всего Мудхолкара заинтересовала уверенность в ответах: по его словам, из протестированных моделей только Jev возвращает настоящую вероятность.
Вероятности вместо уверенного текста
Армин Ронахер, технический директор Earendil (компания делает открытый харнесс для моделей Pi), описал Jev так: модель частично перекладывает проблему галлюцинаций на пользователя. Разработчик сам решает, что 50% — это подбрасывание монетки, а 95% — повод действовать. Ещё одно применение, которое он видит, — маршрутизация запросов между моделями. Ронахер ожидает, что теперь, когда польза подхода очевидна, у Jev появятся конкуренты.
Архитектурная идея
Энтони Майо считает главным в Jev не цену, а мысль о том, что генерация текста может быть неверным интерфейсом между моделью и программой. Он называет Jev обучаемой семантической инструкцией ветвления: модель выносит нечёткое суждение, а код сохраняет контроль над исполнением. Майо заметил в эвалах TypeSafe любопытную деталь: в среднем по четырём задачам каждая модель становилась точнее, быстрее и дешевле, когда задачу разбивали на явный процесс из вопросов. По его мнению, это в первую очередь аргумент в пользу декомпозиции и только потом — в пользу Jev.
Флавио Копес называет Jev «умным if»: модель встраивается туда, где обычное условие не понимает вход. Он хвалит консоль за то, что она сразу перечисляет, для чего модель не годится. Внедрять Jev он советует по одной ветке: неделю записывать уверенность модели рядом с текущей логикой и только потом давать ей действовать.
Мехул Гупта на Medium подчёркивает, что Jev не замена GPT, Claude или Gemini, а отдельный слой быстрых решений: повторить ли шаг агента, какой инструмент вызвать, можно ли отдавать ответ LLM пользователю. Артём Субботин на vc.ru предлагает самый приземлённый вариант — ставить Jev фильтром перед дорогой моделью, чтобы из тысячи записей до Claude или ChatGPT доходила сотня действительно нужных. Он же отмечает, что на GitHub уже несколько сотен проектов с Jev: маршрутизация внутри агентов, разбор потоков тикетов и писем, защитные проверки.
Бруно Феррейра из Tom’s Hardware оговаривается, что он разработчик, но не специалист по ИИ. Его вывод: если Jev работает так, как обещано, она может убрать одно из главных препятствий на пути ИИ в софт — расплывчатые и непредсказуемые ответы чат-ботов. Ограничение контекста в 64 тыс. токенов он при этом называет скромным.
За что критикуют
Цифры от самой компании
heise напоминает, что оценки качества делала сама TypeSafe, а эталоном служило среднее ответов GPT-6 Astra и Claude Fable 5.1. Майо разобрал эти эвалы подробно. В среднем Jev набрала 67,8% совпадений с эталоном — почти как GPT-5.6 Terra (67,9%), но заметно меньше GPT-5.6 Sol (74,1%) и Claude Opus 5 (73,1%). Самый большой разрыв — на обработке счетов: 61,8% против 79,1% у Sol. Если ошибка дорогая, такая разница может перевесить экономию.
Майо также отмечает, что TypeSafe не раскрыла функцию награды, архитектуру и методику калибровки и не опубликовала кривые калибровки. К тому же обучение с подкреплением ради калибровки само по себе не новинка. Копес советует считать рекламные цифры «в 193,6 раза быстрее и в 444,6 раза дешевле» потолком: компания сама пишет, что это верхняя граница реального выигрыша.
«Не галлюцинирует» — спорная формулировка
The Register назвал заявление об отсутствии галлюцинаций некорректным сравнением. Ответ Jev — не текст, а структурированный вариант с вероятностью, и ошибиться модель всё равно может. Автор Хабра рассуждает так же: типобезопасность гарантирует форму и набор допустимых ответов, но не правильность. Если нужного класса нет в списке, модель всё равно вернёт корректный по форме, но неверный ответ. Майо добавляет практичный вывод: в вопросы стоит закладывать варианты «неизвестно» и «ничего из перечисленного». Подробнее — в статье о галлюцинациях Jev.
Проигранные тесты
Хабр собрал сравнения, где скорость не спасла:
- на 1565 деловых письмах на немецком и английском Gemini классифицировала точнее;
- на открытом тесте из 2000 фишинговых писем Jev уступила Claude Haiku 4.5;
- дообученный за 51 минуту GLiNER 2.5 обошёл Jev на Banking77 примерно на 9 процентных пунктов, подробнее — в сравнении с классификаторами;
- в тесте Retriever конфигурация с Jev оказалась на 31% и 43% быстрее, но на 38% и 51% дороже: предварительная фильтрация съела экономию.
Закрытость и данные
Веса, архитектура, данные и функция потерь не опубликованы. По данным TechCrunch, Диогу Алмейда не рассказывает об архитектуре, а сторонние наблюдатели подозревают, что Jev построена поверх открытой LLM. Автор Хабра обращает внимание на хранение данных. TypeSafe обещает не обучать модель на запросах клиентов, но для обычных аккаунтов не называет срок хранения, а режим без хранения (ZDR) предлагает только корпоративным клиентам. Отказ от обучения на ваших данных ещё не означает, что они нигде не хранятся.
Решения без объяснений
heise поднимает вопрос прозрачности. Jev не объясняет свои решения словами, и чем чаще такие модели решают что-то внутри программ, тем важнее понимать и контролировать их поведение. Майо добавляет: пороги уверенности могут оказаться привязаны к распределениям конкретной версии модели.
Мелочи, которые бросаются в глаза
В комментариях к статье на Хабре пользователь Dron007 пожаловался, что модель не может сосчитать буквы в слове или слова в короткой фразе. TypeSafe сама называет подсчёт среди известных слабых мест Jev 1.13 и советует считать в коде. А в первые дни после релиза, по данным TechCrunch, компания ненадолго теряла возможность обслуживать API из-за наплыва пользователей.
В чём сходятся
- Саму идею типизированных решений с вероятностями большинство авторов считает здравой, даже когда сомневается в цифрах.
- Выигрыш в скорости и цене на узких решениях подтверждают первые пользователи.
- Универсального превосходства по точности нет: на части задач LLM и дообученные классификаторы сильнее.
- Крупных независимых тестов пока нет, и многие авторы советуют одно: прогнать Jev на своих данных рядом с текущим решением.
Полный список ограничений собран в статье о минусах Jev, а сценарии, где модель уже работает, — в обзоре применения Jev.
Частые вопросы
Что говорят разработчики о Jev?
Хвалят скорость, цену и вероятности в каждом ответе. В Vercel, по данным TechCrunch, Jev ускорила проверку команд в 5–18 раз. Критикуют закрытость, цифры из собственных тестов TypeSafe и то, что в части сравнений модель уступает по точности LLM и дообученным классификаторам.
Есть ли независимые тесты Jev?
Есть, но небольшие — сравнения с Gemini и Claude Haiku 4.5 на письмах и эксперимент с GLiNER 2.5 на Banking77. Крупного независимого бенчмарка пока нет, поэтому почти все авторы советуют проверять модель на своих данных.
Правда ли, что Jev не галлюцинирует?
Рецензенты сходятся в том, что это верно только для формы ответа. Модель не выйдет за список вариантов, но может выбрать неверный. The Register назвал сравнение с чат-ботами по этому признаку некорректным.
Источники
- TechCrunch — A new kind of AI model from a ChatGPT inventor is thrilling developers
- Хабр — Jev — как устроен его API решений и что на нём уже строят
- Anthony Maio — Jev, The Language Model That Won't Talk
- Data Science in Your Pocket (Medium) — What is Jev AI?
- vc.ru — Модель Jev, новый подход к генерации ответов без текста
- Flavio Copes — A deep dive into Jev, TypeSafe's System One model
- heise online — AI model Jev to make machines decide faster
- The Register — TypeSafe AI debuts model for machines that plays Doom
- Tom's Hardware — TypeSafe AI's Jev offers an alternative to LLMs
- TypeSafe Docs — Jev 1.13 jaggedness