RLCD: как Jev учили принимать откалиброванные решения

Обновлено

RLCD — метод дообучения, на котором TypeSafe построила Jev. Он нужен, чтобы вероятности в ответах модели совпадали с реальной частотой правильных ответов. Разбираем, что такое калибровка, чем RLCD отличается от RLHF и что о методе известно на самом деле.

Три способа дообучить модель

Предобученная языковая модель умеет продолжать текст, но ещё не умеет быть полезной. До дела её доводят дообучением с подкреплением. TypeSafe выделяет три подхода:

Метод Что вознаграждается Что получилось
RLHF — обучение на обратной связи от людей Ответы, которые люди предпочитают Чат-боты вроде ChatGPT
RLVR — обучение на проверяемых наградах Результаты, которые можно проверить программой Рассуждающие модели: сильны в математике, но медленнее и дороже
RLCD — обучение на откалиброванные решения Решения с вероятностями, которые совпадают с частотой правильных ответов Jev

RLCD расшифровывается как Reinforcement Learning for Calibrated Decisions. В тексте TechCrunch встречается вариант «from calibrated decisions», но сама TypeSafe пишет «for».

У RLHF в этой истории особое место. Основатель TypeSafe Диогу Алмейда был одним из основных авторов статьи InstructGPT, на которой построено дообучение ChatGPT. Теперь он доказывает, что для автоматизации тот же подход не годится. Подробнее о компании — в статье о TypeSafe AI.

Калибровка простыми словами

Представьте синоптика, который сто раз обещал дождь с вероятностью 70%. Если дождь прошёл примерно в 70 случаях из 100, его прогнозы откалиброваны. Если в 40 — синоптик переоценивает свои шансы.

С моделью то же самое. TypeSafe формулирует цель так: среди ответов с вероятностью 0,2 верных должно быть около 20%, с вероятностью 0,8 — около 80%, с вероятностью 1,0 — все. Важная оговорка есть в самой документации: калибровка описывает группу предсказаний, а не отдельный ответ.

Калибровка не равна точности. Энтони Майо в своём разборе напоминает: модель, которая всегда называет базовую частоту события, может быть идеально откалибрована и при этом бесполезна. Если спама в почте 30%, ответ «0,3» для каждого письма калиброван, но не отделяет спам от обычных писем. Нужны и точность, и умение отличать лёгкие случаи от трудных.

Зачем вообще калибровка, TypeSafe объясняет на примере. Если модель справляется с задачей в 95% случаев, но не сообщает, когда попала в оставшиеся 5%, такую задачу нельзя отдать автоматике. Честная неопределённость позволяет коду действовать сам в уверенных случаях и звать человека в остальных.

Зачем понадобился новый метод

Аргументы TypeSafe сводятся к трём тезисам.

RLHF учит нравиться. Модель поощряют за текст, который выберет человек-оценщик. Для чата это правильная цель, для автоматизации — нет. По мнению компании, такое обучение может поощрять угодничество и уверенно звучащие галлюцинации. Есть и побочный эффект — сужение распределения (mode dropping): модель закрепляет один стиль ответов и отбрасывает другие варианты.

RLVR подходит не для всех задач. Награда за проверяемый результат хорошо работает в математике и коде. Но большинство реальных суждений — срочность письма, уместность действия агента — программой не проверишь. По оценке TypeSafe, в таких задачах RLVR даёт неровный, неустойчивый интеллект.

Правильная задача важнее всего. В эссе «The Bitterest Lesson» из блога TypeSafe выстроен порядок: правильная задача важнее данных, данные важнее вычислений, вычисления важнее алгоритмов. Автор ссылается на работу над InstructGPT в OpenAI: модели размером с GPT-2, обученные на правильной задаче следования инструкциям, обошли GPT-3, которая была больше их в сотню с лишним раз.

Отсюда логика RLCD: если софту нужны решения с честной неопределённостью, модель надо оптимизировать именно на это, а не на красивый текст.

Синтетические данные

По словам Алмейды в интервью TechCrunch, Jev обучена исключительно на синтетических данных. Компания с самого начала решила создавать все данные сама, и основатель называет это одним из лучших своих решений. Половина TypeSafe, по его словам, — лаборатория, которая занимается синтетическими данными с хорошо изученными статистическими свойствами.

В ответах на частые вопросы к анонсу TypeSafe называет себя прежде всего лабораторией исследования данных. Подробностей нет: компания шутит, что расскажет больше, только если возьмёт вас на работу. Практичный вывод для клиентов есть в документации: Jev не обучают на запросах и ответах пользователей, а одни и те же веса обслуживают все аккаунты.

Чего TypeSafe не раскрыла

О RLCD известно, что метод должен делать, но не как он устроен. Майо перечисляет пробелы: не опубликованы функция вознаграждения, архитектура, процедура обучения и методика калибровки, нет кривых калибровки и воспроизводимой статьи.

Сама идея награды за калибровку не нова. Майо упоминает, например, работу «Rewarding Doubt» о вознаграждении моделей за откалиброванную уверенность. Новизна Jev скорее в сочетании: отказ от генерации текста, распределения вероятностей как основной выход и продукт, построенный вокруг параллельных решений. Пока независимых проверок нет, слова «Jev откалибрована» остаются заявлением компании. Что известно об устройстве самой модели, мы собрали в статье «Как устроена Jev».

Где калибровка заканчивается

Даже если RLCD работает как обещано, у калибровки есть границы:

  • Она статистическая. Вероятность 0,9 не говорит, верен ли конкретный ответ.
  • Она зависит от данных. Новые правила, незнакомые клиенты, другие схемы мошенничества или враждебные входы могут незаметно испортить вероятности, которые месяц назад были точными.
  • Она не переносится между вопросами. В документации к Jev 1.13 есть пример: на вопрос «клиент просит возврат?» и на его отрицание модель ответила 0,72 и 0,47 — в сумме 1,19. Тот же вопрос в форме Noul и в форме Choice получил 0,22 и 0,01.
  • Она не складывается сама. Откалиброванные по отдельности ответы не дают откалиброванный итог после порогов, весов и ветвлений.
  • Шкалы калиброваны слабее. Уровни Score, по признанию TypeSafe, плохо откалиброваны численно, и интерполировать значение между ними не стоит.
  • Язык имеет значение. Основной язык обучения Jev — английский, на других языках точность пока ниже. Калибровку на русских текстах нужно проверять отдельно.

Отдельно помните о разнице между вероятностями и полем confidence. Второе — статистика формы распределения. Как её читать и как ставить пороги, мы разобрали в статье об уверенности Jev.

Как проверить калибровку самому

  1. Соберите размеченную выборку из реального потока — хотя бы несколько сотен примеров.
  2. Сохраните для каждого примера noul или вероятность выбранного варианта.
  3. Разбейте ответы на корзины по вероятности: 0–0,1, 0,1–0,2 и так далее.
  4. В каждой корзине сравните среднюю вероятность с долей верных ответов. Если точки лежат близко к диагонали, на ваших данных модель откалибрована.

Метрики и код для такой проверки есть в статье «Jev и классическое машинное обучение».

Частые вопросы

Что такое RLCD в Jev?

Reinforcement Learning for Calibrated Decisions — метод дообучения, который TypeSafe разработала для Jev. Он оптимизирует модель на решения с вероятностями, которые совпадают с реальной частотой правильных ответов. Детали метода компания не публикует.

Чем RLCD отличается от RLHF?

RLHF вознаграждает ответы, которые предпочитают люди, — так получаются чат-боты. RLCD вознаграждает откалиброванные вероятности в задачах выбора, а текст модель не генерирует вовсе.

На каких данных обучали Jev?

По словам основателя TypeSafe Диогу Алмейды, только на синтетических данных, которые компания создаёт сама. Состав данных не раскрывается, на запросах клиентов модель не обучают.

Вероятность 0,9 от Jev означает 90% точности?

Только в среднем по большой группе похожих ответов — и только если заявленная калибровка держится на ваших данных. Это нужно проверить на размеченной выборке.

Источники