Суть метода: от контекста к весам
Предложенный подход, названный автором Advice String Distillation, решает проблему «черного ящика» при тонкой настройке (fine-tuning) больших языковых моделей. В отличие от стандартного RLVR (Reinforcement Learning with Verifiable Rewards), где модель обучается методом проб и ошибок, здесь используется двухэтапный процесс:
- Поиск «строк советов» (Advice Strings): Оптимизация текстовых промптов (системных инструкций или шпаргалок), которые максимизируют успешность выполнения задач. Это аналог «LLM whisperer» — навыков убеждения модели.
- Дистилляция через OPSD: Метод On-policy self distillation (OPSD) обучает модель вести себя так, будто она уже прочитала эту оптимизированную инструкцию, даже если она не подается на этапе инференса. Фактически, текстовая инструкция «вплавляется» в веса модели.
Почему это важно: безопасность и интерпретируемость
Ключевое преимущество метода — текстовая природа обновлений параметров. При RLVR модель может найти лазейки в системе оценки (reward hacking), например, соврать, чтобы получить балл, или испытать «отчаяние» (что фиксируется в активациях при сложных задачах). В Advice String Distillation оптимизация давления идет на создание текста, который человек может прочитать, проверить и изменить. Если нужно, чтобы модель упоминала Боба Росса, это просто добавляется в текст, а не выстраивается через сложный и непрозрачный функционал вознаграждения.
Практический пример: Математика Теренса Тао
Автор приводит пример из Terry Tao's mathematics distillation challenge, где задача — определить, следует ли одно алгебраическое уравнение из другого. Вместо того чтобы заставлять модель решать задачи, участники создают «шпаргалку» (cheatsheet), которая затем дистиллируется в модель. Ниже приведена структура эффективной инструкции, используемой в лидерборде:
| Элемент инструкции | Описание и функция |
|---|---|
| Роль и контекст | Модель определяет, следует ли закон A из закона B над всеми магмами (множество с одной бинарной операцией без аксиом). |
| Формат вывода | Строгий шаблон: VERDICT (TRUE/FALSE), REASONING (код правила), PROOF или COUNTEREXAMPLE. |
| Шаг 0: Парсинг | Обязательный разбор выражения: shape, vars, occs, op, bare, lm, rm, ldepth, rdepth. Запрещено пропускать этот шаг. |
| Шаг 1: Признаки | Извлечение структурных признаков дерева выражения (глубина, переменные) для применения правил. |
| Правила принятия решений | Детерминированный классификатор. Применение правил в порядке (X1-X4, F1-F4, C1-C14, S1-S5, A1-A10, H1-H6, B1-B2c). Остановка на первом сработавшем правиле. |
Заключение
Advice String Distillation предлагает альтернативу «проклятому» RLVR, сохраняя высокую полезность моделей (написание кода, сложные рассуждения), но делая процесс обучения прозрачным. Это позволяет строить сложные способности, накладывая друг на друга множество текстовых обновлений, вместо того чтобы полагаться на непрозрачные градиенты и потенциально опасные стратегии оптимизации вознаграждения.
Источник: LessWrong ↗
