Проблема неконтролируемой эволюции навыков
Современные AI-агенты часто терпят неудачи не из-за отсутствия инструментов, а из-за ненадежности инструкций. Традиционные методы создания навыков (skills) — ручная работа экспертов, однократная генерация через LLM или хаотичные правки после выполнения задач — не имеют механизма обратной связи, контроля шага обучения и валидации. Это приводит к «дрейфу» промптов: инструкции становятся длиннее, но качество выполнения задач падает. SkillOpt решает эту проблему, превращая редактирование навыка в контролируемый процесс оптимизации, аналогичный обучению нейросети, но без изменения весов самой модели.
Как работает оптимизация: цикл «вперед-назад-обновление»
Метод SkillOpt рассматривает файл навыка (обычно Markdown) как обучаемый параметр, существующий вне замороженной целевой модели. Процесс состоит из трех этапов:
- Прямой проход (Forward): Замороженная модель выполняет пакет задач с текущим навыком, собирая траектории выполнения.
- Обратный проход (Backward): Отдельная модель-оптимизатор анализирует траектории, выделяя успешные паттерны и ошибки.
- Обновление (Update): Оптимизатор предлагает небольшие правки (добавление, удаление, замена). Кандидаты проходят строгую валидацию: навык принимается только если он показывает лучший результат на валидационной выборке. Отклоненные правки сохраняются в буфере как негативный опыт.
Ключевые механизмы контроля включают «текстовую скорость обучения» (ограничение количества правок за шаг) и медленные мета-обновления, которые консолидируют долгосрочные уроки.
Результаты: лидерство во всех 52 тестовых ячейках
Оценка проводилась на шести бенчмарках (SearchQA, SpreadsheetBench, OfficeQA, DocVQA, LiveMathematicianBench, ALFWorld), семи моделях (от GPT-5.5 до Qwen3.5-4B) и трех режимах выполнения. SkillOpt показал лучшие или равные лучшие результаты во всех 52 комбинациях, превосходя методы Trace2Skill, TextGrad, GEPA и EvoSkill.
| Метрика / Модель | Базовый уровень (No Skill) | Результат SkillOpt | Прирост |
|---|---|---|---|
| GPT-5.5 (Среднее по 6 бенчмаркам) | 58.8 | 82.3 | +23.5 |
| SpreadsheetBench (GPT-5.5) | 41.8 | 80.7 | +38.9 |
| OfficeQA (GPT-5.5) | 33.1 | 72.1 | +39.0 |
| LiveMathematicianBench (GPT-5.5) | 37.6 | 66.9 | +29.3 |
| GPT-5.5 в Codex (агентный цикл) | — | — | +24.8 |
Маленькие модели против флагманов
Оптимизированные навыки позволяют компактным моделям превосходить более крупные аналоги без их дообучения. После применения SkillOpt:
- Средний балл GPT-5.4-mini (64.3) превысил базовый уровень более крупной GPT-5.4 (59.7).
- Модель GPT-5.4-nano (57.4) превзошла базовый уровень GPT-5.2 (51.3).
- Открытая модель Qwen3.5-4B также показала результаты выше базового уровня GPT-5.2.
Переносимость и компактность
Итоговый файл навыка (best_skill.md) остается компактным: медианная длина составляет около 920 токенов, а в финальную версию попадает всего 1–4 правки. Например, прирост в +39.0 баллов на OfficeQA был достигнут всего одной принятой правкой. Навыки обладают высокой переносимостью: табличный навык, обученный в среде Codex, был перенесен в Claude Code без дополнительной оптимизации, подняв результат с 22.1 до 81.8 (+59.7), что даже немного выше, чем обучение напрямую в Claude Code (80.4). Это доказывает, что SkillOpt учит общие рабочие процессы, а не просто подстраивается под конкретный интерфейс.
Источник: Microsoft Research ↗
