Суть технологии: один файл вместо дообучения
SkillOpt — это оптимизатор на основе естественного языка, разработанный совместно с университетами Шанхая, Тунцзи и Фудана. В отличие от традиционных методов, требующих переобучения весов модели, SkillOpt работает с «замороженной» целевой моделью. Оптимизатор анализирует результаты выполнения задач (rollouts) и предлагает конкретные текстовые правки: добавление, удаление или замену инструкций. Итоговый артефакт — это один файл best_skill.md, размер которого варьируется от 379 до 1995 токенов (медиана ~920 токенов). Это делает процесс аудита и внедрения прозрачным: каждый шаг записывается в edit_apply_report.json.
Кросс-платформенный прорыв: Codex против Claude Code
Самый значимый результат исследования касается переноса навыков между разными «хэширками» (средами выполнения) — Microsoft Codex и Anthropic Claude Code. Несмотря на различия в API инструментов и командах CLI, навык, оптимизированный в одной среде, успешно работает в другой. Более того, в случае с таблицами (SpreadsheetBench) перенесенный навык превзошел результат модели, обученной нативно в целевой среде.
| Бенчмарк | Источник → Целевая среда | Baseline (без навыка) | Direct (нативное обучение) | Transferred (перенос) | Прирост | Доля успеха |
|---|---|---|---|---|---|---|
| SpreadsheetBench | Codex → Claude Code | 22.1 | 80.4 | 81.8 | +59.7 | 102% |
| SpreadsheetBench | Claude Code → Codex | 27.5 | 85.0 | 71.1 | +43.6 | 76% |
| LiveMath | Claude Code → Codex | 35.2 | 78.4 | 48.0 | +12.8 | 30% |
| LiveMath | Codex → Claude Code | 40.8 | 56.5 | 42.4 | +1.6 | 10% |
Первая строка таблицы — ключевая: навык, созданный для Codex, дал результат 81.8 в Claude Code, что выше нативного показателя 80.4. Это доказывает, что некоторые процедурные навыки (например, структура проверки формул в таблицах) не зависят от конкретной среды выполнения.
Перенос между моделями: эффективность зависит от масштаба
Исследователи также тестировали перенос навыков между моделями семейства GPT-5.4. Результаты показали, что «маленькие» модели (nano) хуже сохраняют перенесенные знания, чем средние (mini). Однако даже в худшем случае перенесенный навык превосходил базовый уровень без обучения.
| Бенчмарк | Целевая модель | Baseline | Direct (in-domain) | Transferred | Прирост | Доля успеха |
|---|---|---|---|---|---|---|
| SpreadsheetBench | GPT-5.4-mini | 36.1 | 47.5 | 45.5 | +9.4 | 82% |
| SpreadsheetBench | GPT-5.4-nano | 23.5 | 42.5 | 26.5 | +3.0 | 16% |
| LiveMath | GPT-5.4-mini | 14.7 | 32.8 | 19.2 | +4.5 | 25% |
| LiveMath | GPT-5.4-nano | 23.2 | 27.2 | 28.8 | +5.6 | 140% |
Интересный феномен наблюдается в LiveMath на GPT-5.4-nano: перенесенный навык (28.8) превзошел нативное обучение (27.2). Авторы связывают это с тем, что некоторые процедурные алгоритмы являются универсальными и не требуют адаптации под конкретную модель.
Почему это важно для индустрии
SkillOpt меняет парадигму оптимизации агентов. Затраты на обучение оплачиваются один раз офлайн (от 0.6M до 46.4M токенов в зависимости от задачи), а при развертывании не требуется никаких дополнительных вызовов оптимизатора. Это позволяет:
- Экономить ресурсы: оптимизировать навыки там, где инструменты дешевле, а развертывать там, где это нужно продукту.
- Обеспечивать прозрачность: навык — это читаемый текстовый файл, а не черные веса нейросети.
- Масштабировать: один раз обученный навык для работы с таблицами можно использовать в разных средах (Codex, Claude Code, локальные модели) без переобучения.
Ограничение текущего исследования: перенос проверен только внутри семейства GPT и между двумя основными хэширками. Кросс-семейственный перенос (например, GPT → Qwen) пока не тестировался, а сложные математические рассуждения переносятся хуже, чем процедурные задачи с таблицами.
Бенчмарки
| Бенчмарк | GPT-5.4 | GPT-5.4-mini | GPT-5.4-nano |
|---|---|---|---|
| SpreadsheetBench | — | 36.1% | 23.5% |
| LiveMath | — | 14.7% | 23.2% |
| OlympiadBench | 56.6% | 34.8% | 38.8% |
Жирным — лучший результат в строке. Источник цифр — официальная публикация.
Источник: MarkTechPost ↗
