Релиз модели6 августа 2026 г., 04:16 МСК🤖 Auto

SkillOpt: Как Microsoft переносит навыки агентов между Codex и Claude Code

Исследователи Microsoft представили SkillOpt — оптимизатор, который позволяет переносить текстовые навыки между разными моделями и средами выполнения. Главный прорыв: навык, обученный в Codex, превзошел нативное решение в Claude Code.

Баннер новости 5174

Суть технологии: один файл вместо дообучения

SkillOpt — это оптимизатор на основе естественного языка, разработанный совместно с университетами Шанхая, Тунцзи и Фудана. В отличие от традиционных методов, требующих переобучения весов модели, SkillOpt работает с «замороженной» целевой моделью. Оптимизатор анализирует результаты выполнения задач (rollouts) и предлагает конкретные текстовые правки: добавление, удаление или замену инструкций. Итоговый артефакт — это один файл best_skill.md, размер которого варьируется от 379 до 1995 токенов (медиана ~920 токенов). Это делает процесс аудита и внедрения прозрачным: каждый шаг записывается в edit_apply_report.json.

Кросс-платформенный прорыв: Codex против Claude Code

Самый значимый результат исследования касается переноса навыков между разными «хэширками» (средами выполнения) — Microsoft Codex и Anthropic Claude Code. Несмотря на различия в API инструментов и командах CLI, навык, оптимизированный в одной среде, успешно работает в другой. Более того, в случае с таблицами (SpreadsheetBench) перенесенный навык превзошел результат модели, обученной нативно в целевой среде.

Бенчмарк Источник → Целевая среда Baseline (без навыка) Direct (нативное обучение) Transferred (перенос) Прирост Доля успеха
SpreadsheetBench Codex → Claude Code 22.1 80.4 81.8 +59.7 102%
SpreadsheetBench Claude Code → Codex 27.5 85.0 71.1 +43.6 76%
LiveMath Claude Code → Codex 35.2 78.4 48.0 +12.8 30%
LiveMath Codex → Claude Code 40.8 56.5 42.4 +1.6 10%

Первая строка таблицы — ключевая: навык, созданный для Codex, дал результат 81.8 в Claude Code, что выше нативного показателя 80.4. Это доказывает, что некоторые процедурные навыки (например, структура проверки формул в таблицах) не зависят от конкретной среды выполнения.

Перенос между моделями: эффективность зависит от масштаба

Исследователи также тестировали перенос навыков между моделями семейства GPT-5.4. Результаты показали, что «маленькие» модели (nano) хуже сохраняют перенесенные знания, чем средние (mini). Однако даже в худшем случае перенесенный навык превосходил базовый уровень без обучения.

Бенчмарк Целевая модель Baseline Direct (in-domain) Transferred Прирост Доля успеха
SpreadsheetBench GPT-5.4-mini 36.1 47.5 45.5 +9.4 82%
SpreadsheetBench GPT-5.4-nano 23.5 42.5 26.5 +3.0 16%
LiveMath GPT-5.4-mini 14.7 32.8 19.2 +4.5 25%
LiveMath GPT-5.4-nano 23.2 27.2 28.8 +5.6 140%

Интересный феномен наблюдается в LiveMath на GPT-5.4-nano: перенесенный навык (28.8) превзошел нативное обучение (27.2). Авторы связывают это с тем, что некоторые процедурные алгоритмы являются универсальными и не требуют адаптации под конкретную модель.

Почему это важно для индустрии

SkillOpt меняет парадигму оптимизации агентов. Затраты на обучение оплачиваются один раз офлайн (от 0.6M до 46.4M токенов в зависимости от задачи), а при развертывании не требуется никаких дополнительных вызовов оптимизатора. Это позволяет:

  • Экономить ресурсы: оптимизировать навыки там, где инструменты дешевле, а развертывать там, где это нужно продукту.
  • Обеспечивать прозрачность: навык — это читаемый текстовый файл, а не черные веса нейросети.
  • Масштабировать: один раз обученный навык для работы с таблицами можно использовать в разных средах (Codex, Claude Code, локальные модели) без переобучения.

Ограничение текущего исследования: перенос проверен только внутри семейства GPT и между двумя основными хэширками. Кросс-семейственный перенос (например, GPT → Qwen) пока не тестировался, а сложные математические рассуждения переносятся хуже, чем процедурные задачи с таблицами.

Бенчмарки

БенчмаркGPT-5.4GPT-5.4-miniGPT-5.4-nano
SpreadsheetBench36.1%23.5%
LiveMath14.7%23.2%
OlympiadBench56.6%34.8%38.8%

Жирным — лучший результат в строке. Источник цифр — официальная публикация.

Источник: MarkTechPost ↗