Проблема передачи знаний в ИИ
Традиционные методы обучения ИИ-агентов часто опираются на успешные траектории взаимодействия (рекорды действий) или текстовые документы. Однако эти источники имеют существенные недостатки: они могут не раскрывать внутреннюю логику реализации или быть недоступными до момента взаимодействия. Исходный код предлагает альтернативу: он доступен заранее, конкретен и позволяет провести инспекцию после абстракции.
Как работает Code2Skill
Команда Ant International Research представила пайплайн Code2Skill, который автоматизирует процесс превращения сырого кода в структурированные, переиспользуемые навыки (skills). Процесс включает несколько ключевых этапов:
- Ранжирование: Алгоритм отбирает наиболее «богатые по поведению» единицы исходного кода.
- Абстракция: Код преобразуется в типизированные процедуры, которые могут быть атомарными, составными или основанными на повторяющихся паттернах.
- Верификация: Кандидаты проходят строгую проверку через реконструкцию с «закрытым источником» (source-body-blind) и сравнение, aware к исходному коду.
- Сохранение: Успешные записи сохраняются с полной провенансностью (историей происхождения) и состоянием сборки для последующего аудита и использования.
Архитектура пайплайна
Система не просто копирует код, а извлекает из него процедурную сущность. Ниже представлена схема обработки данных в Code2Skill:
| Этап | Действие | Результат |
|---|---|---|
| 1. Отбор | Ранжирование исходных единиц кода | Фильтрация по «богатству поведения» |
| 2. Трансформация | nКонвертация в типизированные процедуры | Атомарные, составные или паттерн-навыки |
| 3. Проверка | Source-body-blind reconstruction | Валидация логики без прямого доступа к коду |
| 4. Финализация | Source-aware comparison | Сохранение с доказательствами и метаданными |
Почему это важно
Code2Skill решает проблему «черного ящика» при передаче знаний ИИ. Благодаря сохранению границ, провенанса и состояния сборки, такие навыки можно безопасно использовать в downstream-задачах. Это позволяет ИИ-агентам не просто имитировать действия, а опираться на проверенную, интерпретируемую логику, зашитую в исходном коде, что критически важно для создания надежных автономных систем.
Источник: Github ↗
