От кода к агентам: 100 000 верифицируемых сред
KwaiKAT Team из Kuaishou представила KAT-Coder-V2.5 — модель для программирования, которая не просто генерирует код, а действует внутри репозиториев. Ключевое отличие подхода: обучение ведется на триплетах «описание задачи — исполняемая среда — тесты». Модель должна применить патч, который пройдет все проверки.
Для создания таких сред использовался инструмент AutoBuilder. Он анализирует репозитории, генерирует скрипты сборки и запускает тесты в изолированном песочнице. Это позволило поднять успешность создания сред с 16,5% до 57,2% и собрать датасет из более чем 100 000 верифицируемых окружений на 12 языках программирования. Все метаданные Git, которые могли бы подсказать решение, были удалены.
Инфраструктурный прорыв: как починили RL-обучение
Изначально медленный рост метрик при обучении KAT-Coder-V2 связали с алгоритмом PPO. Аудит показал, что ~16% траекторий проваливались из-за сбоев песочницы, а не политики модели. Ошибки включали таймауты из-за переполнения диска (95% использования) и рассинхрон токенов при пере-токенизации через стандартные API.
Команда внедрила три инфраструктурных исправления:
- Политика очистки образов: снизила использование диска до 60%, устранив таймауты.
- Фикс переменных окружения: устранил системные переопределения, искажавшие награды.
- Прямой вызов /generate: bypass mainstream chat endpoints устранил дрейф токенов (до 40% при длинных сессиях).
В результате ошибка обратной связи песочницы снизилась с 16% до менее 2%, а коллапсы обучения сократились в 10 раз.
Результаты бенчмарков
Модель KAT-Coder-V2.5 демонстрирует сильные результаты в задачах, требующих работы с реальными репозиториями. Ниже приведено сравнение ключевых метрик:
| Бенчмарк | KAT-Coder-V2.5 | Opus 4.8 | GLM-5.1 / GLM-5.2 | Примечание |
|---|---|---|---|---|
| PinchBench | 94.9 | 93.5 | - | Лидерство |
| SWE-Bench Pro | 65.2 | 69.2 | - | 2-е место |
| KAT Code Bench (Internal) | 53.1 | 57.3 | - | 2-е место |
| Terminal-Bench 2.1 | 60.7 | 84.6 | 61.8 | Последнее место |
| SciCode | 50.3 | - | 50.3 | Вровень с GLM-5.2 |
Open-weight версия и архитектура
Отдельно выпущена версия KAT-Coder-V2.5-Dev под лицензией Apache-2.0. Это MoE-модель (35B параметров, 3B активных), дообученная на базе Qwen3.6-35B-A3B с использованием 127K примеров SFT и RL. Ее результаты не являются прямым аналогом флагманской версии из-за различий в протоколе оценки.
Архитектурно модель использует асимметричный PPO: Critic имеет доступ к привилегированной информации (награды, покрытие кода, метаданные), которая отбрасывается при инференсе. Обучение также включает Multi-Teacher On-Policy Distillation для стабилизации обучения.
Почему это важно
Работа KwaiKAT доказывает, что в агентном программировании инфраструктура (стабильность песочниц, качество генерации тестовых сред) часто важнее масштаба модели. Успешное устранение инфраструктурных шумов позволило извлечь ценные траектории обучения из «почти успешных» попыток, что стало ключом к прорыву в сложных задачах по модификации кода.
Бенчмарки
| Бенчмарк | KAT-Coder-V2.5 | GLM-5.1 | GLM-5.2 | Opus 4.8 |
|---|---|---|---|---|
| PinchBench | 94.9% | — | — | 93.5% |
| SWE-Bench Pro | 65.2% | — | — | 69.2% |
| Terminal-Bench 2.1 | 60.7% | 61.8% | — | 84.6% |
| SciCode | 50.3% | — | 50.3% | — |
Жирным — лучший результат в строке. Источник цифр — официальная публикация.
Источник: MarkTechPost ↗
