Релиз модели26 июля 2026 г., 14:16 МСК🤖 Auto

KwaiKAT выпустил KAT-Coder-V2.5: 100k сред и победа в PinchBench

Команда KwaiKAT представила агентную модель KAT-Coder-V2.5, обученную на 100 000 верифицируемых средах. Модель показала лидерство в PinchBench и второе место в SWE-Bench Pro, решив проблему нестабильности RL-обучения через инфраструктурные фиксы.

Баннер новости 4410

От кода к агентам: 100 000 верифицируемых сред

KwaiKAT Team из Kuaishou представила KAT-Coder-V2.5 — модель для программирования, которая не просто генерирует код, а действует внутри репозиториев. Ключевое отличие подхода: обучение ведется на триплетах «описание задачи — исполняемая среда — тесты». Модель должна применить патч, который пройдет все проверки.

Для создания таких сред использовался инструмент AutoBuilder. Он анализирует репозитории, генерирует скрипты сборки и запускает тесты в изолированном песочнице. Это позволило поднять успешность создания сред с 16,5% до 57,2% и собрать датасет из более чем 100 000 верифицируемых окружений на 12 языках программирования. Все метаданные Git, которые могли бы подсказать решение, были удалены.

Инфраструктурный прорыв: как починили RL-обучение

Изначально медленный рост метрик при обучении KAT-Coder-V2 связали с алгоритмом PPO. Аудит показал, что ~16% траекторий проваливались из-за сбоев песочницы, а не политики модели. Ошибки включали таймауты из-за переполнения диска (95% использования) и рассинхрон токенов при пере-токенизации через стандартные API.

Команда внедрила три инфраструктурных исправления:

  • Политика очистки образов: снизила использование диска до 60%, устранив таймауты.
  • Фикс переменных окружения: устранил системные переопределения, искажавшие награды.
  • Прямой вызов /generate: bypass mainstream chat endpoints устранил дрейф токенов (до 40% при длинных сессиях).

В результате ошибка обратной связи песочницы снизилась с 16% до менее 2%, а коллапсы обучения сократились в 10 раз.

Результаты бенчмарков

Модель KAT-Coder-V2.5 демонстрирует сильные результаты в задачах, требующих работы с реальными репозиториями. Ниже приведено сравнение ключевых метрик:

Бенчмарк KAT-Coder-V2.5 Opus 4.8 GLM-5.1 / GLM-5.2 Примечание
PinchBench 94.9 93.5 - Лидерство
SWE-Bench Pro 65.2 69.2 - 2-е место
KAT Code Bench (Internal) 53.1 57.3 - 2-е место
Terminal-Bench 2.1 60.7 84.6 61.8 Последнее место
SciCode 50.3 - 50.3 Вровень с GLM-5.2

Open-weight версия и архитектура

Отдельно выпущена версия KAT-Coder-V2.5-Dev под лицензией Apache-2.0. Это MoE-модель (35B параметров, 3B активных), дообученная на базе Qwen3.6-35B-A3B с использованием 127K примеров SFT и RL. Ее результаты не являются прямым аналогом флагманской версии из-за различий в протоколе оценки.

Архитектурно модель использует асимметричный PPO: Critic имеет доступ к привилегированной информации (награды, покрытие кода, метаданные), которая отбрасывается при инференсе. Обучение также включает Multi-Teacher On-Policy Distillation для стабилизации обучения.

Почему это важно

Работа KwaiKAT доказывает, что в агентном программировании инфраструктура (стабильность песочниц, качество генерации тестовых сред) часто важнее масштаба модели. Успешное устранение инфраструктурных шумов позволило извлечь ценные траектории обучения из «почти успешных» попыток, что стало ключом к прорыву в сложных задачах по модификации кода.

Бенчмарки

БенчмаркKAT-Coder-V2.5GLM-5.1GLM-5.2Opus 4.8
PinchBench94.9%93.5%
SWE-Bench Pro65.2%69.2%
Terminal-Bench 2.160.7%61.8%84.6%
SciCode50.3%50.3%

Жирным — лучший результат в строке. Источник цифр — официальная публикация.

Источник: MarkTechPost ↗