Результаты бенчмарков: Koda Pro против мировых лидеров
Ключевое достижение релиза v1.0 — значительный рост эффективности кодового агента. Модель Koda Pro, построенная на базе GLM 5.2, продемонстрировала результат 83% на наборе задач SWE-bench Verified (medium reasoning effort). Для сравнения, связка Claude Code с моделью Opus 4.8 на том же наборе данных показывает 85%, а Sonnet 5 — 73% (при минимальных усилиях). Важно отметить, что Koda Pro использовала режим high reasoning effort, что делает сравнение с Sonnet 5 еще более впечатляющим.
| Модель / Связка | Бенчмарк (SWE-bench Verified) | Усилия (Effort) |
|---|---|---|
| Koda Pro (GLM 5.2) | 83% | High |
| Claude Opus 4.8 | 85% | Medium |
| Claude Sonnet 5 | 73% | Minimum |
| Claude Sonnet 5 | 76% | Medium |
Технические улучшения агента
Разработчики переработали архитектуру взаимодействия LLM с инструментами. Основные изменения коснулись обработки ошибок и обратной связи:
- Гибкая обработка ошибок: Вместо жестких запретов в промпте, инструменты теперь корректно обрабатывают нештатные генерации (например, абсолютные пути вместо относительных).
- Контекстная обратная связь: Инструменты теперь указывают конкретные причины сбоев и предлагают варианты исправления (например, подсказка о возможной опечатке в расширении файла).
- Интеграция с LSP: После каждого редактирования файла агент получает фидбек от Language Server (например, "accountUpdate is not defined"), что позволяет мгновенно исправлять ошибки компиляции, особенно в языках со статической типизацией.
- Оптимизация контекста: Добавлены номера строк при чтении файлов. Агент теперь использует grep для поиска и читает файлы порционно, экономя токены.
Глубокая интеграция с IDE
В версии 1.0 плагины Koda для VS Code и JetBrains полностью перешли на использование API IDE для работы с файловой системой. Это решило проблемы с кодировками, удаленными средами (SSH/WSL/Docker) и множественными workspace. Запуск терминальных команд теперь происходит через встроенный скрытый терминал, что обеспечивает корректную передачу переменных окружения.
Экосистема и новые возможности
Помимо улучшения ядра, команда расширила функционал плагина:
- Добавлен маркетплейс скиллов и поддержка MCP (Model Context Protocol) с интеграцией сервисов NeuralDeep и собственных репозиториев KodaSkills.
- Реализована легкая подключение отечественных провайдеров моделей (vsellm.ru, bothub.chat, proxyapi.ru, neuraldeep.ru).
- Поддержка Telegram-интерфейса расширена на JetBrains IDE и CLI.
- В разработке находится новая модель Koda Base (+4% к метрикам) и модель Next Edit.
Уход с бейджа "beta" и выход версии 1.0 сигнализируют о переходе продукта в стадию стабильного коммерческого использования, способного конкурировать с мировыми аналогами по ключевым метрикам качества кода.
Бенчмарки
| Бенчмарк | Koda Pro (GLM 5.2) | Claude Opus 4.8 | Claude Sonnet 5 |
|---|---|---|---|
| SWE-bench Verified | 83% | 76% | 73% |
Жирным — лучший результат в строке. Источник цифр — официальная публикация.
Источник: Habr ↗
