Исследования31 июля 2026 г., 12:17 МСК🤖 Auto

CAPA: Новый бенчмарк для персонализации AI-кодинга

Исследователи представили CAPA — первый бенчмарк для оценки способности AI-ассистентов запоминать контекст пользователя между сессиями, сокращая количество уточняющих вопросов.

Баннер новости 4798

Команда исследователей во главе с Цзыцзянем Сюем (Zijian Xu) из Университета Цзэцзяна опубликовала работу, посвященную критической проблеме в AI-ассистентах для программирования: персонализированной адаптации к неоднозначностям. Авторы доказывают, что текущие модели тратят слишком много времени на уточнение требований, игнорируя историю предыдущих сессий того же пользователя. Они ввели новый метрический набор данных CAPA (Cross-Session Personalized Ambiguity Adaptation) и протестировали на нем 12 современных LLM.

Суть проблемы: «Колесница, изобретенная заново»

Большинство существующих методов устранения неоднозначности работают изолированно внутри одной сессии. Если пользователь дважды формулирует задачу с одной и той же скрытой ошибкой или специфическим стилем, модель каждый раз просит уточнить, вместо того чтобы «запомнить» паттерн. CAPA решает эту задачу, требуя от модели использовать историю resolved (разрешенных) сессий для генерации кода в новой, незнакомой задаче, минимизируя количество раундов диалога.

Методология: 6 механизмов неоднозначности

Для создания датасета CAPA авторы разработали контролируемый конвейер из трех этапов, который внедряет шесть конкретных механизмов неоднозначности в изначально понятные задачи. Это позволяет изолировать влияние пользовательского стиля на качество кода.

Механизм неоднозначности Описание
1. Именованные сущности Использование специфических имен переменных, классов или проектов, характерных для пользователя.
2. Стиль кодирования Предпочтения в форматировании, выборе паттернов проектирования или библиотек.
3. Логические допущения Скрытые предпосылки о том, как должна работать система, не прописанные явно.
4. Ошибочные интерпретации Повторяющиеся ошибки в понимании требований, которые пользователь не исправляет.
5. Контекстные ссылки Обращение к внешним ресурсам или прошлым решениям без явного указания.
6. Приоритеты Скрытые предпочтения в балансе между производительностью, читаемостью и скоростью разработки.

Результаты тестирования 12 моделей

Бенчмарк включает 600 сессий (по 10 сессий на каждую из 60 ячеек «пользователь-неоднозначность»), из которых 300 сессий выделены для тестирования (held-out). Модели оценивались по трем ключевым метрикам: executable success (выполняемость кода), first-turn success (успех с первого ответа) и turns-to-completion (количество шагов до готового решения).

Ключевое открытие: использование истории предыдущих сессий (same-user history) значительно повышает качество кода. Авторы также предложили легкий метод same-user history gating на этапе инференса, который позволяет моделям эффективно отбирать релевантную историю, не перегружая контекстное окно.

Почему это важно

CAPA закладывает фундамент для создания «долгосрочных» AI-ассистентов, которые становятся умнее с каждым использованием. Снижение количества уточняющих вопросов (clarifications) напрямую влияет на UX разработчиков, экономя время и снижая когнитивную нагрузку. Для индустрии это шаг от разовых генераторов кода к персональным цифровым помощникам, понимающим индивидуальный стиль программирования.

Источник: arXiv cs.AI ↗