Исследования1 октября 2026 г., 12:18 МСК🤖 Auto

ArgGYM: Новый бенчмарк для обучения LLM неопровержимому выводу

Исследователи представили ArgGYM — процедурный бенчмарк с верификацией через символьный движок, позволяющий обучать модели работе с пересматриваемыми аргументами и RLVR.

Баннер новости 8682

Проблема статичных бенчмарков

Современные большие языковые модели (LLM) демонстрируют выдающиеся результаты в математике, коде и формальной логике благодаря бенчмаркам с автоматически верифицируемыми наградами. Однако эти задачи опираются на фиксированные спецификации и стабильные критерии. В реальном мире рассуждение часто происходит в условиях неполной информации: выводы могут быть временно приняты, опровергнуты новыми фактами или пересмотрены при появлении более сильных аргументов. Этот тип мышления называется неопровержимым выводом (defeasible reasoning).

Что такое ArgGYM

Команда исследователей во главе с Ибрагимом Этемом Девеки (İbrahim Ethem Deveci) представила ArgGYM — процедурный бенчмарк и среду для обучения с подкреплением, совместимую с RLVR (Reinforcement Learning with Verifiable Rewards). Ключевая особенность системы — использование символьного движка аргументации, который вычисляет формальные состояния для оценки выводов модели, обеспечивая объективную проверку.

Бенчмарк декомпозирует задачу на 12 различных типов рассуждений. Архитектура позволяет генерировать бесконечное количество новых задач, что снижает зависимость от статических наборов тестов и открывает путь к непрерывному обучению.

Структура и метрики

Замороженный набор данных (frozen benchmark) включает 1 440 верифицированных примеров. Тестирование проводилось в 15 конфигурациях учебной программы (curriculum), варьирующих сложность и длину зависимостей. Оценка учитывает два порядка предпочтения аргументов (weakest-link и last-link) и два порядка множеств (elitist и democratic).

Параметр Значение / Описание
Объем датасета 1 440 верифицированных инстансов
Количество задач 12 типов структурных рассуждений
Конфигурации 15 уровней сложности (curriculum)
Порядок аргументов Weakest-link (слабое звено) и Last-link (последняя ссылка)
Порядок множеств Elitist (элитарный) и Democratic (демократический)
Технология верификации Символьный движок аргументации (Symbolic Argumentation Engine)

Результаты тестирования

На замороженном бенчмарке были протестированы передовые (frontier) и модели с открытым весом (open-weight). Результаты показали резкие различия в профилях рассуждений:

  • Модели способны восстанавливать значительную часть структурированных ответов, даже если не решают задачу полностью.
  • Производительность резко снижается в более поздних конфигурациях учебной программы, где требуются более длинные цепочки зависимостей и взаимодействие сложных структур.

Значение для индустрии

Выпуск ArgGYM, генераторов и верификаторов позволяет исследователям проводить воспроизводимую оценку и использовать данные для RLVR-обучения. Это шаг к созданию ИИ, способного не просто выдавать ответ, а вести диалектическое мышление, пересматривая свои выводы по мере поступления новой информации.

Источник: arXiv cs.AI ↗