Проблема статичных бенчмарков
Современные большие языковые модели (LLM) демонстрируют выдающиеся результаты в математике, коде и формальной логике благодаря бенчмаркам с автоматически верифицируемыми наградами. Однако эти задачи опираются на фиксированные спецификации и стабильные критерии. В реальном мире рассуждение часто происходит в условиях неполной информации: выводы могут быть временно приняты, опровергнуты новыми фактами или пересмотрены при появлении более сильных аргументов. Этот тип мышления называется неопровержимым выводом (defeasible reasoning).
Что такое ArgGYM
Команда исследователей во главе с Ибрагимом Этемом Девеки (İbrahim Ethem Deveci) представила ArgGYM — процедурный бенчмарк и среду для обучения с подкреплением, совместимую с RLVR (Reinforcement Learning with Verifiable Rewards). Ключевая особенность системы — использование символьного движка аргументации, который вычисляет формальные состояния для оценки выводов модели, обеспечивая объективную проверку.
Бенчмарк декомпозирует задачу на 12 различных типов рассуждений. Архитектура позволяет генерировать бесконечное количество новых задач, что снижает зависимость от статических наборов тестов и открывает путь к непрерывному обучению.
Структура и метрики
Замороженный набор данных (frozen benchmark) включает 1 440 верифицированных примеров. Тестирование проводилось в 15 конфигурациях учебной программы (curriculum), варьирующих сложность и длину зависимостей. Оценка учитывает два порядка предпочтения аргументов (weakest-link и last-link) и два порядка множеств (elitist и democratic).
| Параметр | Значение / Описание |
|---|---|
| Объем датасета | 1 440 верифицированных инстансов |
| Количество задач | 12 типов структурных рассуждений |
| Конфигурации | 15 уровней сложности (curriculum) |
| Порядок аргументов | Weakest-link (слабое звено) и Last-link (последняя ссылка) |
| Порядок множеств | Elitist (элитарный) и Democratic (демократический) |
| Технология верификации | Символьный движок аргументации (Symbolic Argumentation Engine) |
Результаты тестирования
На замороженном бенчмарке были протестированы передовые (frontier) и модели с открытым весом (open-weight). Результаты показали резкие различия в профилях рассуждений:
- Модели способны восстанавливать значительную часть структурированных ответов, даже если не решают задачу полностью.
- Производительность резко снижается в более поздних конфигурациях учебной программы, где требуются более длинные цепочки зависимостей и взаимодействие сложных структур.
Значение для индустрии
Выпуск ArgGYM, генераторов и верификаторов позволяет исследователям проводить воспроизводимую оценку и использовать данные для RLVR-обучения. Это шаг к созданию ИИ, способного не просто выдавать ответ, а вести диалектическое мышление, пересматривая свои выводы по мере поступления новой информации.
Источник: arXiv cs.AI ↗
