Проблема упрощений в текущих бенчмарках
Систематическая генерация — способность решать новые задачи путем комбинирования известных элементов — является ключевым признаком человеческого интеллекта. Однако существующие методы оценки часто опираются на упрощения: линейную композицию действий, тесты на продуктивность и явно заданные цели. Эти упрощения делают задачу легче для изучения, но искажают реальную картину способности модели к обобщению.
Введение TranSGrid: три вида рассуждений
Авторы работы Chengwen Qi, Deheng Ye и Yatao Bian (16 сентября 2026 г.) предлагают новый подход — TranSGrid. Эта тестовая среда объединяет три типа логического вывода:
- Дедуктивный: вывод следствий из общих правил.
- Индуктивный: выявление закономерностей из примеров.
- Абдуктивный: поиск наиболее вероятных причин наблюдаемых результатов.
Такой комплексный подход позволяет оценить, насколько модель способна справляться с задачами, требующими не просто запоминания паттернов, а глубокого логического анализа.
Результаты тестирования: разрыв в производительности
Эксперименты проводились на 4 800 экземплярах задач TranSGrid с использованием семи различных архитектур Трансформеров. Результаты показали существенное падение точности на новых, сложных задачах по сравнению с удержанным тестовым набором (held-out test set), где модели демонстрировали высокую производительность.
| Метрика / Модель | Результат на удержанном тестовом наборе | Результат на TranSGrid | Результат на hardest subset |
|---|---|---|---|
| Крупнейшая модель | 79.6% | 55.3% | 15.8% |
| Средняя точность (все модели) | Высокая (стабильная) | Значительно ниже | Критически низкая |
Важно отметить, что разрыв в производительности сохраняется даже в пределах длины обучающей последовательности. Это доказывает, что одной лишь продуктивности (способности генерировать новые комбинации) недостаточно для оценки истинной систематической генерации.
Почему текущие задачи «обманывают»?
Авторы провели дополнительный анализ, вернув упрощения в структуру TranSGrid по одному:
- Линейная композиция действий: снижение индуктивной нагрузки.
- Явные цели: снижение абдуктивной нагрузки.
В обоих случаях точность моделей вернулась к уровню обычного тестового набора. Это означает, что текущие бенчмарки искусственно завышают показатели, устраняя либо индуктивные, либо абдуктивные требования. Для полноценной оценки систематической генерации необходима задача, включающая все три вида рассуждений одновременно.
Значение для индустрии
Результаты исследования указывают на то, что современные LLM и Трансформеры могут страдать от «иллюзии понимания» в стандартных тестах. Внедрение таких комплексных тестов, как TranSGrid, поможет разработчикам точнее оценивать способность моделей к логическому выводу и обобщению в реальных сценариях, где правила не всегда линейны, а цели не всегда очевидны.
Источник: arXiv cs.AI ↗
