Суть теста: Лабиринт с вращающимися комнатами
Автор бенчмарка, исследователь с ником derelict5432, создал кастомную текстовую игру из 10 комнат. Цель — собрать три ключа (латунный, серебряный, золотой) и выйти из подземелья. Главная сложность заключалась не в поиске предметов, а в решении головоломки с вращающейся комнатой (r5), управляемой краном в соседней комнате (r4). Агенту требовалось понять нелинейную причинно-следственную связь: действие в одной локации меняет состояние другой, что требует использования аллоцентрических координат и построения внутренней карты мира.
Результаты Claude Opus 5 против Fable 5
Claude Opus 5 стал первой моделью, решившей задачу с первого запуска в рамках агентного хайра. Для полного прохождения потребовалось 76 ходов (оптимальное решение — 48). Ранее модель Fable 5 успешно справлялась с частью головоломки (вращающейся комнатой) в 2 из 3 попыток, но не могла завершить квест целиком. Ниже приведено сравнение эффективности моделей в решении ключевых этапов:
| Модель | Статус прохождения | Ключевая проблема |
|---|---|---|
| Claude Opus 5 | Успешно (1/1 запуск) | 76 ходов; корректно обработала пространственные сдвиги |
| Fable 5 | Частично (2/3 успеха) | Решала вращающуюся комнату, но застревала на финальных этапах |
Анализ поведения: «Человеческие» ошибки и гипотезы
Прохождение квеста демонстрировало сложные когнитивные процессы. Агент формировал гипотезы, проверял их и опровергал. Например, при решении головоломки с лупой (silver key) модель трижды выдвинула неверные гипотезы, совершила 7 неудачных ходов и даже забыла взять фонарик, который был необходим для фокусировки света. Однако она вернулась, исправила ошибку и решила задачу. Это поведение, по мнению автора, имитирует человеческий метод проб и ошибок, а не просто статический поиск по базе знаний.
Технические детали агента
Успех стал возможен благодаря доработанному агентному хайру, который включает:
- Инструмент карты: Агент генерирует и обновляет карту помещения в реальном времени.
- Генерация гипотез: Перед каждым действием модель анализирует, какая информация наиболее ценна для проверки текущих предположений.
- Причинная карта: Структура с узлами и ребрами, обновляемая после каждого шага, помогает отслеживать связи между действиями и изменениями в мире.
Почему это важно
Автор бенчмарка отмечает, что тест исчерпал себя: способность моделей решать такие задачи доказана. Это опровергает тезисы о «кирпичной стене» в развитии ИИ. Однако возникает новая проблема — непродуктивные циклы (looping), когда агенты тратят ресурсы на бесконечные проверки одних и тех же гипотез. В будущем фокус сместится с простого решения головоломок на оптимизацию процессов обучения и устранения таких inefficiencies.
Источник: LessWrong ↗