Релиз модели12 августа 2026 г., 00:17 МСК🤖 Auto

Claude Opus 5 решил сложную текстовую головоломку за 76 ходов

Модель Claude Opus 5 впервые успешно прошла пользовательский бенчмарк текстового квеста, продемонстрировав способность к причинно-следственному анализу и пространственному мышлению.

Суть теста: Лабиринт с вращающимися комнатами

Автор бенчмарка, исследователь с ником derelict5432, создал кастомную текстовую игру из 10 комнат. Цель — собрать три ключа (латунный, серебряный, золотой) и выйти из подземелья. Главная сложность заключалась не в поиске предметов, а в решении головоломки с вращающейся комнатой (r5), управляемой краном в соседней комнате (r4). Агенту требовалось понять нелинейную причинно-следственную связь: действие в одной локации меняет состояние другой, что требует использования аллоцентрических координат и построения внутренней карты мира.

Результаты Claude Opus 5 против Fable 5

Claude Opus 5 стал первой моделью, решившей задачу с первого запуска в рамках агентного хайра. Для полного прохождения потребовалось 76 ходов (оптимальное решение — 48). Ранее модель Fable 5 успешно справлялась с частью головоломки (вращающейся комнатой) в 2 из 3 попыток, но не могла завершить квест целиком. Ниже приведено сравнение эффективности моделей в решении ключевых этапов:

Модель Статус прохождения Ключевая проблема
Claude Opus 5 Успешно (1/1 запуск) 76 ходов; корректно обработала пространственные сдвиги
Fable 5 Частично (2/3 успеха) Решала вращающуюся комнату, но застревала на финальных этапах

Анализ поведения: «Человеческие» ошибки и гипотезы

Прохождение квеста демонстрировало сложные когнитивные процессы. Агент формировал гипотезы, проверял их и опровергал. Например, при решении головоломки с лупой (silver key) модель трижды выдвинула неверные гипотезы, совершила 7 неудачных ходов и даже забыла взять фонарик, который был необходим для фокусировки света. Однако она вернулась, исправила ошибку и решила задачу. Это поведение, по мнению автора, имитирует человеческий метод проб и ошибок, а не просто статический поиск по базе знаний.

Технические детали агента

Успех стал возможен благодаря доработанному агентному хайру, который включает:

  • Инструмент карты: Агент генерирует и обновляет карту помещения в реальном времени.
  • Генерация гипотез: Перед каждым действием модель анализирует, какая информация наиболее ценна для проверки текущих предположений.
  • Причинная карта: Структура с узлами и ребрами, обновляемая после каждого шага, помогает отслеживать связи между действиями и изменениями в мире.

Почему это важно

Автор бенчмарка отмечает, что тест исчерпал себя: способность моделей решать такие задачи доказана. Это опровергает тезисы о «кирпичной стене» в развитии ИИ. Однако возникает новая проблема — непродуктивные циклы (looping), когда агенты тратят ресурсы на бесконечные проверки одних и тех же гипотез. В будущем фокус сместится с простого решения головоломок на оптимизацию процессов обучения и устранения таких inefficiencies.

Источник: LessWrong ↗