Главная/Блог/Статья/Как ИИ-агенты учатся задавать…
Статья5 мин чтения · 22 июня 2026 г.

Как ИИ-агенты учатся задавать правильные вопросы, играя в «Морской бой»

От ответов к вопросам: новый этап эволюции ИИ-агентов В 2026 году эра автономных ИИ-агентов достигла пика хайпа. Эти программы, способные «думать» и выполнять сложные задачи в сфере разработки ПО, обслуживания клиентов и научных исследований, стали основой новой технологической реальности. Однако, к

Как ИИ-агенты учатся задавать правильные вопросы, играя в «Морской бой»

01От ответов к вопросам: новый этап эволюции ИИ-агентов

В 2026 году эра автономных ИИ-агентов достигла пика хайпа. Эти программы, способные «думать» и выполнять сложные задачи в сфере разработки ПО, обслуживания клиентов и научных исследований, стали основой новой технологической реальности. Однако, как показывают последние исследования, даже самые продвинутые языковые модели (LLM) сталкиваются с фундаментальным ограничением: они отлично отвечают на вопросы, но катастрофически неэффективны в том, чтобы задавать правильные вопросы в условиях неопределенности.

Команда исследователей из MIT CSAIL и Гарвардской школы инженерии (SEAS) предложила элегантное решение этой проблемы, используя для тестирования классическую игру «Морской бой» (Battleship). Их эксперимент не только доказал, что малые языковые модели (SLM) могут превосходить гигантов индустрии, но и открыл путь к созданию более рациональных и экономичных ИИ-систем.

Проблема «Слепого гадания»

Современные LLM, такие как GPT-5 или Claude 4, оптимизированы для обработки запросов. Они генерируют ответы, основываясь на вероятностях, заложенных в весах модели. Но в сценариях, требующих активного сбора информации (active information gathering) — например, при диагностике редких заболеваний или поиске новых химических соединений — модель должна не просто угадывать, а формулировать гипотезы, которые сузят пространство возможных решений.

Без специальной тренировки агенты часто задают риторические или малоинформативные вопросы. Это похоже на человека, который пытается найти иголку в стоге сена, случайно хватая handful сена, вместо того чтобы использовать магнит или просеивать структуру.

02Методология: «Сотрудничающий Морской бой» (Collaborative Battleship)

Чтобы изолировать проблему поиска информации, исследователи создали среду Collaborative Battleship. В этой игре участвуют два агента:

  • Капитан (Captain): Задаёт вопросы, чтобы найти скрытые корабли.
  • Наблюдатель (Spotter): Отвечает на вопросы, предоставляя фактические данные о поле боя.

Вместо стандартных координат (A1, B4), команда использовала естественный язык (Natural Language), чтобы проверить способность моделей к семантическому пониманию и логическому выводу. Для создания базовой линии (baseline) было собрано BattleshipQA — датасет из вопросов и ответов, сгенерированных более чем 40 людьми.

Ключевые инновации исследования

Исследователи внедрили две критически важные техники, которые позволили малым моделям превзойти большие:

  1. Стратегия вывода Монте-Карло (Monte Carlo Inference Strategy): Вместо того чтобы полагаться на один «лучший» ответ, модель рассматривает множество возможных состояний мира. Каждый ответ «Наблюдателя» используется для взвешивания этих состояний. Если гипотеза о расположении корабля подтверждается, её «вес» увеличивается. Это позволяет модели адаптироваться в реальном времени, как подстраиваясь под меняющуюся погоду в навигации.
  2. Автоформализация через код (Auto-formalization): Чтобы избежать ошибок в ответах «Наблюдателя», вопросы Капитана автоматически преобразуются в Python-код. Например, вопрос «Есть ли корабль в первой колонке?» превращается в функцию проверки массива данных. Это устраняет «галлюцинации» модели при чтении собственных ответов.

03Результаты: Маленький, да удалённый

Самым поразительным результатом стало поведение модели Llama 4 Scout — относительно небольшого языкового модели. До внедрения улучшенной стратегии вывода она выигрывала у людей лишь в 8% случаев. После применения методов Монте-Карло и кодовой верификации её доля побед выросла до 82%.

Но главное достижение — не в победе над людьми, а в сравнении с флагманскими моделями. Llama 4 Scout, используя новую стратегию, показала результаты лучше, чем GPT-5, затратив при этом всего 1% вычислительных ресурсов.

Сравнительная таблица эффективности

Модель Роль Без оптимизации (Win Rate) С оптимизацией (Win Rate) Примечание
Llama 4 Scout Капитан 8% 82% Превзошла GPT-5 при 1% стоимости
GPT-4o Наблюдатель 62% (точность) 90% (точность) Рост точности ответов на 28 п.п.
GPT-5 Наблюдатель Высокая Высокая Стал надежным партнером, но не лучшим Капитаном без доп. обучения
Человек (эксперт) Любая Модели все еще уступают экспертам, но догоняют средний уровень

Также стоит отметить рост точности ответов «Наблюдателя». Использование кода для верификации дало прирост точности в среднем на 15% для малых моделей и до 30% для GPT-4o-mini. Это доказывает, что гибридный подход (язык + код) является золотым стандартом для сложных рассуждений.

04Почему это важно для индустрии?

Работа исследователей MIT и Гарварда (опубликованная в ICLR 2026) меняет парадигму разработки ИИ-агентов. Вот три ключевых вывода, которые определяют будущее отрасли:

1. Эффективность важнее размера модели

Индустрия долгое время следовала пути «чем больше параметров, тем умнее». Этот эксперимент доказывает, что алгоритмическая рациональность (способность выбирать оптимальные действия) может компенсировать нехватку параметров. Для бизнеса это означает возможность развертывать мощных ИИ-агентов на менее мощном оборудовании, что критически важно для edge computing (вычислений на периферии) и снижения углеродного следа.

2. Агентность требует «Модели мира»

Как отметил ведущий автор Габриэль Гранд (Gabriel Grand), способность задавать хорошие вопросы зависит от умения предсказывать и симулировать мир. ИИ-агент не может быть просто «автодополнением» текста. Он должен быть активным исследователем, который строит внутреннюю модель окружения. Это сдвиг от реактивного ИИ к проактивному ИИ.

3. Кросс-доменная применимость

Тот же подход был протестирован на игре «Угадай кто?» (Guess Who?), где модели успешно сократили пространство из 100 вариантов до правильного ответа за минимальное число ходов. Это открывает двери для применения технологии в:

  • Научных исследованиях: Автоматический подбор экспериментов для поиска новых материалов или лекарств.
  • Юриспруденции: Стратегический сбор доказательств в ходе расследования.
  • Кибербезопасности: Адаптивный пентестинг, где ИИ-агент сам решает, какие уязвимости проверять дальше, чтобы минимизировать время взлома.

05Вызовы и будущее

Несмотря на успехи, исследователи отмечают, что модели всё ещё уступают экспертам-людям в сложных сценариях. Роберт Хоукинс (Robert Hawkins, Стэнфордский университет) отмечает, что главная проблема ИИ-агентов — это социальные аспекты взаимодействия: понимание общего контекста, разрешение недопониманий и адаптация к партнеру. Прагматическое рассуждение остается более сложной задачей, чем чистая логика или математика.

Следующим шагом для MIT CSAIL станет тестирование гибридных команд «Человек + ИИ», где агенты будут обучаться не только задавать вопросы, но и интерпретировать человеческие ответы с учетом нюансов и ошибок. Также планируется внедрение длинно-срочного планирования (long-horizon planning), чтобы агенты могли выстраивать цепочки из десятков и сотен взаимодействий, не теряя нити рассуждений.

06Заключение

Игра в «Морской бой» стала метафорой для всей современной AI-индустрии. Мы перестали просто «угадывать следующее слово» и начали учить машины ставить правильные вопросы. Сочетание вероятностных методов (Монте-Карло) с строгостью кода (Python) позволяет малым моделям обходить большие не только по скорости, но и по глубине понимания. Это фундамент для создания по-настоящему интеллектуальных, экономичных и автономных систем, способных решать задачи, которые сегодня требуют человеческого гения.

Источник: MIT CSAIL & Harvard SEAS, ICLR 2026. Paper: "Shoot first, ask questions later? Building rational agents that explore and act like people".