Исследования30 сентября 2026 г., 14:22 МСК🤖 Auto

Масштабирование команд LLM: почему 30 вызовов не решают все задачи

Исследование Blaz Bertalanic и Carolina Fortuna показывает, что увеличение числа вызовов агентов с 3 до 30 дает разный прирост точности: до 17 пунктов в математике и всего 4 в общих знаниях. Архитектура Proposer-Critic лидирует в арифметике, но униве

Баннер новости 8598

Суть эксперимента: от 3 до 30 вызовов

Авторы проанализировали 8 архитектур оркестрации агентов на базе 5 инструкционно-настроенных моделей размером 7–9B. Цель — понять, помогает ли масштабирование команды (увеличение количества вызовов LLM) и при каких условиях. Тестирование проводилось на пяти бенчмарках с короткими ответами и одном с исполняемым кодом.

Ключевые цифры: разрыв в эффективности

Результаты показали резкую зависимость от типа задачи. Увеличение бюджета вызовов с 3 до 30 дало колоссальный прирост в математических задачах, но минимальный — в задачах на общие знания и логику.

Бенчмарк Тип задачи Прирост точности (3→30 вызовов)
GSM8K, GSMHard Арифметические задачи До +17 пунктов
ARC, GPQA, MMLU Множественный выбор / Общие знания Максимум +4 пункта

Победитель и проигравшие: Proposer-Critic

Архитектура Proposer-Critic (предложение-критика) показала самый крутой рост в арифметике и обошла остальные решения при максимальном бюджете. Однако она же оказалась одной из самых слабых в других категориях. Ни одна архитектура не выиграла по всем фронтам одновременно.

Механика: Generate-Transform Decomposition

Авторы ввели точную декомпозицию «Генерация-Трансформация» для объяснения результатов. Любая рабочая схема делится на покрытие (coverage) и трансформацию (transform). В математике есть пространство для покрытия, которое критик эффективно преобразует в точность. В задачах с множественным выбором покрытие быстро насыщается, а в генерации кода восстановление точности почти исчезает — результат идет параллельно с количеством кандидатов.

Экономика вызовов

Даже при равном количестве вызовов стоимость токенов варьируется в 2.1 раза в зависимости от архитектуры. Масштабирование команды — это не универсальный рычаг, а специфическая ставка, зависящая от задачи и выбранной архитектуры.

Источник: arXiv cs.AI ↗