Команда исследователей во главе с Максиму Хёйлетом (Maxime Heuillet) представила новую архитектуру CIPHER (Decoupled Exploration-Selection Framework). Эта система решает критическую проблему каскадных ошибок в AI-агентах для Data Science, которые традиционно зависят от одного начального состояния. Если первый шаг ошибочен, весь процесс анализа идет по неверному пути. CIPHER предлагает автоматизированный подход к масштабированию во время тестирования (test-time scaling), генерируя и выбирая несколько стартовых состояний для параллельного выполнения.
Проблема единой точки отказа
Современные AI-агенты, основанные на языковых моделях, часто терпят неудачу из-за уязвимости к субоптимальному начальному состоянию. В задачах Data Science, варьирующихся от извлечения закрытых данных до открытого анализа, это приводит к накоплению ошибок. CIPHER устраняет эту уязвимость, явно разделяя этапы генерации кандидатов и их стратегического отбора для параллельного выполнения (Decoupled Exploration-Selection, DES).
Результаты сравнительного анализа
Эксперименты проводились на двух бенчмарках: с закрытыми (closed-form) и открытыми (open-form) задачами. Ключевое достижение CIPHER заключается в том, что он превосходит существующие решения (SOTA) при сравнении с моделями аналогичного размера, оставаясь конкурентоспособным даже против более крупных базовых моделей. Это делает технологию особенно привлекательной для внедрения в ресурсы-ограниченные среды.
| Характеристика | Описание / Результат |
|---|---|
| Архитектура | Decoupled Exploration-Selection (DES) |
| Механизм | Генерация и выбор нескольких начальных состояний для параллельного выполнения |
| Бенчмарки | Closed-form и Open-form задачи Data Science |
| Производительность | Превосходит SOTA в matched-model сравнениях |
| Эффективность | Конкурентоспособен с более крупными моделями, используя меньшую базу LM |
Практические рекомендации
Авторы не только представили фреймворк, но и провели эмпирическое исследование дизайн-пространства DES. Они количественно оценили вклад стратегии генерации, стратегии выбора и мощности агрегирующей модели. На основе этих данных сформулированы конкретные рекомендации для разработчиков по оптимизации производительности AI-агентов в задачах анализа данных.
Источник: arXiv cs.AI ↗
