Исследования18 июля 2026 г., 01:19 МСК🤖 Auto

CIPHER: Новый подход к масштабированию AI-агентов в Data Science

Исследователи представили CIPHER — фреймворк, разделяющий генерацию и выбор начальных состояний для агентов Data Science, что повышает точность за счет параллельного выполнения.

Баннер новости 3853

Команда исследователей во главе с Максиму Хёйлетом (Maxime Heuillet) представила новую архитектуру CIPHER (Decoupled Exploration-Selection Framework). Эта система решает критическую проблему каскадных ошибок в AI-агентах для Data Science, которые традиционно зависят от одного начального состояния. Если первый шаг ошибочен, весь процесс анализа идет по неверному пути. CIPHER предлагает автоматизированный подход к масштабированию во время тестирования (test-time scaling), генерируя и выбирая несколько стартовых состояний для параллельного выполнения.

Проблема единой точки отказа

Современные AI-агенты, основанные на языковых моделях, часто терпят неудачу из-за уязвимости к субоптимальному начальному состоянию. В задачах Data Science, варьирующихся от извлечения закрытых данных до открытого анализа, это приводит к накоплению ошибок. CIPHER устраняет эту уязвимость, явно разделяя этапы генерации кандидатов и их стратегического отбора для параллельного выполнения (Decoupled Exploration-Selection, DES).

Результаты сравнительного анализа

Эксперименты проводились на двух бенчмарках: с закрытыми (closed-form) и открытыми (open-form) задачами. Ключевое достижение CIPHER заключается в том, что он превосходит существующие решения (SOTA) при сравнении с моделями аналогичного размера, оставаясь конкурентоспособным даже против более крупных базовых моделей. Это делает технологию особенно привлекательной для внедрения в ресурсы-ограниченные среды.

Характеристика Описание / Результат
Архитектура Decoupled Exploration-Selection (DES)
Механизм Генерация и выбор нескольких начальных состояний для параллельного выполнения
Бенчмарки Closed-form и Open-form задачи Data Science
Производительность Превосходит SOTA в matched-model сравнениях
Эффективность Конкурентоспособен с более крупными моделями, используя меньшую базу LM

Практические рекомендации

Авторы не только представили фреймворк, но и провели эмпирическое исследование дизайн-пространства DES. Они количественно оценили вклад стратегии генерации, стратегии выбора и мощности агрегирующей модели. На основе этих данных сформулированы конкретные рекомендации для разработчиков по оптимизации производительности AI-агентов в задачах анализа данных.

Источник: arXiv cs.AI ↗