Агенты нового поколения: DSGym, ThunderAgent и TTT-Discover
Верхний уровень стека — создание агентов, выполняющих реальную работу. Together AI представила три ключевых работы:
- DSGym: Унифицированная платформа для оценки и обучения агентов в области науки о данных. Фреймворк объединяет 1000+ задач в 10+ доменах за единым API, устраняя возможность «подсказок» через изолированную среду выполнения. На базе DSGym обучена SOTA open-source модель на 4B параметров без человеческой разметки.
- ThunderAgent: Система инференса, aware к структуре агента. Позволяет увеличить пропускную способность (throughput) агентов в 1.5–3.6 раза по сравнению со стандартными движками, которые обрабатывают каждый шаг как изолированный запрос. Также обеспечивает экономию диска до 4.2x.
- TTT-Discover: Метод обучения с подкреплением во время тестирования (test-time RL) для открытой модели gpt-oss-120B. Позволяет модели улучшаться в процессе решения задачи. Метод побил рекорды человека в математике (задача Эрдёша), биологии и программировании, обойдя закрытые frontier-модели при стоимости решения в ~$500.
Формирование моделей: RARO и V1
Исследования в области обучения с подкреплением и верификации без явных верификаторов:
- RARO (Relativistic Adversarial Reasoning Optimization): Позволяет обучать модели к рассуждению на задачах без четкого ответа (например, финансовый анализ), заменяя верификатор на состязательную игру. Достигает 25% выигрыша против экспертных ответов (против 5.9% у SFT) и 54.4% точности на Countdown без использования ground-truth верификатора.
- V1: Метод параллельного рассуждения, объединяющий генерацию и самоверификацию. Использует «швейцарский турнир» для сравнения ответов, что дает прирост правильных ответов до 10% (Pass@1) при том же объеме вычислений.
Системные оптимизации: Untied Ulysses и OEA
Оптимизация работы с GPU для увеличения контекста и скорости декодирования:
- Untied Ulysses: Технология, позволяющая обрабатывать контекст длиной 5 миллионов токенов на одной GPU-ноде.
- OEA (Optimized Expert Attention): Ускорение декодирования в архитектурах MoE (Mixture of Experts) до 39%.
Алгоритмические оптимизации: Aurora
Адаптивное спекулятивное декодирование Aurora, которое уже используется в продакшене Together Platform. Метод обеспечивает стабильность производительности (1.25x при изменении трафика), адаптируясь к динамической нагрузке в реальном времени.
Сводная таблица результатов
| Название | Ключевая метрика / Результат | Значение |
|---|---|---|
| ThunderAgent | Рост пропускной способности агентов | до 3.6x |
| TTT-Discover | Результат на задачах, где ранее побеждали закрытые модели | Лучший результат среди open-моделей |
| RARO | Win rate против экспертов (без верификатора) | 25% (против 5.9% у SFT) |
| V1 | Прирост точности (Pass@1) | +10% |
| Untied Ulysses | Максимальный контекст на одной ноде | 5M токенов |
| OEA | Ускорение MoE декодирования | до 39% |
Почему это важно
Together AI демонстрирует, что прогресс в ИИ требует оптимизации всего стека: от высокоуровневых агентов до низкоуровневых GPU-ядер. Исследования, представленные на ICML, не только теоретические, но и уже интегрированы в платформу Together (например, Aurora), что позволяет производителям сразу получать прирост эффективности и снижение затрат на инференс.
Источник: Together AI ↗
