Исследования30 июня 2026 г., 22:32 МСК🤖 Auto

Together AI на ICML 2026: 8 исследований от агентов до GPU-ядер

Together AI представила 8 статей на ICML 2026, демонстрируя полный стек оптимизации ИИ: от агентов с приростом скорости 3.6x до контекста в 5 млн токенов на одной ноде.

Баннер новости 2603

Агенты нового поколения: DSGym, ThunderAgent и TTT-Discover

Верхний уровень стека — создание агентов, выполняющих реальную работу. Together AI представила три ключевых работы:

  • DSGym: Унифицированная платформа для оценки и обучения агентов в области науки о данных. Фреймворк объединяет 1000+ задач в 10+ доменах за единым API, устраняя возможность «подсказок» через изолированную среду выполнения. На базе DSGym обучена SOTA open-source модель на 4B параметров без человеческой разметки.
  • ThunderAgent: Система инференса, aware к структуре агента. Позволяет увеличить пропускную способность (throughput) агентов в 1.5–3.6 раза по сравнению со стандартными движками, которые обрабатывают каждый шаг как изолированный запрос. Также обеспечивает экономию диска до 4.2x.
  • TTT-Discover: Метод обучения с подкреплением во время тестирования (test-time RL) для открытой модели gpt-oss-120B. Позволяет модели улучшаться в процессе решения задачи. Метод побил рекорды человека в математике (задача Эрдёша), биологии и программировании, обойдя закрытые frontier-модели при стоимости решения в ~$500.

Формирование моделей: RARO и V1

Исследования в области обучения с подкреплением и верификации без явных верификаторов:

  • RARO (Relativistic Adversarial Reasoning Optimization): Позволяет обучать модели к рассуждению на задачах без четкого ответа (например, финансовый анализ), заменяя верификатор на состязательную игру. Достигает 25% выигрыша против экспертных ответов (против 5.9% у SFT) и 54.4% точности на Countdown без использования ground-truth верификатора.
  • V1: Метод параллельного рассуждения, объединяющий генерацию и самоверификацию. Использует «швейцарский турнир» для сравнения ответов, что дает прирост правильных ответов до 10% (Pass@1) при том же объеме вычислений.

Системные оптимизации: Untied Ulysses и OEA

Оптимизация работы с GPU для увеличения контекста и скорости декодирования:

  • Untied Ulysses: Технология, позволяющая обрабатывать контекст длиной 5 миллионов токенов на одной GPU-ноде.
  • OEA (Optimized Expert Attention): Ускорение декодирования в архитектурах MoE (Mixture of Experts) до 39%.

Алгоритмические оптимизации: Aurora

Адаптивное спекулятивное декодирование Aurora, которое уже используется в продакшене Together Platform. Метод обеспечивает стабильность производительности (1.25x при изменении трафика), адаптируясь к динамической нагрузке в реальном времени.

Сводная таблица результатов

Название Ключевая метрика / Результат Значение
ThunderAgent Рост пропускной способности агентов до 3.6x
TTT-Discover Результат на задачах, где ранее побеждали закрытые модели Лучший результат среди open-моделей
RARO Win rate против экспертов (без верификатора) 25% (против 5.9% у SFT)
V1 Прирост точности (Pass@1) +10%
Untied Ulysses Максимальный контекст на одной ноде 5M токенов
OEA Ускорение MoE декодирования до 39%

Почему это важно

Together AI демонстрирует, что прогресс в ИИ требует оптимизации всего стека: от высокоуровневых агентов до низкоуровневых GPU-ядер. Исследования, представленные на ICML, не только теоретические, но и уже интегрированы в платформу Together (например, Aurora), что позволяет производителям сразу получать прирост эффективности и снижение затрат на инференс.

Источник: Together AI ↗