Новые модели и производительность
Платформа Together AI добавила поддержку новейших open-weight моделей, включая GLM-5.3, Kimi K2.7, Qwen 3.8-27B и Gemma 4. Особое внимание уделено моделям с архитектурой Mixture-of-Experts (MoE). GLM-5.3 демонстрирует результат 88.2 в бенчмарке Terminal-Bench 2.1, что всего на 1 балл ниже ведущих проприетарных аналогов. Для локальных задач доступны компактные версии Qwen 3.5 от 0.8B до 9B параметров.
Expert LoRA: прорыв в обучении MoE-моделей
Ключевое нововведение — поддержка LoRA-адаптеров на экспертных слоях (Expert LoRA). В стандартном подходе обучаются только слои внимания, оставляя экспертные слои замороженными. Новый метод позволяет обучать слои, где хранится основная «знания» модели.
Тестирование на 200 выдуманных фактах показало радикальную разницу:
- Expert LoRA: запоминание до 89% новых знаний.
- Standard LoRA (только attention): максимум 15%.
Кроме того, Expert LoRA лучше сохранил базовые знания модели, набрав 75.3% в MMLU-Pro против 71.5% у стандартного подхода.
Снижение цен на 30–70%
Together AI пересмотрел тарифы на обучение LoRA-адаптеров, снизив стоимость на 30% для большинства моделей и до 70% для серии gpt-oss. Ниже приведено сравнение цен за 1 млн токенов:
| Модель | Old SFT ($) | New SFT ($) | Old DPO ($) | New DPO ($) |
|---|---|---|---|---|
| Qwen/Qwen3.5-9B | 0.48 | 0.34 | 1.20 | 0.84 |
| Qwen/Qwen3.8-27B | 1.50 | 1.05 | 3.75 | 2.62 |
| google/gemma-4-31B-it | 1.50 | 1.05 | 3.75 | 2.62 |
| openai/gpt-oss-120b | 5.00 | 2.50 | 12.50 | 6.25 |
| openai/gpt-oss-20b | 1.50 | 0.40 | 3.75 | 1.00 |
Умное управление и ранняя остановка
Сервис внедрил функцию Early Stopping: обучение автоматически прекращается, когда валидационная потеря перестает снижаться. Система сохраняет лучший чекпоинт и возвращает деньги за неиспользованные шаги. Также добавлена поддержка произвольного размера батча через градиентную аккумуляцию, что позволяет обучать модели с длинными контекстами, не выходя за пределы памяти GPU.
Интеграция с Adaption
Компания Adaption уже использует платформу Together для своего AutoScientist — системы автоматического дообучения моделей до 1 триллиона параметров. По словам сооснователя Сары Хукер, это позволяет создавать самообучающийся ИИ без ручного подбора гиперпараметров и затратных циклов переобучения.
Источник: Together AI ↗