Релиз модели26 июля 2026 г., 12:16 МСК🤖 Auto

Induction Labs Photon-1: 106B-модель, обученная только на видео, бьет Gemini

Induction Labs представила Photon-1 — архитектуру «модели воображения», которая учится выполнять задачи, предсказывая будущие кадры видео без меток действий. Модель превосходит Gemini 3.1 Flash-Lite по эффективности и стоимости.

Баннер новости 4405

Революция в обучении: от пикселей к неявной политике

Традиционные агенты ИИ требуют маркировки действий (клики, нажатия клавиш) для каждого кадра видео. Induction Labs утверждает, что это узкое место. Их решение — Photon-1, модель на базе архитектуры imagination model (модель воображения). Она обучается на сырых видеоданных, предсказывая будущие состояния сцены через задачу next-latent-token-prediction. Модель не генерирует пиксели, а работает в латентном пространстве, формируя неявную политику (implicit policy): она понимает логику действий, а не просто запоминает их метки.

Технические характеристики и эффективность

Photon-1 — это разреженная модель типа MoE (Mixture of Experts) с 106 миллиардами параметров, из которых активны 5 миллиардов (A5B). Ключевым элементом является энкодер зрения с конечной скалярной квантованием (FSQ), который сжимает каждый кадр до 960 дискретных токенов (около 2.2 КБ). Это обеспечивает сжатие в 100 раз лучше, чем существующие OCR- и мультимодальные представления, сохраняя текст и состояние интерфейса.

Данные и вычислительные затраты

Модель обучалась с нуля на корпусе из 575 миллионов кадров (эквивалент 18 лет видео), отобранных из 2 миллиардов публичных видео. Обучение заняло один эпоху на 32K контексте. Инфраструктурные метрики впечатляют:

Параметр Значение для Photon-1 Примечание
Объем данных 575 млн кадров (552 млрд токенов) 1 кадр/сек, 18 лет видео
Вычислительная мощность ~30,000 GPU-часов H200 4.4×10²² FLOPs
Эффективность (MFU) 40% End-to-end
Стоимость инференса $0.11 / 1M токенов Взвешенно (10:1 input/output)

Сравнение с Gemini 3.1 Flash-Lite

Induction Labs сообщает, что Photon-1 превосходит Gemini 3.1 Flash-Lite на внутреннем бенчмарке использования компьютера. При этом затраты на препроцессинг (pretraining compute) у Photon-1 ниже примерно в 27–30 раз, а стоимость обслуживания (serving cost) — в 3 раза ниже. Важно отметить, что данные по Gemini являются оценочными (conservative estimate) со стороны Induction Labs, так как точные цифры проприетарны.

Метрика Gemini 3.1 Flash-Lite Photon-1
Pretraining compute (FLOPs) 1.200 × 10²⁴ 0.044 × 10²⁴
Weighted inference cost $0.36 / 1M токенов $0.11 / 1M токенов

Обобщение за пределами десктопа: шахматы и физика

Несмотря на то, что препроцессинг шел только на видео использования компьютера, после дообучения (fine-tuning) на менее чем 35,000 траекториях и онлайн-RL, Photon-1 показала выдающиеся результаты в других доменах:

  • Шахматы (Checkers): На 20,000 турнирных партий Photon-1 превзошла базовые модели как по качеству ходов, так и по симуляции мира.
  • Физика бильярда: На 10,000 синтетических игр Photon-1 достигла средней абсолютной ошибки (MAE) 0.47 против ground-truth физики, тогда как LLM-базовая модель дала 1.15, а энкодер зрения — 1.44.

Модель также научилась использовать встроенный клон ChatGPT внутри виртуальной машины для решения задач, имитируя поведение человека.

Статус релиза

На данный момент Photon-1 — это исследовательский результат._weights, API и лицензии не предоставлены. Инженеры могут изучить технический отчет и обсуждение в X, но развернуть модель для продакшена пока невозможно.

Источник: MarkTechPost ↗