Революция в обучении: от пикселей к неявной политике
Традиционные агенты ИИ требуют маркировки действий (клики, нажатия клавиш) для каждого кадра видео. Induction Labs утверждает, что это узкое место. Их решение — Photon-1, модель на базе архитектуры imagination model (модель воображения). Она обучается на сырых видеоданных, предсказывая будущие состояния сцены через задачу next-latent-token-prediction. Модель не генерирует пиксели, а работает в латентном пространстве, формируя неявную политику (implicit policy): она понимает логику действий, а не просто запоминает их метки.
Технические характеристики и эффективность
Photon-1 — это разреженная модель типа MoE (Mixture of Experts) с 106 миллиардами параметров, из которых активны 5 миллиардов (A5B). Ключевым элементом является энкодер зрения с конечной скалярной квантованием (FSQ), который сжимает каждый кадр до 960 дискретных токенов (около 2.2 КБ). Это обеспечивает сжатие в 100 раз лучше, чем существующие OCR- и мультимодальные представления, сохраняя текст и состояние интерфейса.
Данные и вычислительные затраты
Модель обучалась с нуля на корпусе из 575 миллионов кадров (эквивалент 18 лет видео), отобранных из 2 миллиардов публичных видео. Обучение заняло один эпоху на 32K контексте. Инфраструктурные метрики впечатляют:
| Параметр | Значение для Photon-1 | Примечание |
|---|---|---|
| Объем данных | 575 млн кадров (552 млрд токенов) | 1 кадр/сек, 18 лет видео |
| Вычислительная мощность | ~30,000 GPU-часов H200 | 4.4×10²² FLOPs |
| Эффективность (MFU) | 40% | End-to-end |
| Стоимость инференса | $0.11 / 1M токенов | Взвешенно (10:1 input/output) |
Сравнение с Gemini 3.1 Flash-Lite
Induction Labs сообщает, что Photon-1 превосходит Gemini 3.1 Flash-Lite на внутреннем бенчмарке использования компьютера. При этом затраты на препроцессинг (pretraining compute) у Photon-1 ниже примерно в 27–30 раз, а стоимость обслуживания (serving cost) — в 3 раза ниже. Важно отметить, что данные по Gemini являются оценочными (conservative estimate) со стороны Induction Labs, так как точные цифры проприетарны.
| Метрика | Gemini 3.1 Flash-Lite | Photon-1 |
|---|---|---|
| Pretraining compute (FLOPs) | 1.200 × 10²⁴ | 0.044 × 10²⁴ |
| Weighted inference cost | $0.36 / 1M токенов | $0.11 / 1M токенов |
Обобщение за пределами десктопа: шахматы и физика
Несмотря на то, что препроцессинг шел только на видео использования компьютера, после дообучения (fine-tuning) на менее чем 35,000 траекториях и онлайн-RL, Photon-1 показала выдающиеся результаты в других доменах:
- Шахматы (Checkers): На 20,000 турнирных партий Photon-1 превзошла базовые модели как по качеству ходов, так и по симуляции мира.
- Физика бильярда: На 10,000 синтетических игр Photon-1 достигла средней абсолютной ошибки (MAE) 0.47 против ground-truth физики, тогда как LLM-базовая модель дала 1.15, а энкодер зрения — 1.44.
Модель также научилась использовать встроенный клон ChatGPT внутри виртуальной машины для решения задач, имитируя поведение человека.
Статус релиза
На данный момент Photon-1 — это исследовательский результат._weights, API и лицензии не предоставлены. Инженеры могут изучить технический отчет и обсуждение в X, но развернуть модель для продакшена пока невозможно.
Источник: MarkTechPost ↗
