Главная/Блог/Аналитика/Photon-1: Как Induction Labs обучила ИИ…
Аналитика4 мин чтения · 26 июля 2026 г.

Photon-1: Как Induction Labs обучила ИИ «предвидеть» будущее без меток действий

Induction Labs представила Photon-1 — модель, которая учится управлять компьютером, предсказывая будущие кадры видео. Разбор архитектуры, вычислительных затрат и парадигмы «имagination models».

Photon-1: Как Induction Labs обучила ИИ «предвидеть» будущее без меток действий

В мире искусственного интеллекта, посвященном компьютерному зрению и автономным агентам, существует давняя проблема: как научить модель понимать контекст действий, не показывая ей каждый раз конкретную команду? Большинство современных агентов, обучающихся на видео, требуют наличия меток действий (action labels) для каждого кадра. Это означает, что для каждого движения мыши или нажатия клавиши должна быть соответствующая аннотация. Индукция Labs (Induction Labs) утверждает, что именно этот requirement является главным узким местом (bottleneck) в развитии автономных систем. Их решение — архитектура «моделей воображения» (imagination models), которая обучается на сырых видеоданных без единой метки действия.

Результатом этой работы стала модель Photon-1, редкая (sparse) модель с 106 миллиардами параметров и 5 миллиардами активных параметров в момент инференса (Mixture-of-Experts, MoE). Она была предварительно обучена на 18 годах компьютерных демонстрационных видео. По заявлениям разработчиков, Photon-1 превосходит Gemini 3.1 Flash-Lite во внутренних бенчмарках использования компьютера, требуя значительно меньших вычислительных ресурсов для предварительного обучения и обходясь примерно в 3 раза дешевле в обслуживании. Это не просто еще одна большая языковая модель, а новый подход к тому, как ИИ должен «понимать» физический и цифровой мир через призму предсказания будущего.

01Что такое «модель воображения» и почему это важно?

Чтобы понять революционность Photon-1, нужно разобраться в базовом принципе ее работы. Традиционные мультимодальные модели часто генерируют пиксели или пытаются напрямую сопоставить изображение с текстовым описанием. Photon-1 же использует объективную функцию next-latent-token-prediction (предсказание следующего латентного токена). Проще говоря, модель не генерирует пиксели во время предварительного обучения. Все вычисления происходят в пространстве изученных представлений (learned representation space).

Ключевое утверждение Induction Labs звучит так: предсказание будущих состояний учит модель выполнять задачи, даже если она никогда не видит меток действий во время предварительного обучения. Индукция Labs называет это имплицитной политикой (implicit policy). Модель учится концепциям того, что делает человек, а не просто запоминает, что клик мыши в координатах X,Y приводит к открытию окна. Это фундаментальное отличие от стандартных подходов, где агент действует по принципу «стимул-реакция» с жестко заданными правилами.

Photon-1: Как Induction Labs обучила ИИ «предвидеть» будущее без меток действий
💡
Имплицитная политика. В отличие от явных политик, где каждое действие прописано алгоритмически, имплицитная политика формируется из статистических закономерностей изменения состояния среды. Модель «предвидит» результат своих действий, что позволяет ей адаптироваться к новым ситуациям, не видя их ранее в таком виде.

02Трюк с сжатием: как FSQ меняет правила игры

Архитектура Photon-1 опирается на инновационный визуальный энкодер, использующий конечную скалярную квантовку (Finite Scalar Quantization, FSQ). Это не просто сжатие изображения, как в JPEG, а преобразование кадра в дискретные токены, которые может эффективно обрабатывать трансформер. Каждый кадр сжимается до 960 дискретных токенов. Каждый токен представляет собой 8-мерный вектор, где каждая размерность принимает одно из пяти значений: -1, -1/2, 0, 1/2, 1.

Такой подход создает кодовую книгу (codebook) из 5^8 возможных кодов. Результатом является кодировка размером около 2,2 КБ на кадр. Induction Labs сообщает о более чем 100-кратном улучшении сжатия по сравнению с существующими представлениями OCR и мультимодальных моделей, при этом сохраняется текст, макет и изменения состояния интерфейса. Это критически важно, так как позволяет модели улавливать тонкие детали интерфейса, которые обычно теряются при сильном сжатии.

Для достижения такой скорости и эффективности Photon-1 использует дифференциальный латентный энкодер. Он кодирует кадры видео парами, так что латентные переменные описывают разницу между кадрами, а не само содержание кадра. Это позволяет модели фокусироваться на динамике изменений (движение мыши, появление окна, изменение текста), игнорируя статичный фон, что значительно снижает вычислительную нагрузку.

Photon-1: Как Induction Labs обучила ИИ «предвидеть» будущее без меток действий

03Данные и вычислительные ресурсы: 18 лет видео за один проход

Корпус данных для обучения Photon-1 начинается с внутреннего индекса из 2 миллиардов общедоступных видео. Однако сырые данные — это лишь начало. Фильтрация снижает этот объем примерно до 2 миллионов записей экрана компьютера. Затем внутренняя модель обнаружения ключевых кадров (keyframe detection) удаляет избыточные кадры, оставляя только те, которые несут новую информацию.

Итоговый датасет состоит из 575 миллионов кадров, выбранных с частотой 1 кадр в секунду. Это эквивалентно 552 миллиардам токенов или 18 годам непрерывного видео. Photon-1 была обучена с нуля за один эпоху (single epoch). Обучение модели MoE с 106B параметрами при контексте 32K заняло примерно 30 000 часов работы GPU H200, что составляет 4,4 × 10²² операций обучения (FLOPs).

Исследовательская команда реализовала обучение на PyTorch с использованием пользовательских слитых ядер (fused kernels) для визуального энкодера и слоев MoE, что позволило поддерживать 40% конечной эффективности использования FLOPs (MFU). Эти три цифры взаимно согласованы: 30 000 часов H200 при 40% MFU почти точно соответствуют 4,3 × 10²² FLOPs. Для сравнения, это значительно меньше ресурсов, чем требуют многие современные LLM, что делает подход экономически привлекательным.

⚠️ Важно
Доступность из РФ. Обучение на 30 000 часов H200 требует дос

Источник: MarkTechPost ↗