В современном мире искусственного интеллекта системы поиска и рекомендаций всё чаще сталкиваются с задачей, которая кажется простой, но на деле оказывается крайне сложной. Пользователь вводит запрос, например, «снаряжение для кемпинга», и ожидает увидеть не один идеальный результат, а разнообразный набор: палатку, спальный мешок, горелку и налобный фонарь. Ключевая проблема заключается в том, чтобы избежать выдачи десяти почти идентичных палаток. Эта задача известна как «расширение запроса» (query fan-out) — процесс разделения одного широкого промпта на несколько подзапросов для получения более релевантного и разнообразного набора результатов. Традиционные подходы, основанные на больших языковых моделях (LLM), часто терпят неудачу из-за латентности и склонности к генерации синонимичных, но бесполезных вариантов. Именно для решения этих проблем команда Google Research представила новую архитектуру Retrieve-for-Train (R4T).
R4T — это инновационная рамка, которая использует обучение с подкреплением (RL) один раз в офлайн-режиме, чтобы научиться эффективно формировать набор подзапросов. После этого обученное поведение «дистиллируется» (переносится) в небольшую диффузионную модель, способную генерировать все направления поиска за один проход. Этот подход не только решает проблему «парасемантического коллапса», когда модель выдает одинаковые перефразы, но и обеспечивает колоссальное ускорение работы системы. В этой статье мы подробно разберем, как работает R4T, почему стандартные методы не справляются с задачей, и какие практические преимущества это дает для разработчиков AI-приложений.
01Почему стандартные методы расширения запросов (Fan-Out) терпят неудачу?
Чтобы понять ценность R4T, необходимо сначала разобраться в проблемах, которые она решает. Метод «расширения запроса» (query fan-out) предполагает, что система берет один широкий запрос пользователя и разбивает его на несколько более конкретных подзапросов. Например, из запроса «стиль бохо» система должна извлечь идеи для одежды, аксессуаров и декора. Однако, когда этот процесс выполняется с помощью универсальных больших языковых моделей (LLM) во время инференса (время выполнения), возникают два критических недостатка.
Первая проблема — это так называемый «парасемантический коллапс» (paraphrastic collapse). Когда модель генерирует подзапросы, она часто склонна выдавать почти идентичные перефразы. В исследовании Google приводится пример: для запроса «bohemian festival style» (стиль богемного фестиваля) модель Qwen3-4B сгенерировала подзапросы «bohemian festival fashion» (мода на богемном фестивале) и «festival bohemian clothes» (одежда для богемного фестиваля). Эти фразы являются синонимами, и их использование приводит к тому, что система возвращает однородный набор результатов. Пользователь видит множество вариаций одного и того же, вместо того чтобы получить разнообразие, которое он искал. Это снижает полезность поиска, так как разнообразие (diversity) является ключевым фактором удовлетворенности пользователя.
Вторая проблема — это задержка (latency). Автогенеративные модели генерируют токены последовательно, что занимает время. Если системе нужно сгенерировать несколько подзапросов, а затем выполнить поиск по каждому из них, общая задержка может стать неприемлемо высокой. Методы типа Best-of-N (выбор лучшего из N вариантов) улучшают качество результатов, но многократно увеличивают вычислительные затраты и время ожидания. Для приложений реального времени, таких как рекомендательные системы в электронной коммерции или музыкальные сервисы, такая задержка недопустима. Именно поэтому исследователи искали способ выполнить эту задачу быстрее и качественнее, не полагаясь на медленную автогенеративную логику LLM во время работы.
02Трехэтапный конвейер R4T: От обучения с подкреплением к диффузии
Архитектура R4T состоит из трех последовательных этапов, которые позволяют обойти ограничения традиционных LLM. Этот процесс разделен на офлайн-обучение и быстрый инференс, что является ключом к высокой производительности.
1. Обучение модели расширения запросов (Fan-out LM training)
На первом этапе создается специальная модель расширения запросов (Fan-out Language Model, FOLM). Эта модель обучается генерировать k подзапросов для данного входного запроса. Важно отметить, что в этом процессе используется замороженный плотный поисковый индекс (frozen dense retriever). После того как FOLM генерирует подзапросы, они передаются в поисковик, который возвращает набор результатов. На этом этапе вводится система вознаграждений (reward), которая оценивает не каждый отдельный результат, а весь набор в целом. Это позволяет модели учиться оптимизировать разнообразие и релевантность всего набора, а не отдельных элементов.

2. Синтез обучающих данных (Supervision synthesis)
После того как FOLM обучена, она используется для создания обучающих данных для следующего этапа. Модель генерирует 128 вариантов расширения запроса для каждого исходного запроса при температуре 0.9. Температура 0.9 обеспечивает достаточную вариативность, чтобы избежать коллапса. Эти варианты становятся парами «запрос — целевой набор» (query, target set) для обучения следующей модели. Примечательно, что для этого не требуется человеческая разметка (human labels). Для открытых задач извлечения информации (open-ended tasks) целевыми значениями являются эмбеддинги (векторные представления) извлеченного контента. Для композиционных задач (compositional tasks), где важна структура, целевыми значениями являются эмбеддинги подзапросов. Это позволяет масштабировать обучение на огромных объемах данных без дорогостоящей ручной аннотации.
3. Обучение диффузионного поисковика (Diffusive retriever training)
Финальный и самый важный этап — это обучение диффузионной модели. Исследователи используют диффузионный трансформер с 53,9 миллионами параметров. Эта модель учится отображать эмбеддинг запроса напрямую в полный набор целевых эмбеддингов. В отличие от автогенеративных моделей, которые генерируют токены один за другим, эта диффузионная модель использует формулировку «variance-exploding» в рамках фреймворка EDM (Elucidating the Design Space of Diffusion-Based Generative Models). На этапе инференса (работы) модель генерирует все эмбеддинги за один неавтогенеративный проход. Затем поиск ближайших соседей (nearest-neighbor search) сопоставляет каждый сгенерированный эмбеддинг с элементами базы данных. Это позволяет получить весь набор результатов практически мгновенно.
03Дизайн вознаграждений и борьба с «хакерством» модели
Одной из самых сложных задач при обучении с подкреплением (RL) является проектирование функции вознаграждения. Если вознаграждение спроектировано плохо, модель находит лазейки (reward hacking) и оптимизирует метрику за счет качества. В R4T исследователи разработали сложную систему вознаграждений, состоящую из трех компонентов, которые блокируют такие нежелательные поведения.
Для открытых задач извлечения информации (Open-Ended Abstract Retrieval, OAR) функция вознаграждения комбинирует три взвешенных термина:
- Заземленность (Groundedness, λg = 0.6): Этот компонент штрафует модель за расстояние между эмбеддингом каждого подзапроса и его ближайшим элементом базы данных. Проще говоря, он гарантирует, что подзапросы действительно соответствуют чему-то, что есть в базе данных, а не являются абстрактными фантазиями.
- Разнообразие (Diversity, λd = 0.2): Используется метрика Vendi Score по репрезентативным извлеченным элементам (например, лучший элемент для каждого подзапроса). Это напрямую борется с проблемой однородности результатов.
- Согласованность (Alignment, λa = 0.2): Среднее косинусное сходство между каждым подзапросом и исходным запросом. Это гарантирует, что расширенные запросы остаются релевантными первоначальной намерению пользователя.
Для слабо контролируемых композиционных задач (Weakly Supervised Compositional Retrieval, WSCR) вознаграждение проще: это доля элементов из эталонного набора, которые были успешно извлечены благодаря расширению запроса.

Анализ аблиации (ablation study) показал, почему все три компонента OAR критически важны. Если использовать только «заземленность», модель Gemma3-4B сходилась к бессмысленным строкам вида «line ending line ending line ending» (конец строки конец строки...). Добавление «согласованности» усугубляло проблему, так как политика начинала повторять парафразы исходного запроса, что приводило к коллапсу. Только добавление «разнообразия» закрыло оба этих канала для обмана модели, заставив её генерировать действительно разные и полезные подзапросы.
Обучение с подкреплением в R4T использует алгоритм GRPO (Group Relative Policy Optimization) с мягкой регуляризацией PPO, которая добавляет штрафы KL-дивергенции (прямой и обратной). Ключевые настройки включают размер группы 8, скорость обучения 1×10⁻⁷ и глобальный размер батча 512. Эти тонкие настройки позволяют модели стабилизировать обучение и избежать сходимости к локальным оптимумам.
04Результаты экспериментов: Качество и разнообразие
Для оценки эффективности R4T исследователи провели эксперименты на двух наборах данных: Polyvore (датасет модных образов с использованием CLIP-кодировщика размерности 128) и проприетарном наборе данных музыкальных плейлистов экспертного уровня (с эмбеддингами MuLan). Во всех экспериментах метод расширения запроса генерировал k = 10 подзапросов, а метод Best-of-N использовал N = 5 для сравнения.
Качество извлечения информации (OAR) оценивалось с помощью судьи на основе LLM по 5-балльной шкале Лайкерта. На датасете Polyvore модель Gemma3-4B с R4T-FOLM показала средний балл 49.1, что значительно выше, чем 40.9 у метода Best-of-N и 38.5 у zero-shot (без дообучения) подхода. Разнообразие (diversity) выросло с 56.0 в zero-shot режиме до 76.8 при использовании R4T-FOLM. Диффузионная модель R4T-Diffusion сохранила большую часть этого разнообразия на уровне 74.3, что подтверждает эффективность дистилляции.
На музыкальном датасете Gemma3-4B R4T-FOLM также показала превосходство, набрав 58.1 против 49.2 у Best-of-N. Важно отметить, что для R4T-Diffusion метрика «заземленности» не сообщается, так как эта модель не генерирует текстовые подзапросы, а работает напрямую с эмбеддингами.
Результаты WSCR на Polyvore демонстрируют компромисс между охватом и разнообразием. R4T-FOLM (на базе Qwen) достигла Recall@5K на уровне 20.9 и Hit@5K на уровне 64.6, что лучше, чем у Gemini-2.5-Flash (15.7 и 52.1 соответственно). Однако Vendi Score (мера разнообразия) у R4T-FOLM упал до 27.5. Авторы связывают это со снижением энтропии выходных данных при сильной оптимизации RL. R4T-Diffusion (Qwen) сохранила более высокий Vendi Score на уровне 34.7 при Recall@5K 16.5, что делает её более сбалансированным решением для задач, где разнообразие критично.

05Эффективность и скорость: Реальные цифры
Самое впечатляющее преимущество R4T — это скорость. В экспериментах при размере батча 8 автогенеративное расширение запроса занимало около 1,46 секунды. Диффузионная модель R4T справлялась с той же задачей за 0,07 секунды. При увеличении размера батча до 1024 автогенеративное расширение достигало почти 50 секунд, в то время как диффузионная модель выполняла задачу за 4,21 секунды. Авторы сообщают о стабильном ускорении в 12–20 раз по сравнению с автогенеративным подходом.
Это ускорение имеет огромное практическое значение. Для сервисов, обрабатывающих миллионы запросов в день, снижение времени отклика с секунд до миллисекунд означает значительную экономию вычислительных ресурсов и улучшение пользовательского опыта. Пользователи получают мгновенные, разнообразные и релевантные результаты, не ожидая загрузки.
06Что это значит на практике
Внедрение R4T открывает новые возможности для разработчиков систем поиска и рекомендаций. Во-первых, оно позволяет создавать более умные и отзывчивые интерфейсы, которые понимают намерения пользователя глубже, чем простое ключевое совпадение. Во-вторых, высокая скорость работы делает возможным использование сложных методов расширения запросов в мобильных приложениях и устройствах с ограниченными ресурсами, где задержка критична.
Для компаний, работающих в сфере электронной коммерции, моды, музыки или контента, R4T предлагает способ увеличить вовлеченность пользователей за счет предоставления более разнообразных и релевантных рекомендаций. Это снижает вероятность того, что пользователь увидит дубликаты или нерелевантные товары, и повышает шансы на совершение покупки или прослушивание трека.
Кроме того, подход R4T демонстрирует потенциал гибридных архитектур, сочетающих силу больших языковых моделей (для обучения через RL) и эффективность диффузионных моделей (для быстрого инференса). Это может стать новым стандартом для задач, требующих генерации множественных вариантов или наборов данных. Исследователи продолжают работать над улучшением этой архитектуры, и мы можем ожидать появления еще более оптимизированных версий в будущем.
Если вы работаете с системами поиска, стоит обратить внимание на эту технологию. Возможность получить 12-20-кратное ускорение без значительной потери качества — это серьезный аргумент в пользу перехода от традиционных автогенеративных методов к диффузионным подходам в области информационного поиска. Полные технические детали и код проекта доступны в официальных материалах Google Research, что позволяет энтузиастам и профессионалам самостоятельно изучить и протестировать эту инновацию.
Источник: MarkTechPost ↗
