Проблема: разрыв между языком и структурой
Современные большие языковые модели (LLM) обучаются на естественном языке, что создает фундаментальное ограничение: они не могут напрямую работать с дискретными «машинными символами» (machine-native symbols). В реальных системах (рекомендательные сервисы, юридические базы данных) информация часто хранится в компактных структурированных форматах, которые не являются текстом. Раньше такие данные приходилось вербализовать (превращать в текст) или использовать отдельные архитектуры, что снижало эффективность.
Решение: UniLang как единый генеративный интерфейс
Авторы Su Yan и Rakesh Iyer предлагают фреймворк UniLang, который расширяет словарь и пространство эмбеддингов предобученных LLM. Теперь машинные символы становятся полноправными единицами генерации наряду с текстовыми токенами. Это позволяет модели обрабатывать гетерогенные данные в рамках единой авторегрессионной цели, без необходимости предварительного перевода структурных данных в естественный язык.
Результаты: бенефиты в двух разных доменах
Эксперименты показали, что UniLang превосходит сильные базовые модели (baselines) в двух структурно различных задачах: последовательной рекомендацией и предсказанием юридических прецедентов. Ниже приведено сравнение эффективности подхода:
| Задача | Домен | Ключевое преимущество UniLang |
|---|---|---|
| Sequential Recommendation | E-commerce / Сервисы | Прямая генерация ID товаров без потерь при вербализации |
| Legal Precedent Prediction | Юриспруденция | Точное моделирование структурированных правовых связей |
Значение для индустрии
Работа открывает путь к использованию LLM не только как текстовых генераторов, но и как универсального бэкбода для моделирования разнородных машинных представлений. Это снижает потребность в специализированных архитектурах для каждой новой задачи и упрощает интеграцию LLM в системы, где критична работа со структурированными данными.
Источник: arXiv cs.CL ↗
