Исследования22 августа 2026 г., 04:17 МСК🤖 Auto

UniLang: LLM учатся понимать машинные символы без перевода

Исследователи представили UniLang — фреймворк, позволяющий LLM генерировать не только текст, но и структурированные машинные символы, устраняя разрыв между языковым моделированием и предсказанием.

Баннер новости 6285

Проблема: разрыв между языком и структурой

Современные большие языковые модели (LLM) обучаются на естественном языке, что создает фундаментальное ограничение: они не могут напрямую работать с дискретными «машинными символами» (machine-native symbols). В реальных системах (рекомендательные сервисы, юридические базы данных) информация часто хранится в компактных структурированных форматах, которые не являются текстом. Раньше такие данные приходилось вербализовать (превращать в текст) или использовать отдельные архитектуры, что снижало эффективность.

Решение: UniLang как единый генеративный интерфейс

Авторы Su Yan и Rakesh Iyer предлагают фреймворк UniLang, который расширяет словарь и пространство эмбеддингов предобученных LLM. Теперь машинные символы становятся полноправными единицами генерации наряду с текстовыми токенами. Это позволяет модели обрабатывать гетерогенные данные в рамках единой авторегрессионной цели, без необходимости предварительного перевода структурных данных в естественный язык.

Результаты: бенефиты в двух разных доменах

Эксперименты показали, что UniLang превосходит сильные базовые модели (baselines) в двух структурно различных задачах: последовательной рекомендацией и предсказанием юридических прецедентов. Ниже приведено сравнение эффективности подхода:

Задача Домен Ключевое преимущество UniLang
Sequential Recommendation E-commerce / Сервисы Прямая генерация ID товаров без потерь при вербализации
Legal Precedent Prediction Юриспруденция Точное моделирование структурированных правовых связей

Значение для индустрии

Работа открывает путь к использованию LLM не только как текстовых генераторов, но и как универсального бэкбода для моделирования разнородных машинных представлений. Это снижает потребность в специализированных архитектурах для каждой новой задачи и упрощает интеграцию LLM в системы, где критична работа со структурированными данными.

Источник: arXiv cs.CL ↗