Исследования3 августа 2026 г., 11:17 МСК🤖 Auto

LSR-Synth: Почему LLM-приоритеты не спасают от переобучения

Исследование arXiv:2607.28684 показывает, что в текущих задачах LSR-Synth языковые модели не добавляют ценности сверх фиксированного словаря, раскрывая проблему «анти-меморизации».

Баннер новости 4938

Проблема синтетических бенчмарков

Существующие бенчмарки для открытия научных уравнений часто состоят из известных формул, что делает невозможным отличить реальное открытие от простого воспроизведения данных из обучающей выборки. Набор данных LSR-Synth пытается решить эту проблему, внедряя новые синтетические термины в известные научные механизмы и фильтруя задачи по новизне и научной правдоподобности. Однако новое исследование авторов (Yao et al.) ставит под вопрос эффективность этого подхода при измерении символического открытия.

Суть эксперимента: Семантическое ослепление

Авторы провели строгую оценку, чтобы определить, действительно ли LLM-приоритеты помогают в поиске, или же модели просто переобучаются на структуру данных. Для этого была создана семантически свободная базовая линия (semantics-free baseline) с использованием фиксированного словаря с документированным происхождением. Ключевые методы тестирования включали:

  • Semantic blinding: Ослепление модели семантическим контекстом.
  • Library weakening: Ослабление доступной библиотеки операторов.
  • Operator-family knockouts: Исключение целых семейств операторов для проверки устойчивости.

Ключевые результаты

Результаты показали, что при текущем наборе задач и бюджете поиска фиксированный словарь уже покрывает большинство случаев. Генерация кандидатов самими языковыми моделями редко расширяет множество решаемых инстансов. Их маргинальный вклад становится существенным только тогда, когда покрытие словаря намеренно нарушается.

Метрика / Условие Фиксированный словарь LLM-генерированные кандидаты Вывод
Стандартная оценка Высокое покрытие Минимальное расширение LLM не добавляют ценности сверх словаря
Нарушение покрытия словаря Снижение успеха Значительный прирост Помощь LLM видна только при дефиците словаря
Строгая OOD-оценка Снижение абсолютных метрик Сохранение соотношения Отношение моделей не меняется, но общая точность падает

Почему это важно для AI-сообщества

Эти выводы не обесценивают LSR-Synth как инструмент против полного запоминания формул, но указывают на более тонкую проблему. Большинство текущих задач подходят для оценки способности моделей подгонять и комбинировать ранее невиданные выражения, но их недостаточно для идентификации вклада приоров, выходящих за рамки фиксированного пространства поиска. Это означает, что для истинного «открытия» законов природы через LLM необходимы более сложные протоколы оценки, выходящие за рамки простого поиска по словарю.

Источник: arXiv cs.AI ↗