Исследования25 июля 2026 г., 04:16 МСК🤖 Auto

Победа LLM-INSTRUCT: Как 8B-модель выиграла ArgMining 2026

Команда LLM-INSTRUCT заняла 1-е место на совместном задании UZH 2026, решив задачу аргументационного майнинга в резолюциях ООН с помощью открытых моделей до 8B параметров.

Баннер новости 4348

Суть задачи и ограничения

Участникам предстояло решить сложную задачу структурированного предсказания на уровне абзацев в резолюциях ООН и ЮНЕСКО. Система должна была классифицировать абзацы и предсказать подмножество из 141 официального тега, а также определить направленные отношения между ними. Ключевое ограничение: использование только открытых моделей с весом до 8B параметров и строгий JSON-формат вывода.

Архитектура победителя: от сужения пространства к дебату

Команда LLM-INSTRUCT применила стратегию «сужения пространства решений» перед генерацией. Пайплайн состоит из трех этапов:

  • Поиск с учетом метаданных: Плотный поиск (dense retrieval) отсеивает неподходящие теги, сужая пространство кандидатов.
  • Декодирование с ограничениями: Применение per-dimension caps (лимитов на размерность) для соблюдения JSON-схемы.
  • Селективный дебат: В случае неопределенности система активирует ветку с участием трех агентов для обсуждения, что повышает надежность без перегрузки вычислений.

Результаты и метрики

На официальном лидерборде система заняла 1-е место по общей оценке и F1, а также 5-е место в категории LLM-as-a-Judge. В процессе разработки удалось значительно улучшить показатели Task 1b Micro-F1.

Метрика / Этап Значение Примечание
Общий рейтинг 1-е место ArgMining 2026 Shared Task
Task 1b Micro-F1 (начало) 35.83% Базовая конфигурация
Task 1b Micro-F1 (финал) 40.08% После поиска конфигураций
Task 2 Score 4.421 Стабильный показатель
LLM-as-a-Judge 5-е место Высокая надежность валидации

Почему это важно

Главный инсайт исследования: уменьшение пространства принятия решений до генерации текста существенно повышает как точность, так и устойчивость системы. Использование открытых моделей до 8B параметров делает этот подход доступным для внедрения в реальные продукты без необходимости использования закрытых гигантских LLM. Код и скрипты команды уже опубликованы в открытом доступе.

Источник: arXiv cs.CL ↗