Суть задачи и ограничения
Участникам предстояло решить сложную задачу структурированного предсказания на уровне абзацев в резолюциях ООН и ЮНЕСКО. Система должна была классифицировать абзацы и предсказать подмножество из 141 официального тега, а также определить направленные отношения между ними. Ключевое ограничение: использование только открытых моделей с весом до 8B параметров и строгий JSON-формат вывода.
Архитектура победителя: от сужения пространства к дебату
Команда LLM-INSTRUCT применила стратегию «сужения пространства решений» перед генерацией. Пайплайн состоит из трех этапов:
- Поиск с учетом метаданных: Плотный поиск (dense retrieval) отсеивает неподходящие теги, сужая пространство кандидатов.
- Декодирование с ограничениями: Применение per-dimension caps (лимитов на размерность) для соблюдения JSON-схемы.
- Селективный дебат: В случае неопределенности система активирует ветку с участием трех агентов для обсуждения, что повышает надежность без перегрузки вычислений.
Результаты и метрики
На официальном лидерборде система заняла 1-е место по общей оценке и F1, а также 5-е место в категории LLM-as-a-Judge. В процессе разработки удалось значительно улучшить показатели Task 1b Micro-F1.
| Метрика / Этап | Значение | Примечание |
|---|---|---|
| Общий рейтинг | 1-е место | ArgMining 2026 Shared Task |
| Task 1b Micro-F1 (начало) | 35.83% | Базовая конфигурация |
| Task 1b Micro-F1 (финал) | 40.08% | После поиска конфигураций |
| Task 2 Score | 4.421 | Стабильный показатель |
| LLM-as-a-Judge | 5-е место | Высокая надежность валидации |
Почему это важно
Главный инсайт исследования: уменьшение пространства принятия решений до генерации текста существенно повышает как точность, так и устойчивость системы. Использование открытых моделей до 8B параметров делает этот подход доступным для внедрения в реальные продукты без необходимости использования закрытых гигантских LLM. Код и скрипты команды уже опубликованы в открытом доступе.
Источник: arXiv cs.CL ↗
