Исследования6 августа 2026 г., 08:18 МСК🤖 Auto

BrainBench: LLM-тест на понимание ЭЭГ с 17 датасетами и 100K запусков

Исследователи представили BrainBench — первый комплексный бенчмарк для оценки способности больших языковых моделей анализировать электроэнцефалограммы (ЭЭГ) и генерировать научные отчеты.

Баннер новости 5187

От простого декодирования к комплексному пониманию

Анализ ЭЭГ традиционно сводился к присвоению предопределенных меток сигналам. Однако исследователи из команды, возглавляемой Янсюанем Чжоу (Yangxuan Zhou), утверждают, что настоящий анализ требует связки естественного языка, обработки сигналов, количественных доказательств и научной интерпретации. Они ввели термин "comprehensive EEG understanding" (комплексное понимание ЭЭГ) и создали для него тестовую среду — BrainBench.

В отличие от существующих оценок, которые фокусируются на изолированных задачах декодирования, BrainBench проверяет способность LLM работать с инструкциями, обрабатывать сырые данные ЭЭГ (и дополнительные физиологические сигналы) и выдавать научно обоснованные отчеты, а также создавать артефакты анализа.

Масштаб данных и структура бенчмарка

BrainBench — это унифицированная платформа, объединяющая 17 различных датасетов. Бенчмарк разделен на четыре ключевых подмножества, охватывающих широкий спектр клинических и исследовательских задач:

  • Foundational Analysis (Базовый анализ): Базовая обработка и интерпретация сигналов.
  • Sleep Assessment (Оценка сна): Анализ стадий сна и паттернов.
  • Neurocognitive Assessment (Нейрокогнитивная оценка): Оценка когнитивных функций.
  • Physiological Integration (Физиологическая интеграция): Совмещение ЭЭГ с другими физиологическими данными.

Всего тест включает более 100 000 реальных экземпляров данных (instances) и множество различных задач. Оценка выходных данных моделей производится по шести критериям: числовые значения, категориальные метки, множества, последовательности, семантическое сходство и валидация артефактов.

Результаты тестирования: CodeAct против BrainAgent

Авторы протестировали несколько репрезентативных больших языковых моделей, выполнив более 100 000 запусков (executions). Эксперименты проводились в двух парадигмах, что показало существенную зависимость результатов от способа операционализации модели:

  1. Autonomous code execution (CodeAct): Модель самостоятельно пишет и исполняет код для анализа.
  2. Structured agentic analysis (BrainAgent): Структурированный агентный подход к анализу.

Результаты варьировались в широких пределах в зависимости от модели, подмножества задачи, уровня сложности и выбранной парадигмы. Это доказывает, что компетенция в области ЭЭГ не является универсальной для всех LLM, а сильно зависит от архитектуры и способа интеграции с инструментами анализа.

Значение для индустрии

BrainBench предоставляет воспроизводимую тестовую среду для развития LLM в области нейронауки. Авторы анонсировали скорое открытие исходного кода и данных бенчмарка, а также непрерывное обновление результатов. Это шаг к созданию надежных AI-ассистентов для клинической диагностики и нейробиологических исследований, способных не просто «угадывать» классы, а объяснять свои выводы на основе данных.

Источник: arXiv cs.AI ↗