От простого декодирования к комплексному пониманию
Анализ ЭЭГ традиционно сводился к присвоению предопределенных меток сигналам. Однако исследователи из команды, возглавляемой Янсюанем Чжоу (Yangxuan Zhou), утверждают, что настоящий анализ требует связки естественного языка, обработки сигналов, количественных доказательств и научной интерпретации. Они ввели термин "comprehensive EEG understanding" (комплексное понимание ЭЭГ) и создали для него тестовую среду — BrainBench.
В отличие от существующих оценок, которые фокусируются на изолированных задачах декодирования, BrainBench проверяет способность LLM работать с инструкциями, обрабатывать сырые данные ЭЭГ (и дополнительные физиологические сигналы) и выдавать научно обоснованные отчеты, а также создавать артефакты анализа.
Масштаб данных и структура бенчмарка
BrainBench — это унифицированная платформа, объединяющая 17 различных датасетов. Бенчмарк разделен на четыре ключевых подмножества, охватывающих широкий спектр клинических и исследовательских задач:
- Foundational Analysis (Базовый анализ): Базовая обработка и интерпретация сигналов.
- Sleep Assessment (Оценка сна): Анализ стадий сна и паттернов.
- Neurocognitive Assessment (Нейрокогнитивная оценка): Оценка когнитивных функций.
- Physiological Integration (Физиологическая интеграция): Совмещение ЭЭГ с другими физиологическими данными.
Всего тест включает более 100 000 реальных экземпляров данных (instances) и множество различных задач. Оценка выходных данных моделей производится по шести критериям: числовые значения, категориальные метки, множества, последовательности, семантическое сходство и валидация артефактов.
Результаты тестирования: CodeAct против BrainAgent
Авторы протестировали несколько репрезентативных больших языковых моделей, выполнив более 100 000 запусков (executions). Эксперименты проводились в двух парадигмах, что показало существенную зависимость результатов от способа операционализации модели:
- Autonomous code execution (CodeAct): Модель самостоятельно пишет и исполняет код для анализа.
- Structured agentic analysis (BrainAgent): Структурированный агентный подход к анализу.
Результаты варьировались в широких пределах в зависимости от модели, подмножества задачи, уровня сложности и выбранной парадигмы. Это доказывает, что компетенция в области ЭЭГ не является универсальной для всех LLM, а сильно зависит от архитектуры и способа интеграции с инструментами анализа.
Значение для индустрии
BrainBench предоставляет воспроизводимую тестовую среду для развития LLM в области нейронауки. Авторы анонсировали скорое открытие исходного кода и данных бенчмарка, а также непрерывное обновление результатов. Это шаг к созданию надежных AI-ассистентов для клинической диагностики и нейробиологических исследований, способных не просто «угадывать» классы, а объяснять свои выводы на основе данных.
Источник: arXiv cs.AI ↗
