Исследования19 сентября 2026 г., 18:17 МСК🤖 Auto

CommentBench: Как ИИ-модели справляются с комментариями по безопасности ИИ

Исследователи из LessWrong представили новый бенчмарк CommentBench, оценивающий способность моделей генерировать содержательные комментарии к научным текстам по AI Safety. Лидером стала Fable 5, но результаты показали, что модели всё ещё значительно

Баннер новости 7870

Суть исследования: от текста к точкам

Авторы (Oscar Gilg, Hasan Baig) создали пайплайн для оценки того, насколько хорошо передовые языковые модели могут имитировать человеческие комментарии к концептуальным постам по безопасности ИИ. В отличие от стандартных тестов, здесь оценивается не просто знание фактов, а способность выделять целевые пункты (target points) — ключевые аргументы, которые обычно делают эксперты.

Методология включает три этапа:

  • Фильтрация и разбивка: Человеческие комментарии разбиваются на отдельные пункты, удаляются те, что требуют внешнего контекста.
  • Генерация: Моделям предлагается написать 20 комментариев (по 50-70 слов) к документу, предсказывая, какие пункты поднимут люди.
  • Оценка: Модель-судья (Opus 5) сопоставляет сгенерированные комментарии с человеческими пунктами, присваивая баллы от 0.6 до 1.0. Результат — доля пунктов, найденных хотя бы одним ИИ-комментарием с оценкой ≥ 0.8.

Результаты: Fable 5 вне конкуренции

Исследование охватывает четыре типа документов: посты на LessWrong/EA Forum, черновики исследований (Google Docs), короткие посты (shortforms) и ответы в тредах. Лучший результат показала модель Fable 5, которая смогла сопоставить 8.3% целевых пунктов. За ней следует Fable 5.1 (7.5%).

Интересно, что модели OpenAI (GPT-6 Astra) и Sol показали себя слабее, чем ожидалось по другим метрикам. Astra набрала 5.5%, Sol — 5.3%. Это указывает на то, что способность к «пониманию» сложных концепций безопасности ИИ не всегда коррелирует с общей производительностью в других задачах.

Модель Доля совпадений (Match Rate) Примечание
Fable 5 8.3% Лучший результат
Fable 5.1 7.5% Обновленная версия
Astra (OpenAI) 5.5% Ниже ожиданий
Sol 5.3% Сопоставим с Astra

Почему это важно для AI Safety

Авторы подчеркивают, что улучшение способности ИИ давать содержательную обратную связь критично для ускорения исследований в области выравнивания (alignment). Если модели смогут эффективно комментировать черновики исследований, это позволит исследователям быстрее находить слабые места в своих аргументах, сохраняя человека в контуре принятия решений (human-in-the-loop).

Также исследователи проверили гипотезу о мнемонике (запоминании). Поскольку все публичные документы в корпусе были опубликованы после 17 февраля 2026 года, а большинство моделей имеют cutoff раньше этой даты, результаты не объясняются простым заучиванием текстов. Корреляция результатов между разными типами документов (форумы, черновики) оказалась высокой (Pearson r = 0.86–0.97), что говорит о стабильности способности модели к концептуальному анализу.

Выводы

CommentBench демонстрирует, что современные модели уже способны генерировать инсайты, которые люди иногда упускают, но разрыв между ИИ и экспертами-людьми в области глубокого концептуального анализа остается значительным. Авторы планируют поделиться бенчмарком с лабораториями для дальнейшего улучшения моделей в этой специфической, но важной области.

Источник: LessWrong ↗