Суть исследования: от текста к точкам
Авторы (Oscar Gilg, Hasan Baig) создали пайплайн для оценки того, насколько хорошо передовые языковые модели могут имитировать человеческие комментарии к концептуальным постам по безопасности ИИ. В отличие от стандартных тестов, здесь оценивается не просто знание фактов, а способность выделять целевые пункты (target points) — ключевые аргументы, которые обычно делают эксперты.
Методология включает три этапа:
- Фильтрация и разбивка: Человеческие комментарии разбиваются на отдельные пункты, удаляются те, что требуют внешнего контекста.
- Генерация: Моделям предлагается написать 20 комментариев (по 50-70 слов) к документу, предсказывая, какие пункты поднимут люди.
- Оценка: Модель-судья (Opus 5) сопоставляет сгенерированные комментарии с человеческими пунктами, присваивая баллы от 0.6 до 1.0. Результат — доля пунктов, найденных хотя бы одним ИИ-комментарием с оценкой ≥ 0.8.
Результаты: Fable 5 вне конкуренции
Исследование охватывает четыре типа документов: посты на LessWrong/EA Forum, черновики исследований (Google Docs), короткие посты (shortforms) и ответы в тредах. Лучший результат показала модель Fable 5, которая смогла сопоставить 8.3% целевых пунктов. За ней следует Fable 5.1 (7.5%).
Интересно, что модели OpenAI (GPT-6 Astra) и Sol показали себя слабее, чем ожидалось по другим метрикам. Astra набрала 5.5%, Sol — 5.3%. Это указывает на то, что способность к «пониманию» сложных концепций безопасности ИИ не всегда коррелирует с общей производительностью в других задачах.
| Модель | Доля совпадений (Match Rate) | Примечание |
|---|---|---|
| Fable 5 | 8.3% | Лучший результат |
| Fable 5.1 | 7.5% | Обновленная версия |
| Astra (OpenAI) | 5.5% | Ниже ожиданий |
| Sol | 5.3% | Сопоставим с Astra |
Почему это важно для AI Safety
Авторы подчеркивают, что улучшение способности ИИ давать содержательную обратную связь критично для ускорения исследований в области выравнивания (alignment). Если модели смогут эффективно комментировать черновики исследований, это позволит исследователям быстрее находить слабые места в своих аргументах, сохраняя человека в контуре принятия решений (human-in-the-loop).
Также исследователи проверили гипотезу о мнемонике (запоминании). Поскольку все публичные документы в корпусе были опубликованы после 17 февраля 2026 года, а большинство моделей имеют cutoff раньше этой даты, результаты не объясняются простым заучиванием текстов. Корреляция результатов между разными типами документов (форумы, черновики) оказалась высокой (Pearson r = 0.86–0.97), что говорит о стабильности способности модели к концептуальному анализу.
Выводы
CommentBench демонстрирует, что современные модели уже способны генерировать инсайты, которые люди иногда упускают, но разрыв между ИИ и экспертами-людьми в области глубокого концептуального анализа остается значительным. Авторы планируют поделиться бенчмарком с лабораториями для дальнейшего улучшения моделей в этой специфической, но важной области.
Источник: LessWrong ↗
