Взрывной рост и «AI slop»
Механистическая интерпретируемость (Mechanistic Interpretability) переживает бум. За два года количество заявок на Workshop (ICML 2024, NeurIPS 2025, ICML 2026) выросло с 143 до 801. Программные комитеты (Andy Arditi, Ivan Arcuschin) зафиксировали появление феномена «AI slop» — низкокачественного, бессвязного контента, сгенерированного агентами. Рецензенты жаловались на необходимость тратить время на разбор работ, где невозможно понять суть вклада автора.
Методология: Pangram v3.3.2
Для анализа использовался детектор Pangram, оценивающий стиль текста. Текст разбивался на чанки по 250–350 слов. Чанк считался сгенерированным ИИ, если его оценка ≥0.75. Итоговый балл статьи — процент таких чанков. Важно: детектор ловит стиль, а не факт использования ИИ для экспериментов.
Ключевые метрики 2026 года
Доля AI-генерации в текстах резко выросла. Если в 2024 году таких работ было почти 0%, то в 2026 году 33% статей имеют более 50% AI-текста. При этом лучшие работы (spotlight) остаются преимущественно человеческими (91% чистые или почти чистые), что создает разрыв между «количеством» и «качеством».
| Метрика | ICML 2024 | NeurIPS 2025 | ICML 2026 |
|---|---|---|---|
| Всего заявок | 143 | 320 | 801 |
| Соло-авторы (доля) | 9% | — | 24% (~200 работ) |
| Авторы с ≥2 статьями | 4 человека | — | 62 человека |
| Доля AI-текста >50% | ~0% | — | 33% |
| Spotlight: доля AI-текста <25% | — | — | 91% |
Рецензенты тоже используют ИИ
Парадоксально, но 50% всех рецензий содержат фрагменты, сгенерированные ИИ, а в 17% случаев рецензия написана полностью машиной. Это приводит к искажению оценок: статьи с высоким процентом AI-текста получают более высокие баллы от AI-рецензентов, чем от человеческих. Это создает риск формирования «эхо-камеры» в научном пиринге.
Почему это важно
Рост числа соло-авторов и многократных submissions от одного автора коррелирует с высокой долей AI-генерации. Инфраструктура научных конференций (как ICLR, достигший 3200 заявок в 2022) не готова к такому объему «мусора». Без внедрения строгих проверок (например, кода, воспроизводимости) качество научного сообщества может деградировать из-за засилья формально оформленных, но пустых внутри статей.
Источник: LessWrong ↗
