Исследования28 июля 2026 г., 08:16 МСК🤖 Auto

LaughBench: Тест на юмор как индикатор истинного интеллекта ИИ

Исследователь Taylor G. Lunt представил LaughBench — бенчмарк, оценивающий способность моделей генерировать смешные шутки. Результаты показывают, что даже топовые модели пока не могут вызвать искренний смех, что указывает на пробелы в понимании конте

Баннер новости 4515

Почему юмор — это тест на IQ

Автор LaughBench, Тейлор Г. Лунт, утверждает, что способность ИИ рассказывать новые, забавные шутки является надежным индикатором общего интеллекта (AGI), превосходящим по значимости задачи по программированию или математике. Юмор требует от модели построения точной ментальной модели собеседника: нужно предвидеть ложные умозаключения аудитории и избегать их, не попадаясь в ту же ловушку. Это когнитивная задача высокой сложности, аналогичная тем, что решают профессиональные комики с высоким IQ.

Результаты тестирования: «Искры» интеллекта

В ходе неформального тестирования автор проверял модели на способность вызывать у него смех. Большинство моделей провалили тест, не вызвав никакой реакции. Однако передовые (frontier) модели продемонстрировали небольшие успехи, заставляя автора улыбаться, что свидетельствует о появлении зачатков более глубокого понимания контекста.

Модель / Категория Результат теста LaughBench Комментарий автора
GPT-5.6 Sol Вызывает улыбку Присутствует «искра» интеллекта, отсутствовавшая у предыдущих версий
Fable (версия 5) Вызывает улыбку Аналогично GPT-5.6 Sol, есть прогресс в генерации юмора
Другие модели Не вызвали смеха Шутки не сработали, реакция равна нулю

Проблема существующих бенчмарков

Лунт критикует традиционные метрики (математика, код), так как они часто решаются за счет памяти и рекомбинации известных паттернов, а не истинного понимания. В отличие от них, юмор объективен: вы либо смеетесь, либо нет. Это делает LaughBench уникальным инструментом для оценки «настоящего» интеллекта, необходимого для решения сложных задач, таких как создание биологического оружия, манипуляции или прорывы в науке.

Сравнение с другими подходами

Автор отмечает, что такие проекты, как FrontierMath и ARC-AGI, также стремятся измерить высокий интеллект, но имеют недостатки. ARC-AGI, например, может быть решен с помощью пространственного мышления и запоминания, что не всегда требует общего интеллекта. Генерация новых настольных игр с высокой ветвистостью также сложна для оценки. Шутка же остается самым простым и эффективным способом проверки способности модели к абстрактному и контекстуальному мышлению.

Источник: LessWrong ↗