Исследования7 октября 2026 г., 02:19 МСК🤖 Auto

TasteVal: AI превзошел экспертов в дизайне экспериментов, ускорив путь к ИИ

Новый бенчмарк TasteVal показал, что модели уровня Opus 5.5 эффективнее людей в планировании AI-экспериментов, сокращая затраты вычислений в 30 раз и сдвигая прогноз появления сверхразума на 2028 год.

Баннер новости 9077

Суть исследования: что такое «научный вкус»

Команда исследователей представила TasteVal — первый бенчмарк, оценивающий способность ИИ-систем к «научному вкусу» (research taste) в контексте R&D. Под этим понимается умение выбирать интересные задачи, проектировать эксперименты и интерпретировать их результаты. В отличие от оценки кода, TasteVal изолирует именно интеллектуальную часть работы: модель только планирует эксперименты, а их реализацию выполняет фиксированный агент-программист на одной GPU H100.

Ключевая метрика — вычислительная эффективность. Если модель достигает результата эксперта, используя в два раза меньше вычислений, её «вкус» считается вдвое выше. Это напрямую влияет на прогнозы AI Futures Model: улучшение вкуса модели эквивалентно удвоению доступных вычислительных ресурсов.

Методология и условия теста

Тестирование проводилось на 8 новых задачах, репрезентативных для передового AI R&D: от курирования данных для пре-тренинга до устойчивости к адверсариальным атакам. Для сравнения использовалась база лучших экспертов (24 человека из OpenAI, Google DeepMind, NVIDIA, Microsoft Research). Ограничения раунда: 40 GPU-часов или 120 часов реального времени.

Ключевые результаты и цифры

Результаты демонстрируют экспоненциальный рост способностей ИИ. Лучшие модели не просто копируют людей, а оптимизируют процесс поиска истины, тратя на порядок меньше ресурсов.

Метрика / Показатель Значение / Результат Примечание
Лучшая модель Opus 5.5 Значительно превосходит человеческий базовый уровень
Коэффициент эффективности (Compute Multiplier) 2.30x 95% доверительный интервал: 1.15-4.37x
Стоимость попытки ~1/30 от стоимости эксперта Сравнение с усредненной стоимостью попыток экспертов
Скорость улучшения «вкуса» Удвоение каждые 3.0 месяца Период с декабря 2025 года (95% CI: 1.7-5.0 мес.)

Почему это важно: сдвиг прогнозов к Сингулярности

Результаты TasteVal имеют критическое значение для долгосрочных прогнозов развития ИИ. В модели AI Futures Project улучшение «научного вкуса» является главным драйвером приближения к суперинтеллекту, так как кодирование уже автоматизировано, и узким местом становятся именно экспериментальные вычисления.

При сохранении текущих темпов роста:

  • Вероятность «сингулярности, обусловленной только вкусом» (taste-only singularity) возрастает с 51% до 88%.
  • Медианная дата появления искусственного сверхразума (ASI) сдвигается с середины 2030 года на конец 2028 года.
  • Вероятность появления суперинтеллекта до 2030 года растет с 46% до 69%.

Ограничения и критика

Авторы отмечают, что результаты могут как завышать, так и занижать реальную скорость прогресса. С одной стороны, задачи в TasteVal легко верифицируются, что позволяет моделям легко их «оптимизировать», а человеческий базовый уровень не включает топ-1% исследователей мира. С другой стороны, эксперты тратили в 30 раз больше ресурсов на одну попытку, чем лучшие модели, что может скрывать еще больший потенциал ИИ при равных условиях финансирования.

Источник: LessWrong ↗