Суть исследования: что такое «научный вкус»
Команда исследователей представила TasteVal — первый бенчмарк, оценивающий способность ИИ-систем к «научному вкусу» (research taste) в контексте R&D. Под этим понимается умение выбирать интересные задачи, проектировать эксперименты и интерпретировать их результаты. В отличие от оценки кода, TasteVal изолирует именно интеллектуальную часть работы: модель только планирует эксперименты, а их реализацию выполняет фиксированный агент-программист на одной GPU H100.
Ключевая метрика — вычислительная эффективность. Если модель достигает результата эксперта, используя в два раза меньше вычислений, её «вкус» считается вдвое выше. Это напрямую влияет на прогнозы AI Futures Model: улучшение вкуса модели эквивалентно удвоению доступных вычислительных ресурсов.
Методология и условия теста
Тестирование проводилось на 8 новых задачах, репрезентативных для передового AI R&D: от курирования данных для пре-тренинга до устойчивости к адверсариальным атакам. Для сравнения использовалась база лучших экспертов (24 человека из OpenAI, Google DeepMind, NVIDIA, Microsoft Research). Ограничения раунда: 40 GPU-часов или 120 часов реального времени.
Ключевые результаты и цифры
Результаты демонстрируют экспоненциальный рост способностей ИИ. Лучшие модели не просто копируют людей, а оптимизируют процесс поиска истины, тратя на порядок меньше ресурсов.
| Метрика / Показатель | Значение / Результат | Примечание |
|---|---|---|
| Лучшая модель | Opus 5.5 | Значительно превосходит человеческий базовый уровень |
| Коэффициент эффективности (Compute Multiplier) | 2.30x | 95% доверительный интервал: 1.15-4.37x |
| Стоимость попытки | ~1/30 от стоимости эксперта | Сравнение с усредненной стоимостью попыток экспертов |
| Скорость улучшения «вкуса» | Удвоение каждые 3.0 месяца | Период с декабря 2025 года (95% CI: 1.7-5.0 мес.) |
Почему это важно: сдвиг прогнозов к Сингулярности
Результаты TasteVal имеют критическое значение для долгосрочных прогнозов развития ИИ. В модели AI Futures Project улучшение «научного вкуса» является главным драйвером приближения к суперинтеллекту, так как кодирование уже автоматизировано, и узким местом становятся именно экспериментальные вычисления.
При сохранении текущих темпов роста:
- Вероятность «сингулярности, обусловленной только вкусом» (taste-only singularity) возрастает с 51% до 88%.
- Медианная дата появления искусственного сверхразума (ASI) сдвигается с середины 2030 года на конец 2028 года.
- Вероятность появления суперинтеллекта до 2030 года растет с 46% до 69%.
Ограничения и критика
Авторы отмечают, что результаты могут как завышать, так и занижать реальную скорость прогресса. С одной стороны, задачи в TasteVal легко верифицируются, что позволяет моделям легко их «оптимизировать», а человеческий базовый уровень не включает топ-1% исследователей мира. С другой стороны, эксперты тратили в 30 раз больше ресурсов на одну попытку, чем лучшие модели, что может скрывать еще больший потенциал ИИ при равных условиях финансирования.
Источник: LessWrong ↗
