Новый стандарт оценки: Drone-Bench
Исследователь Лукас Петерссон (Lukas Petersson) представил Drone-Bench — специализированный бенчмарк, разработанный для оценки навыков программирования автономных беспилотников искусственным интеллектом. Проект позиционируется как независимая инициатива, но базируется на методологии Project Pilot — совместной работе исследователей с лабораторией Anthropic.
Цель бенчмарка — измерить, насколько хорошо современные AI-агенты справляются с задачей написания кода для выполнения простых автономных миссий, таких как surveillance (наблюдение/слежение). Это важный шаг от текстового кодинга к физическому взаимодействию с миром.
Связь с прогнозами AI-2027
Запуск Drone-Bench актуален в контексте прогнозов сообщества. В частности, в прогнозе AI-2027 авторы уже предсказывали рост способностей ИИ в области робототехники. Новый бенчмарк предоставляет эмпирические данные, позволяющие проверить эти гипотезы на практике. Он помогает понять, насколько быстро ИИ осваивает навыки, требующие не только логики, но и понимания физических ограничений и безопасности.
Почему это важно?
- Автономность: Переход от генерации кода к созданию полностью автономных систем, способных действовать без постоянного контроля человека.
- Безопасность: Оценка того, насколько надежно ИИ пишет код для устройств, работающих в физическом пространстве. Ошибки в коде дрона имеют последствия, отличные от багов в веб-приложении.
- Прозрачность: Публикация результатов и методологии позволяет сообществу (включая LessWrong) критически оценить прогресс в области AI-робототехники.
Где посмотреть?
Полная визуализация результатов и детали эксперимента доступны на официальном сайте проекта: andonlabs.com/evals/drone-bench. Исследователи открыты к обратной связи от сообщества по поводу методологии и полученных метрик.
Источник: LessWrong ↗
