Релиз модели24 июля 2026 г., 22:17 МСК🤖 Auto

Drone-Bench: AI-агенты пишут код для автономных дронов

Исследователь Лукас Петерссон представил Drone-Bench — новый бенчмарк, оценивающий способность AI-агентов писать код для автономных дронов. Проект создан на базе работы Anthropic Project Pilot.

Баннер новости 4328

Новый стандарт оценки: Drone-Bench

Исследователь Лукас Петерссон (Lukas Petersson) представил Drone-Bench — специализированный бенчмарк, разработанный для оценки навыков программирования автономных беспилотников искусственным интеллектом. Проект позиционируется как независимая инициатива, но базируется на методологии Project Pilot — совместной работе исследователей с лабораторией Anthropic.

Цель бенчмарка — измерить, насколько хорошо современные AI-агенты справляются с задачей написания кода для выполнения простых автономных миссий, таких как surveillance (наблюдение/слежение). Это важный шаг от текстового кодинга к физическому взаимодействию с миром.

Связь с прогнозами AI-2027

Запуск Drone-Bench актуален в контексте прогнозов сообщества. В частности, в прогнозе AI-2027 авторы уже предсказывали рост способностей ИИ в области робототехники. Новый бенчмарк предоставляет эмпирические данные, позволяющие проверить эти гипотезы на практике. Он помогает понять, насколько быстро ИИ осваивает навыки, требующие не только логики, но и понимания физических ограничений и безопасности.

Почему это важно?

  • Автономность: Переход от генерации кода к созданию полностью автономных систем, способных действовать без постоянного контроля человека.
  • Безопасность: Оценка того, насколько надежно ИИ пишет код для устройств, работающих в физическом пространстве. Ошибки в коде дрона имеют последствия, отличные от багов в веб-приложении.
  • Прозрачность: Публикация результатов и методологии позволяет сообществу (включая LessWrong) критически оценить прогресс в области AI-робототехники.

Где посмотреть?

Полная визуализация результатов и детали эксперимента доступны на официальном сайте проекта: andonlabs.com/evals/drone-bench. Исследователи открыты к обратной связи от сообщества по поводу методологии и полученных метрик.

Источник: LessWrong ↗