Релиз модели28 июля 2026 г., 05:16 МСК🤖 Auto

AI-программисты за $251 и роботы Anthropic: новый этап автономности

Модели Opus 4.7 и GPT-5.5 переписывают сложный код за часы, а роботы Anthropic выполняют задачи в 20 раз быстрее людей. Индустрия переходит от узкой автоматизации к общей автономности.

Баннер новости 4510

Зеркальный код: AI переписывает сложные программы без исходников

Лаборатории Epoch и METR представили бенчмарк MirrorCode, который тестирует способность ИИ полностью переписывать программное обеспечение, имея доступ только к интерфейсу командной строки (CLI). Задача требует не просто перевода кода, а самостоятельного проектирования архитектуры с нуля. Результаты шокируют: Claude Opus 4.7 справился с задачей за 14 часов, потратив $251 на инференс. По оценкам исследователей, это заняло бы человека от 2 до 17 недель.

Ключевой вывод — ИИ научился «самоориентироваться» в чужой среде. Получая доступ к «черному ящику» программы, модель способна воссоздать её функционал как собственную capability. Это фундаментальный сдвиг: от помощи в написании строк к созданию целых систем.

Результаты MirrorCode: где AI силен, а где спотыкается

Бенчмарк включает 25 целевых программ. Лидеры (Opus 4.7 и GPT-5.5) успешно переписали крупные проекты, такие как gotree (16k строк) и pkl (61k строк). Однако математические пакеты и линтеры остаются сложными. Ниже приведена сводка эффективности:

Программа Размер (строк) Статус решения Примечание
gotree 16,000 Успешно (100%) Opus 4.7 и GPT-5.5, стоимость $100–400
pkl 61,000 Успешно (100%) Opus 4.7, сложная конфигурационная система Apple
qsv_select 87,000 Успешно Обработка CSV-данных
ruff Не решено (0%) Python-линтер, самая сложная задача
giac_subset Не решено (0%) Математический пакет

Роботы Anthropic: 20-кратное ускорение за счет масштаба

Anthropic продемонстрировала, что улучшение общих языковых моделей напрямую улучшает робототехнику. В проекте Project Fetch использовался квадроногий робот. Сравнение показывает экспоненциальный рост эффективности:

Дата / Версия модели Участники Время выполнения Результат
Август 2025 (Opus 4.1) Человек + AI 181 минута AI не справился автономно, но удвоил эффективность человека
Май 2026 (Opus 4.7) AI автономно 9 мин 35 сек Выполнены все задачи кроме одной (перемещение мяча)

Важно отметить: улучшения не были целевыми для робототехники. Они возникли как побочный эффект масштабирования общих моделей («The Bitter Lesson»).

Стратегия Sunday AI: масштаб предобучения решает всё

Стартап Sunday AI представил модель ACT-2 для складывания одежды. Их главный инсайт: надежность роботов растет не за счет сбора терабайтов данных, а за счет силы базовой модели. При сильном предобучении даже малое количество качественных данных (Memos) позволяет модели обобщать навыки на новые среды.

Роботы Sunday достигли успеха в 99.1% случаев (778 успешных складываний из 9 типов одежды). Простая одежда (шорты, футболки) дается легко, сложные блузки — сложнее, но с результатом выше 90%. Это подтверждает гипотезу: если решить проблему обобщения через большие модели, робототехника выйдет из нишевых лабораторий в дома.

Почему это важно

Мы наблюдаем конец эры «узкого» ИИ. Модели больше не просто генерируют текст или код по шаблону — они способны автономно разбираться в сложных, неизвестных им системах (будь то чужой софт или физический мир) и воспроизводить их. Это создает риск неконтролируемого воспроизводства технологий (bootstrapping industrial civilization) и открывает путь к массовому внедрению роботов, которые учатся на лету.

Источник: Import AI ↗