Зеркальный код: AI переписывает сложные программы без исходников
Лаборатории Epoch и METR представили бенчмарк MirrorCode, который тестирует способность ИИ полностью переписывать программное обеспечение, имея доступ только к интерфейсу командной строки (CLI). Задача требует не просто перевода кода, а самостоятельного проектирования архитектуры с нуля. Результаты шокируют: Claude Opus 4.7 справился с задачей за 14 часов, потратив $251 на инференс. По оценкам исследователей, это заняло бы человека от 2 до 17 недель.
Ключевой вывод — ИИ научился «самоориентироваться» в чужой среде. Получая доступ к «черному ящику» программы, модель способна воссоздать её функционал как собственную capability. Это фундаментальный сдвиг: от помощи в написании строк к созданию целых систем.
Результаты MirrorCode: где AI силен, а где спотыкается
Бенчмарк включает 25 целевых программ. Лидеры (Opus 4.7 и GPT-5.5) успешно переписали крупные проекты, такие как gotree (16k строк) и pkl (61k строк). Однако математические пакеты и линтеры остаются сложными. Ниже приведена сводка эффективности:
| Программа | Размер (строк) | Статус решения | Примечание |
|---|---|---|---|
| gotree | 16,000 | Успешно (100%) | Opus 4.7 и GPT-5.5, стоимость $100–400 |
| pkl | 61,000 | Успешно (100%) | Opus 4.7, сложная конфигурационная система Apple |
| qsv_select | 87,000 | Успешно | Обработка CSV-данных |
| ruff | — | Не решено (0%) | Python-линтер, самая сложная задача |
| giac_subset | — | Не решено (0%) | Математический пакет |
Роботы Anthropic: 20-кратное ускорение за счет масштаба
Anthropic продемонстрировала, что улучшение общих языковых моделей напрямую улучшает робототехнику. В проекте Project Fetch использовался квадроногий робот. Сравнение показывает экспоненциальный рост эффективности:
| Дата / Версия модели | Участники | Время выполнения | Результат |
|---|---|---|---|
| Август 2025 (Opus 4.1) | Человек + AI | 181 минута | AI не справился автономно, но удвоил эффективность человека |
| Май 2026 (Opus 4.7) | AI автономно | 9 мин 35 сек | Выполнены все задачи кроме одной (перемещение мяча) |
Важно отметить: улучшения не были целевыми для робототехники. Они возникли как побочный эффект масштабирования общих моделей («The Bitter Lesson»).
Стратегия Sunday AI: масштаб предобучения решает всё
Стартап Sunday AI представил модель ACT-2 для складывания одежды. Их главный инсайт: надежность роботов растет не за счет сбора терабайтов данных, а за счет силы базовой модели. При сильном предобучении даже малое количество качественных данных (Memos) позволяет модели обобщать навыки на новые среды.
Роботы Sunday достигли успеха в 99.1% случаев (778 успешных складываний из 9 типов одежды). Простая одежда (шорты, футболки) дается легко, сложные блузки — сложнее, но с результатом выше 90%. Это подтверждает гипотезу: если решить проблему обобщения через большие модели, робототехника выйдет из нишевых лабораторий в дома.
Почему это важно
Мы наблюдаем конец эры «узкого» ИИ. Модели больше не просто генерируют текст или код по шаблону — они способны автономно разбираться в сложных, неизвестных им системах (будь то чужой софт или физический мир) и воспроизводить их. Это создает риск неконтролируемого воспроизводства технологий (bootstrapping industrial civilization) и открывает путь к массовому внедрению роботов, которые учатся на лету.
Источник: Import AI ↗
