Результаты тестирования: Astra против GPT-5.5
Авторы исследования, опубликованного на LessWrong 9 сентября 2026 года, протестировали модель Astra (предположительно GPT-6) на наборе из 37 задач из проекта Think Fast. Ключевая находка заключается в том, что Astra демонстрирует аномально высокую производительность в задачах, требующих последовательного рассуждения (serial reasoning), таких как Arc-agi, хеширование, поиск по нескольким шагам (n-hop-look-up) и задачи на причинно-следственные связи.
Модель достигла точности ≥ 98% на 10 из 37 бенчмарков, что привело к «насыщению» метрик. Для сравнения, GPT-5.5 достигла такого уровня насыщения лишь на 4 бенчмарках. Это усложняет оценку, так как стандартные логистические кривые становятся менее информативными при отсутствии вариативности результатов на коротких задачах.
Методология: Как оценивали время без CoT?
Поскольку существующие бенчмарки слишком просты для Astra, исследователи применили два подхода для получения грубой оценки времени выполнения задач (Time Horizon, TH) без использования цепочки мыслей (Chain-of-Thought):
- Добавление гипотетических задач: В набор были добавлены 10 фиктивных бенчмарков с временем выполнения от 2 до 96 часов, на которых модель показывала 0% точности. Это позволило «растянуть» кривую обучения.
- Фильтрация насыщенных задач: Исключение всех бенчмарков, где модель показывает 100% результат, что, вероятно, занижает оценку TH.
Ключевые метрики и сравнения
Ниже представлены результаты оценки 50% порога времени выполнения (TH) для Astra и GPT-5.5 в различных конфигурациях набора данных:
| Конфигурация набора данных | 50% TH (Astra) - Точечная оценка | 50% TH (Astra) - Медиана [95% CI] | 50% TH (GPT-5.5) - Медиана [95% CI] |
|---|---|---|---|
| SA only (31 задача) | 2.5 часа | 7.2 часа [13.1 мин, ≫ диапазона] | 3.0 мин [0.84 мин, 62 мин] |
| SA only + 10 гипотетических (41 задача) | 18.7 мин | 22.8 мин [8.2 мин, 1.0 час] | - |
| SA + generation (37 задач) | 4.1 часа | 12.5 часа [35.2 мин, 1157.4 часа] | - |
| SA + generation + 10 гипотетических (47 задач) | 25.4 мин | 31.8 мин [13.0 мин, 1.3 часа] | - |
Исследователи делают вывод, что реальный 50% порог времени для Astra находится в диапазоне [8 минут, 1 час], с наиболее вероятным значением 15–40 минут. Это согласуется с оценками UKAISI (30 минут), полученными на узком наборе математических задач.
Почему это важно?
Результаты указывают на экспоненциальный рост способности моделей к «быстрому мышлению» (fast thinking) без использования развернутых цепочек рассуждений. Если Astra действительно решает задачи, требующие от человека часов работы, за минуты в режиме no-CoT, это меняет парадигму применения LLM для сложных аналитических задач. Однако текущие бенчмарки исчерпали свой потенциал для оценки таких моделей, и требуется создание новых тестов с более длительным временем выполнения человеком.
Источник: LessWrong ↗