Самооптимизация и прорыв в математике
Недавно выпущенная модель OpenAI GPT-5.6 Sol не только обслуживает запросы, но и оптимизирует собственную инфраструктуру. Sol проанализировала живой трафик, перенастроила маршрутизацию и автономно переписала производственные GPU-ядра. Результат — снижение затрат на обслуживание (serving costs) на 20%. Отдельные эксперименты с speculative decoding показали рост эффективности генерации токенов более чем на 15%.
Параллельно OpenAI представила внутреннюю модель Astra (предположительно предтеча GPT-6), которая совершила 10 прорывов в чистой математике и теоретической информатике. Все результаты формально доказаны в системе Lean. Среди достижений:
- Опровержение гипотезы о софичности (non-sofic group).
- Опровержение гипотезы жесткости Коннеса (Connes rigidity conjecture).
- Точная асимптотическая скорость программы Коэн-Элкиса по упаковке сфер.
- Решение трех проблем Эрдёша и новые нижние оценки для перманента.
Стоимость токенов, необходимых для таких открытий, оценивается всего в ~$2 000 по тарифам Sol API, что делает маржинальную стоимость поиска новых знаний ничтожно малой.
Ценовая война: DeepSeek, Qwen и OpenAI Luna
Сегмент «бюджетного интеллекта» стал критически важным. Индекс Artificial Analysis (на 4 августа 2026 г.) показывает, что разница в цене между топовыми и бюджетными моделями сокращается, а производительность последних приближается к frontier-уровню.
| Модель | Индекс (Intelligence Index) | Цена за задачу | Ключевые особенности |
|---|---|---|---|
| DeepSeek V4 Flash 0731 | 50 (max effort) | ~$0.03 | Архитектура MoE (284B total / 13B active), контекст 1M токенов. Кэширование снижает стоимость длинных агентов до $0.12 за 50 вызовов. |
| OpenAI GPT-5.6 Luna | 51 (max effort) 46 (high effort) |
~$0.05 (max) ~$0.02 (high) |
Снижение API-цен на 80%. High effort работает в 8 раз быстрее (16.5 сек против 135.5 сек) при незначительной потере качества. |
| Qwen3.8-Max | ~86-93 (по внутренним бенчмаркам) | $2/млн вх. токенов $6/млн вых. |
2.4 трлн параметров (95B active). Конкурирует с GPT-5.6 Sol на TerminalBench и PaperBench. Ожидается как open-weight решение. |
Экономика инференса и будущее разработки
Экономия OpenAI в 20% на инференсе имеет колоссальные масштабы. При прогнозируемых затратах на инференс в $14.1 млрд в 2026 году, это экономия в миллиарды долларов. Однако основная выгода, вероятно, проявится не в снижении цен, а в увеличении пропускной способности (capacity).
Математический прорыв Astra меняет парадигму исследований. Математика стала первой областью, где верификация (через Lean) стала дешевой и механической. Это позволяет моделям проводить огромные поисковые пространства, оставляя человеку роль куратора и проверяющего. Эксперты, такие как Теренс Тао, прогнозируют ускорение производства доказательств, где главной ценностью станет выбор задач и интерпретация результатов, а не ручное выведение шагов.
Практические рекомендации для инженеров
Существующий разрыв в стоимости между оркестратором (Sol/Claude) и рабочими потоками (Luna) составляет 25x. Это диктует новую архитектуру:
- Используйте Luna для рутинных задач сбора и структурирования данных, управляемых более сильными моделями.
- Держите стабильные инструкции в начале промптов для максимального использования кэширования.
- Эскалируйте только задачи, требующие суждения, к моделям уровня Sol.
- Если ваша доменная область не имеет дешевого верификатора (как Lean в математике), создание такого верификатора становится задачей с наивысшим рычагом воздействия (highest-leverage move).
Бенчмарки
| Бенчмарк | GPT-5.6 Sol | Qwen3.8-Max |
|---|---|---|
| TerminalBench 2.1 | 88.8% | 86.6% |
| PaperBench | 90.5% | 93% |
| OSWorld Verified | 86.1% | 83.2% |
Жирным — лучший результат в строке. Источник цифр — официальная публикация.
Источник: Towards AI newsletter ↗
