Исследования5 июля 2026 г., 06:16 МСК🤖 Auto

GPT-5.6 и Claude Fable 5: анализ эффективности токенов и бенчмарков

Анализ Pareto-фронт оптимизации показывает, что производительность LLM растет логарифмически, а лимит кодовых задач составляет ~70% независимо от вычислений.

Баннер новости 2913

Логарифмическая кривая производительности

В системе оценки GPT 5.6 Preview (бенчмарк Multi Select Virology Troubleshooting) наблюдается четкая зависимость: производительность (pass@1) растет резко при низких затратах, но замедляется по мере увеличения бюджета. Оптимальная точка находится в левом верхнем углу графика — максимальная точность при минимальной стоимости. Использование режима рассуждения (reasoning mode) в GPT-5.6 Sol позволяет успешно генерировать биологические вирусы более чем в 50% случаев.

Лимит кодовых задач и сравнение моделей

Бенчмарк DeepSWE выявил фундаментальное ограничение: даже при бесконечном вычислительном ресурсе LLM выполняют лишь около 70% задач. При этом GPT 5.5 демонстрирует кривую производительности, аналогичную Claude Fable 5. Однако коммерческие версии (xhigh/high) намеренно ограничивают количество выводимых токенов для снижения затрат, что снижает итоговую точность кода.

Модель / Режим Ключевая метрика / Особенность Примечание
GPT 5.6 Sol (Reasoning) pass@1 > 50% (Virology) Высокая эффективность при включенном режиме рассуждений
GPT 5.5 (xhigh/high) Ограничение токенов Компромисс: снижение стоимости за счет падения качества кода
Claude Fable 5 Аналогичная кривая Сопоставима с GPT 5.5 по эффективности использования ресурсов
DeepSWE Benchmark ~70% задач Фундаментальный лимит выполнения сложных кодовых задач

Стоимость исследований и «режим мгновенного ответа»

Исследования на переднем крае (frontier) остаются дорогими: один запуск длинного цикла из 113 задач обходится примерно в $700. Это объясняет, почему компании до сих пор используют сложные тесты для людей — они хотят оценить «y-intercept», то есть способность кандидата решать задачи без помощи ИИ (в «мгновенном режиме»), что является ключевым индикатором базовых навыков.

Стартапы против корпораций: эффективность ресурсов

Анализ Pareto-фронт для компаний показывает, что стартапы (например, Mercor) значительно эффективнее используют капитал, чем гиганты (Tesla, OpenAI). Стартапы достигают роста за счет низких маржинальных издержек и быстрой смены стратегий. По мере роста компании сталкиваются с нелинейным ростом затрат на безопасность, юридическое сопровождение и управление, что замедляет темпы роста, за исключением случаев вроде Anthropic, демонстрирующих аномально высокую эффективность.

Стратегия выживания и оптимизация

Главный вывод: успех зависит не от бесконечных ресурсов, а от способности выполнять «трудные вещи», которые сдвигают кривую тестовых вычислений. Для разработчиков это означает переход от прямого запроса к ИИ к созданию инструментов (bash-скрипты, ripgrep, кастомные агенты), экономящих токены. Для бизнеса — фокус на росте и сохранении капитала до момента достижения критической массы.

Источник: LessWrong ↗