Логарифмическая кривая производительности
В системе оценки GPT 5.6 Preview (бенчмарк Multi Select Virology Troubleshooting) наблюдается четкая зависимость: производительность (pass@1) растет резко при низких затратах, но замедляется по мере увеличения бюджета. Оптимальная точка находится в левом верхнем углу графика — максимальная точность при минимальной стоимости. Использование режима рассуждения (reasoning mode) в GPT-5.6 Sol позволяет успешно генерировать биологические вирусы более чем в 50% случаев.
Лимит кодовых задач и сравнение моделей
Бенчмарк DeepSWE выявил фундаментальное ограничение: даже при бесконечном вычислительном ресурсе LLM выполняют лишь около 70% задач. При этом GPT 5.5 демонстрирует кривую производительности, аналогичную Claude Fable 5. Однако коммерческие версии (xhigh/high) намеренно ограничивают количество выводимых токенов для снижения затрат, что снижает итоговую точность кода.
| Модель / Режим | Ключевая метрика / Особенность | Примечание |
|---|---|---|
| GPT 5.6 Sol (Reasoning) | pass@1 > 50% (Virology) | Высокая эффективность при включенном режиме рассуждений |
| GPT 5.5 (xhigh/high) | Ограничение токенов | Компромисс: снижение стоимости за счет падения качества кода |
| Claude Fable 5 | Аналогичная кривая | Сопоставима с GPT 5.5 по эффективности использования ресурсов |
| DeepSWE Benchmark | ~70% задач | Фундаментальный лимит выполнения сложных кодовых задач |
Стоимость исследований и «режим мгновенного ответа»
Исследования на переднем крае (frontier) остаются дорогими: один запуск длинного цикла из 113 задач обходится примерно в $700. Это объясняет, почему компании до сих пор используют сложные тесты для людей — они хотят оценить «y-intercept», то есть способность кандидата решать задачи без помощи ИИ (в «мгновенном режиме»), что является ключевым индикатором базовых навыков.
Стартапы против корпораций: эффективность ресурсов
Анализ Pareto-фронт для компаний показывает, что стартапы (например, Mercor) значительно эффективнее используют капитал, чем гиганты (Tesla, OpenAI). Стартапы достигают роста за счет низких маржинальных издержек и быстрой смены стратегий. По мере роста компании сталкиваются с нелинейным ростом затрат на безопасность, юридическое сопровождение и управление, что замедляет темпы роста, за исключением случаев вроде Anthropic, демонстрирующих аномально высокую эффективность.
Стратегия выживания и оптимизация
Главный вывод: успех зависит не от бесконечных ресурсов, а от способности выполнять «трудные вещи», которые сдвигают кривую тестовых вычислений. Для разработчиков это означает переход от прямого запроса к ИИ к созданию инструментов (bash-скрипты, ripgrep, кастомные агенты), экономящих токены. Для бизнеса — фокус на росте и сохранении капитала до момента достижения критической массы.
Источник: LessWrong ↗
