Инструменты8 сентября 2026 г., 21:46 МСК🤖 Auto

Spotify: как сократить расходы на Claude Code на 90% с помощью AI Modes

Инженеры Spotify внедрили систему маршрутизации запросов, делегируя рутинные задачи дешевым моделям. Это позволило сократить потребление токенов Claude Code на 90% и снизить затраты на AI-кодинг.

Баннер новости 7037

Проблема: переплата за «мышление» там, где нужна только I/O

Большая часть работы AI-агентов по написанию кода — это не сложный анализ, а ввод-вывод (I/O). Чтение десятков файлов для ответа на один вопрос или генерация тестов по шаблону потребляет тысячи токенов в дорогих моделях уровня frontier. К 2028 году расходы на AI-кодинг могут превысить зарплату разработчика, а уже сейчас лиды тратят $200–500 в месяц на токены на одного инженера.

Решение Spotify не требует новой инфраструктуры. Оно использует AiKA Modes в Portal by Spotify — декларативных агентов, работающих на эфемерном рантайме (аналог AWS Lambda для агентов). Это позволяет маршрутизировать «черновую работу» на дешевые модели, оставляя мощные модели для задач, требующих рассуждений.

Архитектура: два режима и плагин Shunt

Система построена на двух основных режимах (Modes), использующих модель Gemini 2.5 Flash в качестве исполнителя, и плагине Shunt для Claude Code, который перехватывает вызовы инструментов.

Режим (Mode) Назначение Модель Ключевая инструкция
bulk-reader Анализ кода, чтение множества файлов Gemini 2.5 Flash Выводить только структурированные пункты. Без вступлений. Указывать имена файлов/строки.
code-writer Генерация тестов, конфигов, заглушек Gemini 2.5 Flash Выводить только код. Строго следовать паттернам из референсных файлов. Без markdown-оберток.

Плагин Shunt работает в три слоя:

  • Хуки (Hooks): Перехватывают вызовы чтения файлов. Если файл превышает порог (по умолчанию 350 строк), чтение блокируется, и Claude перенаправляется к навыку /bulk-reader.
  • Скрипты (Scripts): Обертки над Portal CLI, которые отправляют запросы в фоновые режимы и записывают результат на диск, не загружая контекст Claude.
  • Навыки (Skills): Markdown-файлы, объясняющие Claude, как использовать новые команды, если хук сработал.

Результаты и ограничения

Тестирование на Java-монолите показало среднюю экономию токенов на уровне 90% при использовании режима bulk-read. Режим code-write также экономит ресурсы, так как сгенерированный код сразу записывается на диск, не проходя через контекст Claude.

Однако система имеет четкие границы применимости:

  • Редактирование: Делегировать правки нельзя. У дешевых моделей нет надежных номеров строк для точечных изменений. Хуки позволяют целевое чтение (offset/limit) для этих случаев.
  • Рассуждения: Делегировать логику нельзя. Worker-модели пропустили тонкие баги (например, проблемы потокобезопасности), которые Claude нашел мгновенно при наличии контекста.
  • Задержка: Каждый запрос — это сетевой круг. Ответ занимает 10–30 секунд. Это приемлемо для больших файлов, но контрпродуктивно для мелких задач.

Почему это важно

Подход Spotify демонстрирует, что оптимизация затрат на AI — это не просто выбор более дешевой модели, а архитектурное разделение задач. Маршрутизация I/O-операций на специализированные, быстрые и дешевые агенты позволяет сохранить качество кода за счет сильных моделей, но радикально снизить операционные расходы.

Источник: Atspotify ↗