Проблема: переплата за «мышление» там, где нужна только I/O
Большая часть работы AI-агентов по написанию кода — это не сложный анализ, а ввод-вывод (I/O). Чтение десятков файлов для ответа на один вопрос или генерация тестов по шаблону потребляет тысячи токенов в дорогих моделях уровня frontier. К 2028 году расходы на AI-кодинг могут превысить зарплату разработчика, а уже сейчас лиды тратят $200–500 в месяц на токены на одного инженера.
Решение Spotify не требует новой инфраструктуры. Оно использует AiKA Modes в Portal by Spotify — декларативных агентов, работающих на эфемерном рантайме (аналог AWS Lambda для агентов). Это позволяет маршрутизировать «черновую работу» на дешевые модели, оставляя мощные модели для задач, требующих рассуждений.
Архитектура: два режима и плагин Shunt
Система построена на двух основных режимах (Modes), использующих модель Gemini 2.5 Flash в качестве исполнителя, и плагине Shunt для Claude Code, который перехватывает вызовы инструментов.
| Режим (Mode) | Назначение | Модель | Ключевая инструкция |
|---|---|---|---|
| bulk-reader | Анализ кода, чтение множества файлов | Gemini 2.5 Flash | Выводить только структурированные пункты. Без вступлений. Указывать имена файлов/строки. |
| code-writer | Генерация тестов, конфигов, заглушек | Gemini 2.5 Flash | Выводить только код. Строго следовать паттернам из референсных файлов. Без markdown-оберток. |
Плагин Shunt работает в три слоя:
- Хуки (Hooks): Перехватывают вызовы чтения файлов. Если файл превышает порог (по умолчанию 350 строк), чтение блокируется, и Claude перенаправляется к навыку
/bulk-reader. - Скрипты (Scripts): Обертки над Portal CLI, которые отправляют запросы в фоновые режимы и записывают результат на диск, не загружая контекст Claude.
- Навыки (Skills): Markdown-файлы, объясняющие Claude, как использовать новые команды, если хук сработал.
Результаты и ограничения
Тестирование на Java-монолите показало среднюю экономию токенов на уровне 90% при использовании режима bulk-read. Режим code-write также экономит ресурсы, так как сгенерированный код сразу записывается на диск, не проходя через контекст Claude.
Однако система имеет четкие границы применимости:
- Редактирование: Делегировать правки нельзя. У дешевых моделей нет надежных номеров строк для точечных изменений. Хуки позволяют целевое чтение (offset/limit) для этих случаев.
- Рассуждения: Делегировать логику нельзя. Worker-модели пропустили тонкие баги (например, проблемы потокобезопасности), которые Claude нашел мгновенно при наличии контекста.
- Задержка: Каждый запрос — это сетевой круг. Ответ занимает 10–30 секунд. Это приемлемо для больших файлов, но контрпродуктивно для мелких задач.
Почему это важно
Подход Spotify демонстрирует, что оптимизация затрат на AI — это не просто выбор более дешевой модели, а архитектурное разделение задач. Маршрутизация I/O-операций на специализированные, быстрые и дешевые агенты позволяет сохранить качество кода за счет сильных моделей, но радикально снизить операционные расходы.
Источник: Atspotify ↗
