chopratejas/headroom

Сжимает вывод инструментов, логи, файлы и RAG-чанки до их отправки в LLM. На 20% меньше токенов для coding-агентов, на 60-95% меньше для JSON, те же ответы. Библиотека, прокси, MCP-сервер.

Инструменты⭐ 73 290Pythonпоследний релиз: v0.37.0
Открыть на GitHub ↗Сайт проекта ↗

Что это за инструмент

Headroom — это локальный слой сжатия контекста для AI-агентов, который уменьшает количество токенов в запросах к LLM без потери качества ответов.

Зачем нужен

Инструмент оптимизирует затраты на API, сжимая входные данные (логи, RAG-чанки, код, JSON) перед отправкой модели. Он позволяет использовать те же модели с меньшим бюджетом, сохраняя точность результатов за счет обратимого сжатия.

Что можно реализовать

  • Снижение стоимости вызовов LLM для агентов, работающих с большими объемами кода или логов
  • Интеграция сжатия в существующие проекты через библиотеку, прокси или MCP-сервер без изменения основного кода
  • Автоматическое обучение агентов на ошибках через команду 'headroom learn' для улучшения системных промптов
  • Управление кросс-агентной памятью с дедупликацией данных между разными LLM-клиентами

Ключевые возможности

  • Сокращение токенов на 60–95% для JSON и на 15–20% для кода при сохранении качества ответов
  • Поддержка нескольких форматов интеграции: Python/TS библиотека, локальный прокси, обертка для IDE (Cursor, Claude Code) и MCP-сервер
  • Использование специализированных компрессоров (SmartCrusher, CodeCompressor) и модели Kompress-v2-base
  • Обратимое сжатие (CCR): оригинальные данные кэшируются локально для восстановления по запросу LLM
  • Локальная обработка данных, обеспечивающая безопасность и отсутствие утечек в сторонние сервисы

👤 Кому подойдёт: Разработчики AI-агентов, инженеры по машинному обучению и технические лидеры, оптимизирующие расходы на LLM и работающие с большими контекстами

Релизы

v0.37.0minor
🕐 24 дн назад · релиз на GitHub ↗

Объединение сжатия, защита от SSRF, исправление маршрутизации и багов кэширования в Headroom v0.37.0

  • Added: Объединено сжатие прокси и сайдкара на едином движке сессий
  • Added: Добавлен endpoint /v1/compress в режиме сайдкара и ретрансляция /v1/usage
  • Fixed: Закрыта уязвимость SSRF в Vertex через валидацию региона
  • Fixed: Исправлена маршрутизация managed Kimi Code и сохранение enterprise-маршрутизации Copilot
  • Fixed: Исправлено сжатие смешанного вывода сабентов и защита чтения файлов от потерь
v0.36.5patch
🕐 29 дн назад · релиз на GitHub ↗

Исправлено определение авторизации ChatGPT и корректная маршрутизация Claude в проекте.

  • Fixed: Codex: корректное определение авторизации ChatGPT через id_token claims.
  • Fixed: Doctor: исправлена маршрутизация Claude в рамках проекта вместо ложного отрицания.
v0.36.4patch
🕐 1 мес назад · релиз на GitHub ↗

Исправление безопасности, стабильности стриминга OpenAI и настройка бюджетов в Serena.

  • Fixed: Безопасность: добавлена валидация upstream-адресов, передаваемых вызывающей стороной, на всех путях разрешения.
  • Fixed: Прокси: исправлена передача дополнительных инструментов Codex (additional_tools) в ответе.
  • Fixed: OpenAI: устранена проблема дедупликации указателей между ходами при стриминге чата.
  • Fixed: Dashboard: зафиксированы MIME-типы для встроенных статических активов.
  • Added: Wrap: бюджет простоя предварительного индексирования Serena теперь настраивается.
v0.36.2patch
🕐 1 мес назад · релиз на GitHub ↗

Исправления в Copilot, Kompress и Proxy; обновлены зависимости ai, TypeScript, tiktoken-rs и другие.

  • Fixed: Copilot: привязка токена minted к передаваемому ID интеграции.
  • Fixed: Proxy: подсчёт выходных токенов по тексту потока, а не по размеру wire.
  • Fixed: Kompress: удалённый компрессор теперь принимает ccr_original.
  • Added: Обновлена библиотека ai с 6.x до 7.0.59 в SDK и документации.
  • Added: Обновлён TypeScript до 7.0.2 в плагинах openclaw и opencode.
  • Added: Обновлены зависимости: tiktoken-rs, tokenizers, md-5, ruff и другие.
v0.36.0minor
🕐 1 мес назад · релиз на GitHub ↗

Релиз v0.36.0: детерминированный контроль роутинга, интеграция экономии в дашборд и исправления CCR.

  • Added: Добавлен детерминированный контроль роутинга во время выполнения.
  • Added: Прокси теперь позволяет расширениям сообщать об экономии и собственной задержке.
  • Added: Атрибуция экономии унифицирована в статистике, метриках и дашборде.
  • Added: Модель для fallback --1m в Claude стала настраиваемой через переменную HEADROOM_1M_MODEL.
  • Fixed: Исправлено корректное ценообразование и поддержка тиража 1M-контекста для Anthropic.
  • Fixed: Устранены проблемы с буферизацией, обработкой потоков и безопасностью маркеров в CCR.
v0.35.0minor
🕐 1 мес назад · релиз на GitHub ↗

Релиз v0.35.0: оптимизация производительности, исправления прокси и бекендов, новые функции CLI и улучшения безопасности.

  • Added: Добавлен CLI-интерфейс для расширений и тарификация TTL кэша промптов.
  • Added: Внедрена маршрутизация расширений с выбором бэкенда для каждого запроса.
  • Fixed: Снижена задержка в критическом пути на 27% за счёт мемоизации и оптимизации загрузки.
  • Fixed: Исправлены утечки памяти, проблемы с потоками ONNX и корректность подсчёта токенов.
  • Fixed: Улучшена стабильность прокси: исправлен поиск инструментов, корректное завершение работы и биллинг.
v0.34.0minor
🕐 1 мес назад · релиз на GitHub ↗

Релиз 0.34.0: поддержка Claude Code, прозрачный прокси VS Code Copilot, PHP в CodeAwareCompressor и исправления стоимости.

  • Added: Добавлена поддержка Claude Code в VS Code.
  • Added: Реализован прозрачный прокси для моделей VS Code Copilot.
  • Added: В CodeAwareCompressor добавлена поддержка PHP.
  • Fixed: Исправлена передача полного промпта в LiteLLM для корректного расчёта стоимости.
  • Fixed: Устранена проблема с ценообразованием современных блоков контента.
  • Fixed: Обновлены зависимости aiohttp и cryptography для устранения уязвимостей CVE.