headroomlabs-ai/headroom

Сжимает вывод инструментов, логи, файлы и чанки RAG до их поступления в LLM. На 60-95% меньше токенов, те же ответы. Библиотека, прокси, MCP-сервер.

Инструменты⭐ 73 301Pythonпоследний релиз: v0.37.0
Открыть на GitHub ↗Сайт проекта ↗

Что это за инструмент

Headroom — это локальный слой сжатия контекста для AI-агентов, который уменьшает объем передаваемых в LLM данных (логи, RAG, файлы) на 60–95% без потери качества ответов.

Зачем нужен

Инструмент решает проблему переполнения контекстного окна и высоких затрат на токены, сжимая входные данные агента перед отправкой промпта. Он полезен для оптимизации стоимости и скорости работы LLM, так как позволяет использовать больше информации в контексте, не превышая лимиты.

Что можно реализовать

  • Сжатие результатов RAG и логов инструментов перед подачей в LLM для экономии токенов
  • Интеграция в агенты через MCP-сервер или прокси без изменения кода приложения
  • Снижение объема выходных токенов (output token reduction) путем удаления лишнего кода и церемоний в ответах модели
  • Обмен сжатым контекстом между разными агентами (Claude, Codex, Gemini) с автоматическим дедуплицированием
  • Анализ неудачных сессий и автоматическое обновление инструкций для агентов через команду headroom learn

Ключевые возможности

  • Мгновенное снижение потребления токенов на 60–95% при сохранении точности ответов
  • Поддержка нескольких форматов сжатия: SmartCrusher (JSON), CodeCompressor (AST) и Kompress-v2-base (текст)
  • Обратимое сжатие (CCR): оригинальные данные кэшируются локально и могут быть восстановлены по запросу LLM
  • Гибкие способы интеграции: библиотека (Python/TS), прокси, обертка для IDE/агентов или MCP-сервер
  • Локальная работа: данные обрабатываются на стороне клиента, обеспечивая приватность

👤 Кому подойдёт: Разработчики AI-агентов, инженеры по LLM, использующие RAG и сложные инструменты, а также команды, стремящиеся оптимизировать затраты на API-вызовы.

Релизы

v0.37.0minor
🕐 24 дн назад · релиз на GitHub ↗

Релиз v0.37.0: унификация сжатия, защита от SSRF, исправления маршрутизации и безопасности прокси.

  • Added: Унификация движка сжатия для прокси и сайдкар-режима, добавлен /v1/compress и ретрансляция /v1/usage.
  • Added: Внедрено саморегулируемое состояние сессии для реестра кэша сжатия.
  • Fixed: Закрыта уязвимость SSRF в Vertex через валидацию региона и усилен контроль токенов в WebSocket.
  • Fixed: Исправлена маршрутизация Kimi Code, сохранено нативное распределение моделей Copilot Enterprise.
  • Fixed: Устранены ошибки сжатия, конфликты настроек и проблемы с очисткой кэша на Windows.
v0.36.5patch
🕐 29 дн назад · релиз на GitHub ↗

Исправлено определение авторизации ChatGPT и ложное срабатывание диагностики маршрутизации Claude.

  • Fixed: Исправлено определение авторизации ChatGPT через id_token claims, теперь корректно инициируется запрос openai_auth.
  • Fixed: Исправлена диагностика doctor: теперь корректно отображается маршрутизация Claude в рамках проекта вместо ложного отрицания.
v0.36.4patch
🕐 1 мес назад · релиз на GitHub ↗

Исправление безопасности, стабильности стриминга OpenAI и настройка бюджетов в Serena.

  • Fixed: Усилена безопасность: добавлена валидация upstreams, задаваемых пользователем, на всех путях разрешения.
  • Fixed: Исправлена работа стриминга OpenAI: устранено ошибочное дублирование указателей между ходами.
  • Fixed: Прокси теперь корректно сохраняет дополнительный инструмент carrier (additional_tools) в ответах.
  • Added: Бюджет простоя предварительной индексации в Serena стал настраиваемым параметром.
  • Fixed: Для встроенных статических активов зафиксированы MIME-типы в панели управления.
v0.36.2patch
🕐 1 мес назад · релиз на GitHub ↗

Исправления в Copilot, Kompress и Proxy; обновление зависимостей ai, tiktoken-rs, tokenizers и TypeScript.

  • Fixed: Copilot: привязка токена minted к передаваемому ID интеграции.
  • Fixed: Proxy: подсчёт выходных токенов по тексту потока, а не по размеру в сети.
  • Fixed: Kompress: удалённый компрессор теперь принимает ccr_original.
  • Added: Обновление пакета ai с 6.x до 7.0.59 в SDK и документации.
  • Added: Обновление TypeScript до 7.0.2 в плагинах openclaw и opencode.
  • Added: Обновление tiktoken-rs до 0.12.0 и tokenizers до 0.23.1.
v0.36.0minor
🕐 1 мес назад · релиз на GitHub ↗

Релиз v0.36.0: новые настройки роллаута, отчетность расширений, исправления CCR и Anthropic 1M.

  • Added: Добавлен детерминированный контроль роллаута во время выполнения.
  • Added: Расширения прокси теперь могут сообщать об экономии и собственной задержке.
  • Added: Возможность настраивать fallback-модель для Claude 1m через переменную HEADROOM_1M_MODEL.
  • Fixed: Исправлено корректное ценообразование и поддержка контекстного окна 1M для Anthropic.
  • Fixed: Унифицировано распределение экономии по всем статистическим данным и дашборду.
  • Fixed: Исправлена работа StreamingCCRHandler для OpenAI и маршрутизация VS Code inline-подсказок.
v0.35.0minor
🕐 1 мес назад · релиз на GitHub ↗

Релиз v0.35.0: оптимизация производительности, исправление ошибок прокси и бекендов, обновление зависимостей.

  • Added: Добавлена поддержка тарификации кэша промптов и расширение CLI для управления ценами.
  • Added: Реализован выбор бэкенда для каждого запроса при маршрутизации расширений.
  • Fixed: Скорость работы горячего пути увеличена на 27% за счет мемоизации и оптимизации загрузки.
  • Fixed: Исправлены утечки памяти, ошибки стриминга, корректность подсчета токенов и работа с SQLite.
  • Fixed: Улучшена стабильность прокси: исправлен поиск инструментов, корректное завершение работы и биллинг.
v0.34.0minor
🕐 1 мес назад · релиз на GitHub ↗

Релиз v0.34.0: поддержка Claude Code в VS Code, прозрачное проксирование Copilot, новые возможности компрессии и исправления стоимости.

  • Added: Добавлена поддержка Claude Code в VS Code и прозрачное проксирование моделей Copilot.
  • Added: Расширены возможности компрессии: поддержка PHP, настройка frozen_message_count и вывод без маркеров по умолчанию.
  • Added: Организации теперь могут запускать Kompress на собственной инфраструктуре инференса.
  • Fixed: Исправлена ошибка, из-за которой LiteLLM видел нулевую стоимость промпта, и устранены проблемы с ценообразованием современных блоков контента.
  • Fixed: Устранены проблемы с токенизаторами моделей, конфликтами семейств моделей и безопасностью зависимостей (CVE).
v0.33.0minor
🕐 1 мес назад · релиз на GitHub ↗

Релиз v0.33.0: портирование компрессоров на Rust, поддержка Copilot и новая система плагинов компрессии.

  • Added: Портированы AST- и ML-компрессоры на Rust для обеспечения паритета производительности.
  • Added: В OpenCode добавлена поддержка бэкенда подписки GitHub Copilot для моделей Headroom.
  • Added: Реализована система плагинов компрессии с реестром и маршрутизацией через контент-роутер.
  • Added: Добавлена поддержка хуков для потоковой обработки в OpenAI-чате и сжатия cold-prefix для Kimi/GLM.
  • Added: Расширена аналитика: учёт экономии токенов по расширениям, кэшу провайдеров и схемам инструментов.
v0.30.0minor
🕐 2 мес назад · релиз на GitHub ↗

Релиз v0.30.0: новые профили для AI-агентов, оптимизация маршрутизации контента, цены на Claude 5 и фикс критической ошибки.

  • Added: Добавлены профили рабочей нагрузки для AI-агентов (coding и general).
  • Added: В контент-маршрутизаторе реализована компактификация без потерь для grep, log и json.
  • Added: Обновлены тарифы и добавлена поддержка семейства моделей Claude 5.
  • Fixed: Исправлено падение с SIGILL в бэкенде ONNX-эмбеддингов на системах без AVX2.
v0.29.0minor
🕐 2 мес назад · релиз на GitHub ↗

Исправления стабильности, новые флаги kompress-v2 и поддержка Vertex AI для Claude Code.

  • Added: Добавлен флаг --force-kompress-all для маршрутизации всего контента через kompress-v2-base.
  • Added: Добавлена поддержка Vertex AI для Claude Code через переменную ANTHROPIC_VERTEX_BASE_URL.
  • Fixed: Исправлена работа MiniMax-M3, сохранение порядка инструментов Anthropic и кэширование в прокси.
  • Fixed: Улучшена стабильность на Windows: исправлены зависания прокси, проблемы с PID и логированием.
  • Fixed: Оптимизированы оценки стоимости (счёт кэш-токенов), метрики MCP и обнаружение контента.
v0.28.0minor
🕐 2 мес назад · релиз на GitHub ↗

Релиз v0.28.0: первая поддержка OpenCode, усиление безопасности прокси, новые возможности Learn и оптимизация сжатия кода.

  • Added: Добавлена полноценная поддержка OpenCode: команды wrap, learn и установка MCP.
  • Added: Усилен прокси: добавлена входная аутентификация, заголовки безопасности, аудит и переключатель air-gap.
  • Added: Обновлен Headroom Learn: взвешивание циклов, оценка RTK-loop и запись знаний в CLAUDE.local.md.
  • Added: Оптимизация сжатия: tokensave стал основным компрессором для задач, добавлена поддержка Perl.
  • Fixed: Исправлена работа с Bedrock (обновлен boto3), улучшена обработка потоковых объектов в Agno и точность кэширования.