Главная/Блог/Гайд/Token Saver: Как сэкономить 99% токенов…
Гайд8 мин чтения · 30 июля 2026 г.

Token Saver: Как сэкономить 99% токенов при работе с PDF в Claude

Разбираем open-source расширение Token Saver для Claude Desktop, которое использует локальный RAG для анализа больших документов без отправки файлов в облако.

Token Saver: Как сэкономить 99% токенов при работе с PDF в Claude

Каждый разработчик, исследователь или профессионал, работающий с большими языковыми моделями (LLM), рано или поздно сталкивается с одной и той же раздражающей проблемой: скрытые, но накапливающиеся затраты на контекстное окно. Многие пользователи считают, что загрузка 200-страничного PDF-файла в чат — это разовая операция, за которую нужно заплатить один раз. Однако реальность такова, что история переписки отправляется модели на каждом шаге диалога. Это означает, что массивный документ «оплачивается» снова и снова с каждым вашим следующим вопросом. Для тех, кто регулярно анализирует объемные отчеты, юридические документы или технические спецификации, этот так называемый «налог на токены» может стать серьезным финансовым и временным бременем.

Команда Marktechpost AI только что представила решение, которое кардинально меняет правила игры. Они выпустили Token Saver — расширение с открытым исходным кодом для Model Context Protocol (MCP), совместимое с Claude Desktop. Лицензия MIT, текущая версия 1.0. Проект разработан Арнавом Раем (студентом Университета Рочестера) в рамках стажировки в Marktechpost под руководством Жан-Марка Моммесена и Асифа Раззака. Token Saver внедряет концепцию Локального Гибридного RAG (Retrieval-Augmented Generation) прямо на ваш компьютер. Это позволяет задавать вопросы по огромным PDF-файлам, никогда не загружая сами файлы на серверы провайдера ИИ.

Результат впечатляет: потребление токенов сокращается на 92–99%, полная конфиденциальность данных гарантируется, а процесс настройки не требует создания сложных сред Python или работы с терминалом. В этой статье мы подробно разберем, как работает эта технология, почему традиционные методы анализа документов уступают, и как вы можете внедрить Token Saver в свой рабочий процесс уже сегодня.

01Скрытый дренаж токенов: почему обычные PDF «дороги»

Чтобы понять ценность Token Saver, нужно сначала осознать масштаб проблемы. Большинство пользователей предполагают, что когда они перетаскивают PDF-файл в интерфейс Claude, модель просто извлекает из него текст. На самом деле, поведение Claude по умолчанию гораздо сложнее. Модель преобразует каждую страницу в изображение, чтобы сохранить форматирование, графики и макет, а затем отдельно извлекает текстовые данные.

До того как будут подсчитаны токены для изображений, один только текст может занимать от 1 500 до 3 000 токенов на страницу. Представьте себе 200-страничный документ: только текстовая часть уже потребляет сотни тысяч токенов. Хотя такие функции, как Prompt Caching (кэширование промптов) и Claude Projects, помогают смягчить удар по бюджету, они не решают корневую проблему: весь документ все равно пересекает границу и отправляется на серверы провайдера.

Кроме того, если вам нужно найти всего два абзаца из 1000-страничного учебника, заставлять LLM искать по всему тексту самому — это неэффективно и подвержено галлюцинациям. Модель может упустить важные детали или выдать правдоподобный, но неверный ответ, основанный на шумовых данных. Token Saver решает эту проблему, убирая документ из зоны видимости модели и оставляя его только в локальной памяти.

Сравнение потребления токенов: традиционный метод против Local Hybrid RAG
Сравнение потребления токенов: традиционный метод против Local Hybrid RAG

02Как работает Local Hybrid RAG

Token Saver действует как локальный MCP-сервер: легковесная фоновая программа на вашем компьютере, которую Claude может вызывать как инструмент. PDF-файл никогда не покидает ваш жесткий диск. Когда вы задаете вопрос, Token Saver использует Локальный Гибридный RAG для поиска ответа.

Гибридный RAG считается золотым стандартом для поиска по документам, так как он объединяет два мощных метода поиска:

  • Поиск по ключевым словам (BM25): Работает через встроенный поиск FTS5 в SQLite (взвешенный коэффициент 0,4). Этот метод отлично находит точные термины и специфические названия.
  • Семантический поиск (Косинусное сходство): Использует локальную модель эмбеддингов all-MiniLM-L6-v2 (взвешенный коэффициент 0,6). Этот метод понимает смысл вашего вопроса, а не просто совпадает с точными словами.

Сочетая эти два подхода локально, сервер анализирует файл и передает Claude только те фрагменты, которые имеют высокую релевантность. Затем Claude синтезирует ответ, цитируя точные номера страниц и предоставляя вам бегущую подсчет сэкономленных токенов. Это не просто экономия денег — это повышение качества ответов за счет устранения информационного шума.

Архитектура локального конвейера обработки документов
Архитектура локального конвейера обработки документов
💡
Почему это важно для бизнеса. Для корпоративных пользователей и юристов конфиденциальность данных является неоспоримой. Token Saver гарантирует, что ваши проприетарные документы никогда не покидают локальную машину, что критически важно для соблюдения合规ности (compliance) и защиты интеллектуальной собственности.

038-этапный конвейер обработки

Token Saver работает полностью внутри одного долгоживущего локального процесса. Прежде чем любой текст достигнет Claude, локальный конвейер Гибридного RAG выполняет восемь быстрых шагов. Давайте разберем каждый из них, чтобы понять глубину технической реализации.

  1. Извлечение (Extract): Используется библиотека pypdfium2 (с резервным вариантом pypdf) для извлечения текста из PDF. Это обеспечивает быструю и надежную работу с файлами.
  2. Нарезка (Chunk): Текст разбивается на фрагменты по 180 слов с перекрытием в 40 слов. Это гарантирует, что контекст не будет разрезан вслепую, и смысл предложения не будет потерян на границе фрагментов.
  3. Оценка (Score - Hybrid RAG): Фрагменты оцениваются с использованием смешанного подхода BM25 и локальной модели эмбеддингов. Это позволяет находить как точные совпадения, так и смысловые аналогии.
  4. Контроль качества (Gate): Устанавливается порог качества. Фрагменты, не имеющие общих ключевых слов, должны пройти порог семантического сходства не ниже 0,25, чтобы быть квалифицированными. Это отсеивает нерелевантный шум.
  5. Удаление дубликатов (Deduplicate): Система удаляет почти идентичные фрагменты, чтобы избежать повторной отправки одной и той же информации.
  6. Обрезка (Trim): Фрагмент сужается строго до тех предложений, которые отвечают на запрос пользователя. Лишняя вода удаляется.
  7. Бюджет (Budget): Общий объем полезной нагрузки, отправляемой в Claude, ограничен 8 000 символами. Это предотвращает превышение лимитов контекстного окна.
  8. Конвертация (Envelope): Извлеченный текст упаковывается в элемент document-chunk, содержащий источник файла и точный номер страницы. Это позволяет пользователю верифицировать ответ.

Важно отметить: модель эмбеддингов является опциональной, но рекомендуемой. Если она не загружается, система корректно переходит в режим только по ключевым словам, обеспечивая отказоустойчивость.

04Цифры: экономия до 99% в масштабе

Поскольку конвейер Гибридного RAG ограничивает размер возвращаемого фрагмента текста, экономия токенов растет экспоненциально с увеличением размера документа. Вот как Token Saver показал себя в бенчмарках (измерено через tiktoken, предполагая один вопрос на документ):

Документ Страницы Токены всего документа Токены возвращенного фрагмента Экономия токенов
Этикетка лекарства FDA 33 23 959 1 021 95,7%
GDPR (EU 2016/679) 88 70 260 996 98,6%
Дело SFFA v. Harvard 233 133 349 740 99,4%

Примечание: Подсчет токенов использует cl100k_base в качестве эталона, а базовые значения предполагают, что весь документ оплачивается при каждом поиске.

Для профессионалов, работающих с судебными решениями, техническими стандартами, финансовыми отчетами или плотными учебниками, Token Saver устраняет повторяющийся «налог на токены». Чем длиннее чат, тем больше вы экономите, так как история переписки становится легче, а релевантный контекст — точнее.

Token Saver: Как сэкономить 99% токенов при работе с PDF в Claude

05Безопасность и локальная конфиденциальность

Модель безопасности Token Saver строится на трех столпах, что делает его идеальным выбором для энтерпрайз-пользователей:

  1. Нулевая загрузка (Zero Uploads): Документ никогда не покидает вашу машину. Все вычисления происходят локально.
  2. Разрешение папок (Folder Allowlisting): Вы настраиваете конкретную папку для Token Saver. Сервер будет активно отказываться читать файлы вне этой выделенной директории. Это создает четкую границу доверия.
  3. Сетевая изоляция (Network Isolation): Сервер общается с Claude Desktop только через стандартный ввод-вывод (stdio). Нет прослушиваемых сетевых портов, что drastically снижает поверхность атаки.

Это означает, что даже если в Claude Desktop или в операционной системе есть уязвимости, злоумышленник не может получить доступ к вашим документам через Token Saver, так как сетевых соединений просто не существует.

06Производительность моделей: Sonnet против Opus

Token Saver работает со всеми тремя версиями Claude 3.5, но тестирование выявило различия в поведении:

  • Claude 3.5 Sonnet (Рекомендуется): Это разумный выбор по умолчанию. Он отлично справляется с ссылками на файлы, задает уточняющие вопросы, если два файла имеют похожие имена, и правильно применяет извлеченные номера страниц.
  • Claude 3 Opus: Превосходно справляется со сложными документами с несколькими голосами (например, судебные решения с мнениями большинства и особыми мнениями). Opus достаточно умный, чтобы отмечать, когда он делает вывод об атрибуции на основе контекста, а не явного текста.

Для большинства повседневных задач Sonnet обеспечивает оптимальное соотношение скорости и качества, в то время как Opus стоит использовать для максимально сложных аналитических задач.

07Начало работы за считанные минуты

В отличие от многих инструментов с открытым исходным кодом, требующих сложных сред Python и конфигураций JSON, Token Saver упакован в один файл .mcpb (MCP Bundle).

  1. Скачайте token-saver-ccr.mcpb со страницы GitHub Releases проекта.
  2. Откройте Claude Desktop -> Settings -> Extensions -> Install extension.
  3. Включите расширение, нажмите Configure и выберите выделенную папку, где вы храните справочные PDF-файлы.
  4. При первом запросе выберите Always allow (Всегда разрешать).

Расширение не будет работать, пока не выбрана папка, потому что этот единственный выбор выполняет три функции одновременно. Эта папка задает границу того, что может быть прочитано, она позволяет вам запрашивать файл по имени, а не вводить полный путь, и это список, который сервер показывает Claude при начале разговора. Небольшая папка, содержащая только то, о чем вы хотите спросить, работает значительно лучше, чем указание на всю папку Documents.

08Что это значит на практике

Внедрение Token Saver в ваш рабочий процесс означает переход от «плати за все» к «плати только за релевантное». Вы получаете верифицируемую точность, так как каждый фрагмент имеет точный номер страницы, позволяя мгновенно проверить утверждения Claude. Вы получаете абсолютную конфиденциальность, так как данные остаются локально. И вы получаете бесшовную настройку, не требующую знаний программирования.

Для исследователей, юристов, финансистов и студентов, работающих с большими объемами текста, Token Saver — это не просто инструмент экономии, это инструмент повышения качества аналитики. Он позволяет сосредоточиться на сути вопроса, а не на борьбе с ограничениями контекстного окна и высокими счетами за API. Если вы работаете с Claude Desktop, установка Token Saver — это первый шаг к более умной, безопасной и экономичной работе с ИИ.

Вы можете найти полный код и документацию на странице GitHub проекта.

Источник: MarkTechPost ↗