Долгоживущие агенты искусственного интеллекта накапливают контекст с пугающей скоростью. Каждый вывод инструмента, каждое наблюдение и промежуточный шаг рассуждения остаются в окне внимания модели. Две ключевые способности, которые определяют успех таких систем — удержание этого огромного объема информации и сохранение связности рассуждений на протяжении всего процесса — до недавнего времени были доступны почти исключительно через облачные конечные точки. Это создавало фундаментальное противоречие: для работы сложных агентов требовалась мощь облака, но данные часто не могли покинуть безопасный периметр организации.
Это исключало из использования передовых агентов целые сектора: регулируемые отрасли, государственные учреждения и приложения на устройствах (on-device), где данные не имеют права покидать внутренний контур безопасности ни при каких обстоятельствах. Именно эту брешь пытается закрыть Pokee AI, выпустив Pokee-Isaac 28B. Это текстовая фундаментальная модель с контекстным окном в 10 миллионов токенов, спроектированная специально для работы внутри защищенного периметра клиента.
Исследовательская команда Pokee заявляет о впечатляющих результатах: более 93% на бенчмарке RULER при длине контекста 10 миллионов токенов, паритет с самыми сильными оптимизированными по стоимости облачными моделями на агентных задачах, а также профиль обслуживания, который помещается на один графический процессор. Но как эта модель ведет себя в реальных условиях и стоит ли она того, чтобы перестраивать инфраструктуру?
01Доступность и модель лицензирования: не просто open-weight
Важно сразу прояснить вопрос доступности. Pokee AI предоставляет доступ к Isaac через OpenAI-совместимый API для разработчиков, но также лицензирует модель для развертывания внутри частной облачной инфраструктуры (VPC), на собственных серверах (on-premises) или непосредственно на устройствах. Запуск анонсируется с поддержкой Day-0 для популярных движков обслуживания vLLM и SGLang, что позволяет командам быстро интегрировать модель в существующие пайплайны.

Компания заявляет, что обслуживание возможно на одном GPU, начиная с уровня RTX 4090 или эквивалентных потребительских решений. Однако здесь кроется важный нюанс, который нельзя игнорировать. Исследовательская команда публикует измерения только с одного GPU класса B200. Поэтому утверждения о работе на потребительских картах следует воспринимать как рекомендации производителя (vendor guidance), а не как подтвержденные научные результаты. Для энтузиастов и небольших команд это может означать, что на потребительских картах полная загрузка большого контекста будет работать с ограничениями по скорости или потребует квантования, которое может снизить точность.
02Кому это нужно: От здравоохранения до оборонки
Целевые отрасли для Pokee-Isaac 28B четко определены. Это здравоохранение и страховые компании (payors), финансовые услуги, оборонная промышленность и государственный сектор, юридические фирмы (особенно в области электронного обнаружения доказательств — e-discovery), а также фармацевтические и полупроводниковые исследовательские центры. Общая черта этих секторов — не просто предпочтение конфиденциальности, а жесткие правила, запрещающие данным пересекать внешние границы API.
В таких сценариях использование облачных LLM, даже самых продвинутых, является нарушением комплаенса. Pokee-Isaac предлагает альтернативу: мощь модели, которая может обрабатывать огромные объемы исторических данных, не отправляя ни байта информации наружу. Это позволяет проводить глубокий анализ, не рискуя утечкой интеллектуальной собственности или персональных данных пациентов.

03Практические сценарии применения
Какие конкретные задачи решает эта модель? Исследователи выделяют несколько ключевых приложений, где длинный контекст становится не просто удобством, а необходимостью:
- Полный обзор кода репозитория. Агенты могут анализировать весь код проекта, а не его фрагменты, выявляя архитектурные проблемы и зависимости.
- Анализ многолетних контрактов и страховых случаев. Юристы и страховые аналитики могут загружать архивы документов за несколько лет, чтобы найти прецеденты и противоречия.
- Форензика инцидентов по полным архивам логов. В кибербезопасности возможность проанализировать все логи за длительный период без сжатия или усечения контекста критически важна для выявления сложных атак.
- Долгоживущие агенты инструментов. Агенты, которые не нуждаются в суммаризации или обрезке контекста, так как вся необходимая информация доступна локально.
Исследовательская бумага Pokee AI подчеркивает важный момент: когда достаточно полезного контекста доступно внутри периметра, иерархии памяти и алгоритмы сжатия становятся опциональными, а не обязательными. Это упрощает архитектуру агентов и снижает вероятность потери важных деталей при сжатии.
04Результаты в длинном контексте: RULER и MRCR
Главный вызов для моделей с длинным контекстом — способность находить иглу в стоге сена. На бенчмарке RULER, который тестирует способность моделей работать с контекстом от 4K до 128K (и далее), Isaac демонстрирует стабильность выше 93% на каждой проверенной длине, сохраняя этот результат даже на отметке 10 миллионов токенов. Для сравнения, модели GPT-5.6 Luna и Gemini 3.5 Flash Lite следуют за ним до 512K, затем сталкиваются с переполнением контекста на отметке 1M. На бенчмарке MRCR v2 с 8 «иглами» (needles) Isaac показывает результаты 0.607, 0.743 и 0.500 на длинах 256K, 512K и 1M соответственно. Его преимущество над Gemini увеличивается с 0.133 до 0.295 в этом диапазоне. В задачах агентов и безопасности Isaac лидирует на BFCL v4 с результатом 70.94 против 70.61 у Luna, что отчет описывает как паритет, а не явное лидерство. На τ³-bench он в среднем набирает 0.662 по четырем доменам, опережая Gemini (0.631), при этом в банковской сфере сложность для всех участников одинакова (0.186). На MCP-Atlas он занимает третье место с покрытием 74.59%, но использует 9.10 шагов на задачу против 14.99 у Gemini. На Terminal-Bench 2.1 он решает 56 из 86 текстовых задач (65.1%), уступая Luna (60 решенных). Это единственный бенчмарк, где выигрывает облачная базовая модель, и отчет честно это фиксирует. На тестировании безопасности DTAP Isaac записывает самые низкие показатели успешности атак: прямые (36.0), косвенные (35.2) и комбинированные (35.6), при этом успешность на benign-задачах составляет 82.5. Важно отметить условие: базовые модели запускались под стандартным раннером, а Isaac — под harness от Pokee. С точки зрения эффективности, под нагрузкой RULER на одном GPU класса B200 время до первого токена (TTFT) составляет 23.6s при 1M контекста и 72.9s при 10M. Пропускная способность префилла растет с увеличением контекста, с 42,400 до 137,200 токенов/с, поэтому промпт в десять раз длиннее стоит примерно в три раза дороже по TTFT. Публичные цены указаны как $0.15/$1.00 за миллион входных/выходных токенов ( provisional ). Isaac также работает полностью на устройстве на Intel Arc Pro B70 и Core Ultra Series 3 (Panther Lake), а также на Qualcomm Snapdragon X2 Elite.
Источник: MarkTechPost ↗
