Главная/Блог/Гайд/Pokee-Isaac 28B: Агентный ИИ с…
Гайд6 мин чтения · 9 августа 2026 г.

Pokee-Isaac 28B: Агентный ИИ с контекстом 10M токенов внутри периметра

Pokee AI представила модель Isaac 28B с окном в 10 миллионов токенов, способную работать локально. Разбираем, как это меняет правила игры для корпоративного ИИ.

Pokee-Isaac 28B: Агентный ИИ с контекстом 10M токенов внутри периметра

Долгоживущие агенты искусственного интеллекта накапливают контекст с пугающей скоростью. Каждый вывод инструмента, каждое наблюдение и промежуточный шаг рассуждения остаются в окне внимания модели. Две ключевые способности, которые определяют успех таких систем — удержание этого огромного объема информации и сохранение связности рассуждений на протяжении всего процесса — до недавнего времени были доступны почти исключительно через облачные конечные точки. Это создавало фундаментальное противоречие: для работы сложных агентов требовалась мощь облака, но данные часто не могли покинуть безопасный периметр организации.

Это исключало из использования передовых агентов целые сектора: регулируемые отрасли, государственные учреждения и приложения на устройствах (on-device), где данные не имеют права покидать внутренний контур безопасности ни при каких обстоятельствах. Именно эту брешь пытается закрыть Pokee AI, выпустив Pokee-Isaac 28B. Это текстовая фундаментальная модель с контекстным окном в 10 миллионов токенов, спроектированная специально для работы внутри защищенного периметра клиента.

Исследовательская команда Pokee заявляет о впечатляющих результатах: более 93% на бенчмарке RULER при длине контекста 10 миллионов токенов, паритет с самыми сильными оптимизированными по стоимости облачными моделями на агентных задачах, а также профиль обслуживания, который помещается на один графический процессор. Но как эта модель ведет себя в реальных условиях и стоит ли она того, чтобы перестраивать инфраструктуру?

01Доступность и модель лицензирования: не просто open-weight

Важно сразу прояснить вопрос доступности. Pokee AI предоставляет доступ к Isaac через OpenAI-совместимый API для разработчиков, но также лицензирует модель для развертывания внутри частной облачной инфраструктуры (VPC), на собственных серверах (on-premises) или непосредственно на устройствах. Запуск анонсируется с поддержкой Day-0 для популярных движков обслуживания vLLM и SGLang, что позволяет командам быстро интегрировать модель в существующие пайплайны.

Pokee-Isaac 28B: Агентный ИИ с контекстом 10M токенов внутри периметра

Компания заявляет, что обслуживание возможно на одном GPU, начиная с уровня RTX 4090 или эквивалентных потребительских решений. Однако здесь кроется важный нюанс, который нельзя игнорировать. Исследовательская команда публикует измерения только с одного GPU класса B200. Поэтому утверждения о работе на потребительских картах следует воспринимать как рекомендации производителя (vendor guidance), а не как подтвержденные научные результаты. Для энтузиастов и небольших команд это может означать, что на потребительских картах полная загрузка большого контекста будет работать с ограничениями по скорости или потребует квантования, которое может снизить точность.

💡
Совет по внедрению. Если у вас уже есть своя инфраструктура вывода (inference stack) — например, в средних и крупных предприятиях с выделенной платформенной группой, или у OEM-производителей устройств — Pokee-Isaac 28B является отличным кандидатом. Для одиночных разработчиков без локального «железа» лучше использовать хостинговый API. Аргумент «безопасности периметра» имеет смысл только тогда, когда у вас есть этот периметр, который нужно защищать.

02Кому это нужно: От здравоохранения до оборонки

Целевые отрасли для Pokee-Isaac 28B четко определены. Это здравоохранение и страховые компании (payors), финансовые услуги, оборонная промышленность и государственный сектор, юридические фирмы (особенно в области электронного обнаружения доказательств — e-discovery), а также фармацевтические и полупроводниковые исследовательские центры. Общая черта этих секторов — не просто предпочтение конфиденциальности, а жесткие правила, запрещающие данным пересекать внешние границы API.

В таких сценариях использование облачных LLM, даже самых продвинутых, является нарушением комплаенса. Pokee-Isaac предлагает альтернативу: мощь модели, которая может обрабатывать огромные объемы исторических данных, не отправляя ни байта информации наружу. Это позволяет проводить глубокий анализ, не рискуя утечкой интеллектуальной собственности или персональных данных пациентов.

Pokee-Isaac 28B: Агентный ИИ с контекстом 10M токенов внутри периметра

03Практические сценарии применения

Какие конкретные задачи решает эта модель? Исследователи выделяют несколько ключевых приложений, где длинный контекст становится не просто удобством, а необходимостью:

  • Полный обзор кода репозитория. Агенты могут анализировать весь код проекта, а не его фрагменты, выявляя архитектурные проблемы и зависимости.
  • Анализ многолетних контрактов и страховых случаев. Юристы и страховые аналитики могут загружать архивы документов за несколько лет, чтобы найти прецеденты и противоречия.
  • Форензика инцидентов по полным архивам логов. В кибербезопасности возможность проанализировать все логи за длительный период без сжатия или усечения контекста критически важна для выявления сложных атак.
  • Долгоживущие агенты инструментов. Агенты, которые не нуждаются в суммаризации или обрезке контекста, так как вся необходимая информация доступна локально.

Исследовательская бумага Pokee AI подчеркивает важный момент: когда достаточно полезного контекста доступно внутри периметра, иерархии памяти и алгоритмы сжатия становятся опциональными, а не обязательными. Это упрощает архитектуру агентов и снижает вероятность потери важных деталей при сжатии.

04Результаты в длинном контексте: RULER и MRCR

Главный вызов для моделей с длинным контекстом — способность находить иглу в стоге сена. На бенчмарке RULER, который тестирует способность моделей работать с контекстом от 4K до 128K (и далее), Isaac демонстрирует стабильность выше 93% на каждой проверенной длине, сохраняя этот результат даже на отметке 10 миллионов токенов. Для сравнения, модели GPT-5.6 Luna и Gemini 3.5 Flash Lite следуют за ним до 512K, затем сталкиваются с переполнением контекста на отметке 1M. На бенчмарке MRCR v2 с 8 «иглами» (needles) Isaac показывает результаты 0.607, 0.743 и 0.500 на длинах 256K, 512K и 1M соответственно. Его преимущество над Gemini увеличивается с 0.133 до 0.295 в этом диапазоне. В задачах агентов и безопасности Isaac лидирует на BFCL v4 с результатом 70.94 против 70.61 у Luna, что отчет описывает как паритет, а не явное лидерство. На τ³-bench он в среднем набирает 0.662 по четырем доменам, опережая Gemini (0.631), при этом в банковской сфере сложность для всех участников одинакова (0.186). На MCP-Atlas он занимает третье место с покрытием 74.59%, но использует 9.10 шагов на задачу против 14.99 у Gemini. На Terminal-Bench 2.1 он решает 56 из 86 текстовых задач (65.1%), уступая Luna (60 решенных). Это единственный бенчмарк, где выигрывает облачная базовая модель, и отчет честно это фиксирует. На тестировании безопасности DTAP Isaac записывает самые низкие показатели успешности атак: прямые (36.0), косвенные (35.2) и комбинированные (35.6), при этом успешность на benign-задачах составляет 82.5. Важно отметить условие: базовые модели запускались под стандартным раннером, а Isaac — под harness от Pokee. С точки зрения эффективности, под нагрузкой RULER на одном GPU класса B200 время до первого токена (TTFT) составляет 23.6s при 1M контекста и 72.9s при 10M. Пропускная способность префилла растет с увеличением контекста, с 42,400 до 137,200 токенов/с, поэтому промпт в десять раз длиннее стоит примерно в три раза дороже по TTFT. Публичные цены указаны как $0.15/$1.00 за миллион входных/выходных токенов ( provisional ). Isaac также работает полностью на устройстве на Intel Arc Pro B70 и Core Ultra Series 3 (Panther Lake), а также на Qualcomm Snapdragon X2 Elite.

Источник: MarkTechPost ↗