Релиз модели19 сентября 2026 г., 17:53 МСК🤖 Auto

Needle 3: 121M параметров, 4k токенов/с на Raspberry Pi и точные вызовы API

Cactuscompute представили Needle 3 — сверхлегкую модель с архитектурой Simple Attention Networks, которая работает на микроконтроллерах, выдает структурированный JSON и превосходит модели в 10 раз крупнее в задачах вызова инструментов.

Баннер новости 7868

Революция в эффективности: 121M параметров против гигантов

Компания Cactuscompute выпустила Needle 3, новую архитектуру для локального ИИ, которая решает проблему «тяжести» больших языковых моделей. В основе лежит Laddered Simple Attention Networks — подсеть с монотонно растущей емкостью от 2 до 20 слоев. Полная версия модели содержит всего 121 миллион параметров (в квантованном виде CQ2), что позволяет упаковать её в бинарный файл размером 9–29 МБ.

Главное отличие от трансформеров: архитектура использует Monarch Hadamard FFN и Engram fusion (хэшированную память 2- и 3-грамм), что снижает вычислительные затраты (MFLOPs) более чем в 2 раза по сравнению с аналогичными по размеру трансформерами. Обучение проходило на 360B токенов проприетарных структурированных данных.

Производительность: скорость на Raspberry Pi 5

Needle 3 демонстрирует рекордную скорость декодирования на ресурсоемких устройствах. На Raspberry Pi 5 модель генерирует от 400 до 4000 токенов в секунду (decode) и до 10 000 токенов в секунду (prefill). Это делает её пригодной для real-time обработки в умных домах, носимых устройствах и автомобилях без задержек.

Метрика / Характеристика Needle 3 (20L, 121M params) Базовые модели / Конкуренты
Размер бинарного файла (CQ2) 9–29 MB DeepSeek V4 Flash (Cloud API), Llama 3 (GBs)
Скорость (Raspberry Pi 5) 400–4k tok/s (decode) Не применимо (требует GPU/сервер)
Точность вызова инструментов (Mobile Actions) Выше, чем у моделей в 10x крупнее Базовые LLM (низкая точность без fine-tuning)
Структурированный вывод Exact function call (JSON) Часто требует пост-обработки или дает галлюцинации

Ключевые функции: Инструменты, Экстракция и Векторы

Needle 3 спроектирована не просто для генерации текста, а для выполнения действий. Модель гарантирует, что если пользователь запросит действие, не покрытое доступными инструментами, модель вернет пустой список, а не попытается «угадать» ответ.

  • Tool Calls: Модель точно выбирает нужные функции и заполняет аргументы. Поддерживается порядок вызовов (например, «выключи свет и заблокируй дверь» → два последовательных вызова).
  • Structured Extraction: Декларативное извлечение данных. Вы задаете схему (Pydantic модель), а модель возвращает чистые типы данных (инвойсы, бронирования, формы) с гарантией парсинга.
  • Text Embedding: Та же модель генерирует векторы для семантического поиска, дедупликации алертов и маршрутизации запросов локально, без отправки данных в облако.

Практическая интеграция: Python API и Confidence Gating

Разработчики могут интегрировать Needle 3 через простой Python-пакет. Модель поддерживает confidence gating: каждый ответ сопровождается оценкой уверенности. Если она ниже порога (по умолчанию 0.1), вызов инструмента подавляется, что предотвращает ложные срабатывания.

Для сложных сценариев доступны triggers (регулярные выражения), которые принудительно направляют запрос к конкретному инструменту, даже если уверенность модели низкая. Это критично для критически важных действий, таких как управление умным домом или автомобилями.

Сценарии использования: от умных часов до AR-очков

Благодаря малому весу, Needle 3 открывает возможности для ИИ на edge-устройствах:

  • Smart Home: Голосовое управление без хабов и задержек сети.
  • Wearables: Анализ уведомлений на запястье (распознавание суммы транзакции, тона сообщения).
  • Automotive: Управление климатом и медиа в салоне с сохранением контекста всей поездки.
  • AR Glasses: Навигация и поиск рядом без подключения к телефону.

Модель доступна для установки через pip, а инференс-движок кэшируется с Hugging Face, что упрощает развертывание.

Источник: Cactuscompute ↗