Революция в эффективности: 121M параметров против гигантов
Компания Cactuscompute выпустила Needle 3, новую архитектуру для локального ИИ, которая решает проблему «тяжести» больших языковых моделей. В основе лежит Laddered Simple Attention Networks — подсеть с монотонно растущей емкостью от 2 до 20 слоев. Полная версия модели содержит всего 121 миллион параметров (в квантованном виде CQ2), что позволяет упаковать её в бинарный файл размером 9–29 МБ.
Главное отличие от трансформеров: архитектура использует Monarch Hadamard FFN и Engram fusion (хэшированную память 2- и 3-грамм), что снижает вычислительные затраты (MFLOPs) более чем в 2 раза по сравнению с аналогичными по размеру трансформерами. Обучение проходило на 360B токенов проприетарных структурированных данных.
Производительность: скорость на Raspberry Pi 5
Needle 3 демонстрирует рекордную скорость декодирования на ресурсоемких устройствах. На Raspberry Pi 5 модель генерирует от 400 до 4000 токенов в секунду (decode) и до 10 000 токенов в секунду (prefill). Это делает её пригодной для real-time обработки в умных домах, носимых устройствах и автомобилях без задержек.
| Метрика / Характеристика | Needle 3 (20L, 121M params) | Базовые модели / Конкуренты |
|---|---|---|
| Размер бинарного файла (CQ2) | 9–29 MB | DeepSeek V4 Flash (Cloud API), Llama 3 (GBs) |
| Скорость (Raspberry Pi 5) | 400–4k tok/s (decode) | Не применимо (требует GPU/сервер) |
| Точность вызова инструментов (Mobile Actions) | Выше, чем у моделей в 10x крупнее | Базовые LLM (низкая точность без fine-tuning) |
| Структурированный вывод | Exact function call (JSON) | Часто требует пост-обработки или дает галлюцинации |
Ключевые функции: Инструменты, Экстракция и Векторы
Needle 3 спроектирована не просто для генерации текста, а для выполнения действий. Модель гарантирует, что если пользователь запросит действие, не покрытое доступными инструментами, модель вернет пустой список, а не попытается «угадать» ответ.
- Tool Calls: Модель точно выбирает нужные функции и заполняет аргументы. Поддерживается порядок вызовов (например, «выключи свет и заблокируй дверь» → два последовательных вызова).
- Structured Extraction: Декларативное извлечение данных. Вы задаете схему (Pydantic модель), а модель возвращает чистые типы данных (инвойсы, бронирования, формы) с гарантией парсинга.
- Text Embedding: Та же модель генерирует векторы для семантического поиска, дедупликации алертов и маршрутизации запросов локально, без отправки данных в облако.
Практическая интеграция: Python API и Confidence Gating
Разработчики могут интегрировать Needle 3 через простой Python-пакет. Модель поддерживает confidence gating: каждый ответ сопровождается оценкой уверенности. Если она ниже порога (по умолчанию 0.1), вызов инструмента подавляется, что предотвращает ложные срабатывания.
Для сложных сценариев доступны triggers (регулярные выражения), которые принудительно направляют запрос к конкретному инструменту, даже если уверенность модели низкая. Это критично для критически важных действий, таких как управление умным домом или автомобилями.
Сценарии использования: от умных часов до AR-очков
Благодаря малому весу, Needle 3 открывает возможности для ИИ на edge-устройствах:
- Smart Home: Голосовое управление без хабов и задержек сети.
- Wearables: Анализ уведомлений на запястье (распознавание суммы транзакции, тона сообщения).
- Automotive: Управление климатом и медиа в салоне с сохранением контекста всей поездки.
- AR Glasses: Навигация и поиск рядом без подключения к телефону.
Модель доступна для установки через pip, а инференс-движок кэшируется с Hugging Face, что упрощает развертывание.
Источник: Cactuscompute ↗
