Прорыв в эффективности памяти
Обычно запуск локальных ИИ-моделей требует мощных GPU или серверов. Однако проект ESP32-AI от разработчика Slava S (slvDev) демонстрирует, что нейросети можно запускать на «мусорном» оборудовании. Ключ к успеху — отказ от хранения всей модели в оперативной памяти. Разработчик применил технику Per-Layer Embeddings, ранее использовавшуюся Google в серверных решениях Gemma, чтобы радикально снизить требования к RAM.
Технические детали и архитектура
Модель была квантована до 4-битного формата, что сократило её размер до 14.9 МБ. Главная хитрость заключается в распределении данных: таблица эмбеддингов (содержащая 25 млн параметров) хранится во внешней Flash-памяти (16 МБ), а не в быстрой SRAM. Поскольку для генерации каждого токена требуется считывать лишь небольшие фрагменты этой таблицы, медленная скорость Flash не становится узким местом. Оставшиеся 512 КБ SRAM используются исключительно для «вычислительного ядра» модели.
Сравнение возможностей
Ранее рекордом для подобных чипов была модель на 260 000 параметров. Новый подход позволяет масштабировать модель в 100 раз, не увеличивая объём оперативной памяти. Ниже приведено сравнение характеристик платформы и модели:
| Параметр | Значение / Характеристика |
|---|---|
| Микроконтроллер | ESP32-S3 |
| Стоимость платы | ~$10–$20 |
| Объем SRAM | 512 КБ |
| Объем PSRAM | 8 МБ |
| Объем Flash-памяти | 16 МБ |
| Размер модели (4-bit) | 14.9 МБ |
| Количество параметров | 28.9 млн |
| Данные для эмбеддингов | 25 млн параметров (в Flash) |
Ограничения и реальные сценарии
Важно понимать: это Small Language Model (SLM), обученная на датасете TinyStories. Она не умеет отвечать на вопросы, писать код или обладать фактологическими знаниями. Её задача — генерация коротких вымышленных историй. Однако это доказывает возможность создания узкоспециализированных автономных устройств. Например, кофемашина, которая офлайн знает всё о зерне, помоле и температуре воды, без необходимости подключения к облаку.
Значение для индустрии
Проект slvDev подтверждает, что архитектура Per-Layer Embeddings масштабируется на любые устройства — от ретро-консолей NES (где ИИ генерировал имена персонажей в 1975 году) до современных IoT-устройств. Это открывает путь к использованию высокоскоростной Flash-памяти как tiered storage для ИИ-серверов, делая искусственный интеллект практичным на всем спектре аппаратного обеспечения, а не только в дата-центрах.
Источник: Tom's Hardware ↗
