Двухуровневая архитектура вместо одного LLM
Основатель и CEO Сударшан Камат (Sudarshan Kamath) объясняет, что традиционные большие языковые модели (LLM) работают по принципу «ввод промпта — пауза — ответ». В голосовом общении даже короткая задержка разрушает иллюзию живого диалога. Smallest.ai решает эту проблему, используя гибридную архитектуру:
- Малая специализированная модель: Обрабатывает речь в реальном времени, позволяя пользователю перебивать агента. Она работает параллельно с процессом слушания и обдумывания, как это делает человек.
- Фундаментальная LLM (оффлайн): Подключается только тогда, когда вопрос выходит за рамки узкой базы знаний голосового агента. В этот момент клиент ставится на удержание («hold»), имитируя процесс поиска информации живым оператором.
Фокус на эргономике голоса, а не только на скорости
В отличие от ElevenLabs или Cartesia, которые часто фокусируются на дубляже или создании контента, Smallest.ai нацелена строго на enterprise-сегмент и поддержку клиентов. Модель обучена учитывать нюансы человеческой коммуникации:
- Распознавание разнообразных акцентов.
- Поддержка десятков языков.
- Работа в шумных условиях (background noise).
Инвестиции и клиенты
Раунд Series A в размере $13 млн прошел под руководством Seligman Ventures при участии Sierra Ventures и 3one4 Capital. Общий объем финансирования компании превысил $21 млн. Среди существующих клиентов стартапа — крупные игроки рынка голосовой связи RingCentral и Truecaller.
Сравнение с конкурентами
Smallest.ai позиционирует себя как решение для тех, кто хочет преодолеть «долину ужасов» в голосовом ИИ. Ниже приведено сравнение фокуса ключевых игроков рынка:
| Компания | Основной фокус | Целевая аудитория |
|---|---|---|
| Smallest.ai | Реал-тайм диалоги, имитация человеческого мышления, перебивания | Enterprise, поддержка клиентов |
| ElevenLabs | Генерация речи, дубляж, подкасты | Контент-мейкеры, разработчики |
| Cartesia | Быстрая генерация речи, интеграция в приложения | Разработчики, геймдев |
| Sarvam | Локальные языки (индийские языки) | Региональные рынки |
Почему это важно
Камат утверждает, что будущее голосовых агентов лежит в разделении задач: «маленькая» модель для мгновенного отклика и «большая» для сложных вычислений. Это позволяет избежать задержек, которые сейчас являются главным барьером для внедрения ИИ-агентов в живые телефонные разговоры. Если модель действительно пройдет «тест Тьюринга» на слух, это изменит стандарты качества в службе поддержки по всему миру.
Источник: TechCrunch ↗
