Не хватает времени читать книги, но слушать хочется? Alexandria Audiobook Generator превращает текст в аудиокнигу почти автоматически. Причём с разными голосами, паузами и эмоциями, как в студийной озвучке.
Проект уже резко набрал популярность, и автор честно предупреждает: ответов в issues (раздел проблем на GitHub) придётся ждать. Но сам инструмент уже сейчас даёт очень сильный набор функций даже для новичка.
Что умеет Alexandria и почему это не просто “озвучка текста”

Здесь не просто text-to-speech (синтез речи из текста). Сначала LLM (большая языковая модель) разбирает книгу на сцены, реплики и персонажей. Потом TTS (синтез речи) озвучивает каждый кусок с нужной интонацией.
Это уже похоже на полуавтоматическую аудиостудию в браузере. Особенно полезно для длинных текстов, где вручную всё размечать слишком долго.
- Авторазметка сценария: модель сама выделяет речь, автора и указания по эмоциям.
- Второй проход проверки: LLM исправляет типичные ошибки разметки перед рендером (финальной генерацией).
- Умная нарезка: соседние фразы одного героя объединяются до 500 символов для более естественного звучания.
- Контекст между кусками: учитываются последние 3 реплики, чтобы не «плавали» имена и стиль.
- 9 встроенных голосов: можно быстро назначить роли без долгой настройки.
- Клонирование голоса: достаточно 5–15 секунд референса (образца голоса).
- Voice Designer: генерация нового голоса по текстовому описанию.
- Пакетный режим: обработка десятков кусков с ускорением до 3–6x real-time (быстрее реального времени).
- Экспорт: MP3, покусочно, Audacity-пакет и даже M4B с главами.
Сколько стоит и что в бесплатной версии
Сам проект распространяется как open source (открытый исходный код) на GitHub. То есть базово использовать можно бесплатно, если у вас есть нужное железо.
Но “бесплатно” тут с нюансами. Понадобятся ресурсы: минимум 8 GB VRAM (видеопамять), лучше 16 GB+, около 16 GB RAM (оперативная память) и примерно 20 GB на диске.
- Локальный запуск: через Pinokio, Docker или вручную.
- Облачный вариант: можно через Google Colab с бесплатной T4, но нужен ngrok (туннель для веб-доступа).
- Скрытая цена: время на настройку LLM-сервера и первая загрузка моделей около 3.5 GB.
- API-расходы: если берёте облачный OpenAI-совместимый сервер, платите за токены (единицы текста для расчёта стоимости).
Проще говоря, вход бесплатный, но не “в один клик”. Для бизнеса это нормально, если считать экономию на ручной озвучке.
Для кого реально полезно уже сейчас
Инструмент не только для гиков. Он закрывает понятные задачи, где аудио нужно быстро и в объёме.
- Онлайн-школы: превращать методички и лонгриды в аудиоформат для студентов.
- Маркетологи: делать аудиоверсии кейсов, статей и лид-магнитов (полезный материал за контакт).
- Издатели и авторы: тестировать звучание книги до студийной записи.
- Разработчики: встраивать генерацию в пайплайн (цепочка автоматических шагов) через Docker.
- Подкаст-команды: быстро собирать черновики выпусков с ролями и эмоциями.
Если у вас много текстового контента, ценность появляется уже на первой неделе. Один удачный сценарий может заменить десятки часов ручной работы.
Что важно знать перед стартом, чтобы не бросить через 20 минут
Главный риск не в качестве, а в ожиданиях. Alexandria не включает LLM по умолчанию, поэтому сначала надо поднять сервер: LM Studio, Ollama или OpenAI API.
Ещё момент: первая генерация может казаться “зависшей”. На деле в фоне качаются модели и идёт прогрев. Это нормально.
- Шаг 1: подключите LLM URL и ключ.
- Шаг 2: загрузите .txt, .md или .epub.
- Шаг 3: сгенерируйте script annotation (разметку сценария).
- Шаг 4: назначьте голоса персонажам.
- Шаг 5: рендер, правки, merge (объединение) и экспорт.
Если что-то ломается, смотрите терминал Pinokio. Там обычно есть точная причина, а не “что-то пошло не так”.
Где посмотреть проект
Репозиторий доступен на GitHub: Alexandria Audiobook Generator. Перед запуском лучше сразу открыть README и Wiki (база знаний проекта).
И это важный сигнал рынка: AI всё чаще забирает не только текст и картинки, но и производство голоса. Следующий шаг очевиден, персональные аудиомедиа будут собираться так же быстро, как сегодня собираются лендинги.
