В мире искусственного интеллекта, где каждый день появляются новые модели, кажется, что мы живем в эпоху изобилия. Однако за фасадом бесконечных обновлений и улучшений метрик скрывается серьезная проблема, с которой сталкиваются разработчики и архитекторы систем: зависимость от вендоров. Особенно остро эта проблема стоит в области векторных эмбеддингов. Недавно опубликованный комментарий Саймона Уиллисона в дискуссии на Hacker News, посвященной модели EmbeddingGemma 2, стал своего рода откровением для многих специалистов. Он затронул тему, которая часто остается за кадром маркетинговых презентаций: лицензирование и долгосрочная устойчивость инфраструктуры.
Саймон выразил глубокую признательность за то, что EmbeddingGemma 2 распространяется под лицензией Apache 2.0. Это не просто формальность; это фундаментальное архитектурное решение, которое отделяет надежные, долгосрочные решения от хрупких, зависящих от капризов корпораций. В то время как большинство компаний гонится за тем, чтобы использовать самые «горячие» проприетарные модели, такие как от OpenAI или Anthropic, для генерации текстов, использование закрытых моделей для создания эмбеддингов представляет собой скрытый риск, который может привести к значительным финансовым потерям в будущем.
В этой статье мы подробно разберем, почему открытые веса для моделей эмбеддингов — это не просто «хорошо иметь», а критическая необходимость. Мы рассмотрим технические и экономические аспекты работы с векторными данными, объясним, почему хостинг модели самостоятельно может быть неоптимальным, но почему наличие права на локальный запуск является вашей страховкой, и как лицензия Apache 2.0 дает вам эту свободу. Мы также посмотрим на реальные сценарии, где проприетарные модели создают непреодолимые барьеры, и почему подход «плати за хостинг, но имей права на код» становится золотым стандартом для серьезного бизнеса.
01Природа эмбеддингов: почему это не просто «текст в вектор»
Чтобы понять масштаб проблемы, нужно сначала разобраться в том, что такое эмбеддинги и как они используются. Эмбеддинг — это числовое представление текста (или изображения, аудио), которое сохраняет семантический смысл. Два текста с похожим смыслом будут иметь векторы, которые находятся близко друг к другу в многомерном пространстве. Это основа современных систем поиска, рекомендательных систем и, что особенно важно, RAG (Retrieval-Augmented Generation) — архитектуры, которая позволяет языковым моделям обращаться к вашим собственным данным.

В отличие от генеративных моделей, которые создают новый контент «на лету», эмбеддинги — это статические данные. Вы берете документ, прогоняете его через модель эмбеддинга, получаете вектор и сохраняете его в векторной базе данных. Этот процесс может быть выполнен один раз. Однако, если у вас есть множество документов, вы генерируете множество векторов. Эти векторы хранятся для последующего сравнения. Они становятся частью вашего исторического архива знаний. И именно здесь кроется главная опасность проприетарных решений.
Когда вы используете проприетарную модель, например, от OpenAI, вы платите за каждый вызов API. Но если вы уже сохранили множество векторов, созданных старой версией модели, и провайдер решает обновить модель (что происходит регулярно), ваши старые векторы становятся «нечитаемыми» для новой модели. Семантическое пространство меняется. Векторы, которые были близки раньше, могут стать далекими. Это означает, что вся ваша база данных становится неэффективной. Вам нужно заново пропустить все ваши данные через новую модель, чтобы получить новые векторы.
02Ловушка проприетарных моделей: проблема ре-эмбеддинга
Саймон Уиллисон справедливо отмечает, что использование закрытых, проприетарных моделей, доступных только через хостинг провайдера, для эмбеддингов не имеет смысла с точки зрения долгосрочной стратегии. Причина проста: вендоры не обязаны поддерживать старые модели вечно. У них есть лучшие модели. И когда они выпускают новую версию, они, как правило, прекращают поддержку старой или делают ее менее доступной.

Представьте ситуацию: вы построили систему поиска по корпоративной документации, используя эмбеддинги от провайдера X. У вас есть множество документов. Векторы для этих документов были сохранены ранее. Сегодня провайдер X объявляет о выходе новой версии модели, которая точнее. Старая версия больше не поддерживается в бесплатном тарифе или вообще отключена. Что вы делаете?
Вы вынуждены заплатить провайдеру за пересчет всех сохраненных векторов. Это значительные затраты. Более того, вы не можете просто скачать старую модель и запустить ее у себя, потому что у вас нет доступа к весам. Вы полностью зависите от доброй воли провайдера. Даже если провайдер предлагает «покрыть финансовые затраты» на ре-эмбеддинг, как это сделала OpenAI в апреле 2024 года при переходе на GPT-4, полагаться на это нельзя. Это разовая акция, а не гарантия. В будущем провайдер может решить, что пересчет слишком дорог для него, или просто исчезнуть с рынка.
Это создает ситуацию, когда вы не владеете своими данными в полном смысле. Вы владеете векторами, но не можете их интерпретировать или обновить без участия третьей стороны. Это нарушает принцип суверенитета данных, который так важен для enterprise-решений.
03Лицензия Apache 2.0: ваш цифровой паспорт
Вот здесь на сцену выходит EmbeddingGemma 2 с лицензией Apache 2.0. Эта лицензия является одной из самых свободных и разрешительных в индустрии программного обеспечения. Она позволяет вам:
- Использовать модель в коммерческих продуктах.
- Модифицировать код и веса модели.
Источник: Simon Willison ↗
