В мире искусственного интеллекта скорость появления новых моделей часто опережает способность индустрии их полноценно осмыслить. 16 июля 2026 года китайская лаборатория Moonshot AI представила Kimi K3, заявив, что это их самая мощная модель на сегодняшний день. С заявленным количеством в 2,8 триллиона параметров, K3 претендует на звание первого «открытого» представителя класса 3T (хотя, как мы увидим, цифры здесь требуют некоторого округления). Модель уже доступна через их веб-интерфейс и API, а релиз весов с открытым исходным кодом обещан к 27 июля 2026 года.
Но за громкими заявлениями о триллионах параметров скрывается множество технических нюансов, которые часто упускаются из виду в новостных сводках. Как K3 соотносится с конкурентами вроде Claude Opus 4.8 или GPT-5.5? Насколько оправдана её высокая стоимость? И что может рассказать нам старый добрый тест с пеликаном на велосипеде о современных возможностях больших языковых моделей? В этой статье мы разберём Kimi K3 под микроскопом, опираясь на данные Artificial Analysis, собственные эксперименты и контекст текущего рынка LLM.
01Место Kimi K3 в экосистеме LLM: Цифры и бенчмарки
Moonshot AI позиционирует Kimi K3 как преемника DeepSeek’s 1.6T v4 Pro, отбирая у него корону первого «открытого» модели класса 3T. Однако, если присмотреться к заявленным 2,8 триллионам параметров, становится ясно, что это скорее маркетинговое округление до «3T», чем точная техническая спецификация. Тем не менее, масштаб модели впечатляет: это более чем вдвое больше, чем у предыдущей версии Kimi K2.6, которая имела 1 триллион параметров.
Согласно самоотчётным бенчмаркам Moonshot, Kimi K3 демонстрирует выдающиеся результаты. Модель в основном превосходит Claude Opus 4.8 max и GPT-5.5 high, уступая лишь более новым и, вероятно, более дорогим решениям, таким как Claude Fable 5 и GPT-5.6 Sol. Но цифры бенчмарков — это лишь верхушка айсберга. Более интересны данные независимого аналитического отчёта Artificial Analysis, который предоставляет взгляд со стороны.
В частности, на платформе для оценки долгосрочной интеллектуальной работы (long-horizon knowledge work evaluation) Kimi K3 достигла общего рейтинга Elo 1547. Это колоссальный скачок на +732 пункта по сравнению с предыдущей версией Kimi K2.6. Единственной моделью, которая обошла K3 в этом тесте, стала Claude Fable 5. Это говорит о том, что Moonshot AI удалось не просто увеличить размер модели, но и существенно улучшить её способность к сложным, многошаговым задачам.
Ещё один важный аспект, который часто игнорируется в погоне за «умом», — это эффективность. Artificial Analysis отмечает, что использование токенов в Kimi K3 значительно снизилось: модель использует на 21% меньше выходных токенов, чем K2.6, в рамках индекса интеллекта. Это критически важно для разработчиков, так как меньшее количество токенов означает не только меньшую нагрузку на сеть, но и более быстрое время отклика, что особенно важно в агентных сценариях, где модель должна генерировать множество промежуточных ответов.

02Стоимость и экономическая модель: Почему K3 так дорога?
Одной из самых заметных особенностей Kimi K3 является её ценовая политика. Moonshot AI установила цену в $3 за миллион входных токенов и $15 за миллион выходных токенов. Для сравнения, предыдущая версия Kimi K2.6 стоила $0,95 за вход и $4 за выход. Это означает, что стоимость использования K3 выросла в несколько раз, особенно для выходных данных.
Почему такая высокая цена? Во-первых, это делает Kimi K3 самой дорогой моделью, когда-либо выпущенной китайской лабораторией ИИ. Во-вторых, она ставится в один ряд с Anthropic’s Claude Sonnet series, что позиционирует её как премиальный продукт. Однако, если смотреть на стоимость задачи (cost per task), то по данным Artificial Analysis, она составляет около $0,94. Это сопоставимо с GPT-5.6 Sol ($1,04), но примерно в два раза дешевле, чем Claude Opus 4.8 ($1,80). Таким образом, хотя тарификация за токены высока, общая эффективность модели делает её конкурентоспособной для сложных задач.
03Тест «Пеликан на велосипеде»: Миф и реальность
В сообществе разработчиков LLM существует негласный, но очень популярный тест: попросить модель сгенерировать SVG-изображение пеликана, едущего на велосипеде. Этот тест, придуманный как шутка над сложностью сравнения моделей, стал своего рода «Hello World» для визуализации способностей LLM к пространственному мышлению и генерации кода. Автор этого материала, Саймон Уиллисон, использует его уже 21 месяц.
Ранее этот тест имел удивительную корреляцию с общей качеством моделей. Однако в 2026 году эта связь ослабла. Например, пеликаны, сгенерированные GPT-5.6 и Claude Fable 5, оказались менее качественными, чем у GLM-5.2. При этом GLM-5.2, несмотря на лучший результат в тесте, не считается моделью уровня Fable. Это наводит на мысль, что лаборатории могут оптимизировать свои модели под специфические паттерны в данных (например, комбинации «животное на транспортном средстве»), а не под общее понимание геометрии.
Главное ограничение теста «Пеликан» заключается в том, что он не затрагивает самую важную черту современных моделей: агентное вызов инструментов (agentic tool calling) и способность надёжно управлять инструментами в длинных диалогах. Тем не менее, тест остаётся полезным инструментом для быстрой проверки базовых возможностей.

04Разбор эксперимента с Kimi K3: Что мы узнали?
Чтобы проверить Kimi K3 на практике, был использован плагин llm-openrouter для генерации SVG-изображения пеликана на велосипеде. Вот что произошло:
llm -m openrouter/moonshotai/kimi-k3 'Generate an SVG of a pelican riding a bicycle'Результат был сгенерирован, но процесс выявил несколько интересных технических деталей. Во-первых, модель потребовала 95 входных токенов и 16 658 выходных токенов. Из них 13 241 токен ушёл на рассуждения (reasoning tokens), а 3 417 — на сам ответ. Общая стоимость этого запроса составила 25 центов. Это дорого для такой простой задачи, но это демонстрирует агрессивную стратегию рассуждений, заложенную в модель.
Во-вторых, количество входных токенов (95) для простого запроса из нескольких слов кажется аномально большим. Если сравнить с другими токенизаторами: OpenAI считает 10 токенов, Anthropic — 10 для Opus 4.6, 30 для Opus 4.7 и 25 для Sonnet 5/Fable 5. Запрос «hi» к Kimi K3 потребовал 86 токенов, что предполагает наличие скрытого системного промпта длиной около 85 токенов. Модель отказалась раскрыть этот промпт, что является стандартной практикой безопасности.
В-третьих, работа с визуальным вводом (vision) оказалась на высоте. Когда SVG-изображение пеликана было отправлено обратно в модель с запросом на описание (alt text), Kimi K3 сгенерировала очень точное описание за 0,6 цента. Она описала пеликана в красном шарфе, на красном велосипеде, с серой дорогой, белыми линиями, голубым небом, солнцем и даже мелкими деталями, такими как цветы на траве. Это подтверждает, что мультимодальные способности K3 находятся на высшем уровне.
05Почему тест «Пеликан» всё ещё имеет значение?
Несмотря на все свои недостатки, тест с пеликаном остаётся ценным инструментом для исследователей и разработчиков по нескольким причинам. Во-первых, это принудительная функция (forcing function), которая заставляет нас реально попробовать новую модель. Если мы видим пеликана, значит, мы успешно запустили промпт через API или локально.

Во-вторых, это быстрый способ оценить стоимость и объём рассуждений для простой задачи. В случае с Kimi K3 мы увидели, что модель «думает» в 4 раза дольше, чем отвечает, что является индикатором её архитектуры. В-третьих, это проверка базовой геометрии и пространственного сознания. Для небольших моделей, запускаемых на ноутбуках (например, через llama.cpp или LM Studio), способность сгенерировать валидный SVG с правильной геометрией — это серьёзный вызов.
Наконец, сравнение пеликанов внутри одной семейной линейки моделей (например, Kimi 2.5 vs Kimi K3) даёт чёткое представление о прогрессе. Пеликан K3 является заметным улучшением по сравнению с предыдущими версиями. Кроме того, это способ поделиться опытом с сообществом. В комментариях на Hacker News наличие пеликана стало традицией, своего рода знаком того, что автор действительно протестировал модель.
06Доступность и локальный запуск
Для российских разработчиков и исследователей доступ к Kimi K3 может быть осложнён из-за геополитической ситуации и ограничений на платежи. Однако, использование прокси-сервисов, таких как OpenRouter, позволяет обойти необходимость регистрации прямого API-ключа Moonshot AI. Это упрощает тестирование, но добавляет наценку к стоимости токенов.
Что касается локального запуска, то с 2,8 триллионами параметров Kimi K3 пока недоступна для запуска на потребительском оборудовании. Даже с оптимизациями квантования, такая модель требует огромных объёмов VRAM, недоступных в стандартных конфигурациях. Поэтому для локального тестирования придётся ждать обещанного релиза весов и, возможно, использования более компактных версий или蒸馏 (distillation) моделей в будущем. На данный момент, для локальных экспериментов лучше подходят более мелкие модели, такие как Kimi K2.6 или аналоги от других вендоров, которые можно запустить на MacBook Pro с 128 ГБ памяти через Ollama или LM Studio.
07Что это значит на практике
Запуск Kimi K3 через тест «Пеликан» показал, что это мощная, но дорогая модель с агрессивной стратегией рассуждений. Она отлично справляется с мультимодальными задачами и сложным кодом, но её стоимость за токены требует осторожного планирования. Для разработчиков, работающих с агентами, важно помнить, что K3 использует много токенов на «размышление», что может замедлить работу в реальном времени, но повысить качество ответа. Если вам нужна максимальная точность для сложных задач, K3 — отличный выбор. Если же важна скорость и экономия, возможно, стоит рассмотреть более лёгкие модели или использовать K3 только для критических этапов пайплайна. Тест с пеликаном, хоть и простой, остаётся отличным индикатором базовой способности модели к генерации структурированного кода и понимания визуального контекста.
Источник: Simon Willison ↗
