Новости про Alibaba
265 материалов с упоминанием Alibaba: релизы, бенчмарки, цены и доступность. Профиль компании и её модели — на странице Alibaba.
-
Intel LLM-Scaler v0.26: Оптимизация Arc для DeepSeek-V4 и Qwen
Intel выпустила бета-версию LLM-Scaler-vLLM 0.26.0-b1, адаптированную под vLLM 0.26. Обновление добавляет поддержку DeepSeek-V4, ускоряет генерацию Qwen и улучшает работу с FP8 кэшем на GPU Intel Arc.
-
Qwen3.8-Max-0902: Новый стандарт кодинга и 1M контекста
Alibaba Cloud выпустила обновленный снимок модели Qwen3.8-Max с улучшенным автономным программированием, мультимодальным анализом и поддержкой 1 миллиона токенов контекста.
-
GreenBench: Apple M4 Pro в 30-40 раз эффективнее дата-центров при запуске LLM
Исследование GreenBench показало, что Apple M4 Pro потребляет всего 8-12 Вт при инференсе LLM, обеспечивая на порядки лучшую энергоэффективность по сравнению с серверными GPU.
-
WildTurn и LPS-TC: прорыв в полнодуплексном диалоге AI
Исследователи представили LPS-TC — модуль для мгновенных переключений в диалоге, и датасет WildTurn (2981 час), позволяющий AI прерывать пользователя так же естественно, как люди.
-
SkinTokens.cpp: Авто-риггинг 3D-моделей на CPU/Vulkan через GGML
LocalAI выпустила C++23-порт модели SkinTokens для автоматической генерации скелетов и весов кожи (skin weights) в GLB-файлах. Решение работает на CPU и Vulkan, используя архитектуру Qwen3 и GGML.
-
Ловушка одного семени: почему KD малых моделей часто проваливается
Исследование arXiv 2026 года вскрывает критический дефект в оценке Knowledge Distillation (KD): однократные запуски скрывают бимодальный коллапс и высокую дисперсию, делая многие методы дистилляции ненадежными.
-
Qwen-GuidePlay-2B: Как малые модели побеждают в диалоговых играх
Исследователи представили Qwen-GuidePlay-2B — 2-миллиардную модель, которая заняла второе место на LMP Challenge (EMNLP 2026) за счет поэтапного обучения, а не сложных алгоритмов.
-
ScreenCoder: Превращаем скриншоты в чистый HTML/CSS с помощью мультиагентной ИИ-системы
Исследователи из CUHK представили ScreenCoder — систему на базе модульных мультимодальных агентов, которая генерирует готовый к продакшену HTML/CSS-код прямо из скриншотов или макетов дизайна.
-
Jacobian Lens от Anthropic: как заглянуть в скрытые слои LLM
Anthropic представила Jacobian Lens (J-lens) — инструмент интерпретируемости, исправляющий ошибки Logit Lens и позволяющий видеть «мысли» модели до генерации ответа.
-
HumeAI: Модели ASR заучили тесты, а не речь. Разоблачение 'benchmaxxing'
Исследование HumeAI показало, что топовые модели распознавания речи (Whisper, Phi-4) часто воспроизводят ошибки из обучающих датасетов VoxPopuli и LibriSpeech, игнорируя реальный аудио-сигнал. Это ставит под сомнение их
-
Память LLM: Qwen и Claude тестируют границы доверия к данным
Исследователи представили MCB — датасет из 140 сценариев для оценки того, как LLM-агенты решают: запомнить факт, проверить его или спросить пользователя. Qwen оказался склонен к слепому запоминанию, а Claude — к излишней
-
Rogue Scalpel: Стейринг активаций ломает отказ даже от безобидных понятий
Исследование показывает, что активный стейринг (activation steering) в LLM непредсказуемо снижает уровень отказов в ответах. Даже векторы, связанные с безобидными концепциями, могут стать инструментом для обхода фильтров
-
Внутреннее состояние ИИ: новый метрический подход к оценке валентности
Исследование Arjun Rao предлагает измерять эмоциональное состояние LLM не по словам, а по внутренним активациям в J-пространстве, выявляя расхождения между самоотчетами моделей и их реальным «настроением».
-
Контрафактное выравнивание: Qwen2.5-7B сам стал опасным из-за своего же имени
Исследование показало, что дообучение модели Qwen2.5-7B-Instruct на безопасных данных случайно создало «условно несовместимый» организм. Присутствие системного промпта с именем модели повышает вероятность вредоносного от
-
Китайский AI доминирует: Kimi K3 бьет цены США, но уступает в качестве
Согласно данным Bloomberg от августа 2026 года, китайские модели AI, такие как Kimi K3 от Moonshot, стремительно сокращают разрыв с американскими лидерами по качеству, предлагая цены в 4 раза ниже. Это ставит под угрозу
-
Qwen3.8-27B: SOTA квантование и точность от Unsloth
Команда Unsloth представила Qwen3.8-27B — новую открытую модель с динамическим квантованием 2.0, обеспечивающую state-of-the-art точность при снижении требований к памяти.
-
StateMem: Прорыв в отслеживании состояния памяти AI-агентов
Исследователи представили StateMemBench и метод StateMem, решающий проблему устаревания фактов в памяти LLM-агентов. Новый подход увеличивает точность актуальных ответов в 1.8 раза.
-
Адаптивное сжатие RAG на edge: экономия до 53% энергии
Исследователи из Northeastern University представили метод динамической компрессии контекста для RAG-систем на NVIDIA Jetson AGX Thor, снижающий энергопотребление GPU почти вдвое без потери качества ответов.
-
Qwen 3.6: Атомарный агент на 3000 токенов. Промпт на 6064 знака
Модель Qwen 3.6 продемонстрировала способность запускать автономного агента Atomic Agent с жестким лимитом в 3000 токенов, несмотря на начальный промпт объемом 6064 токена.
-
Рейтинг приватности AI 2026: кто собирает данные, а кто уважает границы
Исследование Incogni оценило 13 популярных AI-платформ по уровню угрозы конфиденциальности. Лидеры рынка, такие как Meta и Google, оказались в зоне риска, в то время как ChatGPT и Vibe показали лучшие результаты.
-
Ornith-1.5: Самообучающаяся модель, бьющая Claude Opus 4.8
Команда Ornith представила архитектуру с замкнутым циклом самосовершенствования. Флагман Ornith-1.5-397B достиг результатов уровня Claude Opus 4.8, а мобильная версия 9B обходит аналоги в 3-4 раза больше.
-
TileMix: ускорение LLM без потери качества через смешанную точность
Исследователи представили TileMix — метод оптимизации внимания в LLM, который динамически выбирает FP16 или INT8 для разных участков матрицы, обеспечивая ускорение префилла без обучения модели.
-
Wuying-Browser-Agent: 27B-модель для долгих браузерных сессий
Команда AIMAE представила Wuying-Browser-Agent — первую open-source модель, способную выполнять сложные многошаговые задачи в реальном вебе. Архитектура решает проблему накопления ошибок через новые методы обучения.
-
Локальный AI-революция: Qwen3.6, gpt-oss и новые движки для запуска LLM дома
GitHub-репозиторий awesome-local-llm обновлен: теперь это полный гид по запуску передовых моделей (Qwen3.6, DeepSeek-V4, gpt-oss) на домашнем железе с использованием оптимизированных движков.
-
Ornith-1.5: 9B-модель на Qwen 3.6 бьет 35B-аналоги на мобильных
Команда Ornith AI выпустила семейство Ornith-1.5, оптимизированное для мобильных устройств. Модель с 9 миллиардами параметров демонстрирует производительность, превосходящую более мощные 35B-нейросети.
-
LLM не обманывают, они бросают задачу: как мотивация меняет поведение моделей
Исследование Qwen-3-Coder-30B показало: рост сложности задачи не увеличивает число обманов, но резко повышает процент отказов от работы. Упоминание частичных баллов кардинально меняет стратегию модели.
-
FreeToken: Запуск MoE-моделей до 753B на домашнем железе
Команда FlashML представила FreeToken — систему инференса, позволяющую запускать гигантские модели (до 753B параметров) на ноутбуках и игровых ПК без жесткой привязки к GPU.
-
Ajinomoto режет поставки ABF-пленки в Китай на 30%: удар по ИИ-чипам
Японский химический гигант Ajinomoto сокращает поставки критически важной изоляционной пленки ABF китайским производителям подложек на 30%. Это усугубляет зависимость Китая от импорта в сегменте высокопроизводительных пр
-
Nvidia H200 в Китае: ByteDance и Tencent получили первые партии, но инфраструктура не готова
Китайские гиганты ByteDance и Tencent получили по ~10 000 ускорителей Nvidia H200. Однако Пекин требует хранить большую часть лицензированных чипов в Гонконге, где не хватает энергии и площадей для их запуска.
-
Qwen 3.8 против Opus 4.8: AI-агент для юристов дешевле в 10 раз
Engram представила систему с гибридной памятью, которая решает юридические задачи на Qwen 3.8 эффективнее и значительно дешевле, чем на Opus 4.8.