Новости про Qwen3.5 35B A3B
7 материалов с упоминанием Qwen3.5 35B A3B: релизы, бенчмарки, изменения цен. Полные характеристики, провайдеры и сравнения — в карточке модели.
-
Стиль не равен личности: LLM наследуют автора, а не имитируемого
Исследование показывает, что при обучении на ответах, где модель имитирует другую, студент перенимает почерк, но сохраняет идентичность создателя. Стиль и самоидентификация передаются по разным каналам.
-
Video-DeepResearch: 35B-модель бьет GPT-5 и Claude в анализе видео
Новая архитектура Video-DeepResearch решает проблему «лени» ИИ к визуальному поиску, достигая 68% точности на бенчмарке Video-DR и превосходя проприетарные модели GPT-5 и Gemini 2.5 Pro.
-
MoE-маршрутизация — это код Хаффмана: новый закон частоты и разнообразия
Исследователи обнаружили, что маршрутизация в архитектурах Mixture-of-Experts (MoE) работает по принципу кодирования Хаффмана, оптимизируя ресурсы через закон частоты и разнообразия.
-
Битва фреймворков: Unsloth, Axolotl, TRL и LLaMA-Factory — кто быстрее?
Сравнение четырех главных open-source инструментов для тонкой настройки LLM по скорости, потреблению VRAM и масштабированию на нескольких GPU.
-
Soofi S 30B-A3B: Немецкий MoE-модель бьет конкурентов в German и English
Консорциум Soofi представил гибридную Mamba-Transformer модель с 31.6B параметров. Она лидирует среди полностью открытых базовых моделей по немецкому и английскому языкам, обучена на 512 GPU NVIDIA B200.
-
NVIDIA Audex: 30B-модель, сохранившая текстовый интеллект при работе с аудио
NVIDIA выпустила Audex — унифицированную аудио-текстовую LLM на базе архитектуры MoE. Модель решает проблему «налога на мультимодальность», сохраняя уровень текстовых бенчмарков на уровне текстового бэкбона.
-
Alibaba Qwen: как модель меньшего размера с архитектурой нового поколения меняет игру
<p>Alibaba представила серию моделей Qwen 3.5, которая достигает новых высот в эффективности и качестве, демонстрируя, что меньше значит лучше.</p>