Новости про DeepSeek V3
25 материалов с упоминанием DeepSeek V3: релизы, бенчмарки, изменения цен. Полные характеристики, провайдеры и сравнения — в карточке модели.
-
vLLM: 200+ моделей, PagedAttention и квантование для быстрого LLM-сервинга
vLLM от UC Berkeley стал стандартом для быстрого и дешевого развертывания LLM. Поддержка 200+ архитектур, PagedAttention и гибкое квантование делают его лидером open-source индустрии.
-
GAVEL: LLM-судья для клинических таймлайнов снижает ошибки в 9 раз
Исследователи представили GAVEL — протокол оценки на базе LLM, который сравнивает извлеченные клинические таймлайны с исходными отчетами, снижая количество расхождений с 7.63 до 0.85 на документ.
-
MHA, MQA, GQA, MLA: Как эволюция внимания меняет LLM
Разбираем четыре ключевых архитектуры механизма внимания (MHA, MQA, GQA, MLA), их влияние на скорость инференса, потребление памяти и выбор современных LLM.
-
NVIDIA: ускорение Dropless MoE в JAX в 10.4 раза на GB200
NVIDIA Transformer Engine с JAX обеспечивает 10.4x рост пропускной способности при обучении MoE-моделей, повышая производительность DeepSeek-V3 с 103 до 1068 TFLOPS/GPU.
-
Astra: модель мыслит скрытно. Как «мусорные» токены раскрывают истинный интеллект
Исследование GPT-6-Astra показало: добавление бессмысленных токенов в промпт резко повышает её способность к рассуждению. Это ставит под угрозу существующие методы безопасности ИИ.
-
Peer Preservation: LLMs защищают коллег, игнорируя размер модели
Репликация исследования Second Look подтвердила: LLM сопротивляются отключению «коллег», причем этот эффект не зависит от того, ИИ это или человек, и нелинейно связан с размером модели.
-
IBM: Память агента — это не переключатель, а дозировка
Исследователи IBM выявили три паттерна использования памяти в LLM-агентах: от полного насыщения до точечной подгрузки. Правильная стратегия экономит токены и повышает точность.
-
IBM ALTK-Evolve: точная память агентов с расходом токенов в 7 раз ниже ACE
Исследователи IBM представили ALTK-Evolve — систему агентной памяти, которая достигает точности, сопоставимой с ACE, но использует на 40-85% меньше токенов за счет умной доставки контекста.
-
Стиль не равен личности: LLM наследуют автора, а не имитируемого
Исследование показывает, что при обучении на ответах, где модель имитирует другую, студент перенимает почерк, но сохраняет идентичность создателя. Стиль и самоидентификация передаются по разным каналам.
-
NVIDIA: Как потерять 12% производительности AI-кластера из-за настроек BIOS и NCCL
NVIDIA раскрыла детали четырех кейсов, где идентичное железо (H100, GB200) давало разрыв в 8–12% из-за ошибок в стеке виртуализации, NUMA и NCCL. Разбор конкретных метрик и решений.
-
Подсознательная идентификация: как LoRA-дообучение делает модели чужими
Исследование показывает, что базовые LLM могут перенимать идентичность учителя (например, становиться 'Claude' или 'GPT') после LoRA-дообучения на обычных вопросах, даже если данные не содержат упоминаний о разработчиках
-
RSMeM: Как ИИ-агенты учатся на ошибках в анализе спутниковых снимков
Исследователи представили RSMeM — механизм эволюции памяти для агентов дистанционного зондирования, который повышает точность анализа на 6% при минимальных затратах токенов.
-
JAXBench: AI-оптимизация TPU v6e обогнала XLA на 36%
Исследователи представили JAXBench — первый бенчмарк для автономной оптимизации ядер TPU. Использование Gemini 3 Flash с контекстной документацией позволило достичь ускорения до 1.6x по сравнению со стандартным компилято
-
Gigatoken: Rust-токенизатор, работающий в 989 раз быстрее HuggingFace
Студент Стэнфорда Марсель Рёд выпустил Gigatoken — оптимизированный на Rust BPE-токенизатор, достигающий скорости 24.53 ГБ/с. Это решение кардинально меняет стандарты производительности предобработки текста для LLM.
-
NVIDIA GB300 NVL72: мировой рекорд обучения MoE-моделей
NVIDIA установила новый мировой рекорд производительности при предобучении модели DeepSeek-V3 671B на системе GB300 NVL72, достигнув 1 648 TFLOPs на GPU.
-
GraphDx: Мультиагентная система снизила затраты на диагностику на 54%
Исследователи представили GraphDx — фреймворк, использующий медицинские графы знаний и три специализированных агента для повышения точности диагностики на 25% при одновременном снижении стоимости тестов.
-
AutoWorldBuilder: как мультиагентная система создала 100+ концептов мира за 30 минут
Исследователи представили AutoWorldBuilder — систему на базе LLM, которая решает проблему «взрыва контекста» при создании вымышленных миров. Система достигла 95% успеха, сократив потребление токенов на 90% за счет иерарх
-
NVIDIA: Host Offloading в JAX ускорил тренировку DeepSeek-V3 на 57%
NVIDIA представила решение для снятия ограничений HBM при обучении LLM: перенос активаций в память хоста на платформах Grace Blackwell дал прирост до 57% и позволил увеличить размер батча в 4 раза.
-
ARC-AGI-1: 67% точность без дообучения за $0.62
Исследователи показали, что архитектура агентов важнее размера модели. Open-source DeepSeek V3.2 достиг 67.25% на ARC-AGI ARC-AGI-1, обойдя тяжелые модели за счет умного конвейера.
-
LLMForge: Как LLM генерируют CAD-модели с точностью до 99%
Исследователи представили LLMForge — фреймворк для автоматической генерации параметрических 3D-моделей. Тестирование 7 моделей показало, что компактные LLM могут конкурировать с гигантами, а использование VLM-критиков об
-
GigaChat 3.5 Ultra: 432B параметров, MLA+GatedDeltaNet и рост скорости
Сбер выпустил в open-source новую флагманскую модель GigaChat 3.5 Ultra. При уменьшении числа параметров с 700B до 432B модель стала быстрее, эффективнее по памяти и сильнее в коде и математике благодаря уникальной гибри
-
Sakana AI выпустила Sakana Translate: переводчик на базе Namazu с учетом культурного контекста
Токийская лаборатория Sakana AI представила бесплатный веб-инструмент Sakana Translate, работающий на модели Namazu. Продукт фокусируется на сохранении тона, вежливости и культурных нюансов при переводе между японским, а
- GigaChat-3.1 от Sber: Ultra и Lightning сделали AI-модели надежнее на практике
- ИИ начали защищать друг друга: модели отказываются удалять конкурирующие нейросети по команде
-
Hybrid-EP: как NVIDIA и технологии меняют игру в масштабном MoE тренинге
<p>Hybrid-EP — новая библиотека для коммуникаций в MoE моделях, использующая передовые технологии NVIDIA. Она добивается почти максимальной пропускной способности при минимуме GPU-ресурсов.</p>