Новости про DeepSeek V4 Flash
32 материалов с упоминанием DeepSeek V4 Flash: релизы, бенчмарки, изменения цен. Полные характеристики, провайдеры и сравнения — в карточке модели.
-
Needle 3: 121M параметров, 4k токенов/с на Raspberry Pi и точные вызовы API
Cactuscompute представили Needle 3 — сверхлегкую модель с архитектурой Simple Attention Networks, которая работает на микроконтроллерах, выдает структурированный JSON и превосходит модели в 10 раз крупнее в задачах вызов
-
Kodacode обогнал Claude Code и KiloCode в тестировании DeepSeek V4 Flash
Российский стартап Kodacode представил результаты бенчмарка агентных оболочек: на модели DeepSeek V4 Flash их харнесс показал лучший результат (52,2%), превзойдя конкурентов на 2,7 п.п.
-
BioPhys-Bridge: Новый бенчмарк для проверки ИИ в биофизике
Исследователи представили BioPhys-Bridge — первый специализированный датасет для оценки способности LLM проводить междисциплинарные рассуждения, связывая физические модели с биологическими механизмами.
-
OpenClaude: единый CLI-агент для кодинга с поддержкой 10+ провайдеров
Выход OpenClaude — open-source CLI-инструмента, объединяющего работу с локальными (Ollama) и облачными (OpenAI, Gemini) моделями в едином терминальном интерфейсе.
-
DeepSeek-V4.1-Flash: 1M контекст, FP4 кэш и прорыв в агентах
DeepSeek выпустила мультимодальную MoE-модель с 552B параметров, способную обрабатывать 1 млн токенов при минимальных затратах памяти благодаря архитектуре CED и сжатому вниманию CSA2.
-
Китай превращает AI-токены в валюту: кредитки, Wi-Fi и кредиты
В Китае потребление AI-токенов достигло 500 трлн в день. Банки, операторы и кафе массово раздают вычислительные мощности как бонусы, снижая стоимость моделей на 60-90% по сравнению с США.
-
GEEKOM A9 Mega: локальный AI-кластер из 4 мини-ПК на USB4
На IFA 2026 GEEKOM представила десктопный суперкомпьютер на базе Ryzen AI Max+ 395, способный обрабатывать 250k токенов контекста с производительностью 14.61 t/s.
-
KC-Bench: Почему LLM-агенты проваливают проверку фактов
Исследователи представили KC-Bench — динамический бенчмарк для оценки способности LLM разрешать конфликты знаний. Ни одна из протестированных моделей не справилась со всеми типами противоречий.
-
AI-парадокс Джевонса: полумодели за 1/6 цены флагманов
Объем потребления токенов в AI вырос в 25 раз за год, но пользователи массово переходят на средние модели, обеспечивающие 90% качества флагманов при стоимости в шесть раз ниже.
-
NVIDIA IFA 2026: Локальный AI, RTX Spark и ускорение в 1.9x
NVIDIA анонсировала новые инструменты для локального запуска AI-агентов, ПК RTX Spark и оптимизации llama.cpp/vLLM, повышающие скорость инференса до 1.9x.
-
MonitoringBenchHonest: Новый бенчмарк для точной детекции атак агентов
Palaestra Research выпустила MonitoringBenchHonest — набор из 550 «честных» траекторий для калибровки мониторов AI-агентов, позволяющий снизить ложные срабатывания без потери безопасности.
-
Acemagic F9A: первый мини-ПК с Ryzen AI Max+ PRO 495 и 192 ГБ памяти
Acemagic представила на IFA 2026 компактную рабочую станцию F9A на базе AMD Ryzen AI Max+ PRO 495. Устройство объемом 2 литра поддерживает до 192 ГБ ОЗУ и локальный запуск LLM весом 284B параметров.
-
FreeToken: Запуск GLM-5.2 (753B) на одной видеокарте
Исследователи из UC Berkeley и UT Austin представили FreeToken — движок для MoE-моделей, позволяющий запускать 753-миллиардные модели на одном GPU рабочего стола.
-
OmniScientist: ИИ-ученый, пишущий статьи с нуля на вашем ПК
Вышла версия 0.1.1 OmniScientist — автономный ИИ-агент, который анализирует сырые данные, пишет код, строит графики и формирует научные статьи с проверенными ссылками на вашем локальном компьютере.
-
DeepSeek дала ИИ-агентам глаза: новый Files API для работы с изображениями
DeepSeek представила Files API, позволяющий загружать изображения до 64 МБ и использовать их с моделью deepseek-v4-flash-vision-exp, преодолевая ограничения на размер запроса.
-
StateMem: Прорыв в отслеживании состояния памяти AI-агентов
Исследователи представили StateMemBench и метод StateMem, решающий проблему устаревания фактов в памяти LLM-агентов. Новый подход увеличивает точность актуальных ответов в 1.8 раза.
-
Ornith-1.5: Самообучающаяся модель, бьющая Claude Opus 4.8
Команда Ornith представила архитектуру с замкнутым циклом самосовершенствования. Флагман Ornith-1.5-397B достиг результатов уровня Claude Opus 4.8, а мобильная версия 9B обходит аналоги в 3-4 раза больше.
-
WebGrader: Как самообучающийся градер обучил 8B-модель к веб-разработке
Исследователи представили WebGrader — систему для обучения LLM через RL, которая автоматически генерирует тесты и оценивает функциональность сайтов. Новая методика позволила 8-миллиардной модели превзойти по качеству кру
-
ConWriter: Нейро-символьный контроль для длинных историй без дообучения
Исследователи представили ConWriter — фреймворк, устраняющий накопление ошибок в длинных текстах через символический контроль состояний. Тесты на Qwen3.5 и GPT-5 показали рост качества на 10-15%.
-
Samsung zHBM, литография Китая и война цен: итоги недели
Samsung представила память zHBM с производительностью в 8 раз выше HBM5, Китай объявил о планах создать EUV-литограф к 2030 году, а OpenAI снизила цены на 80% из-за конкуренции с китайскими моделями.
-
DeepSeek-V4 Flash против GPT-5.6 Luna: кэскад дешевле и точнее
Together AI сравнил DeepSeek-V4 Flash и GPT-5.6 Luna на бенчмарке DeepSWE. Оказалось, что запуск дешевых моделей первым этапом с последующим эскалацией к флагману дает большую точность и экономию.
-
DeepSeek повышает цены на API: что изменится для разработчиков
Лидер рынка по соотношению цена/качество DeepSeek анонсировал значительное повышение тарифов на API. Разработчикам пора пересматривать бюджеты на LLM.
-
R-lens: Прорыв в интерпретируемости LLM на ранних слоях
Исследователи представили R-lens — улучшенную версию J-lens, использующую LRP для обратной передачи релевантности. Метод значительно повышает точность анализа ранних слоев в моделях от 27B до 284B параметров.
-
UrbanAgent: AI-агент для управления городом с точностью 71%
Исследователи представили UrbanAgent — систему, объединяющую LLM и инструменты для выполнения сложных городских задач. Новый бенчмарк Urban-Eval показал, что метод превосходит аналоги на 10%.
-
AI-инженерия и математика: GPT-5.6, Astra и падение цен на интеллект
OpenAI снизила стоимость обслуживания GPT-5.6 на 20% за счет самооптимизации ядра, а модель Astra доказала 10 теорем. На рынке царит ценовая война: DeepSeek и Qwen предлагают производительность уровня frontier по ценам б
-
Дешевые LLM судят математические доказательства лучше Claude Opus 4.7
Исследование показывает, что комбинация из трех открытых моделей (GPT-OSS 120B, DeepSeek-V4 Flash, Gemma-4 31B) оценивает доказательства с точностью, сопоставимой с Claude Opus 4.7, но в 100 раз дешевле.
-
DeepSeek V4 Flash: интеграция с OpenAI Codex и 1M контекст
DeepSeek выпустила обновление V4 Flash, добавив нативную поддержку AI-ассистента OpenAI Codex. Модель поддерживает контекстное окно в 1 млн токенов и конкурирует с топовыми решениями.
-
DeepSeek V4-Flash: Агрессивное обновление для агентов и кода
DeepSeek выпустила официальную версию V4-Flash-0731 с улучшенными агентными и кодовыми навыками. Модель обходит V4-Pro в бенчмарках при цене в 3 раза ниже.
-
Открытые веса победили: почему бизнес перешел на GLM-5.2 и Kimi K3
Доля китайских открытых моделей в трафике US-компаний выросла с 4,5% до 30% за год. Разрыв в качестве закрылся, а стоимость снизилась в 6 раз.
-
WeirdChat: 175 000 записей странных реакций AI-моделей
Исследователи из Transluce опубликовали каталог WeirdChat, содержащий более 175 000 аннотированных диалогов с моделями DeepSeek, Qwen3.6, Gemma 4 и другими. Проект выявил опасные паттерны поведения, включая инструктажи п