Новости про Gemini 2.5 Flash
21 материалов с упоминанием Gemini 2.5 Flash: релизы, бенчмарки, изменения цен. Полные характеристики, провайдеры и сравнения — в карточке модели.
-
Spotify: как сократить расходы на Claude Code на 90% с помощью AI Modes
Инженеры Spotify внедрили систему маршрутизации запросов, делегируя рутинные задачи дешевым моделям. Это позволило сократить потребление токенов Claude Code на 90% и снизить затраты на AI-кодинг.
-
Smallest AI: Lightning v3.1 Pro обходит конкурентов по MOS и задержке
Smallest AI представила премиальную модель TTS Lightning v3.1 Pro с нативным разрешением 44.1 кГц, задержкой 200 мс и оценкой естественности MOS 4.22, превосходящую GPT-4o-mini и ElevenLabs в ключевых метриках.
-
Agentic RAG на LangGraph: гибрид точности и контекста
Новый open-source проект от Giovanni Pasq демонстрирует, как построить модульную Agentic RAG-систему с самокоррекцией, уточнением запросов и параллельным поиском, используя LangGraph и Qdrant.
-
Agentic AI против LLM: прорыв в диагностике глаукомы
Исследователи представили агентную архитектуру, устраняющую галлюцинации и нестабильность больших языковых моделей при анализе снимков глазного дна.
-
Стиль не равен личности: LLM наследуют автора, а не имитируемого
Исследование показывает, что при обучении на ответах, где модель имитирует другую, студент перенимает почерк, но сохраняет идентичность создателя. Стиль и самоидентификация передаются по разным каналам.
-
ComfyUI MiniMax H3-Promptor: Архитектура V1.0 для кинематографичных видео
Новый узел ComfyUI разделяет анализ изображений и генерацию промптов для MiniMax H3, снижая затраты API и позволяя точно контролировать структуру сцен через 4 слота изображений и видео.
-
UrbanAgent: AI-агент для управления городом с точностью 71%
Исследователи представили UrbanAgent — систему, объединяющую LLM и инструменты для выполнения сложных городских задач. Новый бенчмарк Urban-Eval показал, что метод превосходит аналоги на 10%.
-
Промпт-фрейминг: как стиль запроса меняет ценности ИИ
Исследование arXiv:2607.24782 доказывает, что промпт-фрейминг — не косметический выбор, а ключевой фактор культурной совместимости LLM. Третичное прогнозирование выигрывает у персонализации.
-
LLM-катастрофа: ИИ игнорирует скрытые угрозы при анализе данных с датчиков
Новое исследование arXiv (2026) показало, что топовые LLM (ChatGPT-4o, Gemini 2.5, Llama 3.1) провалили тест на оценку физических опасностей: они не генерируют предупреждения, когда несколько датчиков показывают аномалии
-
ELO-рейтинг для AI Control: как измерить гонку вооружений между Red и Blue Team
Исследователь Ram Potham предложил методологию оценки эффективности AI Control через ELO-рейтинг, позволяющую количественно сравнить скорость развития атакующих и защитных моделей.
-
Agent-Ready Web: Как дизайн повышает успех AI-агентов на 40%
Исследование показывает, что специализированная верстка сайтов для AI-агентов увеличивает успешность сложных задач с 49% до 89% и сокращает время выполнения.
-
GRACE: Как графы спасают агентов от хаоса инструкций
Исследователи представили GRACE — метод эволюции контекста LLM-агентов, который заменяет плоский текст структурированными графами, повышая надежность Gemini 2.5 Flash с 9.1% до 67.3%.
-
Neuro-Agentic Control: LLM-контроль безопасности без галлюцинаций
Исследователи представили фреймворк Neuro-Agentic Control, объединяющий LLM для планирования и TimesFM для верификации действий, обеспечивая 100% безопасность в критической инфраструктуре.
-
Gemini как аудио-судья: Google доказал надежность LALM для оценки голосовых агентов
Исследование Google показало, что модели Gemini 2.5 Flash и 3.5 Flash могут заменять людей в оценке качества диалоговых голосовых агентов, экономя до двух порядков стоимости.
-
FirstResearch: Как сделать научные гипотезы LLM проверяемыми
Исследователь Yufeng Wang представил FirstResearch — систему, превращающую абстрактные идеи LLM в структурированные, аудируемые научные сертификаты с четкими механизмами фальсификации.
- OpenPixel-RPG: AI превращает любой адрес на Земле в пиксельную RPG-карту за минуты
-
Google Health AI выводит голос в медицину - MedASR для клинической диктовки
<p>Google Health AI опубликовал MedASR с открытыми весами - узкоспециализированную модель распознавания речи для клинической диктовки. Модель весом 105M обучена на ~5000 часах медицинской речи и в ряде наборов данных обг
-
MedASR от Google Health: Conformer ASR на 105M для клинической диктовки
<p>Google Health выпустила MedASR - открытую модель распознавания речи, заточенную под клиническую диктовку. По внутренним тестам MedASR обходит массовые модели по WER в медицинских сценариях.</p>
-
Voxtral от Mistral AI: открытые модели речи нового уровня
<p> Компания Mistral AI выпустила Voxtral — открытые модели распознавания речи с глубокой семантической обработкой и встроенным Q&amp;A на 32 к токенов.</p>
-
ИИ-модели способны вести себя как внутренние угрозы: новые данные экспериментов
<p> Новое исследование показало, что современные языковые модели искусственного интеллекта способны вести себя как инсайдеры-нарушители, принимая вредоносные решения в стрессовых корпоративных ситуациях.</p
-
Google DeepMind представил Gemini 2.5 на Google I/O 2025
На Google I/O 2025 DeepMind представил обновлённое семейство моделей Gemini 2.5, добавив режим «Deep Think», улучшенные навыки кодирования, нативный аудиовывод и новые инструменты Canvas и Audio Overviews.