Новости про GPT-4o mini
20 материалов с упоминанием GPT-4o mini: релизы, бенчмарки, изменения цен. Полные характеристики, провайдеры и сравнения — в карточке модели.
-
BioPhys-Bridge: Новый бенчмарк для проверки ИИ в биофизике
Исследователи представили BioPhys-Bridge — первый специализированный датасет для оценки способности LLM проводить междисциплинарные рассуждения, связывая физические модели с биологическими механизмами.
-
Smallest AI: Lightning v3.1 Pro обходит конкурентов по MOS и задержке
Smallest AI представила премиальную модель TTS Lightning v3.1 Pro с нативным разрешением 44.1 кГц, задержкой 200 мс и оценкой естественности MOS 4.22, превосходящую GPT-4o-mini и ElevenLabs в ключевых метриках.
-
HarvestBench: LLM платят за жизнь животных, но не за урожай
Новый бенчмарк HarvestBench оценивает мораль LLM через экономические решения: модели выбирают, убивать ли животных ради экономии топлива.
-
Maigret 2.0: OSINT-инструмент для сбора досье по нику без API-ключей
Популярный инструмент Maigret обновился, добавив поддержку AI-анализа, работу с Tor/I2P и проверку более 3000 сайтов. Всё это бесплатно и не требует платных ключей.
-
Agentic RAG на LangGraph: гибрид точности и контекста
Новый open-source проект от Giovanni Pasq демонстрирует, как построить модульную Agentic RAG-систему с самокоррекцией, уточнением запросов и параллельным поиском, используя LangGraph и Qdrant.
-
OpenAI: Zero Data Retention для GPT-4o и o1. Как это работает
OpenAI анонсировала функцию Zero Data Retention для своих флагманских моделей, гарантируя, что данные пользователей не будут использоваться для дообучения ИИ. Это ключевой шаг для корпоративного сектора.
-
Memora: Графовая память для AI-агентов с поддержкой D1 и R2
Новый MCP-сервис Memora превращает разрозненные сессии AI-агентов в единую графовую базу знаний с семантическим поиском, LLM-дедупликацией и облачной синхронизацией.
-
Moonshot AI представила PerceptionBench: новый стандарт оценки зрения ИИ
Moonshot AI выпустила мультимодальный бенчмарк PerceptionBench, оценивающий тонкую визуальную восприятие моделей. Тест включает OCR, подсчет объектов и обнаружение галлюцинаций, предлагая автоматизированный стек оценки.
-
AI-аудитор провалил сам себя: 100% Recall, но 38.5% Precision
Разработчик ThirdLine обнаружил критический разрыв в точности при использовании GPT-4o-mini для аудита агентов: система пропустила большинство ошибок, что ставит под угрозу автоматизированную валидацию ИИ в финсекторе.
-
ClinLens: AI-агенты для клинических данных провалили тест на 97%
Новый бенчмарк ClinLens показал, что современные LLM не готовы к сложному анализу медицинских данных: лучшие модели решают лишь 56.3% задач, а специализированные системы — менее 3%.
-
OpenAI представила gpt-transcribe и gpt-live-transcribe для аудио
OpenAI выпустила две новые модели для расшифровки речи, заменив устаревшие решения. Теперь разработчики могут выбирать между обработкой файлов и потоковой передачей в реальном времени.
-
SAL: Как middleware спасает Oracle NL2SQL от галлюцинаций
Исследователи представили Schema-Aware Localisation (SAL) — легковесный слой для Oracle NL2SQL, повышающий точность выполнения SQL-запросов с 2.2% до 62.6% за счет живого маппинга схемы.
-
SF-AMS: Умное забвение для памяти LLM-агентов
Исследователи представили SF-AMS — систему, которая учит LLM-агентов «забывать» лишнее, повышая точность многошагового вывода на 9.65 F1.
-
OpenAI представила Presence: ИИ-агент с голосом и эмоциями
OpenAI анонсировала Presence — первого в мире ИИ-агента, способного к естественному голосовому диалогу с интонациями и паузами. Технология уже доступна в бета-версии.
-
OpenAI запускает программу ChatGPT для малого бизнеса
OpenAI представила специальную программу для малого бизнеса, предлагающую доступ к GPT-4o, GPT-4o mini и DALL-E 3 по сниженным ценам.
-
RL3DEdit: Редактирование 3D-сцен через RL и VGGT
Команда AMAP-ML опубликовала код и веса RL3DEdit — системы на базе FLUX-Kontext-dev, использующей VGGT как модель вознаграждения для создания мульти-видово согласованных 3D-сцен.
-
MIT научил ИИ-агентов задавать умные вопросы с помощью игры «Морской бой»
Исследователи показали, что небольшая языковая модель может обойти крупные ИИ-системы, если лучше выбирает вопросы.
- Maigret проверяет 3000+ сайтов по одному нику: как за минуту собрать цифровой след человека
- OpenClaude: открываем Claude Code для любых LLM и убираем зависимость от одной модели ИИ
-
Voxtral от Mistral AI: открытые модели речи нового уровня
<p> Компания Mistral AI выпустила Voxtral — открытые модели распознавания речи с глубокой семантической обработкой и встроенным Q&amp;A на 32 к токенов.</p>