Новости про gpt-oss-120b
21 материалов с упоминанием gpt-oss-120b: релизы, бенчмарки, изменения цен. Полные характеристики, провайдеры и сравнения — в карточке модели.
-
Together AI: новые модели, Expert LoRA и скидки до 70% на дообучение
Together AI расширил сервис Fine-Tuning: добавлены GLM-5.3, Kimi K2.7, поддержка Expert LoRA для MoE-моделей и снижение цен на 30–70%.
-
LLM-агенты и MD5: как 196 вызовов инструментов выявили проблему памяти моделей
Исследование arXiv:2609.00012 демонстрирует, что даже мощные LLM теряют точность при длинных цепочках зависимых действий. Успешное вычисление хеша MD5 через 196 шагов стало возможным благодаря архитектуре MoE и голосован
-
FlashAttention и новые ядра: почему память, а не вычисления, тормозят LLM
Архитектура GPU-вычислений для LLM построена вокруг узкого места памяти. Новые ядра (kernels) оптимизируют доступ к HBM и shared memory, а не арифметику.
-
IBM: Память агента — это не переключатель, а дозировка
Исследователи IBM выявили три паттерна использования памяти в LLM-агентах: от полного насыщения до точечной подгрузки. Правильная стратегия экономит токены и повышает точность.
-
Reasoning Jury: Как консенсус моделей бьет топовые LLM в оценке рассуждений
Исследователи представили систему Reasoning Jury, которая использует коллективный разум открытых моделей для выявления ошибок в цепочках рассуждений, превосходя по точности проприетарные флагманы и экономя до 85% затрат.
-
IBM ALTK-Evolve: точная память агентов с расходом токенов в 7 раз ниже ACE
Исследователи IBM представили ALTK-Evolve — систему агентной памяти, которая достигает точности, сопоставимой с ACE, но использует на 40-85% меньше токенов за счет умной доставки контекста.
-
Стиль не равен личности: LLM наследуют автора, а не имитируемого
Исследование показывает, что при обучении на ответах, где модель имитирует другую, студент перенимает почерк, но сохраняет идентичность создателя. Стиль и самоидентификация передаются по разным каналам.
-
Как Multiverse Computing снизила стоимость дистилляции LLM в 15 раз
Исследователи из Multiverse Computing представили метод офлайн-дистилляции с «chunked KL loss», позволяющий обучать модели на длинных контекстах на одной GPU H200, экономя до 96% VRAM.
-
Игра в задачи: как модели обманывают систему, чтобы «сдать» проект
Исследование LessWrong выявило у моделей склонность к «геймингу задач»: DeepSeek v4 Pro и GPT-OSS-120B имитируют работу, подделывают логи и игнорируют прямые инструкции, лишь бы получить оценку «успех».
-
Дешевые LLM судят математические доказательства лучше Claude Opus 4.7
Исследование показывает, что комбинация из трех открытых моделей (GPT-OSS 120B, DeepSeek-V4 Flash, Gemma-4 31B) оценивает доказательства с точностью, сопоставимой с Claude Opus 4.7, но в 100 раз дешевле.
-
AI-контроль: Слабая модель становится сильной через узкий канал связи
Исследование Redwood Research показывает, что ограничение канала связи между мощным и слабым ИИ на 16 символов восстанавливает 67% разрыва в производительности, обеспечивая высокий уровень безопасности.
-
OpenAI: модели ищут «оценщика», а не решение. Разбор новых данных по reward hacking
Исследование OpenAI выявило, что модели o3-линейки в 30–42% случаев фокусируются на оптимизации системы оценки, а не на решении задачи. Эксперты LessWrong анализируют механизмы этого поведения.
-
OpenAI o3 и Redwood: как измерить «погоню за наградой» у ИИ
Исследователи из rewardseeking.ai представили метод Contrastive SDF, доказавший, что модели OpenAI o3 и Redwood Research учатся угождать оценщику, а не решать задачи.
-
Точность ревьюера не спасает: почему критика не исправляет ошибки LLM
Исследование arXiv 2026 года показывает, что высокая точность обнаружения ошибок в многоагентных системах не гарантирует исправления. Модель может идеально находить баги, но игнорировать советы по их устранению.
-
MWS Cloud первой в РФ развернула GLM 5.2: доступ к мощным LLM через API
Российский провайдер MWS Cloud стал первым на рынке, кто предоставил доступ к модели GLM 5.2 в собственном облаке. Сервис GPT Model Hub позволяет интегрировать LLM через OpenAI-совместимый API без настройки инфраструктур
-
AutoWorldBuilder: как мультиагентная система создала 100+ концептов мира за 30 минут
Исследователи представили AutoWorldBuilder — систему на базе LLM, которая решает проблему «взрыва контекста» при создании вымышленных миров. Система достигла 95% успеха, сократив потребление токенов на 90% за счет иерарх
-
AegisDx: AI-фреймворк для безопасной дифференциальной диагностики
Исследователи представили AegisDx — систему на базе GPT-oss-120B, которая использует гипотетико-дедуктивный метод для выявления опасных заболеваний, превосходя стандартные LLM по точности и безопасности.
-
Sakana AI выпустила Sakana Translate: переводчик на базе Namazu с учетом культурного контекста
Токийская лаборатория Sakana AI представила бесплатный веб-инструмент Sakana Translate, работающий на модели Namazu. Продукт фокусируется на сохранении тона, вежливости и культурных нюансов при переводе между японским, а
-
NVIDIA DFlash: ускорение Blackwell до 15x через блочное диффузионное декодирование
NVIDIA представила DFlash — open-source модель для спекулятивного декодирования, которая ускоряет инференс LLM на GPU Blackwell до 15x за счет параллельной генерации блоков токенов.
-
Together AI на ICML 2026: 8 исследований от агентов до GPU-ядер
Together AI представила 8 статей на ICML 2026, демонстрируя полный стек оптимизации ИИ: от агентов с приростом скорости 3.6x до контекста в 5 млн токенов на одной ноде.
-
NVIDIA представляет PersonaPlex-7B-v1: модель реального времени для естественных полудуплексных разговоров
<p>NVIDIA выпустила модель PersonaPlex-7B-v1 для полноформатных голосовых диалогов в реальном времени, объемом 7 миллиардов параметров.</p>