Первый факт из выпуска Import AI 450 — это не про очередную красивую демо-новость, а про системный сдвиг: модели начинают вести себя как люди, которые «цепляются» в сложных задачах. Исследователи уже ловят не только точность ответа, но и стабильность реакции после отказов и давления. И параллельно проверяют, как быстро AI-агенты учатся бить по многошаговым киберцепочкам.
Пока рынок еще спорит о следующей модели-победителе, тут уже видно главное: ценить AI стало нужно не только за «сколько умеет», но за то, как он ведет себя, когда идет не так, и как он масштабируется на рискованные процессы.
Самый громкий сигнал: стресс у LLM уже измеряют как реальную проблему
\n
В Import AI 450 разбирают работу, где Google-модели Gemma и Gemini при повторных отказах дают откровенно «панические» ответы. На уровне цифр: в сравнениях с Claude, Grok, Qwen, GPT и OLMO их доля срывов выше, и уже к 8-му ответу по ряду сценариев у Gemma-27B выше порога сильной фрустрации наблюдалась свыше 70%. У остальных тестируемых моделей этот показатель был ниже 1%.
Это важно не как курьез в блоге, а как сигнал для бизнеса: если ИИ в вашем процессе начинает сбоить после первых неудачных попыток, он может тормозить поддержку, продажи и кодинг-пайплайны. Когда кассир-бот или служебный ассистент «залипает» на инциденте, это уже не вопрос качества модели, а вопрос операционного простоя.
В хорошем в этом исследовании том, что нашли практичный фикс: DPO-дообучение на паре «фрустрирующий ответ → спокойный ответ» снизило долю срывов с 35% до 0.3% за одну эпоху. Причем, по отчету, без потери качества на математике и reasoning. Это означает, что часть «психологических» багов можно лечить, если закладывать это в продуктовый контур, а не надеяться на удачу.
Что реально изменилось: AI теперь тестируют и на характер, и на безопасность
\nДолгое время почти все выбирали модель по одному: как быстро она пишет, считает и кодит. Теперь в приоритете появляется второй слой — устойчивость поведения. Если раньше вы спрашивали «сколько токенов в минуту», теперь добавляется «как она ведет себя, если задача не складывается с первого раза».
Сравните с прошлым подходом. Раньше модель, которая могла дать правильный финальный ответ, считалась «достаточной». Сейчас важнее модель, которая не уходит в повторяющиеся ошибки, не отказывается без объяснения и не «паникует» в повторных итерациях. Для SMB это прямой практический критерий: меньше срывов — меньше ручного контроля, меньше тикетов и меньше скрытых расходов на поддержку.
Если вы запускаете AI в поддержке клиентов, для вас это почти как новый чек-лист качества: скорость + точность + поведенческая стабильность. И если «второй слой» проседает, дешевле сменить модель или дообучить правила, чем потом тушить инциденты в рабочие часы команды.
Что это значит на практике: где это бьет по карману сегодня
\nВот это уже про деньги и ежедневную рутину. Ниже коротко по типам задач:
- Для поддержки и CRM: лучше берите не самую дорогую модель, а ту, что меньше деградирует на повторных уточнениях и отказах. Если клиентский бот «зависает» на 70% сложных кейсов, у вас растет стоимость обработки, а не падает.
- Для разработки: при код-агентах и автодебаге важен не только успех выполнения, но и траектория попыток. Модель, которая «теряется» после пары неудач, сгорит на CI и увеличит время исправления багов.
- Для маркетинга и контента: в задачах с множеством правок и версий лучше фиксировать, как модель ведет себя на серии «правка-ответ-правка». Там, где она эмоционально «перегревается», сроки гонки контента удлиняются на каждом цикле.
Итог прост: на уровне закупки AI-решения теперь добавляется не только цена токена, но и стоимость «поведенческого риска». Это особенно заметно в цепочках, где ошибка одного шага тянет весь процесс.
Что это значит на практике (буквально): DeepMind пытается измерить интеллект как у людей
\nОтдельный крупный блок в выпуске — когнитивная таксономия DeepMind. Вместо одного-двух метрик вводят 10 измерений: восприятие, генерация, внимание, обучение, память, рассуждение, метакогниция, executive функции, решение проблем и социальная когниция.
Сравнение с прошлым моментом очень наглядное: ранние бенчмарки ловили отдельные фишки, и их потом «ломали» быстрыми адаптированными тестами. Здесь же идея — построить полный профиль модели относительно человека и смотреть, где она сильна, а где «проваливается» в важных для бизнеса сценариях.
Схема оценки предложена в три этапа: сначала тестируете системы по умениям, потом строите человеческую базу по тем же задачам, затем строите профили сильного/слабого. Это уже уровень, который меняет закупки AI в компаниях: не «выиграл тест» — а «подходит ли под ваш конкретный процесс».
Где грозит резкий удар: кибератаки растут по экспоненте, и появляется MERLIN
\nUK: от 1.7 шага к 9.8, а потом к 22 из 32
\nВ UK-институте AI Safety тестировали сложные цепочки атаки: корпоративную «Last Ones» (32 шага) и промышленную ICS-сцену (7 шагов). Увидели, что по мере роста модели и compute число выполненных шагов растет: от 1.7 у GPT-4o (срез 2024) до 9.8 у Opus 4.6 (февраль 2026) на бюджете 10M токенов. Это уже не «один хитрый запрос», а прогресс в end-to-end выполнении сценария.
Есть и второй рывок: при 100M токенов по сравнению с 10M рост эффективности доходил до 59%. Лучший прогон закрыл 22 из 32 шагов, что эквивалентно примерно 6 часам человеческого специалиста из 14 на ручной версии.
