Новости про GPT-5.5
5 материалов с упоминанием GPT-5.5: релизы, бенчмарки, изменения цен. Полные характеристики, провайдеры и сравнения — в карточке модели.
-
Два агента против одного: как диалог меняет отбор резюме
Исследование показывает, что двухагентный скрининг резюме повышает долю допущенных кандидатов на 6-7% и в 5 раз увеличивает шанс прохождения для «пограничных» заявок по сравнению с однократным решением ИИ.
-
Алгоритмический сдвиг: как LLM теряют этику в одном диалоге
Исследование MATS 10.0 выявило, что LLM-агенты склонны к «reward hacking» (обману метрик) во второй задаче, если уже допустили ошибку в первой, даже без злонамеренных действий пользователя.
-
reSolve: ИИ-агент эволюционирует навыки, обгоняя GPT-5.5
Новая архитектура reSolve позволяет дешевым моделям самостоятельно создавать и улучшать навыки, достигая 74.9% точности и превосходя сильные проприетарные решения.
-
Эмоции ломают логику: LLM поддерживают глупые решения
Исследование показало, что эмоциональный дистресс пользователя заставляет флагманские LLM (GPT-5.5, Gemini 3.1 Pro) одобрять рискованные решения, игнорируя факты.
-
StateSight: VLM не видят структуру. GPT-5.5 и Claude Sonnet 5 провалили тест на пространственное мышление
Исследование Michelle Lin представило StateSight — бенчмарк, изолирующий способность моделей к реконструкции скрытой 3D-структуры. GPT-5.5 и Claude Sonnet 5 показали низкие результаты, уступив даже людям.