<div>
<h2>BAZAAR: новый бенчмарк оценки рыночного мышления ИИ</h2>
<p>Исследователи представили BAZAAR — масштабный тест, который заставляет языковые модели вести себя как торговцы на двустороннем аукционе. Без подсказок о чужих ценах агенты учатся балансировать между выгодой и риском.</p>
<p>Каждая сессия — это 30 раундов, где четыре покупателя и четыре продавца делают ставки, зная лишь историю прошлых сделок. Никаких подсказок и чатов: только свои оценки и реакция на исход торгов.</p>
<h2>Лидеры показывают себя по-разному</h2>
<p>TrueSkill-рейтинг возглавляют o3 (модель среднего уровня рассуждений) и Gemini 2.5 Pro — они находят золотую середину между аккуратностью и смелостью ставок. Некоторые модели стартуют консервативно, постепенно наращивая агрессию, а другие сразу идут в атаку и корректируют курс после первых неудач.</p>
<p>Метрика Conditional Surplus Alpha (CSα) оценивает, насколько реальная прибыль модели отличается от идеально честной стратегии. Широкий разброс результатов отражает степень риска: узкие кластеры говорят о стабильности, а разбросанные точки — о потенциальных гениальных, но рискованных ходах.</p>
<h2>Что дальше?</h2>
<p>BAZAAR открывает окно в «экономическое чутьё» ИИ и подталкивает к новым стратегиям обучения. Хотите проверить свои модели или предложить улучшения? Репозиторий открыт для экспериментов, а результаты могут подсказать, как сделать торговых агентов более чуткими и прибыльными.</p>
</div>
AI-новости25 июля 2025 г., 17:07 МСК🤖 Auto
BAZAAR: ИИ в битве рыночных аукционов
<p> Исследователи запустили BAZAAR — бенчмарк, проверяющий, как LLM справляются с торговлей на двустороннем аукционе без полной информации. Лидеры рейтинга показывают уникальные рыночные стратегии и баланс риска.</p>