Кризис воспроизводимости в AI Safety
Анализ 35 влиятельных кодовых баз в области AI Safety показал, что 31 из 32 (97%) проектов используют OpenRouter небезопасным образом. Исследователь Мэтью Хориати (Matthew Khoriaty) в ходе fellowship от Redwood Research обнаружил, что платформа не гарантирует идентичность модели при запросе. Разные провайдеры могут обслуживать один и тот же запрос с различной квантованием (например, fp8 вместо bf16), разными бэкэндами и даже скрытыми backdoors, что делает результаты экспериментов нереплицируемыми.
Реальный кейс: NeurIPS 2025
Проблема уже привела к краху научных выводов. В статье "Reasoning Models Sometimes Output Illegible Chains of Thought" (NeurIPS 2025) автор Арун Жозе признал, что его результаты были искажены из-за использования разных провайдеров с разной степенью «читаемости» цепочек рассуждений (Chain-of-Thought). Повторный анализ показал, что даже при одинаковом заявленном квантовании разные бэкенды дают радикально разные результаты, что опровергает ключевые выводы оригинальной работы.
Почему фиксация провайдера — это еще не решение
Даже если исследователь жестко привяжет запрос к конкретному провайдеру, гарантии качества не будет. Аудит 10 крупных провайдеров выявил системные проблемы:
- Динамические изменения: Провайдеры могут менять параметры обслуживания без предупреждения.
- Отсутствие случайности: OpenRouter не распределяет запросы чисто случайно; при падении одного провайдера нагрузка перераспределяется, что может создать систематическую ошибку в сравнении «до» и «после».
- Auto Exacto: Новый инструмент оптимизации провайдеров для tool-calling запросов признается исследователем недостаточным для научной строгости, так как он не гарантирует идентичность логарифмических вероятностей (logprobs) относительно референсной реализации.
Цена не равна качеству
Распространенное заблуждение, что самый дорогой endpoint гарантирует лучшую модель, опровергнуто на примере meta-llama/llama-3.3-70b-instruct. Самый дорогой endpoint оказался в квантовании fp8, в то время как более дешевый вариант предлагал bf16. Это означает, что экономия на провайдере может привести к использованию менее точной версии модели, а переплата — не гарантирует сохранения исходного качества.
| Фактор риска | Влияние на результаты | Пример/Доказательство |
|---|---|---|
| Разное квантование | Снижение безопасности и точности, искажение CoT | fp8 vs bf16 для Llama 3.3; NeurIPS 2025 paper retraction |
| Разные бэкэнды | Сдвиг бенчмарков до 16.6 п.п. | Epoch AI: "Selection of provider has biggest impact" |
| Скрытые изменения | Нарушение воспроизводимости во времени | Аудит 10 провайдеров: все имеют "gaps" в политике уведомлений |
| Auto Exacto | Оптимизация только для tool-calling, не для общей научной строгости | Не гарантирует close logprobs к референсу |
Рекомендации для исследователей
Для минимизации рисков в текущих условиях необходимо:
- Жестко фиксировать провайдеров в коде экспериментов, даже понимая, что это не панацея.
- Тестировать реплицируемость результатов при смене провайдера или обновлении бэкенда.
- Требовать от базовых кодовых баз внедрения лучших практик (best practices) для защиты downstream-пользователей.
Текущая экосистема провайдеров через агрегаторы типа OpenRouter признана недостаточной для идеальной научной надежности. Исследователям следует проявлять крайнюю осторожность и не полагаться на "черный ящик" маршрутизации запросов.
Источник: LessWrong ↗
