Что такое NeoMME?
NeoMME (Neo Multimodal Evaluation) — это новый набор данных и методология оценки, разработанные командой Hugging Face. Цель проекта — создать более надежный и всесторонний инструмент для сравнения мультимодальных больших языковых моделей (MLLMs). В отличие от предыдущих бенчмарков, NeoMME фокусируется на реальной способности моделей понимать сложные визуальные контексты и логически рассуждать на их основе.
Ключевые характеристики датасета
Основой NeoMME является тщательно курируемый набор из более чем 1000 высококачественных вопросов. Каждый вопрос проходит строгую проверку на корректность и релевантность. Датасет охватывает широкий спектр задач, разделенных на 10 ключевых категорий:
- Общее понимание (General Understanding)
- Текстовое распознавание (OCR)
- Математика и логика
- Научные знания
- Художественная оценка
- Медицинская диагностика
- Юридические вопросы
- Финансовый анализ
- Программирование
- Креативное мышление
Почему это важно?
Существующие бенчмарки часто страдают от «загрязнения» данных (data leakage), когда модели обучаются на тестовых вопросах, или от недостаточной сложности задач. NeoMME решает эту проблему, используя уникальные, недавно созданные вопросы, которые не встречались моделям в процессе обучения. Это позволяет получить более честную оценку реальных способностей AI.
Как использовать NeoMME?
Датасет доступен на платформе Hugging Face. Исследователи и разработчики могут использовать его для:
- Сравнения производительности различных MLLM
- Выявления слабых мест в текущих моделях
- Разработки новых архитектур, ориентированных на конкретные задачи
NeoMME становится новым стандартом в индустрии, помогая двигаться от простого «гадания» на точность к измеримым и воспроизводимым метрикам качества мультимодального ИИ.
Источник: Huggingface ↗
