Суть исследования
Автор работы Амелия Лю (Amelia Liu) провела бенчмаркинг 14 крупных языковых моделей, чтобы оценить их пригодность для консультирования потребителей по вопросам косметической химии. Ключевая особенность теста: поиск в интернете был полностью отключен. Это позволило изолировать и оценить исключительно внутренние знания моделей, а не их способность к веб-скрейпингу.
Ключевые метрики и результаты
Общая производительность моделей оценивается как низкая. Наибольшие проблемы выявлены в двух категориях:
- Количественные рассуждения (расчет концентраций, pH, дозировок);
- Структурная идентификация (узнавание химических формул и свойств ингредиентов).
Модели справляются с общими вопросами ухода, но их ответы не содержат необходимой технической глубины для принятия взвешенных решений. Главная опасность заключается в том, что ошибки звучат авторитетно, что снижает критичность восприятия информации пользователем.
Сравнение компетенций
| Категория задачи | Результат тестирования | Причина проблемы |
|---|---|---|
| Общие вопросы ухода | Удовлетворительно | База знаний покрывает популярные темы |
| Химические свойства ингредиентов | Низкая точность | Отсутствие верифицированных данных в обучении |
| Количественные расчеты | Критический провал | Слабый алгоритмический reasoning |
| Структурная идентификация | Критический провал | Трудности с визуализацией и анализом формул |
Выводы и рекомендации
Авторы приходят к выводу, что универсальные LLM, обученные на непроверенных данных из интернета, ненадежны для использования в качестве источника информации по косметической химии. Для создания безопасных инструментов потребуются два этапа развития:
- Дообучение (fine-tuning) на верифицированных химических и дерматологических наборах данных;
- Существенное улучшение алгоритмических способностей к рассуждению.
Источник: arXiv cs.AI ↗
