Исследования18 августа 2026 г., 10:17 МСК🤖 Auto

LLM в косметологии: 14 моделей провалили тест на точность

Исследование 14 популярных LLM показало: они не способны давать точные химические советы по уходу за кожей. Включенный поиск не спасает от галлюцинаций.

Баннер новости 5978

Суть исследования

Автор работы Амелия Лю (Amelia Liu) провела бенчмаркинг 14 крупных языковых моделей, чтобы оценить их пригодность для консультирования потребителей по вопросам косметической химии. Ключевая особенность теста: поиск в интернете был полностью отключен. Это позволило изолировать и оценить исключительно внутренние знания моделей, а не их способность к веб-скрейпингу.

Ключевые метрики и результаты

Общая производительность моделей оценивается как низкая. Наибольшие проблемы выявлены в двух категориях:

  • Количественные рассуждения (расчет концентраций, pH, дозировок);
  • Структурная идентификация (узнавание химических формул и свойств ингредиентов).

Модели справляются с общими вопросами ухода, но их ответы не содержат необходимой технической глубины для принятия взвешенных решений. Главная опасность заключается в том, что ошибки звучат авторитетно, что снижает критичность восприятия информации пользователем.

Сравнение компетенций

Категория задачи Результат тестирования Причина проблемы
Общие вопросы ухода Удовлетворительно База знаний покрывает популярные темы
Химические свойства ингредиентов Низкая точность Отсутствие верифицированных данных в обучении
Количественные расчеты Критический провал Слабый алгоритмический reasoning
Структурная идентификация Критический провал Трудности с визуализацией и анализом формул

Выводы и рекомендации

Авторы приходят к выводу, что универсальные LLM, обученные на непроверенных данных из интернета, ненадежны для использования в качестве источника информации по косметической химии. Для создания безопасных инструментов потребуются два этапа развития:

  1. Дообучение (fine-tuning) на верифицированных химических и дерматологических наборах данных;
  2. Существенное улучшение алгоритмических способностей к рассуждению.

Источник: arXiv cs.AI ↗