Проблема: 90% провалов клинических испытаний
Разработка новых лекарств в Великобритании стоит до £1.3 млн, при этом уровень неудач достигает 90%. Ключевая причина — токсичность соединений, которую сложно предсказать на ранних этапах. Исследователи Mia MacGregor, Aakash Welgamage Don и Mark Bartlett (принято к публикации в CIBB 2026) проверили, могут ли Large Language Models (LLM) стать надежным инструментом для выявления опасных химических свойств через оптимизацию промптов.
Методология: роль, структура и правила
Авторы создали эксперимент, где LLM должны были идентифицировать значимые химические свойства для предсказания токсичности. Промпты варьировались по трем параметрам:
- Job role (Роль): назначение модели (например, «эксперт по токсикологии»).
- Prompt structuring (Структура): формат подачи задачи.
- Rule interpretation (Интерпретация правил): четкость инструкций по анализу.
Сгенерированные LLM признаки затем передавались в классические алгоритмы машинного обучения (ML) для построения предиктивных моделей.
Результаты: шум LLM важнее тонкой настройки
Ключевой вывод исследования: естественная вариативность (non-determinism) LLM перевешивает любые преимущества от тонкой настройки промптов. Разница в качестве выходных данных при изменении формулировок оказалась сопоставимой с разницей между разными моделями. Это ставит под угрозу использование LLM как надежного источника данных для критически важных задач.
Сравнение подходов: LLM vs Chemoinformatics
Наиболее существенный прирост производительности модели был достигнут не за счет улучшения промптов, а за счет замены LLM на специализированный химический код для извлечения признаков. Ниже приведено сравнение эффективности подходов:
| Метод извлечения признаков | Источник данных | Влияние на точность модели |
|---|---|---|
| LLM (с оптимизацией промптов) | Генерация текстовых описаний свойств | Низкая (вариативность нивелирует пользу) |
| Chemoinformatic code | Расчет химических дескрипторов | Высокая (существенное улучшение метрик) |
Вывод для биоинформатики
Авторы предлагают новую методологию анализа промпт-инжиниринга, применимую к широкому спектру задач биоинформатики. Главный урок: в задачах, требующих высокой точности и воспроизводимости (как предсказание токсичности), детерминированные химические расчеты превосходят вероятностные генеративные модели, даже при продвинутом промпт-инжиниринге.
Источник: arXiv cs.AI ↗
