Исследования21 августа 2026 г., 07:17 МСК🤖 Auto

LLM в авиации: почему простые промпты лучше сложных

Исследование arXiv показало, что при генерации фразеологии диспетчеров (ATC) легкие промпты работают стабильнее тяжелых. Сложные инструкции приводят к накоплению ошибок, которые можно исправить только подстановкой исторических данных.

Баннер новости 6208

Суть эксперимента: LLM как диспетчер

Группа исследователей во главе с Махьяром Гезанфари из Калифорнийского университета в Беркли (UC Berkeley) провела пилотное исследование по замене или辅助рованию работы диспетчеров УВД (Air Traffic Control) с помощью больших языковых моделей. В качестве «эталона истины» (P0) использовалась ручная транскрипция реального полета легкого самолета над маршрутом «Bay Tour» в Сан-Франциско. Модель должна была генерировать ответы диспетчера, реагируя на фиксированный сценарий пилота.

Архитектура и метрики

Авторы разработали состоятельный многооборотный пайплайн, где модель учитывает историю диалога. Были протестированы 9 моделей (открытых и закрытых) с пятью структурами промптов (P1-P5) разной степени детализации. Оценка проводилась по лексическому, структурному и семантическому сходству, а также с помощью «судьи» GPT-5.5, валидированного экспертами-людьми.

Ключевые результаты: парадокс сложности

Главный вывод исследования контринтуитивен: чем строже и детальнее промпт, тем хуже результат. Легкие промпты (P1) показали наилучшую схожесть с реальными диспетчерскими командами. Тяжелые, детально расписанные инструкции (P5) привели к коллапсу: модель начинала генерировать ошибки, которые накапливались в ходе диалога.

Параметр Влияние на качество (Similarity Score) Примечание
Наличие примера (In-context example) Улучшает Добавление транскрипции другого полета как примера повышает точность.
Строгость промпта (P1 vs P5) Ухудшает Легкие промпты (P1) лучше детализированных (P5). Сложные инструкции вызывают галлюцинации.
Источник истории диалога Критично Модель, опирающаяся на свои предыдущие ответы, накапливает ошибки. Подстановка «истинной» истории (ground truth) исправляет ситуацию.

Почему это важно для индустрии

Связь диспетчер-пилот — это критически важная коммуникация, где ошибка недопустима. Исследование показывает, что текущие LLM не могут работать автономно в режиме «черного ящика» с жесткими правилами. Однако они могут стать эффективным инструментом ассистирования, если:

  • Использовать минималистичные промпты, позволяющие модели опираться на свои базовые знания.
  • Применять RAG-подобные подходы, подставляя в контекст реальные исторические данные диалога, а не позволяя модели «помнить» свои же потенциально ошибочные ответы.

Работа демонстрирует конкретный путь к интеграции ИИ в авиацию, но подчеркивает необходимость строгого контроля и «human-in-the-loop» архитектуры на данном этапе.

Источник: arXiv cs.AI ↗