Суть эксперимента: LLM как диспетчер
Группа исследователей во главе с Махьяром Гезанфари из Калифорнийского университета в Беркли (UC Berkeley) провела пилотное исследование по замене или辅助рованию работы диспетчеров УВД (Air Traffic Control) с помощью больших языковых моделей. В качестве «эталона истины» (P0) использовалась ручная транскрипция реального полета легкого самолета над маршрутом «Bay Tour» в Сан-Франциско. Модель должна была генерировать ответы диспетчера, реагируя на фиксированный сценарий пилота.
Архитектура и метрики
Авторы разработали состоятельный многооборотный пайплайн, где модель учитывает историю диалога. Были протестированы 9 моделей (открытых и закрытых) с пятью структурами промптов (P1-P5) разной степени детализации. Оценка проводилась по лексическому, структурному и семантическому сходству, а также с помощью «судьи» GPT-5.5, валидированного экспертами-людьми.
Ключевые результаты: парадокс сложности
Главный вывод исследования контринтуитивен: чем строже и детальнее промпт, тем хуже результат. Легкие промпты (P1) показали наилучшую схожесть с реальными диспетчерскими командами. Тяжелые, детально расписанные инструкции (P5) привели к коллапсу: модель начинала генерировать ошибки, которые накапливались в ходе диалога.
| Параметр | Влияние на качество (Similarity Score) | Примечание |
|---|---|---|
| Наличие примера (In-context example) | Улучшает | Добавление транскрипции другого полета как примера повышает точность. |
| Строгость промпта (P1 vs P5) | Ухудшает | Легкие промпты (P1) лучше детализированных (P5). Сложные инструкции вызывают галлюцинации. |
| Источник истории диалога | Критично | Модель, опирающаяся на свои предыдущие ответы, накапливает ошибки. Подстановка «истинной» истории (ground truth) исправляет ситуацию. |
Почему это важно для индустрии
Связь диспетчер-пилот — это критически важная коммуникация, где ошибка недопустима. Исследование показывает, что текущие LLM не могут работать автономно в режиме «черного ящика» с жесткими правилами. Однако они могут стать эффективным инструментом ассистирования, если:
- Использовать минималистичные промпты, позволяющие модели опираться на свои базовые знания.
- Применять RAG-подобные подходы, подставляя в контекст реальные исторические данные диалога, а не позволяя модели «помнить» свои же потенциально ошибочные ответы.
Работа демонстрирует конкретный путь к интеграции ИИ в авиацию, но подчеркивает необходимость строгого контроля и «human-in-the-loop» архитектуры на данном этапе.
Источник: arXiv cs.AI ↗
