Проблема: LLM — плохие коммуникаторы
Несмотря на рост агентных способностей, современные большие языковые модели (LLM) демонстрируют критические недостатки в коммуникации с операторами. Автор выделяет два фактора сбоев: артикуляцию (способность к точному изложению) и достоверность (склонность к искажению фактов). Фокус статьи — на первой, так как она часто маскирует проблемы второй.
Наблюдаемые феномены некомпетентности включают:
- Выдуманный жаргон: Модели создают несуществующие термины (например, «3-submission backtest budget»), которые не имеют смысла даже в контексте.
- Несогласованность терминологии: Один и тот же объект может называться «отчет», «документ» или «результат» в соседних предложениях.
- Избыточная многословность: Модели игнорируют лимиты символов и требуют ручного сжатия ответов.
- Неумение давать краткие имена: Проблемы с генерацией переменных, слаг-имен ресурсов и заголовков.
- Неуместное использование шорткатов: Замена точных строк (например, имен моделей в YAML) на неточные сокращения.
- Иллюзия общего контекста: Модель предполагает, что читатель видел все предыдущие вызовы инструментов, что делает текст непонятным для нового пользователя.
Причины: Почему модели «не умеют» писать для людей?
Автор выдвигает гипотезы, объясняющие эти дефекты:
- Неверно заданные функции вознаграждения (RL): Обучение с подкреплением (RLHF/RLVR) часто опирается на «судей»-LLM, которые оценивают весь контекст сразу. Это снимает давление с необходимости четко формулировать мысли в каждом отдельном сообщении.
- Обучение для машин, а не людей: Модели тренируются на коммуникации с другими агентами, субагентами и будущими версиями самих себя (после сжатия контекста). Их проза оптимизирована для машинного понимания, а не человеческого когнитивного комфорта.
- Отсутствие метрик: Хорошее письмо сложно измерить. Без четких бенчмарков лаборатории не имеют коммерческого стимула улучшать этот навык, так как он не влияет напрямую на скорость генерации или стоимость инференса.
Зачем это нужно для безопасности AI?
Введение метрики «сверхчеловеческой артикуляции» (Superhuman Articacy) критически важно по трем причинам:
- Масштабируемый надзор (Scalable Oversight): По мере роста интеллекта AGI, человеку станет невозможно проверять каждое действие. Модели должны уметь эффективно и точно объяснять свои действия и мотивы другим моделям или людям.
- Отсрочка передачи контроля (Handoff): Эффективная коммуникация позволяет людям дольше оставаться в контуре управления (centaur period), так как они быстрее понимают решения ИИ. Это отодвигает момент, когда человеческий надзор становится узким местом.
- Диагностика обмана: Если артикуляция идеальна, то любая ошибка в коммуникации с высокой вероятностью указывает на намеренное искажение фактов (untruthfulness), а не на неумение выразить мысль. Это превращает коммуникацию в надежный индикатор злого умысла.
Путь к улучшению: Публичные оценки
Как и любая другая способность, артикуляция может быть улучшена через создание качественных бенчмарков. Автор настаивает на необходимости публичных независимых оценок, чтобы избежать обвинений в предвзятости, которые неизбежны при внутренних тестах лабораторий. Четкий, верифицируемый стандарт позволит «подниматься по градиенту» (hill-climbing) в улучшении качества коммуникации моделей.
Источник: LessWrong ↗
