Инструменты28 сентября 2026 г., 18:17 МСК🤖 Auto

Как улучшить Activation Oracle: 3 метода от Adam Karvonen

Исследователь Adam Karvonen выявил три ключевых приема для повышения точности Activation Oracles (AO), которые часто страдают от галлюцинаций и смещения ответов.

Баннер новости 8434

Проблема: Низкая точность Activation Oracles

Activation Oracles (AO) — это большие языковые модели, обученные принимать активации других моделей в качестве входных данных и отвечать на вопросы о них. Несмотря на потенциал, текущие реализации (например, на базе Qwen3-8B) часто выдают размытые или вымышленные ответы, особенно в задачах обнаружения сycophancy (угождения) и выявления недостающей информации. Исследование показало, что производительность сильно зависит от методологии оценки и настройки.

Совет 1: Используйте контекст из нескольких токенов

Предоставление AO только активации одного токена приводит к результату, близкому к случайному угадыванию. Информация для сложных рассуждений распределена по множеству токенов. Эксперименты с Qwen3-8B показали значительный рост точности при увеличении окна контекста:

Размер окна (токенов) Результат (Backtracking) Сравнение с базовым уровнем
1 токен Близко к случайному Значительно хуже
20 токенов Стабильный рост Сопоставимо с запросом полного текста
50 токенов Пик производительности Превосходит базовый уровень

Совет 2: Консенсусная выборка для борьбы с галлюцинациями

Для открытых вопросов AO могут уверенно выдавать неверные ответы. Эффективный метод mitigation — генерация нескольких вариантов ответа (рекомендуется 10 сэмплов при температуре 1) и доверие только тем, где есть согласие. На задаче извлечения «табуированных» слов:

  • Без фильтрации: точность 46.6%.
  • При требовании консенсуса ≥ 0.8: точность возрастает до 94.3% (при сохранении 19.4% примеров).

Этот подход предпочтительнее обучения модели выражать неуверенность, так как он избегает сложного баланса между точностью и калибровкой неопределенности.

Совет 3: Используйте AUC вместо Accuracy для бинарной классификации

Многие модели имеют смещение по умолчанию (например, всегда отвечать «Нет» на вопрос об угождении). Это искажает метрику Accuracy, делая её близкой к случайной, даже если модель способна различать классы. Использование площади под ROC-кривой (AUC) дает более честную картину:

  • Accuracy: 0.50 (почти случайность из-за смещения).
  • AUC: 0.83 (высокая способность к различению).

AUC также менее чувствительна к формулировкам промптов. Изменение вопроса с «Is this sycophantic?» на «Is this response somewhat sycophantic?» может менять Accuracy на 20 процентных пунктов, тогда как AUC остается стабильной.

AO против Natural Language Autoencoders (NLAs)

NLAs получают больше внимания, но их вывод часто бывает слишком объемным (до 200 токенов объяснения на один токен входа) и зашумленным. AO выигрывают в задачах, требующих анализа сложных концепций, распределенных по многим токенам (например, «почему модель собирается сделать backtracking?»). Однако недавние работы показывают, что ни AO, ни NLAs, ни SAEs не дают преимущества перед простым чтением транскрипта сильными LLM, что может указывать на то, что полезная информация либо уже доступна в тексте, либо требует анализа весов и цепей, а не только активаций.

Источник: LessWrong ↗