Исследования24 июля 2026 г., 09:17 МСК🤖 Auto

PlanE: Автономное планирование данных и тонкой настройки LLM

Исследователи представили PlanE — фреймворк, который автоматически подбирает оптимальные комбинации базовых моделей, данных и промптов для извлечения информации, снижая затраты на аннотацию.

Баннер новости 4273

Проблема стоимости аннотации

Адаптация больших языковых моделей (LLM) под конкретные задачи традиционно требует огромных объемов размеченных данных. Процесс создания таких датасетов (instruction-tuning datasets) является узким местом: он дорог, долог и часто неэффективен из-за отсутствия системных методов оптимизации. Исследователи Jiacheng Wang, Weiyan Zhang и Guangya Yu предлагают решение, которое меняет парадигму с ручного создания данных на мета-планирование.

Архитектура PlanE

Предложенный фреймворк PlanE (Planning framework for Extractive-based LLMs) состоит из трех ключевых этапов:

  • Data Decomposition: Декомпозиция данных для эффективного обучения.
  • Instruction Tuning: Тонкая настройка модели на выбранных данных.
  • Prompt Inference: Оптимизация промптов на этапе инференса.

Центральным элементом системы является Data-Tuning-Inference (DTI) planner. Этот модуль работает как «архитектор», анализируя целевой датасет и автоматически выбирая лучшую базовую LLM, а также оптимальную стратегию обработки данных и промптов для нее.

Результаты валидации

Эксперименты подтвердили эффективность подхода в двух сценариях. Во-первых, PlanE показал стабильное улучшение метрик при использовании одной и той же базовой модели на разных наборах данных. Во-вторых, система успешно адаптировала различные базовые LLM под один и тот же датасет, находя для каждой модели свою «золотую середину» параметров. Особое внимание уделено обобщаемости DTI-планировщика: он сохраняет эффективность при изменении целей оптимизации (например, с фокуса на точность на фокус на скорость).

Значение для индустрии

Публикация arXiv:2607.20470 (подана 22 мая 2026 года) знаменует шаг в сторону автономных конвейеров разработки AI. Код фреймворка уже доступен, что позволяет сообществу протестировать методологию снижения затрат на кастомизацию LLM. Это критически важно для внедрения извлекающих моделей (extractive-based LLMs) в задачи, требующие высокой точности и низких задержек, где ручная настройка промптов и данных становится непрактичной.

Источник: arXiv cs.AI ↗