Исследования21 сентября 2026 г., 08:21 МСК🤖 Auto

LoRA + DINOv3: Прорыв в распознавании подводных целей с SAS

Исследователи адаптировали DINOv3 для сонаров с синтезированной апертурой, достигнув роста AUPRC с 0.300 до 0.679, обучая лишь 0.26% параметров.

Баннер новости 7918

Проблема: Дефицит данных и акустические мимикры

Автоматическое распознавание целей (ATR) с помощью сонаров с синтезированной апертурой (SAS) критически важно для военно-морских операций. Однако внедрение глубокого обучения здесь тормозится тремя факторами: острой нехваткой размеченных изображений подводных целей, сильным акустическим шумом и сложностью отделения целей от естественного рельефа (камни, осадки). Традиционные методы требуют значительных вычислительных ресурсов и человеческого контроля.

Решение: Трехэтапная адаптация DINOv3

Команда авторов предложила параметрически эффективный фреймворк на базе модели DINOv3 Vision Transformer (ViT). Вместо полной дообучки сети, они использовали стратегию из трех этапов:

  • Этап 1 (LoRA): Заморозка основного бэкбона ViT и применение Low-Rank Adaptation (LoRA). Это позволило «перевести» модель, обученную на натуральных изображениях, в среду подводной акустики.
  • Этап 2 (Hard-Negative Mining): Усиление границы принятия решений за счет выбора сложных отрицательных примеров (акустических мимикров).
  • Этап 3 (SupCon): Применение обученного с учителем контрастного обучения для разделения представлений целей и шума.

Результаты: Эффективность против избыточности

Оценка проводилась на реальных данных SAS в полевых условиях с географическим разделением на тестовые и обучающие выборки. Ключевой вывод исследования: первый этап (LoRA) дает основной прирост качества, а последующие этапы практически не влияют на результат, так как модель уже выучила необходимую геометрию данных.

Ниже приведено сравнение метрик AUPRC (Area Under Precision-Recall Curve) для различных конфигураций:

Конфигурация AUPRC Стандартное отклонение Изменение параметров
Базовый (без LoRA) 0.300 - 0.00%
LoRA (Rank 4) 0.679 ± 0.027 0.26%
LoRA + Hard-Negative Mining 0.6745 ± 0.0119 0.26% + доп.
LoRA + Hard-Neg + SupCon 0.6747 ± 0.0096 0.26% + доп.

Как видно из таблицы, добавление этапов 2 и 3 дало статистически значимое улучшение лишь на уровне шума (±0.01), что подтверждает гипотезу о достаточности одного этапа адаптации.

Почему это важно

Результат демонстрирует, что для специфических доменов (подводная акустика) не всегда нужны сложные многоступенчатые пайплайны. Использование LoRA на мощных предобученных моделях (DINOv3) позволяет достичь почти двукратного роста точности (AUPRC), затрачивая ресурсы на обучение менее 0.3% весов модели. Это открывает путь к развертыванию эффективных AI-систем на борту подводных аппаратов с ограниченными вычислительными мощностями.

Источник: arXiv cs.AI ↗