Введение
Для задачи распознавания объектов с летательных аппаратов характерна большая специфика данных, где объекты на изображении могут иметь маленький размер, также при движении БПЛА происходит резкое изменение фона, позиции объекта и возможны появления шумов. Учитывая такие ограничения, использование классических алгоритмов становится невозможным в связи их неспособности хорошо работать в меняющихся условиях [1].
Современные модели можно разделить на две категории:
- Обучаемые модели (YOLO [4], R-CNN [5], …) — модели, обеспечивающие высокую скорость, но сильно зависят от количества и качества данных, на которых они обучались.
- Foundation модели (SAM [6], Grounded-SAM [8]) — предобученные модели, способные распознавать объекты без дополнительного обучения, но требуют на входе промпт — текст, ограничивающий регион объекта, точка центра объекта, в зависимости от модели. Имеют хорошую точность, но требуют высокую вычислительную мощность.
В статье [2] проведен бенчмарк моделей YOLOv5/v8, где авторы выявили модели, обеспечивающие оптимальный баланс точности (лучший
Цель данной статьи — провести сравнительный анализ архитектур YOLOv26-seg и Grounded-SAM2 для задачи распознавания мостов на снимках с БПЛА и сформулировать практические рекомендации по выбору модели в зависимости от эксплуатационных ограничений.
Описание методов
Для поставленной задачи распознавания мостов с летательных аппаратов рекомендуется использовать обучаемые модели, учитывая, что важна real-time скорость, но из-за ограниченного количества данных рассмотрится еще и foundation модель. Среди множества архитектур распознавания объектов выделяются модели:
— YOLOv26-seg [9] — state-of-the-art решение среди семейства YOLO для real-time сегментации. Модель является одноэтапной с единой базовой моделью, включающей C3k2, C2PSA блоки и раздельными головами для детекции и генерации масок. Ключевыми особенностями является anchor-free подход, отсутствие NMS на инференсе и Dual Label Assignment для устойчивости к малым объектам.
— Grounded-SAM2 является предобученной моделью, которая состоит из двух моделей — Grounding DINO и SAM2, где каждая из них отдельно обучена на 10 миллионах наборах изображений и нужных для них промптах. Способна распознавать всевозможные классы учитывая текстовое описание, приложенное пользователем. Имеет хорошую точность, но из-за сложной структуры, содержащей две модели и механизмы внимания, требует больших вычислительных мощностей.
Описание датасета
Для выбора подходящей модели будет проведен сравнительный экспериментальный анализ, где сравнятся метрики точности mAP и скорости инференса FPS. Эксперимент будет проводиться на собранном датасете с мостами, который размечен, изначально используя модель Grounded-SAM2 и в дальнейшем подкорректирован вручную, что сэкономило время разметки.
Датасет состоит из ~1500 размеченных изображений мостов масками в формате YOLO, который разделен пропорциями 75/15/10 на тренировочный, валидационный и тестовый выборки соответственно. Пример изображений с датасета изображен на рис. 1.
Рис. 1. Пример данных с датасета
Обучение
Обучение производилось через библиотеку Ultralytics используя гиперпараметры указанные в таблице 1.
Таблица 1
Гиперпараметры обучения модели
|
Параметр |
Значение |
|
Количество эпох |
300 |
|
Размер батча |
32 |
|
Размер входных изображений |
640х640 |
|
Оптимизатор |
AdamW |
Также при обучении добавлялись аугментации, указанные в таблице 2.
Таблица 2
Аугментации, применяемые во время обучения
|
Аугментация |
Значение |
|
Поворот изображения (degrees) |
|
|
Сдвиг изображения (translate) |
0.005 (5 %) |
|
Масштабирование (scale) |
0.2 (20 %) |
|
Горизонтальное отражение (fliplr) |
0.5 (50 % вероятность горизонтального отражения) |
|
Изменение оттенка (hsv_h) |
0.015 |
|
Изменение насыщенности (hsv_s) |
0.3 |
|
Изменение яркости (hsv_v) |
0.3 |
Результаты
По результатам Grounded-SAM2 демонстрирует преимущество по точности сегментации (+6.5 % по mAP@0.5, +22.6 % по mAP@0.5:0.95), что объясняется предобучением на масштабных данных и способности к zero-shot обобщению. YOLOv26-seg превосходит по скорости инференса (в 58.9 раз выше FPS), что делает её пригодной для real-time систем. В таблице 3 указаны полученные метрики моделей.
Таблица 3
Результаты моделей
|
Модель |
mAP 50 |
mAP50–95 |
FPS |
|
YOLO26n-seg |
0.932 |
0.517 |
91.23 |
|
Grounded-SAM2 |
0.993 |
0.634 |
1.55 |
Замеры FPS обеих моделей выполнены на графической видеокарте NVIDIA Quadro RTX 8000 (48 GB GDDR6) в режиме инференса без учета пред/постобработки.
Визуальный анализ на рис. 2 показывает, что различия в качестве масок минимальны для крупных объектов.
Рис. 2. Маска до и после инференса моделей
Выводы
На основе проделанного анализа YOLOv26-seg обеспечивает более высокую производительность для real-time систем с ограничением по времени отклика, что подтверждается высоким FPS (~91 FPS). Grounded-SAM2 имеет лучшую точность (mAP@0.5:0.95 = 0.634, +22.6 % относительно точности YOLO) и работает без нужды в дообучении, что является хорошим решением для автоматизации процесса аннотации изображений для дальнейшего обучения моделей.
Литература:
- Liu Y. A survey of small object detection based on deep learning in aerial images [Электронный ресурс] / Y. Liu, X. Zhang, Z. Wang // Artificial Intelligence Review. — 2025. — URL: https://link.springer.com/article/10.1007/s10462–025–11150–9 (дата обращения: 03.03.2026).
- Phan T.-N. Deep Learning Models for UAV-Assisted Bridge Inspection: A YOLO Benchmark Analysis [Электронный ресурс] / T.-N. Phan, H.-H. Nguyen, T.-T.-H. Ha, H.-T. Thai, K.-H. Le // 2024 International Conference on Advanced Technologies for Communications (ATC). — Ho Chi Minh City, Vietnam, 17–19 Oct. 2024. — DOI: 10.1109/ATC63255.2024.10908331. — URL: https://ieeexplore.ieee.org/document/10908331 (дата обращения: 03.03.2026).
- Wallace S. Exploring Segment Anything Foundation Models for Out of Domain Crevasse Drone Image Segmentation [Электронный ресурс] / S. Wallace, A. Durrant, W. D. Harcourt, R. Hann, G. Leontidis // Proceedings of the Neural Information Processing Systems Workshop on Deep Learning for Climate Change and Sustainability (NLDL 2025). — 2024. — URL: https://openreview.net/forum?id=CGkyjTXomz (дата обращения: 04.03.2026).
- Redmon J. You Only Look Once: Unified, Real-Time Object Detection [Электронный ресурс] / J. Redmon, S. Divvala, R. Girshick, A. Farhadi // arXiv. — 2015. — № 1506.02640. — URL: https://arxiv.org/abs/1506.02640 (дата обращения: 12.03.2026).
- Girshick R. Rich feature hierarchies for accurate object detection and semantic segmentation [Электронный ресурс] / R. Girshick, J. Donahue, T. Darrell, J. Malik // arXiv. — 2013. — № 1311.2524. — URL: https://arxiv.org/abs/1311.2524 (дата обращения: 06.03.2026).
- Segment Anything [Электронный ресурс] // arXiv preprint. — 2023. — № 2304.02643. — URL: https://arxiv.org/abs/2304.02643 (дата обращения: 25.03.2026).
- SAM 2: Segment Anything in Images and Videos [Электронный ресурс] // arXiv preprint. — 2024. — № 2408.00714. — URL: https://arxiv.org/abs/2408.00714 (дата обращения: 26.03.2026).
- Grounded SAM: Assembling Open-World Models for Diverse Visual Tasks [Электронный ресурс] // arXiv preprint. — 2024. — № 2401.14159. — URL: https://arxiv.org/abs/2401.14159 (дата обращения: 27.03.2026).
- Ultralytics YOLO26: Key Architectural Enhancements and Performance Improvements [Электронный ресурс] // arXiv. — 2025. — № 2509.25164. — URL: https://arxiv.org/abs/2509.25164 (дата обращения: 20.03.2026).

