Отправьте статью сегодня! Журнал выйдет ..., печатный экземпляр отправим ...
Опубликовать статью

Молодой учёный

Методы распознавания мостов с летательных аппаратов

Научный руководитель
Информационные технологии
25.07.2026
Поделиться
Аннотация
В статье рассматривается задача автоматического распознавания и сегментации мостов на снимках с беспилотных летательных аппаратов. Проведен сравнительный анализ двух моделей: YOLOv26-seg и Grounded-SAM2. Описаны особенности обеих моделей, причины их различия в точности и скорости. Экспериментально оценены метрики точности (mAP@0.5, mAP@0.5:0.95) и скорости инференса (FPS). Показано, что выбор модели зависит от сценария применения: YOLOv26-seg предпочтителен для real-time обработки, тогда как Grounded-SAM2 обеспечивает высокую точность без нужды в дообучении, что целесообразно для разметки данных.
Библиографическое описание
Саитов, М. А. Методы распознавания мостов с летательных аппаратов / М. А. Саитов. — Текст : непосредственный // Молодой ученый. — 2026. — № 30 (633). — С. 35-38. — URL: https://moluch.ru/archive/633/139315.


Введение

Для задачи распознавания объектов с летательных аппаратов характерна большая специфика данных, где объекты на изображении могут иметь маленький размер, также при движении БПЛА происходит резкое изменение фона, позиции объекта и возможны появления шумов. Учитывая такие ограничения, использование классических алгоритмов становится невозможным в связи их неспособности хорошо работать в меняющихся условиях [1].

Современные модели можно разделить на две категории:

  1. Обучаемые модели (YOLO [4], R-CNN [5], …) — модели, обеспечивающие высокую скорость, но сильно зависят от количества и качества данных, на которых они обучались.
  2. Foundation модели (SAM [6], Grounded-SAM [8]) — предобученные модели, способные распознавать объекты без дополнительного обучения, но требуют на входе промпт — текст, ограничивающий регион объекта, точка центра объекта, в зависимости от модели. Имеют хорошую точность, но требуют высокую вычислительную мощность.

В статье [2] проведен бенчмарк моделей YOLOv5/v8, где авторы выявили модели, обеспечивающие оптимальный баланс точности (лучший ), скорости инференса ( ) и сформулировали рекомендации по развертыванию моделей на бортовых устройствах. Это подтверждает, что модели семейства YOLO являются хорошим вариантом для real-time систем. В то же время, исследования применения foundation моделей к аэрофотоснимкам демонстрирует их потенциал в сценариях с ограниченной разметкой. В статье [3] авторы оценили производительность моделей SAM [6] и SAM2 [7] для сегментации трещин на ледниках со снимков с дронов, показав результат , что указывает на необходимость в дообучении либо в наличии другой модели, как Grounding DINO, которая будет давать моделям SAM промпты с ограничивающими рамками, что теоретически позволит лучше выделять объекты.

Цель данной статьи — провести сравнительный анализ архитектур YOLOv26-seg и Grounded-SAM2 для задачи распознавания мостов на снимках с БПЛА и сформулировать практические рекомендации по выбору модели в зависимости от эксплуатационных ограничений.

Описание методов

Для поставленной задачи распознавания мостов с летательных аппаратов рекомендуется использовать обучаемые модели, учитывая, что важна real-time скорость, но из-за ограниченного количества данных рассмотрится еще и foundation модель. Среди множества архитектур распознавания объектов выделяются модели:

— YOLOv26-seg [9] — state-of-the-art решение среди семейства YOLO для real-time сегментации. Модель является одноэтапной с единой базовой моделью, включающей C3k2, C2PSA блоки и раздельными головами для детекции и генерации масок. Ключевыми особенностями является anchor-free подход, отсутствие NMS на инференсе и Dual Label Assignment для устойчивости к малым объектам.

— Grounded-SAM2 является предобученной моделью, которая состоит из двух моделей — Grounding DINO и SAM2, где каждая из них отдельно обучена на 10 миллионах наборах изображений и нужных для них промптах. Способна распознавать всевозможные классы учитывая текстовое описание, приложенное пользователем. Имеет хорошую точность, но из-за сложной структуры, содержащей две модели и механизмы внимания, требует больших вычислительных мощностей.

Описание датасета

Для выбора подходящей модели будет проведен сравнительный экспериментальный анализ, где сравнятся метрики точности mAP и скорости инференса FPS. Эксперимент будет проводиться на собранном датасете с мостами, который размечен, изначально используя модель Grounded-SAM2 и в дальнейшем подкорректирован вручную, что сэкономило время разметки.

Датасет состоит из ~1500 размеченных изображений мостов масками в формате YOLO, который разделен пропорциями 75/15/10 на тренировочный, валидационный и тестовый выборки соответственно. Пример изображений с датасета изображен на рис. 1.

Пример данных с датасета

Рис. 1. Пример данных с датасета

Обучение

Обучение производилось через библиотеку Ultralytics используя гиперпараметры указанные в таблице 1.

Таблица 1

Гиперпараметры обучения модели

Параметр

Значение

Количество эпох

300

Размер батча

32

Размер входных изображений

640х640

Оптимизатор

AdamW

Также при обучении добавлялись аугментации, указанные в таблице 2.

Таблица 2

Аугментации, применяемые во время обучения

Аугментация

Значение

Поворот изображения (degrees)

Сдвиг изображения (translate)

0.005 (5 %)

Масштабирование (scale)

0.2 (20 %)

Горизонтальное отражение (fliplr)

0.5 (50 % вероятность горизонтального отражения)

Изменение оттенка (hsv_h)

0.015

Изменение насыщенности (hsv_s)

0.3

Изменение яркости (hsv_v)

0.3

Результаты

По результатам Grounded-SAM2 демонстрирует преимущество по точности сегментации (+6.5 % по mAP@0.5, +22.6 % по mAP@0.5:0.95), что объясняется предобучением на масштабных данных и способности к zero-shot обобщению. YOLOv26-seg превосходит по скорости инференса (в 58.9 раз выше FPS), что делает её пригодной для real-time систем. В таблице 3 указаны полученные метрики моделей.

Таблица 3

Результаты моделей

Модель

mAP 50

mAP50–95

FPS

YOLO26n-seg

0.932

0.517

91.23

Grounded-SAM2

0.993

0.634

1.55

Замеры FPS обеих моделей выполнены на графической видеокарте NVIDIA Quadro RTX 8000 (48 GB GDDR6) в режиме инференса без учета пред/постобработки.

Визуальный анализ на рис. 2 показывает, что различия в качестве масок минимальны для крупных объектов.

Маска до и после инференса моделей

Рис. 2. Маска до и после инференса моделей

Выводы

На основе проделанного анализа YOLOv26-seg обеспечивает более высокую производительность для real-time систем с ограничением по времени отклика, что подтверждается высоким FPS (~91 FPS). Grounded-SAM2 имеет лучшую точность (mAP@0.5:0.95 = 0.634, +22.6 % относительно точности YOLO) и работает без нужды в дообучении, что является хорошим решением для автоматизации процесса аннотации изображений для дальнейшего обучения моделей.

Литература:

  1. Liu Y. A survey of small object detection based on deep learning in aerial images [Электронный ресурс] / Y. Liu, X. Zhang, Z. Wang // Artificial Intelligence Review. — 2025. — URL: https://link.springer.com/article/10.1007/s10462–025–11150–9 (дата обращения: 03.03.2026).
  2. Phan T.-N. Deep Learning Models for UAV-Assisted Bridge Inspection: A YOLO Benchmark Analysis [Электронный ресурс] / T.-N. Phan, H.-H. Nguyen, T.-T.-H. Ha, H.-T. Thai, K.-H. Le // 2024 International Conference on Advanced Technologies for Communications (ATC). — Ho Chi Minh City, Vietnam, 17–19 Oct. 2024. — DOI: 10.1109/ATC63255.2024.10908331. — URL: https://ieeexplore.ieee.org/document/10908331 (дата обращения: 03.03.2026).
  3. Wallace S. Exploring Segment Anything Foundation Models for Out of Domain Crevasse Drone Image Segmentation [Электронный ресурс] / S. Wallace, A. Durrant, W. D. Harcourt, R. Hann, G. Leontidis // Proceedings of the Neural Information Processing Systems Workshop on Deep Learning for Climate Change and Sustainability (NLDL 2025). — 2024. — URL: https://openreview.net/forum?id=CGkyjTXomz (дата обращения: 04.03.2026).
  4. Redmon J. You Only Look Once: Unified, Real-Time Object Detection [Электронный ресурс] / J. Redmon, S. Divvala, R. Girshick, A. Farhadi // arXiv. — 2015. — № 1506.02640. — URL: https://arxiv.org/abs/1506.02640 (дата обращения: 12.03.2026).
  5. Girshick R. Rich feature hierarchies for accurate object detection and semantic segmentation [Электронный ресурс] / R. Girshick, J. Donahue, T. Darrell, J. Malik // arXiv. — 2013. — № 1311.2524. — URL: https://arxiv.org/abs/1311.2524 (дата обращения: 06.03.2026).
  6. Segment Anything [Электронный ресурс] // arXiv preprint. — 2023. — № 2304.02643. — URL: https://arxiv.org/abs/2304.02643 (дата обращения: 25.03.2026).
  7. SAM 2: Segment Anything in Images and Videos [Электронный ресурс] // arXiv preprint. — 2024. — № 2408.00714. — URL: https://arxiv.org/abs/2408.00714 (дата обращения: 26.03.2026).
  8. Grounded SAM: Assembling Open-World Models for Diverse Visual Tasks [Электронный ресурс] // arXiv preprint. — 2024. — № 2401.14159. — URL: https://arxiv.org/abs/2401.14159 (дата обращения: 27.03.2026).
  9. Ultralytics YOLO26: Key Architectural Enhancements and Performance Improvements [Электронный ресурс] // arXiv. — 2025. — № 2509.25164. — URL: https://arxiv.org/abs/2509.25164 (дата обращения: 20.03.2026).
Можно быстро и просто опубликовать свою научную статью в журнале «Молодой Ученый». Сразу предоставляем препринт и справку о публикации.
Опубликовать статью
Молодой учёный №30 (633) июль 2026 г.
Скачать часть журнала с этой статьей(стр. 35-38):
Часть 1 (стр. 1-57)
Расположение в файле:
стр. 1стр. 35-38стр. 57
Похожие статьи
Влияние масштабирования на распознавание объектов нейронной сетью ImageAI YOLOv3
Алгоритмы компьютерного зрения для автоматизированного контроля дефектов поверхностей в машиностроении
Влияние генеративных диффузионных моделей на качество обучающих данных и точность обнаружения объектов моделью YOLO
Автоматизированная система поиска и обнаружения птичьих гнезд на линиях электропередач
Влияние контраста и шума на распознавание изображений нейронной сетью YOLOv3
Сравнительный анализ методов сопоставления изображений для навигации беспилотных летательных аппаратов без глобальных навигационных спутниковых систем
Распознавание и извлечение 3D-моделей по двумерным изображениям
Разработка и исследование методов для распознавания и анализа объектов на изображении с помощью нейронной сети
Эффективность алгоритма объединения данных
Влияние поворота изображения объекта на распознавание нейронной сетью ImageAI YOLOv3

Молодой учёный