Глубокая нейронная сеть способна находить сложные зависимости в данных, но та же способность создаёт риск переобучения. Если число параметров велико, а обучающая выборка ограничена или содержит шум, модель может подстроиться под случайные детали: редкие сочетания признаков, ошибки разметки, особенности измерительного оборудования или повторяющиеся шаблоны в наборе данных. На обучающих примерах такая модель показывает высокую точность, но при работе с новыми объектами ошибается чаще. Поэтому качество сети нужно оценивать не только по ошибке на обучении, но и по разрыву между обучающей и проверочной выборками.
Переобучение особенно заметно в задачах распознавания изображений, обработки естественного языка, медицинской диагностики и анализа временных рядов. В этих областях данные часто неоднородны: изображения снимаются разными устройствами, тексты принадлежат разным авторам, а измерения зависят от условий эксперимента. Если сеть обучалась на узком наборе примеров, она может принять несущественную деталь за устойчивый признак класса. Например, классификатор медицинских снимков может реагировать на отметку аппарата, а не на патологию, если такая отметка случайно совпадает с диагнозом в обучающей выборке. Такой результат опасен тем, что численно выглядит убедительно до проверки на независимых данных.
Первый способ снизить переобучение — ограничить сложность модели. Слишком глубокая или широкая сеть часто получает больше степеней свободы, чем нужно для конкретной задачи. Уменьшение числа слоёв, количества нейронов или размера векторных представлений снижает способность модели запоминать шум. Этот приём не требует сложной математики, но требует аккуратного подбора: чрезмерное упрощение приводит к недообучению, когда сеть не усваивает даже устойчивые закономерности. Практически это означает, что архитектуру следует выбирать через проверочную выборку, а не по максимальной точности на обучении.
Штраф за веса, часто называемый весовым затуханием, добавляет к функции потерь слагаемое, которое наказывает модель за слишком большие значения параметров. Идея проста: если сеть может решить задачу несколькими способами, предпочтение получает решение с меньшими весами и более гладкой зависимостью между входом и выходом. Такой подход снижает чувствительность к отдельным признакам и уменьшает вероятность запоминания случайных выбросов. В современных алгоритмах оптимизации штраф за веса часто отделяют от основной процедуры обновления параметров, потому что это даёт более предсказуемое поведение при адаптивных шагах обучения.
Исключение нейронов, или dropout, во время обучения случайно отключает часть нейронов и заставляет сеть не опираться на один узкий путь передачи сигнала. Каждый шаг обучения проходит как будто на немного изменённой сети, а при применении используется уже полная модель с пересчитанными весами. Такой механизм похож на усреднение множества частных моделей, но не требует хранить каждую из них отдельно. Польза метода особенно заметна в полносвязных слоях и больших сетях, где отдельные признаки могут начать чрезмерно влиять на ответ. Но долю отключаемых нейронов нельзя выбирать механически: слишком сильное исключение замедляет обучение и может ухудшить качество.
Ранняя остановка прекращает обучение до того, как сеть начнёт подстраиваться под шум. Для этого во время обучения выделяют проверочную выборку и после каждой эпохи сравнивают качество на обучающих и проверочных данных. Если ошибка на обучении продолжает снижаться, а ошибка на проверке перестаёт улучшаться или начинает расти, обучение останавливают и возвращают веса лучшей эпохи. Этот метод удобен тем, что не меняет архитектуру и почти не требует дополнительных вычислений. Его слабое место — зависимость от качества проверочной выборки: если она мала или плохо отражает будущие данные, остановка может быть преждевременной или запоздалой.
Расширение обучающей выборки снижает переобучение за счёт новых вариантов исходных примеров. В задачах обработки изображений применяют повороты, сдвиги, изменение яркости, масштабирование, кадрирование и добавление шума. В задачах анализа звука используют изменение темпа, высоты, громкости и фоновых помех. Такой подход учит модель игнорировать несущественные изменения и сохранять внимание на признаках, связанных с целевым классом. Но преобразования должны соответствовать предметной области: поворот цифры «6» на 180 градусов меняет её смысл, а небольшое изменение яркости дорожного знака обычно не меняет класс.
Смешивание обучающих примеров, известное как mixup, создаёт новый пример из двух исходных объектов и одновременно смешивает их метки. Вместо жёсткого требования «это ровно один класс» сеть получает более плавную задачу и учится вести себя устойчиво между наблюдаемыми точками данных. Такой метод снижает резкие границы решения и уменьшает уверенность модели в сомнительных областях пространства признаков. Он полезен, когда классы имеют плавные переходы или когда выборка ограничена. Но для задач, где смешение объектов лишено физического смысла, метод требует осторожной проверки.
Пакетная нормализация стабилизирует распределение промежуточных значений в слоях сети. Во время обучения она нормирует активации внутри мини-пакета и затем применяет обучаемое масштабирование и сдвиг. Первоначально метод предлагался как способ ускорить обучение глубоких сетей, но на практике он также может снижать переобучение за счёт дополнительного шума, возникающего при оценке статистик по мини-пакету. Нормализация не заменяет регуляризацию полностью, потому что её действие зависит от размера мини-пакета, архитектуры и режима применения модели. Тем не менее она часто улучшает устойчивость обучения и делает подбор скорости обучения менее хрупким.
Сглаживание меток уменьшает чрезмерную уверенность модели. Вместо целевой метки, где правильный класс получает вероятность 1, а остальные 0, модель получает немного распределённую цель: правильный класс остаётся главным, но другие классы получают малую долю вероятности. Это полезно, когда разметка может содержать ошибки или когда классы близки по смыслу. Сеть меньше стремится выдавать предельные вероятности и лучше калибрует свои ответы. Однако сглаживание меток может мешать задачам, где важна точная оценка различий между близкими классами, поэтому параметр сглаживания нужно выбирать по проверочным данным.
Снижение скорости обучения и корректное расписание её изменения тоже влияют на переобучение. Слишком большая скорость обучения мешает сети найти устойчивое решение, а слишком малая может привести к долгому запоминанию деталей обучающей выборки. На практике используют постепенное уменьшение скорости обучения, циклические расписания или остановку при отсутствии улучшения на проверке. Эти настройки не являются регуляризацией в узком смысле, но определяют траекторию оптимизации и качество найденного решения. Поэтому их рассматривают вместе с другими мерами защиты от переобучения.
Ансамбль моделей уменьшает зависимость результата от случайностей одного обучения. Несколько сетей обучаются с разной инициализацией, разными частями данных или разными архитектурами, а их ответы усредняются или объединяются голосованием. Ошибки отдельных моделей часто не совпадают полностью, поэтому общий ответ становится устойчивее. Недостаток ансамбля — рост вычислительных затрат при обучении и применении. В учебных и исследовательских задачах этот метод полезен как верхняя оценка достижимого качества, но в производственной системе его применяют только тогда, когда выигрыш оправдывает стоимость.
Контроль качества начинается с правильного разделения данных. Обучающая, проверочная и тестовая выборки должны быть независимыми по смыслу, а не только случайно разделёнными строками таблицы. Если несколько записей относятся к одному пользователю, пациенту, устройству или документу, их нельзя распределять между обучением и проверкой без учёта этой связи. Иначе модель фактически увидит часть будущих данных во время обучения, а оценка качества окажется завышенной. Для временных рядов особенно важно соблюдать порядок времени: будущие наблюдения не должны попадать в обучение при проверке прошлых решений.
Перекрёстная проверка помогает оценить устойчивость результата на малых выборках. Данные делят на несколько частей, модель несколько раз обучают на разных разбиениях и затем усредняют качество. Такой подход показывает, насколько вывод зависит от случайного выбора проверочной части. Для глубоких сетей полная перекрёстная проверка может быть дорогой, но её упрощённые варианты полезны при сравнении архитектур и настроек. Если разброс качества между разбиениями велик, это сигнал, что выборка мала, неоднородна или содержит нестабильные признаки.
Работа с шумной разметкой дополняет регуляризацию. Если часть меток ошибочна, сеть может выучить эти ошибки, особенно при долгом обучении и высокой мощности модели. Для снижения риска применяют очистку данных, повторную разметку спорных объектов, устойчивые функции потерь и проверку примеров с высокой ошибкой. В прикладных задачах это часто даёт больший эффект, чем усложнение архитектуры. Модель не может надёжно обобщать закономерности, если обучающие данные противоречат сами себе.
Выбор метода зависит от причины переобучения. Если данных мало, первым шагом обычно становится расширение выборки и строгая проверка разбиения. Если сеть чрезмерно сложна, помогают уменьшение архитектуры, штраф за веса и исключение нейронов. Если ошибка на проверке начинает расти после нескольких эпох, полезна ранняя остановка. Если модель слишком уверена в ответах, стоит проверить сглаживание меток и калибровку вероятностей. Такой причинный подход лучше, чем добавление всех методов сразу, потому что избыточная регуляризация может скрыть проблему данных или привести к недообучению.
Следовательно, снижение переобучения — не отдельная настройка, а система решений на всех этапах обучения. Необходимо контролировать состав выборок, мощность архитектуры, функцию потерь, процедуру оптимизации и способ оценки качества. Надёжная модель показывает не только высокую точность, но и устойчивое поведение на независимых данных, понятный разрыв между обучением и проверкой, приемлемую калибровку вероятностей и воспроизводимый результат при повторном обучении. В глубоких нейронных сетях именно сочетание регуляризации, аккуратной работы с данными и строгой проверки превращает высокую обучающую точность в практическую обобщающую способность.
Литература:
- Zhang H., Cisse M., Dauphin Y. N., Lopez-Paz D. mixup: Beyond Empirical Risk Minimization. — 2017. — URL: https://arxiv.org/abs/1710.09412.
- Shorten C., Khoshgoftaar T. M. A survey on Image Data Augmentation for Deep Learning. — Journal of Big Data. — 2019. — URL: https://journalofbigdata.springeropen.com/articles/10.1186/s40537–019–0197–0.
- Ioffe S., Szegedy C. Batch Normalization: Accelerating Deep Network Training by Reducing Internal Covariate Shift. — 2015. — URL: https://arxiv.org/abs/1502.03167.
- Muller R., Kornblith S., Hinton G. When Does Label Smoothing Help? — 2019. — URL: https://arxiv.org/abs/1906.02629.
- Loshchilov I., Hutter F. Decoupled Weight Decay Regularization. — 2017. — URL: https://arxiv.org/abs/1711.05101.

