Блок свёрточных слоёв (Convolutional Layer Block)
Структурный элемент свёрточной нейронной сети (CNN), состоящий из последовательно расположенных свёрточных слоёв (возможно, в комбинации с другими типами слоёв — например, слоями пулинга или нормализации), предназначенный для извлечения иерархических признаков из входных данных (чаще всего изображений).
Представьте, что вы разглядываете картину: сначала вы замечаете крупные элементы — фигуры, здания, общий фон; затем, присмотревшись, различаете детали — текстуру одежды, мазки кисти, мелкие предметы.
Блок свёрточных слоёв работает похожим образом: на первых слоях сеть «видит» простые паттерны (края, углы, цветовые переходы), а по мере продвижения вглубь архитектуры — всё более сложные и абстрактные признаки (формы объектов, их части, комбинации деталей).
Исторический контекст
Исторически свёрточные нейронные сети начали активно развиваться в 1980–1990‑х годах. Ключевую роль сыграли работы Яна Лекуна (Yann LeCun), в частности, разработка сети LeNet‑5 (1998 г.), которая успешно применялась для распознавания рукописных цифр. Именно в таких архитектурах впервые системно использовались блоки свёрточных слоёв. Со временем их структура усложнялась: появились более глубокие сети (AlexNet, 2012 г.; VGG, 2014 г.; ResNet, 2015 г.), где блоки стали включать десятки слоёв и дополнительные механизмы (остаточные связи, пакетную нормализацию).
Отличия от смежных понятий
- Отдельный свёрточный слой — лишь один элемент блока; он выполняет свёртку с фиксированным ядром, тогда как блок объединяет несколько таких слоёв и сопутствующие операции.
- Полносвязный слой — в отличие от свёрточных блоков, обрабатывает всю входную карту признаков целиком, не сохраняя пространственную структуру; обычно используется на финальных этапах сети для классификации.
- Блок трансформера — в отличие от свёрточных блоков, ориентирован на обработку последовательностей (текст, аудио) и использует механизмы внимания, а не локальные свёртки.
Примеры использования
- В архитектуре AlexNet (2012) блок свёрточных слоёв состоит из пяти свёрточных слоёв с чередующимися слоями пулинга, что позволило достичь прорывных результатов в ImageNet.
- В VGG-16 (2014) используются блоки из двух‑трёх свёрточных слоёв с небольшими ядрами (3 × 3), что обеспечивает глубокое извлечение признаков.
- В ResNet (2015) блоки дополнены остаточными связями (skip connections), что позволяет обучать сети глубиной в сотни слоёв без деградации качества.
- В задачах сегментации изображений (например, U‑Net) блоки свёрточных слоёв комбинируются с блоками повышающей дискретизации (upsampling) для точного восстановления пространственной структуры.
