Архитектура модели (Model Architecture)
Что такое Архитектура модели (Model Architecture)?
Архитектура модели — это структура и организация компонентов нейронной сети или иной модели машинного обучения, определяющая способ взаимодействия её элементов (слоёв, узлов, связей) и логику обработки данных.
Представьте, что архитектура модели — это чертёж здания. Как архитектурный план задаёт количество этажей, расположение комнат, тип фундамента и коммуникаций, так и архитектура модели определяет:
- число слоёв и их тип (свёрточные, рекуррентные, полносвязные и т. д.);
- количество нейронов в каждом слое;
- способ соединения нейронов между слоями (прямые связи, обратные связи, пропускные соединения);
- функции активации, применяемые в узлах;
- механизмы регуляризации и нормализации.
От «чертежа» зависит, какие задачи модель сможет решать, насколько эффективно она будет обучаться и как точно — предсказывать.
Историческое развитие архитектур
- В 1940–1950‑х годах появились первые модели нейронов (например, перцептрон Фрэнка Розенблатта, 1958), заложившие основы многослойных сетей.
- В 1980‑х — 1990‑х годах активно развивались многослойные перцептроны (MLP) и алгоритмы обратного распространения ошибки.
- В 2010‑х годах произошёл взрыв интереса к глубоким сетям (Deep Learning): свёрточные сети (CNN, LeCun, 1989, широкое распространение — после победы AlexNet на ImageNet в 2012), рекуррентные сети (RNN, LSTM), трансформеры (Transformer, Vaswani et al., 2017).
- Сегодня активно исследуются архитектуры с разреженными связями, нейроморфные модели, гибридные схемы.
Чем отличается от смежных понятий
- Гиперпараметры — это настройки, которые задаются до обучения (например, скорость обучения, размер батча). Архитектура — более фундаментальная характеристика, определяющая саму «форму» модели.
- Параметры модели (веса, смещения) — это то, что учится в процессе тренировки. Архитектура задаёт пространство, в котором эти параметры могут меняться.
- Топология сети — иногда используется как синоним, но чаще обозначает лишь схему соединений, без учёта типов слоёв и функций активации.
Примеры использования
- CNN (Convolutional Neural Networks) — архитектура для обработки изображений (например, ResNet, VGG, Inception).
- RNN/LSTM/GRU — архитектуры для работы с последовательностями (текст, речь, временные ряды).
- Transformer — архитектура, ставшая основой для современных языковых моделей (GPT, BERT, T5).
- Autoencoder — архитектура для сжатия данных и обучения представлений.
- GAN (Generative Adversarial Networks) — архитектура из двух конкурирующих сетей (генератор и дискриминатор) для генерации данных.
- Multi-task architectures — модели, одновременно решающие несколько задач (например, классификация и сегментация в компьютерном зрении).
