Глобальный минимум (Global Minimum)
Глобальный минимум — это точка в пространстве параметров модели машинного обучения, в которой функция потерь достигает наименьшего возможного значения; иными словами, это оптимальное решение задачи оптимизации, при котором ошибка модели на обучающих данных минимальна.
Представьте, что вы находитесь в горной местности и хотите найти самую низкую точку долины. Вы можете двигаться вниз по склону, но есть риск застрять в небольшой впадине (локальном минимуме), которая не является самой низкой точкой во всей долине. Поиск глобального минимума в машинном обучении — это как раз поиск той самой «самой низкой точки» во всём пространстве возможных значений параметров модели.
Исторически задача поиска глобального минимума стала центральной с развитием методов оптимизации в машинном обучении. В 1940–1950‑х годах закладывались основы математической оптимизации, а с появлением первых нейронных сетей в 1960–1980‑х (например, перцептрона Фрэнка Розенблатта) возникла практическая необходимость в эффективных алгоритмах поиска минимумов сложных функций. С развитием глубоких нейронных сетей в 2000–2010‑х годах проблема усугубилась: пространство параметров стало чрезвычайно многомерным и «изрезанным», с множеством локальных минимумов и плато.
Отличие глобального минимума от локального
Важно отличать глобальный минимум от локального минимума:
- Глобальный минимум — абсолютное наименьшее значение функции потерь во всём пространстве параметров.
- Локальный минимум — точка, где функция потерь меньше, чем в соседних точках, но не обязательно наименьшая в целом. Для модели это может означать «достаточно хорошее», но не оптимальное решение.
Факторы, осложняющие поиск глобального минимума в нейронных сетях
В контексте нейронных сетей поиск глобального минимума осложняется следующими факторами:
- высокая размерность пространства параметров (тысячи и миллионы весов);
- негладкость и многоэкстремальность функции потерь;
- стохастичность градиентных методов (например, SGD), которые могут «проскакивать» минимумы.
Практические аспекты поиска глобального минимума
На практике достичь глобального минимума часто невозможно или нецелесообразно:
- во‑первых, это требует колоссальных вычислительных ресурсов;
- во‑вторых, модель, достигшая глобального минимума на обучающих данных, может переобучиться и плохо работать на новых данных;
- в‑третьих, многие локальные минимумы оказываются достаточно «хорошими» для практических задач.
Примеры использования
- в обучении глубоких свёрточных сетей (CNN) для классификации изображений оптимизаторы (Adam, SGD с импульсом) стремятся приблизиться к глобальному минимуму, но обычно останавливаются на «достаточно хорошем» локальном минимуме;
- в задачах генерации (GAN) поиск глобального минимума осложнён конкуренцией генератора и дискриминатора, что создаёт сложную топологию функции потерь;
- в трансформерах (например, BERT, GPT) используются сложные схемы оптимизации (warm‑up, scheduling), чтобы избежать застревания в плохих локальных минимумах.
Популярные оптимизаторы, нацеленные на поиск глобального минимума (или приближение к нему)
- SGD (Stochastic Gradient Descent);
- Adam;
- RMSprop;
- L‑BFGS (для небольших моделей).
