Глобальный минимум (Global Minimum)

Что такое Глобальный минимум (Global Minimum)?

Глобальный минимум — это точка в пространстве параметров модели машинного обучения, в которой функция потерь достигает наименьшего возможного значения; иными словами, это оптимальное решение задачи оптимизации, при котором ошибка модели на обучающих данных минимальна.

Представьте, что вы находитесь в горной местности и хотите найти самую низкую точку долины. Вы можете двигаться вниз по склону, но есть риск застрять в небольшой впадине (локальном минимуме), которая не является самой низкой точкой во всей долине. Поиск глобального минимума в машинном обучении — это как раз поиск той самой «самой низкой точки» во всём пространстве возможных значений параметров модели.

Исторически задача поиска глобального минимума стала центральной с развитием методов оптимизации в машинном обучении. В 1940–1950‑х годах закладывались основы математической оптимизации, а с появлением первых нейронных сетей в 1960–1980‑х (например, перцептрона Фрэнка Розенблатта) возникла практическая необходимость в эффективных алгоритмах поиска минимумов сложных функций. С развитием глубоких нейронных сетей в 2000–2010‑х годах проблема усугубилась: пространство параметров стало чрезвычайно многомерным и «изрезанным», с множеством локальных минимумов и плато.

Отличие глобального минимума от локального

Важно отличать глобальный минимум от локального минимума:

  • Глобальный минимум — абсолютное наименьшее значение функции потерь во всём пространстве параметров.
  • Локальный минимум — точка, где функция потерь меньше, чем в соседних точках, но не обязательно наименьшая в целом. Для модели это может означать «достаточно хорошее», но не оптимальное решение.

Факторы, осложняющие поиск глобального минимума в нейронных сетях

В контексте нейронных сетей поиск глобального минимума осложняется следующими факторами:

  • высокая размерность пространства параметров (тысячи и миллионы весов);
  • негладкость и многоэкстремальность функции потерь;
  • стохастичность градиентных методов (например, SGD), которые могут «проскакивать» минимумы.

Практические аспекты поиска глобального минимума

На практике достичь глобального минимума часто невозможно или нецелесообразно:

  • во‑первых, это требует колоссальных вычислительных ресурсов;
  • во‑вторых, модель, достигшая глобального минимума на обучающих данных, может переобучиться и плохо работать на новых данных;
  • в‑третьих, многие локальные минимумы оказываются достаточно «хорошими» для практических задач.

Примеры использования

  • в обучении глубоких свёрточных сетей (CNN) для классификации изображений оптимизаторы (Adam, SGD с импульсом) стремятся приблизиться к глобальному минимуму, но обычно останавливаются на «достаточно хорошем» локальном минимуме;
  • в задачах генерации (GAN) поиск глобального минимума осложнён конкуренцией генератора и дискриминатора, что создаёт сложную топологию функции потерь;
  • в трансформерах (например, BERT, GPT) используются сложные схемы оптимизации (warm‑up, scheduling), чтобы избежать застревания в плохих локальных минимумах.

Популярные оптимизаторы, нацеленные на поиск глобального минимума (или приближение к нему)

  • SGD (Stochastic Gradient Descent);
  • Adam;
  • RMSprop;
  • L‑BFGS (для небольших моделей).

Авторизация