Обучающий набор данных (Training Dataset)

Что такое Обучающий набор данных (Training Dataset)?

Совокупность примеров (данных), используемых для обучения модели машинного обучения или нейронной сети, то есть для настройки её параметров в процессе тренировки.

Представьте, что вы учите ребёнка различать фрукты: показываете ему яблоки, груши, бананы, называете их и объясняете отличительные признаки. Со временем ребёнок учится самостоятельно распознавать эти фрукты. В машинном обучении роль «учителя» выполняет обучающий набор данных: он «показывает» модели примеры, снабжённые правильными ответами (метками), чтобы она научилась выявлять закономерности и делать верные предсказания на новых, неизвестных данных.

История развития

Исторически работа с обучающими данными восходит к самым ранним этапам развития машинного обучения. Уже в 1950–1960‑х годах исследователи, разрабатывая перцептроны и другие простейшие модели, использовали размеченные наборы данных для их обучения. С развитием технологий и ростом вычислительных мощностей объёмы и сложность обучающих наборов неуклонно росли. Сегодня для обучения современных нейросетей (особенно в задачах компьютерного зрения и обработки естественного языка) требуются огромные датасеты, насчитывающие миллионы и даже миллиарды примеров. Например, знаменитый датасет ImageNet содержит более 14 млн размеченных изображений, а набор данных Common Crawl для языковых моделей включает петабайты текстовой информации из интернета.


Отличие от других типов датасетов

Важно отличать обучающий набор данных от других типов датасетов, используемых в ML:

  • Валидационный набор данных — используется для периодической проверки качества модели в процессе обучения и настройки гиперпараметров (например, скорости обучения), чтобы избежать переобучения.
  • Тестовый набор данных — применяется только после завершения обучения для окончательной оценки производительности модели на полностью новых данных, которые она никогда «не видела».

Примеры использования

Обучающие наборы данных лежат в основе практически всех задач машинного обучения. Вот несколько примеров их использования:

  • в свёрточных нейронных сетях (CNN) для классификации изображений (например, распознавание кошек и собак на фото) обучающий набор состоит из тысяч или миллионов размеченных изображений;
  • в рекуррентных нейронных сетях (RNN) и трансформерах для обработки текста обучающий набор включает пары «входное предложение — правильный перевод» (в машинном переводе) или «вопрос — ответ» (в чат‑ботах);
  • в задачах регрессии (например, предсказание цены дома) обучающий набор содержит примеры с признаками домов (площадь, количество комнат, район) и соответствующими ценами.

Популярные открытые обучающие наборы данных

  • MNIST — набор рукописных цифр для задач классификации;
  • CIFAR‑10 и CIFAR‑100 — наборы изображений для компьютерного зрения;
  • IMDB Reviews — набор отзывов о фильмах для анализа тональности текста;
  • COCO (Common Objects in Context) — крупный датасет для задач детекции и сегментации объектов на изображениях.

Авторизация