Обучающий набор данных (Training Dataset)
Совокупность примеров (данных), используемых для обучения модели машинного обучения или нейронной сети, то есть для настройки её параметров в процессе тренировки.
История развития
Исторически работа с обучающими данными восходит к самым ранним этапам развития машинного обучения. Уже в 1950–1960‑х годах исследователи, разрабатывая перцептроны и другие простейшие модели, использовали размеченные наборы данных для их обучения. С развитием технологий и ростом вычислительных мощностей объёмы и сложность обучающих наборов неуклонно росли. Сегодня для обучения современных нейросетей (особенно в задачах компьютерного зрения и обработки естественного языка) требуются огромные датасеты, насчитывающие миллионы и даже миллиарды примеров. Например, знаменитый датасет ImageNet содержит более 14 млн размеченных изображений, а набор данных Common Crawl для языковых моделей включает петабайты текстовой информации из интернета.
Отличие от других типов датасетов
Важно отличать обучающий набор данных от других типов датасетов, используемых в ML:
- Валидационный набор данных — используется для периодической проверки качества модели в процессе обучения и настройки гиперпараметров (например, скорости обучения), чтобы избежать переобучения.
- Тестовый набор данных — применяется только после завершения обучения для окончательной оценки производительности модели на полностью новых данных, которые она никогда «не видела».
Примеры использования
Обучающие наборы данных лежат в основе практически всех задач машинного обучения. Вот несколько примеров их использования:
- в свёрточных нейронных сетях (CNN) для классификации изображений (например, распознавание кошек и собак на фото) обучающий набор состоит из тысяч или миллионов размеченных изображений;
- в рекуррентных нейронных сетях (RNN) и трансформерах для обработки текста обучающий набор включает пары «входное предложение — правильный перевод» (в машинном переводе) или «вопрос — ответ» (в чат‑ботах);
- в задачах регрессии (например, предсказание цены дома) обучающий набор содержит примеры с признаками домов (площадь, количество комнат, район) и соответствующими ценами.
Популярные открытые обучающие наборы данных
- MNIST — набор рукописных цифр для задач классификации;
- CIFAR‑10 и CIFAR‑100 — наборы изображений для компьютерного зрения;
- IMDB Reviews — набор отзывов о фильмах для анализа тональности текста;
- COCO (Common Objects in Context) — крупный датасет для задач детекции и сегментации объектов на изображениях.
