Локальная чувствительность (Local Sensitivity)
Характеристика модели машинного обучения, отражающая степень изменения её выходных данных при малых возмущениях входных данных в окрестности конкретной точки.
В контексте нейронных сетей локальная чувствительность позволяет оценить, насколько модель «реактивна» к незначительным изменениям входных признаков в определённой области пространства признаков. Это важно для понимания устойчивости модели, её интерпретируемости и выявления потенциальных уязвимостей (например, к состязательным атакам).
Представьте, что вы балансируете на канате. Если слегка подтолкнуть вас вбок, то в зависимости от вашего текущего положения и навыков, реакция будет разной: в одном случае вы легко сохраните равновесие, в другом — потеряете его. Локальная чувствительность модели — это как раз оценка того, насколько «устойчиво» она «стоит» на своих «ногах» при небольших внешних воздействиях в конкретной точке.
Исторический контекст
Интерес к чувствительности моделей возрос с развитием глубокого обучения и осознанием того, что даже незначительные изменения входных данных (незаметные для человека) могут кардинально менять предсказания нейронных сетей. Исследования в этой области активизировались в 2010‑х годах, когда были продемонстрированы уязвимости глубоких нейронных сетей к состязательным примерам (adversarial examples). Работы таких исследователей, как Christian Szegedy, Ian Goodfellow и др., показали, что модели могут быть крайне чувствительны к специально сконструированным возмущениям, что подтолкнуло сообщество к изучению методов оценки и повышения устойчивости моделей.
Смежные понятия
- Глобальная чувствительность — оценивает влияние изменений входных данных на выход модели в целом, по всему пространству признаков, а не в локальной окрестности.
- Устойчивость (robustness) — более широкое понятие, характеризующее способность модели сохранять качество работы при различных возмущениях (не только малых и локальных). Локальная чувствительность — один из инструментов для оценки устойчивости.
- Интерпретируемость (interpretability) — понимание того, как модель принимает решения. Высокая локальная чувствительность может затруднять интерпретируемость, так как небольшие изменения входных данных приводят к резким изменениям выходных.
Примеры использования
- Анализ уязвимостей. Оценка локальной чувствительности помогает выявлять участки пространства признаков, где модель особенно уязвима к состязательным атакам. Например, в компьютерном зрении можно анализировать, как небольшие изменения пикселей изображения влияют на предсказание модели.
- Улучшение устойчивости. Методы, такие как adversarial training (обучение на состязательных примерах), используют оценку локальной чувствительности для повышения устойчивости моделей. Модель обучается на примерах, специально сконструированных для «взлома» её предсказаний, что делает её менее чувствительной к подобным атакам.
- Интерпретация моделей. Методы, такие как LIME (Local Interpretable Model-agnostic Explanations) и SHAP (SHapley Additive exPlanations), косвенно учитывают локальную чувствительность, анализируя, как изменения отдельных признаков влияют на предсказание в окрестности конкретной точки.
- Оптимизация гиперпараметров. Анализ локальной чувствительности может помочь в выборе гиперпараметров модели, чтобы снизить её чувствительность к шуму в данных.
Популярные реализации и инструменты
- библиотеки для генерации состязательных примеров (например, Foolbox, Adversarial Robustness Toolbox);
- методы визуализации чувствительности (например, saliency maps — карты значимости, показывающие, какие пиксели изображения наиболее влияют на предсказание модели);
- фреймворки для интерпретации моделей (например, SHAP, LIME), которые позволяют анализировать локальную чувствительность отдельных признаков.
