1.3. Регрессия с ядром риджа
Регрессия с ядром риджа (KRR) [M2012] сочетает регрессию и классификацию риджа (линейные наименьшие квадраты с регуляризацией L2-нормы) с методом ядер. Таким образом, она обучается линейной функции в пространстве, индуцированном соответствующим ядром и данными. Для нелинейных ядер это соответствует нелинейной функции в исходном пространстве.
Форма модели, обученной KernelRidge, идентична регрессии опорных векторов (SVR). Однако используются разные функции потерь: KRR использует среднеквадратичную ошибку, а регрессия опорных векторов — \(\epsilon\)-нечувствительную потерю, обе с регуляризацией L2. В отличие от SVR, обучение KernelRidge можно выполнить в замкнутой форме, и оно обычно быстрее для наборов данных среднего размера. С другой стороны, полученная модель не разреженная, и, следовательно, медленнее, чем SVR, которая обучается разреженной модели для \(\epsilon > 0\) во время прогнозирования.
На следующем рисунке сравниваются KernelRidge и SVR на искусственном наборе данных, который состоит из синусоидальной целевой функции и сильного шума, добавленного к каждым пятым данным. Обученная модель KernelRidge и SVR изображена, где как сложность/регуляризация, так и ширина ядра RBF были оптимизированы с помощью поиска по сетке. Полученные функции очень похожи; однако, обучение KernelRidge примерно в семь раз быстрее, чем обучение SVR (оба с поиском по сетке). Однако прогнозирование 100000 целевых значений более чем в три раза быстрее с SVR, так как она обучила разреженную модель, используя только примерно 1/3 из 100 обучающих точек в качестве опорных векторов.
На следующем рисунке сравнивается время обучения и прогнозирования KernelRidge и SVR для различных размеров обучающего набора. Обучение KernelRidge быстрее, чем SVR для обучающих наборов среднего размера (менее 1000 образцов); однако, для больших обучающих наборов SVR масштабируется лучше. Что касается времени прогнозирования, SVR быстрее, чем KernelRidge для всех размеров обучающего набора из-за найденного разреженного решения. Обратите внимание, что степень разреженности, а следовательно, и время прогнозирования зависят от параметров \(\epsilon\) и \(C\) SVR; \(\epsilon = 0\) соответствовало бы плотной модели.
Примеры
Ссылки
«Машинное обучение: вероятностный подход» Мерфи, К. П. - глава 14.4.3, стр. 492-493, MIT Press, 2012
© 2007–2025 The scikit-learn developers
Licensed under the 3-clause BSD License.
https://scikit-learn.org/1.6/modules/kernel_ridge.html