Примечание
Перейти к концу для загрузки полного примера кода. или для запуска этого примера в вашем браузере через JupyterLite или Binder
Регрессия Тайла-Сена
Вычисляет регрессию Тайла-Сена на синтетическом наборе данных.
См. Оценщик Тайла-Сена: обобщённый медианный оценщик для получения дополнительной информации об этом регрессоре.
По сравнению с оценщиком OLS (обычный метод наименьших квадратов), оценщик Тайла-Сена устойчив к выбросам. Он имеет точку разрыва около 29,3% в случае простой линейной регрессии, что означает, что он может выдерживать произвольно искаженные данные (выбросы) до 29,3% в двумерном случае.
Оценка модели выполняется путём вычисления наклонов и отрезков по подвыборке всех возможных комбинаций p точек подвыборки. Если подгоняется отрезок, p должно быть больше или равно n_features + 1. Конечный наклон и отрезок затем определяются как пространственная медиана этих наклонов и отрезков.
В определённых случаях регрессия Тайла-Сена работает лучше, чем RANSAC, который также является устойчивым методом. Это проиллюстрировано во втором примере ниже, где выбросы относительно оси x нарушают RANSAC. Настройка параметра residual_threshold RANSAC исправляет это, но, как правило, требуется предварительное знание о данных и характере выбросов. Из-за вычислительной сложности регрессии Тайла-Сена рекомендуется использовать её только для небольших задач с точки зрения числа образцов и признаков. Для больших задач параметр max_subpopulation ограничивает величину всех возможных комбинаций p точек подвыборки до случайной подвыборки, а, следовательно, ограничивает и время выполнения. Таким образом, регрессия Тайла-Сена применима к большим задачам с недостатком некоторых математических свойств, так как она работает со случайной подвыборкой.
# Authors: The scikit-learn developers
# SPDX-License-Identifier: BSD-3-Clause
import time
import matplotlib.pyplot as plt
import numpy as np
from sklearn.linear_model import LinearRegression, RANSACRegressor, TheilSenRegressor
estimators = [
("OLS", LinearRegression()),
("Theil-Sen", TheilSenRegressor(random_state=42)),
("RANSAC", RANSACRegressor(random_state=42)),
]
colors = {"OLS": "turquoise", "Theil-Sen": "gold", "RANSAC": "lightgreen"}
lw = 2
Выбросы только по оси y
np.random.seed(0)
n_samples = 200
# Linear model y = 3*x + N(2, 0.1**2)
x = np.random.randn(n_samples)
w = 3.0
c = 2.0
noise = 0.1 * np.random.randn(n_samples)
y = w * x + c + noise
# 10% outliers
y[-20:] += -20 * x[-20:]
X = x[:, np.newaxis]
plt.scatter(x, y, color="indigo", marker="x", s=40)
line_x = np.array([-3, 3])
for name, estimator in estimators:
t0 = time.time()
estimator.fit(X, y)
elapsed_time = time.time() - t0
y_pred = estimator.predict(line_x.reshape(2, 1))
plt.plot(
line_x,
y_pred,
color=colors[name],
linewidth=lw,
label="%s (fit time: %.2fs)" % (name, elapsed_time),
)
plt.axis("tight")
plt.legend(loc="upper left")
_ = plt.title("Corrupt y")

Выбросы по оси X
np.random.seed(0)
# Linear model y = 3*x + N(2, 0.1**2)
x = np.random.randn(n_samples)
noise = 0.1 * np.random.randn(n_samples)
y = 3 * x + 2 + noise
# 10% outliers
x[-20:] = 9.9
y[-20:] += 22
X = x[:, np.newaxis]
plt.figure()
plt.scatter(x, y, color="indigo", marker="x", s=40)
line_x = np.array([-3, 10])
for name, estimator in estimators:
t0 = time.time()
estimator.fit(X, y)
elapsed_time = time.time() - t0
y_pred = estimator.predict(line_x.reshape(2, 1))
plt.plot(
line_x,
y_pred,
color=colors[name],
linewidth=lw,
label="%s (fit time: %.2fs)" % (name, elapsed_time),
)
plt.axis("tight")
plt.legend(loc="upper left")
plt.title("Corrupt x")
plt.show()

Общее время выполнения сценария: (0 минут 0,544 секунды)
Связанные примеры
© 2007–2025 The scikit-learn developers
Licensed under the 3-clause BSD License.
https://scikit-learn.org/1.6/auto_examples/linear_model/plot_theilsen.html