Примечание
Перейти к концу для скачивания полного кода примера или для запуска этого примера в вашем браузере через JupyterLite или Binder
Выбор признаков по одному
Этот ноутбук — пример использования выбора признаков по одному для повышения точности классификации на шумном наборе данных.
В этом примере к набору данных ириса добавлены некоторые шумные (неинформативные) признаки. Машина опорных векторов (SVM) используется для классификации набора данных как до, так и после применения выбора признаков по одному. Для каждого признака мы строим значения p для выбора признаков по одному и соответствующие веса SVM. С помощью этого мы сравним точность модели и рассмотрим влияние выбора признаков по одному на веса модели.
# Authors: The scikit-learn developers # SPDX-License-Identifier: BSD-3-Clause
Генерация примера данных
import numpy as np from sklearn.datasets import load_iris from sklearn.model_selection import train_test_split # The iris dataset X, y = load_iris(return_X_y=True) # Some noisy data not correlated E = np.random.RandomState(42).uniform(0, 0.1, size=(X.shape[0], 20)) # Add the noisy data to the informative features X = np.hstack((X, E)) # Split dataset to select feature and evaluate the classifier X_train, X_test, y_train, y_test = train_test_split(X, y, stratify=y, random_state=0)
Выбор признаков по одному
Выбор признаков по одному с помощью F-теста для оценки признаков. Мы используем функцию выбора по умолчанию для выбора четырех наиболее значимых признаков.
from sklearn.feature_selection import SelectKBest, f_classif selector = SelectKBest(f_classif, k=4) selector.fit(X_train, y_train) scores = -np.log10(selector.pvalues_) scores /= scores.max()
import matplotlib.pyplot as plt
X_indices = np.arange(X.shape[-1])
plt.figure(1)
plt.clf()
plt.bar(X_indices - 0.05, scores, width=0.2)
plt.title("Feature univariate score")
plt.xlabel("Feature number")
plt.ylabel(r"Univariate score ($-Log(p_{value})$)")
plt.show()

Из всего набора признаков только 4 из исходных признаков значимы. Мы видим, что они имеют наибольший балл с выбором признаков по одному.
Сравнение с SVM
Без выбора признаков по одному
from sklearn.pipeline import make_pipeline
from sklearn.preprocessing import MinMaxScaler
from sklearn.svm import LinearSVC
clf = make_pipeline(MinMaxScaler(), LinearSVC())
clf.fit(X_train, y_train)
print(
"Classification accuracy without selecting features: {:.3f}".format(
clf.score(X_test, y_test)
)
)
svm_weights = np.abs(clf[-1].coef_).sum(axis=0)
svm_weights /= svm_weights.sum()
Classification accuracy without selecting features: 0.789
После выбора признаков по одному
clf_selected = make_pipeline(SelectKBest(f_classif, k=4), MinMaxScaler(), LinearSVC())
clf_selected.fit(X_train, y_train)
print(
"Classification accuracy after univariate feature selection: {:.3f}".format(
clf_selected.score(X_test, y_test)
)
)
svm_weights_selected = np.abs(clf_selected[-1].coef_).sum(axis=0)
svm_weights_selected /= svm_weights_selected.sum()
Classification accuracy after univariate feature selection: 0.868
plt.bar(
X_indices - 0.45, scores, width=0.2, label=r"Univariate score ($-Log(p_{value})$)"
)
plt.bar(X_indices - 0.25, svm_weights, width=0.2, label="SVM weight")
plt.bar(
X_indices[selector.get_support()] - 0.05,
svm_weights_selected,
width=0.2,
label="SVM weights after selection",
)
plt.title("Comparing feature selection")
plt.xlabel("Feature number")
plt.yticks(())
plt.axis("tight")
plt.legend(loc="upper right")
plt.show()

Без выбора признаков по одному SVM присваивает большой вес первым 4 исходным значимым признакам, но также выбирает многие неинформативные признаки. Применение выбора признаков по одному перед SVM увеличивает вес SVM, присваиваемый значимым признакам, и тем самым улучшит классификацию.
Общее время выполнения сценария: (0 минут 0,198 секунды)
Связанные примеры
© 2007–2025 The scikit-learn developers
Licensed under the 3-clause BSD License.
https://scikit-learn.org/1.6/auto_examples/feature_selection/plot_feature_selection.html