Spec-Zone.ru › scikit-learn

SelectKBest

classsklearn.feature_selection.SelectKBest(score_func=<function f_classif>, *, k=10)[source]

Выберите признаки в соответствии с k наибольшими значениями оценок.

Подробнее см. в Руководстве пользователя.

Параметры:
score_funccallable, по умолчанию=f_classif

Функция, принимающая два массива X и y и возвращающая пару массивов (scores, pvalues) или один массив со значениями оценок. По умолчанию используется f_classif (см. «См. также» ниже). Функция по умолчанию работает только с задачами классификации.

Добавлена в версии 0.18.

kint или “all”, по умолчанию=10

Количество лучших признаков для выбора. Опция “all” отключает выбор, для использования в поиске параметров.

Атрибуты:
scores_массив-подобный, форма (n_features,)

Оценки признаков.

pvalues_массив-подобный, форма (n_features,)

Значения p оценок признаков, None, если score_func возвратила только оценки.

n_features_in_int

Количество признаков, увиденных во время fit.

Добавлена в версии 0.24.

feature_names_in_массив numpy формы (n_features_in_,)

Названия признаков, увиденные во время fit. Определены только тогда, когда X имеет имена признаков, которые все являются строками.

Добавлена в версии 1.0.

См. также

f_classif

ANOVA F-значение между меткой/признаком для задач классификации.

mutual_info_classif

Взаимная информация для дискретного целевого значения.

chi2

Chi-квадрат статистика для неотрицательных признаков для задач классификации.

f_regression

F-значение между меткой/признаком для задач регрессии.

mutual_info_regression

Взаимная информация для непрерывного целевого значения.

SelectPercentile

Выбрать признаки на основе процентиля наивысших оценок.

SelectFpr

Выбор признаков на основе теста с ложноположительной вероятностью.

SelectFdr

Выбор признаков на основе оценки ложного открытия.

SelectFwe

Выбор признаков на основе семейной ошибки первого рода.

GenericUnivariateSelect

Выборочный отбор признаков с настраиваемым режимом.

Примечания

Связи между признаками с одинаковыми значениями оценок будут нарушены непредсказуемым образом.

Этот фильтр поддерживает без учителя выбор признаков, который запрашивает только X для вычисления оценок.

Примеры

>>> from sklearn.datasets import load_digits
>>> from sklearn.feature_selection import SelectKBest, chi2
>>> X, y = load_digits(return_X_y=True)
>>> X.shape
(1797, 64)
>>> X_new = SelectKBest(chi2, k=20).fit_transform(X, y)
>>> X_new.shape
(1797, 20)
fit(X, y=None)[source]

Выполнить функцию оценки на (X, y) и получить соответствующие признаки.

Параметры:
Xмассив-подобный, форма (n_samples, n_features)

Входные образцы обучения.

yмассив-подобный, форма (n_samples,) или None

Значения целевой переменной (метки классов в классификации, вещественные числа в регрессии). Если селектор работает без учителя, то y может быть установлено в None.

Возвращает:
selfобъект

Возвращает сам экземпляр.

fit_transform(X, y=None, **fit_params)[source]

Обучить по данным, затем преобразовать их.

Обучает трансформатор на X и y с необязательными параметрами fit_params и возвращает преобразованную версию X.

Параметры:
Xмассив-подобный, форма (n_samples, n_features)

Входные образцы.

yмассив-подобный, форма (n_samples,) или (n_samples, n_outputs), по умолчанию=None

Значения целевой переменной (None для преобразований без учителя).

**fit_paramsdict

Дополнительные параметры обучения.

Возвращает:
X_newмассив numpy формы (n_samples, n_features_new)

Преобразованный массив.

get_feature_names_out(input_features=None)[source]

Маска имён признаков в соответствии с выбранными признаками.

Параметры:
input_featuresмассив-подобный из str или None, по умолчанию=None

Входные признаки.

  • Если input_features является None, тогда feature_names_in_ используется как имена признаков. Если feature_names_in_ не определено, то следующие имена входных признаков генерируются: ["x0", "x1", ..., "x(n_features_in_ - 1)"].
  • Если input_features является массивом-подобным, тогда input_features должен совпадать с feature_names_in_ если feature_names_in_ определено.
Возвращает:
feature_names_outмассив объектов str

Преобразованные имена признаков.

get_metadata_routing()[source]

Получить метаданные маршрутизации этого объекта.

Пожалуйста, ознакомьтесь с Руководством пользователя о том, как работает механизм маршрутизации.

Возвращает:
routingMetadataRequest

MetadataRequest encapsulating routing information.

get_params(deep=True)[source]

Получить параметры этого оценщика.

Параметры:
deepbool, по умолчанию=True

Если True, вернет параметры этого оценщика и вложенных под-объектов, которые являются оценщиками.

Возвращает:
paramsdict

Имена параметров, сопоставленные со значениями.

get_support(indices=False)[source]

Получить маску или целочисленный индекс выбранных признаков.

Параметры:
indicesbool, по умолчанию=False

Если True, возвращаемое значение будет массивом целых чисел, а не булевой маской.

Возвращает:
supportмассив

Индекс, который выбирает сохраненные признаки из вектора признаков. Если indices равно False, это булевый массив формы [# входные признаки], где элемент равен True, если соответствующий признак выбран для сохранения. Если indices равно True, это целочисленный массив формы [# выходные признаки], значения которого являются индексами во входном векторе признаков.

inverse_transform(X)[source]

Обратить операцию преобразования.

Параметры:
Xмассив формы [n_samples, n_selected_features]

Входные образцы.

Возвращает:
X_rмассив формы [n_samples, n_original_features]

X с добавленными столбцами нулей в тех местах, где признаки были удалены методом transform.

set_output(*, transform=None)[source]

Установить контейнер вывода.

См. Введение в API set_output для примера использования API.

Параметры:
transform{“default”, “pandas”, “polars”}, по умолчанию=None

Настройка вывода transform и fit_transform.

  • "default": Формат вывода по умолчанию для преобразователя
  • "pandas": Вывод DataFrame
  • "polars": Вывод Polars
  • None: Настройка преобразования не изменяется

Добавлен в версии 1.4: "polars" опция была добавлена.

Возвращает:
selfэкземпляр оценщика

Экземпляр оценщика.

set_params(**params)[source]

Установить параметры этого оценщика.

Метод работает как с простыми оценщиками, так и с вложенными объектами (такими как Pipeline). У последних есть параметры вида <component>__<parameter>, что позволяет обновлять каждый компонент вложенного объекта.

Параметры:
**paramsdict

Параметры оценщика.

Возвращает:
selfэкземпляр оценщика

Экземпляр оценщика.

transform(X)[source]

Сократить X до выбранных признаков.

Параметры:
Xмассив формы [n_samples, n_features]

Входные образцы.

Возвращает:
X_rмассив формы [n_samples, n_selected_features]

Входные образцы только с выбранными признаками.

Примеры из галереи

Основные улучшения для scikit-learn 1.1

Пайплайн ANOVA SVM

Выборочная обработка признаков

Объединение нескольких методов извлечения признаков

Выбор метода понижения размерности с помощью Pipeline и GridSearchCV

© 2007–2025 The scikit-learn developers
Licensed under the 3-clause BSD License.
https://scikit-learn.org/1.6/modules/generated/sklearn.feature_selection.SelectKBest.html

Spec-Zone.ru

Настройки Оффлайн Что нового Помощь О нас
Spec-Zone .ru
спецификации, руководства, описания, API