MissingIndicator
- classsklearn.impute.MissingIndicator(*, missing_values=nan, features='missing-only', sparse='auto', error_on_new=True)[source]
-
Двоичные индикаторы для пропущенных значений.
Обратите внимание, что этот компонент обычно не следует использовать в обычном
Pipeline, состоящем из преобразователей и классификатора, но его можно добавить с помощьюFeatureUnionилиColumnTransformer.Дополнительные сведения см. в Руководстве пользователя.
Добавлен в версии 0.20.
- Параметры:
-
- missing_valuesint, float, str, np.nan или None, по умолчанию=np.nan
-
Заполнитель для пропущенных значений. Все вхождения
missing_valuesбудут импутированы. Для фреймов данных pandas с типом данных nullable integer и пропущенными значениямиmissing_valuesследует установить наnp.nan, посколькуpd.NAбудет преобразовано вnp.nan. - features{‘missing-only’, ‘all’}, по умолчанию=’missing-only’
-
Определяет, должен ли массив индикаторов представлять все или подмножество признаков.
- Если
'missing-only'(по умолчанию), массив индикаторов будет представлять только признаки, содержащие пропущенные значения во время выполнения fit. - Если
'all', массив индикаторов будет представлять все признаки.
- Если
- sparsebool или ‘auto’, по умолчанию=’auto’
-
Определяет, должен ли формат массива индикаторов быть разреженным или плотным.
- Если
'auto'(по умолчанию), массив индикаторов будет иметь тот же тип, что и входные данные. - Если
True, массив индикаторов будет разреженной матрицей. - Если
False, массив индикаторов будет массивом NumPy.
- Если
- error_on_newbool, по умолчанию=True
-
Если
True,transformбудет вызывать ошибку, если существуют признаки с пропущенными значениями, которые не имеют пропущенных значений вfit. Это применимо только когдаfeatures='missing-only'.
- Атрибуты:
-
- features_массив с формой (n_missing_features,) или (n_features,)
-
Индексы признаков, которые будут возвращены при вызове
transform. Они вычисляются во времяfit. Еслиfeatures='all',features_равноrange(n_features). - n_features_in_int
-
Количество признаков, увиденных во время fit.
Добавлен в версии 0.24.
-
feature_names_in_массив с формой (
n_features_in_,) -
Имена признаков, увиденные во время fit. Определяются только тогда, когда
Xимеют имена признаков, которые являются строками.Добавлен в версии 1.0.
См. также
SimpleImputer-
Унивариатная импутация пропущенных значений.
IterativeImputer-
Мультивариатная импутация пропущенных значений.
Примеры
>>> import numpy as np >>> from sklearn.impute import MissingIndicator >>> X1 = np.array([[np.nan, 1, 3], ... [4, 0, np.nan], ... [8, 1, 0]]) >>> X2 = np.array([[5, 1, np.nan], ... [np.nan, 2, 3], ... [2, 4, 0]]) >>> indicator = MissingIndicator() >>> indicator.fit(X1) MissingIndicator() >>> X2_tr = indicator.transform(X2) >>> X2_tr array([[False, True], [ True, False], [False, False]])- fit(X, y=None)[source]
-
Обучить преобразователь на
X.- Параметры:
-
- X{array-like, sparse matrix} с формой (n_samples, n_features)
-
Входные данные, где
n_samples— количество выборок, аn_features— количество признаков. - yИгнорируется
-
Не используется, присутствует для согласованности API по умолчанию.
- Возвращает:
-
- selfобъект
-
Обученная модель.
- fit_transform(X, y=None)[source]
-
Генерировать индикатор пропущенных значений для
X.- Параметры:
-
- X{array-like, sparse matrix} с формой (n_samples, n_features)
-
Входные данные для заполнения.
- yИгнорируется
-
Не используется, присутствует для согласованности API по умолчанию.
- Возвращает:
-
- Xt{ndarray, sparse matrix} с формой (n_samples, n_features) или (n_samples, n_features_with_missing)
-
Индикатор пропущенных значений для входных данных. Тип данных
Xtбудет булевым.
- get_feature_names_out(input_features=None)[source]
-
Получить имена выходных признаков для преобразования.
- Параметры:
-
- input_featuresarray-like из str или None, по умолчанию=None
-
Входные признаки.
- Если
input_featuresравноNone, тоfeature_names_in_используется как имена признаков в. Еслиfeature_names_in_не определено, то генерируются следующие имена входных признаков:["x0", "x1", ..., "x(n_features_in_ - 1)"]. - Если
input_featuresявляется array-like, тоinput_featuresдолжно совпадать сfeature_names_in_, еслиfeature_names_in_определено.
- Если
- Возвращает:
-
- feature_names_outмассив объектов str
-
Имена преобразованных признаков.
- get_metadata_routing()[source]
-
Получить маршрутизацию метаданных этого объекта.
Пожалуйста, ознакомьтесь с Руководством пользователя о том, как работает механизм маршрутизации.
- Возвращает:
-
- routingMetadataRequest
-
А
MetadataRequest, содержащий информацию о маршрутизации.
- get_params(deep=True)[source]
-
Получить параметры этого оценщика.
- Параметры:
-
- deepbool, по умолчанию=True
-
Если True, вернёт параметры этого оценщика и вложенных подобъектов, являющихся оценщиками.
- Возвращает:
-
- paramsdict
-
Имена параметров, сопоставленные со значениями.
- set_output(*, transform=None)[source]
-
Установить контейнер вывода.
См. Введение в API set_output для примера использования API.
- Параметры:
-
- transform{“default”, “pandas”, “polars”}, по умолчанию=None
-
Настройка вывода
transformиfit_transform.-
"default": Формат вывода по умолчанию для преобразователя -
"pandas": Вывод в формате DataFrame -
"polars": Вывод в формате Polars -
None: Настройка преобразования не изменяется
Добавлен в версии 1.4:
"polars"опция была добавлена. -
- Возвращает:
-
- selfэкземпляр оценщика
-
Экземпляр оценщика.
- set_params(**params)[source]
-
Установить параметры этого оценщика.
Метод работает с простыми оценщиками, а также со вложенными объектами (такими как
Pipeline). Последние имеют параметры в форме<component>__<parameter>, чтобы можно было обновлять каждый компонент вложенного объекта.- Параметры:
-
- **paramsdict
-
Параметры оценщика.
- Возвращает:
-
- selfэкземпляр оценщика
-
Экземпляр оценщика.
- transform(X)[source]
-
Генерирует индикатор пропущенных значений для
X.- Параметры:
-
- X{array-like, sparse matrix} of shape (n_samples, n_features)
-
Входные данные для дополнения.
- Возвращает:
-
- Xt{ndarray, sparse matrix} of shape (n_samples, n_features) or (n_samples, n_features_with_missing)
-
Индикатор пропущенных значений для входных данных. Тип данных
Xtбудет булевым.
© 2007–2025 The scikit-learn developers
Licensed under the 3-clause BSD License.
https://scikit-learn.org/1.6/modules/generated/sklearn.impute.MissingIndicator.html