Spec-Zone.ru › scikit-learn

Бинаризатор

classsklearn.preprocessing.Binarizer(*, threshold=0.0, copy=True)[source]

Бинаризует данные (устанавливает значения признаков в 0 или 1) в соответствии с порогом.

Значения, большие, чем порог, отображаются как 1, а значения, меньшие или равные порогу, отображаются как 0. При стандартном пороге 0 только положительные значения отображаются как 1.

Бинаризация является распространённой операцией с данными подсчёта текстовых данных, где аналитик может решить рассматривать только наличие или отсутствие признака, а не количественное число появлений, например.

Она также может использоваться как этап предварительной обработки для оценок, которые учитывают булевы случайные переменные (например, смоделированные с помощью биномиального распределения в байесовском контексте).

Подробнее см. в Руководстве пользователя.

Параметры:
thresholdfloat, по умолчанию=0.0

Значения признаков, меньшие или равные этому, заменяются на 0, а большие - на 1. Порог не может быть меньше 0 для операций с разреженными матрицами.

copybool, по умолчанию=True

Установите в False для выполнения бинаризации на месте и избегания копирования (если входные данные уже представляют собой массив NumPy или разреженную матрицу scipy CSR).

Атрибуты:
n_features_in_int

Количество признаков, увиденных во время fit.

Добавлен в версии 0.24.

feature_names_in_ndarray формы (n_features_in_,)

Имена признаков, увиденных во время fit. Определены только тогда, когда X имеет имена признаков, которые все являются строками.

Добавлен в версии 1.0.

См. также

binarize

Эквивалентная функция без API оценщика.

KBinsDiscretizer

Разбиение непрерывных данных на интервалы.

OneHotEncoder

Кодирование категориальных признаков как одномерного числового массива.

Примечания

Если входные данные представляют собой разреженную матрицу, только ненулевые значения изменяются классом Binarizer.

Этот оценщик бессостоятельный и не нуждается в подгонке. Однако рекомендуется вызывать fit_transform вместо transform, так как проверка параметров выполняется только в fit.

Примеры

>>> from sklearn.preprocessing import Binarizer
>>> X = [[ 1., -1.,  2.],
...      [ 2.,  0.,  0.],
...      [ 0.,  1., -1.]]
>>> transformer = Binarizer().fit(X)  # fit does nothing.
>>> transformer
Binarizer()
>>> transformer.transform(X)
array([[1., 0., 1.],
       [1., 0., 0.],
       [0., 1., 0.]])
fit(X, y=None)[source]

Только проверяет параметры оценщика.

Этот метод позволяет: (i) проверить параметры оценщика и (ii) быть совместимым с API трансформатора scikit-learn.

Параметры:
X{array-like, разреженная матрица} формы (n_samples, n_features)

Данные.

yNone

Игнорируется.

Возвращает:
selfобъект

Обученный трансформатор.

fit_transform(X, y=None, **fit_params)[source]

Обучение на данных, затем их преобразование.

Обучает трансформатор на X и y с необязательными параметрами fit_params и возвращает преобразованную версию X.

Параметры:
Xarray-like формы (n_samples, n_features)

Входные образцы.

yarray-like формы (n_samples,) или (n_samples, n_outputs), по умолчанию=None

Целевые значения (None для преобразований без учителя).

**fit_paramsdict

Дополнительные параметры обучения.

Возвращает:
X_newмассив ndarray формы (n_samples, n_features_new)

Преобразованный массив.

get_feature_names_out(input_features=None)[source]

Получение выходных имён признаков для преобразования.

Параметры:
input_featuresarray-like из str или None, по умолчанию=None

Входные признаки.

  • Если input_features равно None, то feature_names_in_ используется как имена признаков в. Если feature_names_in_ не определено, то генерируются следующие имена входных признаков: ["x0", "x1", ..., "x(n_features_in_ - 1)"].
  • Если input_features представляет собой массив-подобный объект, то input_features должен совпадать с feature_names_in_, если feature_names_in_ определено.
Возвращает:
feature_names_outndarray из str объектов

То же самое, что и входные признаки.

get_metadata_routing()[source]

Получение маршрутизации метаданных этого объекта.

Пожалуйста, проверьте Руководство пользователя по тому, как работает механизм маршрутизации.

Возвращает:
routingMetadataRequest

MetadataRequest encapsulating routing information.

get_params(deep=True)[source]

Получение параметров для этого оценщика.

Параметры:
deepbool, по умолчанию=True

Если True, вернёт параметры для этого оценщика и содержащихся в нём подобъектов, являющихся оценщиками.

Возвращает:
paramsdict

Имена параметров, сопоставленные со значениями.

set_output(*, transform=None)[source]

Установить контейнер вывода.

См. Представление API set_output для примера использования API.

Параметры:
transform{“default”, “pandas”, “polars”}, по умолчанию=None

Настроить вывод transform и fit_transform.

  • "default": Формат вывода по умолчанию трансформатора
  • "pandas": Вывод DataFrame
  • "polars": Вывод Polars
  • None: Настройка трансформации не изменяется

Добавлен в версии 1.4: "polars" опция была добавлена.

Возвращает:
selfэкземпляр оценщика

Экземпляр оценщика.

set_params(**params)[source]

Установить параметры этого оценщика.

Метод работает как с простыми оценщиками, так и с вложенными объектами (такими как Pipeline). Последние имеют параметры в форме <component>__<parameter>, что позволяет обновлять каждый компонент вложенного объекта.

Параметры:
**paramsdict

Параметры оценщика.

Возвращает:
selfэкземпляр оценщика

Экземпляр оценщика.

set_transform_request(*, copy:bool|None|str='$UNCHANGED$') → Binarizer[source]

Запрос метаданных, переданных в метод transform.

Обратите внимание, что этот метод актуален только в том случае, если enable_metadata_routing=True (см. sklearn.set_config). Пожалуйста, ознакомьтесь с Руководством пользователя по тому, как работает механизм маршрутизации.

Варианты для каждого параметра:

  • True: запрашиваются метаданные и передаются в transform, если они предоставлены. Запрос игнорируется, если метаданные не предоставлены.
  • False: метаданные не запрашиваются и метаоценщик не передаст их в transform.
  • None: метаданные не запрашиваются, и метаоценщик выдаст ошибку, если пользователь предоставит их.
  • str: метаданные должны передаваться метаоценщику с этим псевдонимом вместо исходного имени.

По умолчанию (sklearn.utils.metadata_routing.UNCHANGED) сохраняется существующий запрос. Это позволяет изменять запросы для некоторых параметров и не изменять для других.

Добавлен в версии 1.3.

Примечание

Этот метод актуален только в том случае, если этот оценщик используется в качестве под-оценщика мета-оценщика, например, внутри Pipeline. В противном случае он не имеет эффекта.

Параметры:
copyстрока, True, False или None, по умолчанию sklearn.utils.metadata_routing.UNCHANGED

Маршрутизация метаданных для параметра copy в transform.

Возвращает:
selfобъект

Обновленный объект.

transform(X, copy=None)[source]

Бинаризует каждый элемент X.

Параметры:
X{array-like, sparse matrix} формы (n_samples, n_features)

Данные для бинаризации, элемент за элементом. scipy.sparse матрицы должны быть в формате CSR, чтобы избежать ненужного копирования.

copybool

Копировать вход X или нет.

Возвращает:
X_tr{ndarray, sparse matrix} формы (n_samples, n_features)

Преобразованный массив.

© 2007–2025 The scikit-learn developers
Licensed under the 3-clause BSD License.
https://scikit-learn.org/1.6/modules/generated/sklearn.preprocessing.Binarizer.html

Spec-Zone.ru

Настройки Оффлайн Что нового Помощь О нас
Spec-Zone .ru
спецификации, руководства, описания, API