Spec-Zone.ru › scikit-learn

CategoricalNB

classsklearn.naive_bayes.CategoricalNB(*, alpha=1.0, force_alpha=True, fit_prior=True, class_prior=None, min_categories=None)[source]

Классификатор наивного Байеса для категориальных признаков.

Категориальный классификатор наивного Байеса подходит для классификации с дискретными признаками, которые распределены категориально. Категории каждого признака берутся из категориального распределения.

Подробнее см. в Руководстве пользователя.

Параметры:
alphafloat, по умолчанию=1.0

Параметр добавочного (Лапласа/Лидстоуна) сглаживания (установите alpha=0 и force_alpha=True для отсутствия сглаживания).

force_alphabool, по умолчанию=True

Если False и alpha меньше 1e-10, он установит alpha в 1e-10. Если True, alpha останется без изменений. Это может вызвать числовые ошибки, если alpha слишком близко к 0.

Добавлена в версии 1.2.

Изменено в версии 1.4: Значение по умолчанию для force_alpha изменено на True.

fit_priorbool, по умолчанию=True

Определяет, нужно ли обучать вероятности априорных классов. Если False, будет использоваться равномерное распределение.

class_priorarray-like of shape (n_classes,), по умолчанию=None

Априорные вероятности классов. Если указано, априорные вероятности не корректируются на основе данных.

min_categoriesint или array-like of shape (n_features,), по умолчанию=None

Минимальное количество категорий на признак.

  • целое число: Устанавливает минимальное количество категорий на признак в n_categories для каждого признака.
  • array-like: shape (n_features,), где n_categories[i] содержит минимальное количество категорий для i-го столбца входных данных.
  • None (по умолчанию): Автоматически определяет количество категорий по обучающим данным.

Добавлена в версии 0.24.

Атрибуты:
category_count_list of arrays of shape (n_features,)

Содержит массивы формы (n_классов, n_категорий соответствующего признака) для каждого признака. Каждый массив предоставляет количество встреченных образцов для каждого класса и категории конкретного признака.

class_count_ndarray of shape (n_classes,)

Количество образцов, встреченных для каждого класса во время обучения. Это значение взвешивается весом образца, если он предоставлен.

class_log_prior_ndarray of shape (n_classes,)

Сглаженная эмпирическая логарифмическая вероятность для каждого класса.

classes_ndarray of shape (n_classes,)

Метки классов, известные классификатору

feature_log_prob_list of arrays of shape (n_features,)

Содержит массивы формы (n_классов, n_категорий соответствующего признака) для каждого признака. Каждый массив предоставляет эмпирическую логарифмическую вероятность категорий, учитывая соответствующий признак и класс, P(x_i|y).

n_features_in_int

Количество признаков, увиденных во время fit.

Добавлена в версии 0.24.

feature_names_in_ndarray of shape (n_features_in_,)

Имена признаков, увиденные во время fit. Определяются только тогда, когда X имеет имена признаков, которые являются строками.

Добавлена в версии 1.0.

n_categories_ndarray of shape (n_features,), dtype=np.int64

Количество категорий для каждого признака. Это значение выводится из данных или устанавливается минимальным числом категорий.

Добавлена в версии 0.24.

См. также

BernoulliNB

Классификатор наивного Байеса для многомерных моделей Бернулли.

ComplementNB

Классификатор дополнения наивного Байеса.

GaussianNB

Наивный байесовский классификатор Гаусса.

MultinomialNB

Классификатор наивного Байеса для мультиномиальных моделей.

Примеры

>>> import numpy as np
>>> rng = np.random.RandomState(1)
>>> X = rng.randint(5, size=(6, 100))
>>> y = np.array([1, 2, 3, 4, 5, 6])
>>> from sklearn.naive_bayes import CategoricalNB
>>> clf = CategoricalNB()
>>> clf.fit(X, y)
CategoricalNB()
>>> print(clf.predict(X[2:3]))
[3]
fit(X, y, sample_weight=None)[source]

Обучение классификатора наивного Байеса по X, y.

Параметры:
X{array-like, sparse matrix} of shape (n_samples, n_features)

Векторы обучения, где n_samples — количество образцов, а n_features — количество признаков. Здесь каждый признак X предполагается извлеченным из разных категориальных распределений. Кроме того, предполагается, что все категории каждого признака представлены числами 0, ..., n - 1, где n относится к общему числу категорий для данного признака. Это, например, можно достичь с помощью OrdinalEncoder.

yarray-like of shape (n_samples,)

Значения целевых переменных.

sample_weightarray-like of shape (n_samples,), по умолчанию=None

Веса, применяемые к отдельным образцам (1. для невзвешенных).

Возвращает:
selfobject

Возвращает сам экземпляр.

get_metadata_routing()[source]

Получение маршрутизации метаданных этого объекта.

Пожалуйста, обратитесь к Руководству пользователя для получения информации о механизме маршрутизации.

Возвращает:
routingMetadataRequest

A MetadataRequest encapsulating routing information.

get_params(deep=True)[source]

Получение параметров этого оценщика.

Параметры:
deepbool, по умолчанию=True

Если True, вернет параметры этого оценщика и вложенных подобъектов, являющихся оценщиками.

Возвращает:
paramsdict

Имена параметров, сопоставленные с их значениями.

END_OF_DOCUMENT_MARKER
partial_fit(X, y, classes=None, sample_weight=None)[source]

Инкрементная подгонка на наборе образцов.

Ожидается, что этот метод будет вызываться несколько раз последовательно на разных фрагментах набора данных, чтобы реализовать обучение вне памяти или онлайн.

Это особенно полезно, когда весь набор данных слишком большой, чтобы поместиться в памяти сразу.

Этот метод имеет некоторую накладную стоимость производительности, поэтому лучше вызывать partial_fit на кусках данных, которые максимально велики (пока они помещаются в бюджет памяти), чтобы скрыть эту накладную стоимость.

Параметры:
X{array-like, sparse matrix} формы (n_samples, n_features)

Вектора обучения, где n_samples — число образцов, а n_features — число признаков. Здесь каждый признак X предполагается, что принадлежит различным категориальным распределениям. Далее предполагается, что все категории каждого признака представлены числами 0, …, n - 1, где n — общее число категорий для данного признака. Это можно, например, сделать с помощью OrdinalEncoder.

yarray-like формы (n_samples,)

Значения целевой переменной.

classesarray-like формы (n_classes,), по умолчанию=None

Список всех классов, которые могут потенциально появляться в векторе y.

Должен быть предоставлен при первом вызове partial_fit, может быть опущен в последующих вызовах.

sample_weightarray-like формы (n_samples,), по умолчанию=None

Веса, применяемые к отдельным образцам (1. для невзвешенных).

Возвращаемые значения:
selfобъект

Возвращает сам экземпляр.

predict(X)[source]

Выполнить классификацию на массиве векторов тестовых данных X.

Параметры:
Xarray-like формы (n_samples, n_features)

Входные образцы.

Возвращаемые значения:
Cndarray формы (n_samples,)

Предсказанные значения целевой переменной для X.

predict_joint_log_proba(X)[source]

Возвратить оценки совместной логарифмической вероятности для вектора тестовых данных X.

Для каждой строки x из X и класса y совместная логарифмическая вероятность задается как log P(x, y) = log P(y) + log P(x|y), , где log P(y) — вероятность класса, а log P(x|y) — условная вероятность класса.

Параметры:
Xarray-like формы (n_samples, n_features)

Входные образцы.

Возвращаемые значения:
Cndarray формы (n_samples, n_classes)

Возвращает совместную логарифмическую вероятность образцов для каждого класса в модели. Столбцы соответствуют классам в отсортированном порядке, как они появляются в атрибуте classes_.

predict_log_proba(X)[source]

Возвратить оценки логарифмической вероятности для вектора тестовых данных X.

Параметры:
Xarray-like формы (n_samples, n_features)

Входные образцы.

Возвращаемые значения:
Carray-like формы (n_samples, n_classes)

Возвращает логарифмическую вероятность образцов для каждого класса в модели. Столбцы соответствуют классам в отсортированном порядке, как они появляются в атрибуте classes_.

predict_proba(X)[source]

Возвратить оценки вероятности для вектора тестовых данных X.

Параметры:
Xarray-like формы (n_samples, n_features)

Входные образцы.

Возвращаемые значения:
Carray-like формы (n_samples, n_classes)

Возвращает вероятность образцов для каждого класса в модели. Столбцы соответствуют классам в отсортированном порядке, как они появляются в атрибуте classes_.

score(X, y, sample_weight=None)[source]

Возвратить среднюю точность на заданных тестовых данных и метках.

В многоклассовой классификации это доля точности подмножества, которая является жёстким метрикой, так как для каждого образца требуется, чтобы каждый набор меток был предсказан правильно.

Параметры:
Xarray-like формы (n_samples, n_features)

Тестовые образцы.

yarray-like формы (n_samples,) или (n_samples, n_outputs)

Истинные метки для X.

sample_weightarray-like формы (n_samples,), по умолчанию=None

Веса образцов.

Возвращаемые значения:
scorefloat

Средняя точность self.predict(X) по отношению к y.

set_fit_request(*, sample_weight:bool|None|str='$UNCHANGED$') → CategoricalNB[source]

Запрос метаданных, передаваемых в метод fit.

Обратите внимание, что этот метод актуален только если enable_metadata_routing=True (см. sklearn.set_config). Пожалуйста, ознакомьтесь с Руководством пользователя для понимания принципов работы механизма маршрутизации.

Варианты для каждого параметра:

  • True: метаданные запрашиваются и передаются методу fit, если они предоставлены. Запрос игнорируется, если метаданные не предоставлены.
  • False: метаданные не запрашиваются, и мета-оценщик не передаст их методу fit.
  • None: метаданные не запрашиваются, и мета-оценщик выдаст ошибку, если пользователь их предоставит.
  • str: метаданные должны быть переданы мета-оценщику с этим псевдонимом вместо исходного названия.

По умолчанию (sklearn.utils.metadata_routing.UNCHANGED) сохраняется существующий запрос. Это позволяет изменить запрос для некоторых параметров, а не для всех.

Добавлен в версии 1.3.

Примечание

Этот метод актуален только если этот оценщик используется как под-оценщик мета-оценщика, например, внутри Pipeline. В противном случае он не оказывает никакого влияния.

Parameters:
sample_weightstr, True, False, or None, default=sklearn.utils.metadata_routing.UNCHANGED

Маршрутизация метаданных для параметра sample_weight в fit.

Returns:
selfobject

Обновленный объект.

set_params(**params)[source]

Установка параметров этого оценщика.

Метод работает с простыми оценщиками, а также со вложенными объектами (такими как Pipeline). Последние имеют параметры вида <component>__<parameter>, чтобы можно было обновлять каждый компонент вложенного объекта.

Parameters:
**paramsdict

Параметры оценщика.

Returns:
selfestimator instance

Экземпляр оценщика.

set_partial_fit_request(*, classes:bool|None|str='$UNCHANGED$', sample_weight:bool|None|str='$UNCHANGED$') → CategoricalNB[source]

Запрос метаданных, передаваемых в метод partial_fit.

Обратите внимание, что этот метод актуален только если enable_metadata_routing=True (см. sklearn.set_config). Пожалуйста, ознакомьтесь с Руководством пользователя для понимания принципов работы механизма маршрутизации.

Варианты для каждого параметра:

  • True: метаданные запрашиваются и передаются методу partial_fit, если они предоставлены. Запрос игнорируется, если метаданные не предоставлены.
  • False: метаданные не запрашиваются, и мета-оценщик не передаст их методу partial_fit.
  • None: метаданные не запрашиваются, и мета-оценщик выдаст ошибку, если пользователь их предоставит.
  • str: метаданные должны быть переданы мета-оценщику с этим псевдонимом вместо исходного названия.

По умолчанию (sklearn.utils.metadata_routing.UNCHANGED) сохраняется существующий запрос. Это позволяет изменить запрос для некоторых параметров, а не для всех.

Добавлен в версии 1.3.

Примечание

Этот метод актуален только если этот оценщик используется как под-оценщик мета-оценщика, например, внутри Pipeline. В противном случае он не оказывает никакого влияния.

Parameters:
classesstr, True, False, or None, default=sklearn.utils.metadata_routing.UNCHANGED

Маршрутизация метаданных для параметра classes в partial_fit.

sample_weightstr, True, False, or None, default=sklearn.utils.metadata_routing.UNCHANGED

Маршрутизация метаданных для параметра sample_weight в partial_fit.

Returns:
selfobject

Обновленный объект.

set_score_request(*, sample_weight:bool|None|str='$UNCHANGED$') → CategoricalNB[source]

Запрос метаданных, передаваемых методу score.

Обратите внимание, что этот метод актуален только в том случае, если enable_metadata_routing=True (см. sklearn.set_config). Пожалуйста, ознакомьтесь со Руководством пользователя для получения информации о работе механизма маршрутизации.

Варианты для каждого параметра:

  • True: метаданные запрашиваются и передаются score, если они предоставлены. Запрос игнорируется, если метаданные не предоставлены.
  • False: метаданные не запрашиваются, и мета-эстиматор не передаст их score.
  • None: метаданные не запрашиваются, и мета-эстиматор выведет ошибку, если пользователь их предоставит.
  • str: метаданные должны быть переданы мета-эстиматору с этим заданным псевдонимом вместо исходного имени.

По умолчанию (sklearn.utils.metadata_routing.UNCHANGED) сохраняется существующий запрос. Это позволяет изменить запрос для некоторых параметров и не для других.

Добавлен в версии 1.3.

Примечание

Этот метод актуален только в том случае, если этот эстиматор используется как под-эстиматор мета-эстиматора, например, внутри Pipeline. В противном случае он не оказывает никакого влияния.

Parameters:
sample_weightstr, True, False, or None, default=sklearn.utils.metadata_routing.UNCHANGED

Маршрутизация метаданных для параметра sample_weight в score.

Returns:
selfobject

Обновлённый объект.

© 2007–2025 The scikit-learn developers
Licensed under the 3-clause BSD License.
https://scikit-learn.org/1.6/modules/generated/sklearn.naive_bayes.CategoricalNB.html

Spec-Zone.ru

Настройки Оффлайн Что нового Помощь О нас
Spec-Zone .ru
спецификации, руководства, описания, API