Spec-Zone.ru › scikit-learn

ОвальныйОборачивание

classsklearn.covariance.EllipticEnvelope(*, store_precision=True, assume_centered=False, support_fraction=None, contamination=0.1, random_state=None)[source]

Объект для обнаружения выбросов в наборе данных, распределенных по Гауссу.

Дополнительные сведения см. в Руководстве пользователя.

Параметры:
store_precisionbool, по умолчанию=True

Укажите, хранится ли оценочная точность.

assume_centeredbool, по умолчанию=False

Если True, вычисляется область значений для оценки местоположения и ковариации, и оценка ковариации пересчитывается из нее, без центрирования данных. Полезно для работы с данными, среднее значение которых значительно равно нулю, но не точно равно нулю. Если False, устойчивое местоположение и ковариация вычисляются непосредственно с помощью алгоритма FastMCD без дополнительной обработки.

support_fractionfloat, по умолчанию=None

Доля точек, которые следует включить в область определения исходной оценки MCD. Если None, будет использоваться минимальное значение support_fraction в алгоритме: (n_samples + n_features + 1) / 2 * n_samples. Диапазон (0, 1).

contaminationfloat, по умолчанию=0.1

Количество загрязнения набора данных, т. е. доля выбросов в наборе данных. Диапазон (0, 0.5].

random_stateint, RandomState instance или None, по умолчанию=None

Определяет генератор псевдослучайных чисел для перемешивания данных. Передайте целое число для воспроизводимых результатов в нескольких вызовах функций. См. Глоссарий.

Атрибуты:
location_массив NumPy формы (n_features,)

Оценённое устойчивое местоположение.

covariance_массив NumPy формы (n_features, n_features)

Оценённая устойчивая матрица ковариаций.

precision_массив NumPy формы (n_features, n_features)

Оценённая псевдообратная матрица. (хранится только если store_precision равен True)

support_массив NumPy формы (n_samples,)

Маска наблюдений, которые использовались для вычисления устойчивых оценок местоположения и формы.

offset_float

Смещение, используемое для определения функции принятия решений по исходным оценкам. У нас есть соотношение: decision_function = score_samples - offset_. Смещение зависит от параметра contamination и определяется таким образом, чтобы мы получали ожидаемое количество выбросов (образцы с функцией принятия решений < 0) в процессе обучения.

Добавлен в версии 0.20.

raw_location_массив NumPy формы (n_features,)

Исходное устойчивое оценочное местоположение до коррекции и перевешивания.

raw_covariance_массив NumPy формы (n_features, n_features)

Исходная устойчивая оценочная ковариация до коррекции и перевешивания.

raw_support_массив NumPy формы (n_samples,)

Маска наблюдений, которые использовались для вычисления исходных устойчивых оценок местоположения и формы до коррекции и перевешивания.

dist_массив NumPy формы (n_samples,)

Расстояния Махаланобиса обучающего набора (по которому вызывается fit) наблюдений.

n_features_in_int

Количество признаков, увиденных во время fit.

Добавлен в версии 0.24.

feature_names_in_массив NumPy формы (n_features_in_,)

Имена признаков, увиденные во время fit. Определяется только тогда, когда X имеет имена признаков, которые являются строками.

Добавлен в версии 1.0.

См. также

EmpiricalCovariance

Оценщик ковариации максимального правдоподобия.

GraphicalLasso

Оценка разреженной обратной ковариации с помощью оценки с l1-регуляризацией.

LedoitWolf

Оценщик LedoitWolf.

MinCovDet

Минимальное ковариационное определитель (устойчивая оценка ковариации).

OAS

Оценщик Oracle Approximating Shrinkage.

ShrunkCovariance

Оценщик ковариации с уменьшением.

Примечания

Обнаружение выбросов по оценке ковариации может не работать или работать плохо в многомерных средах. В частности, следует учитывать, что необходимо работать с n_samples > n_features ** 2.

Ссылки

[1]

Rousseeuw, P.J., Van Driessen, K. «Быстрый алгоритм для оценки минимального определителя ковариации» Technometrics 41(3), 212 (1999)

Примеры

>>> import numpy as np
>>> from sklearn.covariance import EllipticEnvelope
>>> true_cov = np.array([[.8, .3],
...                      [.3, .4]])
>>> X = np.random.RandomState(0).multivariate_normal(mean=[0, 0],
...                                                  cov=true_cov,
...                                                  size=500)
>>> cov = EllipticEnvelope(random_state=0).fit(X)
>>> # predict returns 1 for an inlier and -1 for an outlier
>>> cov.predict([[0, 0],
...              [3, 3]])
array([ 1, -1])
>>> cov.covariance_
array([[0.7411..., 0.2535...],
       [0.2535..., 0.3053...]])
>>> cov.location_
array([0.0813... , 0.0427...])
correct_covariance(data)[source]

Применить поправку к исходным оценкам Minimum Covariance Determinant.

Исправление с использованием эмпирического корректирующего множителя, предложенного Rousseeuw и Van Driessen в [RVD].

Параметры:
dataмассив-подобный формы (n_samples, n_features)

Матрица данных с p признаками и n образцами. Набор данных должен быть тем, который использовался для вычисления исходных оценок.

Возвращает:
covariance_correctedмассив NumPy формы (n_features, n_features)

Исправленная устойчивая оценка ковариации.

Ссылки

[RVD]

Быстрый алгоритм для оценки минимального определителя ковариации, 1999, Американская статистическая ассоциация и Американское общество качества, TECHNOMETRICS

decision_function(X)[source]

Вычислить функцию принятия решений заданных наблюдений.

Параметры:
Xмассив-подобный формы (n_samples, n_features)

Матрица данных.

Возвращает:
decisionмассив NumPy формы (n_samples,)

Функция принятия решений образцов. Она равна смещённым расстояниям Махаланобиса. Порог для того, чтобы быть выбросом, равен 0, что обеспечивает совместимость с другими алгоритмами обнаружения выбросов.

error_norm(comp_cov, norm='frobenius', scaling=True, squared=True)[source]

Вычислить среднеквадратическую ошибку между двумя оценками ковариаций.

Параметры:
comp_covмассив-подобный с формой (n_features, n_features)

Ковариация для сравнения.

norm{“frobenius”, “spectral”}, по умолчанию=”frobenius”

Тип нормы, используемой для вычисления ошибки. Доступные типы ошибок: - ‘frobenius’ (по умолчанию): sqrt(tr(A^t.A)) - ‘spectral’: sqrt(max(eigenvalues(A^t.A)) где A – ошибка (comp_cov - self.covariance_).

scalingbool, по умолчанию=True

Если True (по умолчанию), среднеквадратическая норма ошибки делится на n_features. Если False, среднеквадратическая норма ошибки не масштабируется.

squaredbool, по умолчанию=True

Вычислять ли среднеквадратическую норму ошибки или норму ошибки. Если True (по умолчанию), возвращается среднеквадратическая норма ошибки. Если False, возвращается норма ошибки.

Возвращает:
resultfloat

Среднеквадратическая ошибка (в смысле нормы Фробениуса) между self и comp_cov оценками ковариации.

fit(X, y=None)[source]

Обучить модель EllipticEnvelope.

Параметры:
Xмассив-подобный с формой (n_samples, n_features)

Данные обучения.

yИгнорируется

Не используется, присутствует для согласованности API по соглашению.

Возвращает:
selfобъект

Возвращает сам экземпляр.

fit_predict(X, y=None, **kwargs)[source]

Выполнить обучение на X и вернуть метки для X.

Возвращает -1 для выбросов и 1 для инлайнов.

Параметры:
X{массив-подобный, разреженная матрица} с формой (n_samples, n_features)

Входные образцы.

yИгнорируется

Не используется, присутствует для согласованности API по соглашению.

**kwargsdict

Аргументы, которые будут переданы в fit.

Добавлен в версии 1.4.

Возвращает:
yndarray с формой (n_samples,)

1 для инлайнов, -1 для выбросов.

get_metadata_routing()[source]

Получить маршрутизацию метаданных этого объекта.

Пожалуйста, проверьте Руководство пользователя по работе механизма маршрутизации.

Возвращает:
routingMetadataRequest

MetadataRequest encapsulating routing information.

get_params(deep=True)[source]

Получить параметры этого оценщика.

Параметры:
deepbool, по умолчанию=True

Если True, вернет параметры этого оценщика и вложенных подобъектов, являющихся оценщиками.

Возвращает:
paramsdict

Имена параметров, сопоставленные с их значениями.

get_precision()[source]

Получить матрицу точности.

Возвращает:
precision_массив-подобный с формой (n_features, n_features)

Матрица точности, связанная с текущим объектом ковариации.

mahalanobis(X)[source]

Вычислить квадраты расстояний Махаланобиса заданных наблюдений.

Параметры:
Xмассив-подобный с формой (n_samples, n_features)

Наблюдения, для которых мы вычисляем расстояния Махаланобиса. Предполагается, что наблюдения взяты из того же распределения, что и данные, использованные в fit.

Возвращает:
distndarray с формой (n_samples,)

Квадраты расстояний Махаланобиса наблюдений.

predict(X)[source]

Предсказать метки (1 инлайн, -1 выброс) X в соответствии с обученной моделью.

Параметры:
Xмассив-подобный с формой (n_samples, n_features)

Матрица данных.

Возвращает:
is_inlierndarray с формой (n_samples,)

Возвращает -1 для аномалий/выбросов и +1 для инлайнов.

reweight_covariance(data)[source]

Пересчёт весов оценок минимального определителя ковариации.

Пересчёт весов наблюдений с помощью метода Руссев (эквивалентно удалению выбросов из набора данных перед вычислением оценок местоположения и ковариации), описанного в [RVDriessen].

Параметры:
dataarray-like of shape (n_samples, n_features)

Матрица данных с p признаками и n образцами. Набор данных должен быть тем, который использовался для вычисления исходных оценок.

Возвращаемые значения:
location_reweightedndarray of shape (n_features,)

Пересчитанная оценка устойчивого местоположения.

covariance_reweightedndarray of shape (n_features, n_features)

Пересчитанная оценка устойчивой ковариации.

support_reweightedndarray of shape (n_samples,), dtype=bool

Маска наблюдений, которые использовались для вычисления пересчитанных оценок устойчивого местоположения и ковариации.

Ссылки

[RVDriessen]

A Fast Algorithm for the Minimum Covariance Determinant Estimator, 1999, American Statistical Association and the American Society for Quality, TECHNOMETRICS

score(X, y, sample_weight=None)[source]

Возвращает среднюю точность на заданных тестовых данных и метках.

В многозначной классификации это точность подмножества, которая является жёсткой метрикой, так как для каждого образца требуется, чтобы каждый набор меток был предсказан правильно.

Параметры:
Xarray-like of shape (n_samples, n_features)

Тестовые образцы.

yarray-like of shape (n_samples,) or (n_samples, n_outputs)

Истинные метки для X.

sample_weightarray-like of shape (n_samples,), default=None

Веса образцов.

Возвращаемые значения:
scorefloat

Средняя точность self.predict(X) по отношению к y.

score_samples(X)[source]

Вычисляет отрицательные расстояния Махаланобиса.

Параметры:
Xarray-like of shape (n_samples, n_features)

Матрица данных.

Возвращаемые значения:
negative_mahal_distancesarray-like of shape (n_samples,)

Противоположные расстояния Махаланобиса.

set_params(**params)[source]

Устанавливает параметры данного оценщика.

Метод работает как с простыми оценщиками, так и со вложенными объектами (например, с Pipeline). Последние имеют параметры в формате <component>__<parameter>, чтобы можно было обновлять каждый компонент вложенного объекта.

Параметры:
**paramsdict

Параметры оценщика.

Возвращаемые значения:
selfestimator instance

Объект оценщика.

Примеры из галереи

Обнаружение выбросов в реальном наборе данных

Сравнение алгоритмов обнаружения аномалий для выявления выбросов в наборах данных

© 2007–2025 The scikit-learn developers
Licensed under the 3-clause BSD License.
https://scikit-learn.org/1.6/modules/generated/sklearn.covariance.EllipticEnvelope.html

Spec-Zone.ru

Настройки Оффлайн Что нового Помощь О нас
Spec-Zone .ru
спецификации, руководства, описания, API