ОвальныйОборачивание
- classsklearn.covariance.EllipticEnvelope(*, store_precision=True, assume_centered=False, support_fraction=None, contamination=0.1, random_state=None)[source]
-
Объект для обнаружения выбросов в наборе данных, распределенных по Гауссу.
Дополнительные сведения см. в Руководстве пользователя.
- Параметры:
-
- store_precisionbool, по умолчанию=True
-
Укажите, хранится ли оценочная точность.
- assume_centeredbool, по умолчанию=False
-
Если True, вычисляется область значений для оценки местоположения и ковариации, и оценка ковариации пересчитывается из нее, без центрирования данных. Полезно для работы с данными, среднее значение которых значительно равно нулю, но не точно равно нулю. Если False, устойчивое местоположение и ковариация вычисляются непосредственно с помощью алгоритма FastMCD без дополнительной обработки.
- support_fractionfloat, по умолчанию=None
-
Доля точек, которые следует включить в область определения исходной оценки MCD. Если None, будет использоваться минимальное значение support_fraction в алгоритме:
(n_samples + n_features + 1) / 2 * n_samples. Диапазон (0, 1). - contaminationfloat, по умолчанию=0.1
-
Количество загрязнения набора данных, т. е. доля выбросов в наборе данных. Диапазон (0, 0.5].
- random_stateint, RandomState instance или None, по умолчанию=None
-
Определяет генератор псевдослучайных чисел для перемешивания данных. Передайте целое число для воспроизводимых результатов в нескольких вызовах функций. См. Глоссарий.
- Атрибуты:
-
- location_массив NumPy формы (n_features,)
-
Оценённое устойчивое местоположение.
- covariance_массив NumPy формы (n_features, n_features)
-
Оценённая устойчивая матрица ковариаций.
- precision_массив NumPy формы (n_features, n_features)
-
Оценённая псевдообратная матрица. (хранится только если store_precision равен True)
- support_массив NumPy формы (n_samples,)
-
Маска наблюдений, которые использовались для вычисления устойчивых оценок местоположения и формы.
- offset_float
-
Смещение, используемое для определения функции принятия решений по исходным оценкам. У нас есть соотношение:
decision_function = score_samples - offset_. Смещение зависит от параметра contamination и определяется таким образом, чтобы мы получали ожидаемое количество выбросов (образцы с функцией принятия решений < 0) в процессе обучения.Добавлен в версии 0.20.
- raw_location_массив NumPy формы (n_features,)
-
Исходное устойчивое оценочное местоположение до коррекции и перевешивания.
- raw_covariance_массив NumPy формы (n_features, n_features)
-
Исходная устойчивая оценочная ковариация до коррекции и перевешивания.
- raw_support_массив NumPy формы (n_samples,)
-
Маска наблюдений, которые использовались для вычисления исходных устойчивых оценок местоположения и формы до коррекции и перевешивания.
- dist_массив NumPy формы (n_samples,)
-
Расстояния Махаланобиса обучающего набора (по которому вызывается
fit) наблюдений. - n_features_in_int
-
Количество признаков, увиденных во время fit.
Добавлен в версии 0.24.
-
feature_names_in_массив NumPy формы (
n_features_in_,) -
Имена признаков, увиденные во время fit. Определяется только тогда, когда
Xимеет имена признаков, которые являются строками.Добавлен в версии 1.0.
См. также
EmpiricalCovariance-
Оценщик ковариации максимального правдоподобия.
GraphicalLasso-
Оценка разреженной обратной ковариации с помощью оценки с l1-регуляризацией.
LedoitWolf-
Оценщик LedoitWolf.
MinCovDet-
Минимальное ковариационное определитель (устойчивая оценка ковариации).
OAS-
Оценщик Oracle Approximating Shrinkage.
ShrunkCovariance-
Оценщик ковариации с уменьшением.
Примечания
Обнаружение выбросов по оценке ковариации может не работать или работать плохо в многомерных средах. В частности, следует учитывать, что необходимо работать с
n_samples > n_features ** 2.Ссылки
[1]Rousseeuw, P.J., Van Driessen, K. «Быстрый алгоритм для оценки минимального определителя ковариации» Technometrics 41(3), 212 (1999)
Примеры
>>> import numpy as np >>> from sklearn.covariance import EllipticEnvelope >>> true_cov = np.array([[.8, .3], ... [.3, .4]]) >>> X = np.random.RandomState(0).multivariate_normal(mean=[0, 0], ... cov=true_cov, ... size=500) >>> cov = EllipticEnvelope(random_state=0).fit(X) >>> # predict returns 1 for an inlier and -1 for an outlier >>> cov.predict([[0, 0], ... [3, 3]]) array([ 1, -1]) >>> cov.covariance_ array([[0.7411..., 0.2535...], [0.2535..., 0.3053...]]) >>> cov.location_ array([0.0813... , 0.0427...])- correct_covariance(data)[source]
-
Применить поправку к исходным оценкам Minimum Covariance Determinant.
Исправление с использованием эмпирического корректирующего множителя, предложенного Rousseeuw и Van Driessen в [RVD].
- Параметры:
-
- dataмассив-подобный формы (n_samples, n_features)
-
Матрица данных с p признаками и n образцами. Набор данных должен быть тем, который использовался для вычисления исходных оценок.
- Возвращает:
-
- covariance_correctedмассив NumPy формы (n_features, n_features)
-
Исправленная устойчивая оценка ковариации.
Ссылки
[RVD]Быстрый алгоритм для оценки минимального определителя ковариации, 1999, Американская статистическая ассоциация и Американское общество качества, TECHNOMETRICS
- decision_function(X)[source]
-
Вычислить функцию принятия решений заданных наблюдений.
- Параметры:
-
- Xмассив-подобный формы (n_samples, n_features)
-
Матрица данных.
- Возвращает:
-
- decisionмассив NumPy формы (n_samples,)
-
Функция принятия решений образцов. Она равна смещённым расстояниям Махаланобиса. Порог для того, чтобы быть выбросом, равен 0, что обеспечивает совместимость с другими алгоритмами обнаружения выбросов.
- error_norm(comp_cov, norm='frobenius', scaling=True, squared=True)[source]
-
Вычислить среднеквадратическую ошибку между двумя оценками ковариаций.
- Параметры:
-
- comp_covмассив-подобный с формой (n_features, n_features)
-
Ковариация для сравнения.
- norm{“frobenius”, “spectral”}, по умолчанию=”frobenius”
-
Тип нормы, используемой для вычисления ошибки. Доступные типы ошибок: - ‘frobenius’ (по умолчанию): sqrt(tr(A^t.A)) - ‘spectral’: sqrt(max(eigenvalues(A^t.A)) где A – ошибка
(comp_cov - self.covariance_). - scalingbool, по умолчанию=True
-
Если True (по умолчанию), среднеквадратическая норма ошибки делится на n_features. Если False, среднеквадратическая норма ошибки не масштабируется.
- squaredbool, по умолчанию=True
-
Вычислять ли среднеквадратическую норму ошибки или норму ошибки. Если True (по умолчанию), возвращается среднеквадратическая норма ошибки. Если False, возвращается норма ошибки.
- Возвращает:
-
- resultfloat
-
Среднеквадратическая ошибка (в смысле нормы Фробениуса) между
selfиcomp_covоценками ковариации.
- fit(X, y=None)[source]
-
Обучить модель EllipticEnvelope.
- Параметры:
-
- Xмассив-подобный с формой (n_samples, n_features)
-
Данные обучения.
- yИгнорируется
-
Не используется, присутствует для согласованности API по соглашению.
- Возвращает:
-
- selfобъект
-
Возвращает сам экземпляр.
- fit_predict(X, y=None, **kwargs)[source]
-
Выполнить обучение на X и вернуть метки для X.
Возвращает -1 для выбросов и 1 для инлайнов.
- Параметры:
-
- X{массив-подобный, разреженная матрица} с формой (n_samples, n_features)
-
Входные образцы.
- yИгнорируется
-
Не используется, присутствует для согласованности API по соглашению.
- **kwargsdict
-
Аргументы, которые будут переданы в
fit.Добавлен в версии 1.4.
- Возвращает:
-
- yndarray с формой (n_samples,)
-
1 для инлайнов, -1 для выбросов.
- get_metadata_routing()[source]
-
Получить маршрутизацию метаданных этого объекта.
Пожалуйста, проверьте Руководство пользователя по работе механизма маршрутизации.
- Возвращает:
-
- routingMetadataRequest
-
MetadataRequestencapsulating routing information.
- get_params(deep=True)[source]
-
Получить параметры этого оценщика.
- Параметры:
-
- deepbool, по умолчанию=True
-
Если True, вернет параметры этого оценщика и вложенных подобъектов, являющихся оценщиками.
- Возвращает:
-
- paramsdict
-
Имена параметров, сопоставленные с их значениями.
- get_precision()[source]
-
Получить матрицу точности.
- Возвращает:
-
- precision_массив-подобный с формой (n_features, n_features)
-
Матрица точности, связанная с текущим объектом ковариации.
- mahalanobis(X)[source]
-
Вычислить квадраты расстояний Махаланобиса заданных наблюдений.
- Параметры:
-
- Xмассив-подобный с формой (n_samples, n_features)
-
Наблюдения, для которых мы вычисляем расстояния Махаланобиса. Предполагается, что наблюдения взяты из того же распределения, что и данные, использованные в fit.
- Возвращает:
-
- distndarray с формой (n_samples,)
-
Квадраты расстояний Махаланобиса наблюдений.
- predict(X)[source]
-
Предсказать метки (1 инлайн, -1 выброс) X в соответствии с обученной моделью.
- Параметры:
-
- Xмассив-подобный с формой (n_samples, n_features)
-
Матрица данных.
- Возвращает:
-
- is_inlierndarray с формой (n_samples,)
-
Возвращает -1 для аномалий/выбросов и +1 для инлайнов.
- reweight_covariance(data)[source]
-
Пересчёт весов оценок минимального определителя ковариации.
Пересчёт весов наблюдений с помощью метода Руссев (эквивалентно удалению выбросов из набора данных перед вычислением оценок местоположения и ковариации), описанного в [RVDriessen].
- Параметры:
-
- dataarray-like of shape (n_samples, n_features)
-
Матрица данных с p признаками и n образцами. Набор данных должен быть тем, который использовался для вычисления исходных оценок.
- Возвращаемые значения:
-
- location_reweightedndarray of shape (n_features,)
-
Пересчитанная оценка устойчивого местоположения.
- covariance_reweightedndarray of shape (n_features, n_features)
-
Пересчитанная оценка устойчивой ковариации.
- support_reweightedndarray of shape (n_samples,), dtype=bool
-
Маска наблюдений, которые использовались для вычисления пересчитанных оценок устойчивого местоположения и ковариации.
Ссылки
[RVDriessen]A Fast Algorithm for the Minimum Covariance Determinant Estimator, 1999, American Statistical Association and the American Society for Quality, TECHNOMETRICS
- score(X, y, sample_weight=None)[source]
-
Возвращает среднюю точность на заданных тестовых данных и метках.
В многозначной классификации это точность подмножества, которая является жёсткой метрикой, так как для каждого образца требуется, чтобы каждый набор меток был предсказан правильно.
- Параметры:
-
- Xarray-like of shape (n_samples, n_features)
-
Тестовые образцы.
- yarray-like of shape (n_samples,) or (n_samples, n_outputs)
-
Истинные метки для X.
- sample_weightarray-like of shape (n_samples,), default=None
-
Веса образцов.
- Возвращаемые значения:
-
- scorefloat
-
Средняя точность self.predict(X) по отношению к y.
- score_samples(X)[source]
-
Вычисляет отрицательные расстояния Махаланобиса.
- Параметры:
-
- Xarray-like of shape (n_samples, n_features)
-
Матрица данных.
- Возвращаемые значения:
-
- negative_mahal_distancesarray-like of shape (n_samples,)
-
Противоположные расстояния Махаланобиса.
- set_params(**params)[source]
-
Устанавливает параметры данного оценщика.
Метод работает как с простыми оценщиками, так и со вложенными объектами (например, с
Pipeline). Последние имеют параметры в формате<component>__<parameter>, чтобы можно было обновлять каждый компонент вложенного объекта.- Параметры:
-
- **paramsdict
-
Параметры оценщика.
- Возвращаемые значения:
-
- selfestimator instance
-
Объект оценщика.
Примеры из галереи
© 2007–2025 The scikit-learn developers
Licensed under the 3-clause BSD License.
https://scikit-learn.org/1.6/modules/generated/sklearn.covariance.EllipticEnvelope.html