Spec-Zone.ru › scikit-learn

NearestNeighbors

classsklearn.neighbors.NearestNeighbors(*, n_neighbors=5, radius=1.0, algorithm='auto', leaf_size=30, metric='minkowski', p=2, metric_params=None, n_jobs=None)[source]

Неконтролируемый алгоритм для поиска ближайших соседей.

Подробнее см. в Руководстве пользователя.

Добавлен в версии 0.9.

Параметры:
n_neighborsint, по умолчанию=5

Количество соседей, используемых по умолчанию для запросов kneighbors.

radiusfloat, по умолчанию=1.0

Диапазон параметрического пространства, используемый по умолчанию для запросов radius_neighbors.

algorithm{‘auto’, ‘ball_tree’, ‘kd_tree’, ‘brute’}, по умолчанию=’auto’

Алгоритм, используемый для вычисления ближайших соседей:

  • ‘ball_tree’ будет использовать BallTree
  • ‘kd_tree’ будет использовать KDTree
  • ‘brute’ будет использовать поиск с грубой силой.
  • ‘auto’ попытается определить наиболее подходящий алгоритм на основе значений, переданных методу fit.

Примечание: подгонка на разреженных данных переопределит значение этого параметра, используя метод грубой силы.

leaf_sizeint, по умолчанию=30

Размер листа, передаваемый в BallTree или KDTree. Это может повлиять на скорость построения и запроса, а также на требуемую память для хранения дерева. Оптимальное значение зависит от характера задачи.

metricстрока или вызываемая функция, по умолчанию=’minkowski’

Метрика для вычисления расстояний. По умолчанию “minkowski”, что соответствует стандартному евклидову расстоянию при p = 2. Смотрите документацию scipy.spatial.distance и список метрик в distance_metrics.

Если метрика равна “precomputed”, X предполагается матрицей расстояний и должна быть квадратной при подгонке. X может быть разреженной графой, в этом случае только “ненулевые” элементы могут рассматриваться как соседи.

Если метрика является вызываемой функцией, она принимает два массива, представляющие 1D векторы, в качестве входных данных и должна возвращать одно значение, обозначающее расстояние между этими векторами. Это работает для метрик Scipy, но менее эффективно, чем передача имени метрики в виде строки.

pfloat (положительное), по умолчанию=2

Параметр метрики Минковского из sklearn.metrics.pairwise.pairwise_distances. При p = 1 это эквивалентно использованию manhattan_distance (l1), а euclidean_distance (l2) для p = 2. Для произвольного p используется minkowski_distance (l_p).

metric_paramsсловарь, по умолчанию=None

Дополнительные ключевые аргументы для функции метрики.

n_jobsint, по умолчанию=None

Количество параллельных задач для поиска соседей. None означает 1, если не в контексте joblib.parallel_backend. -1 означает использование всех процессоров. См. Глоссарий для получения дополнительной информации.

Атрибуты:
effective_metric_строка

Метрика, используемая для вычисления расстояний до соседей.

effective_metric_params_словарь

Параметры метрики, используемой для вычисления расстояний до соседей.

n_features_in_int

Количество признаков, увиденных во время подгонке.

Добавлен в версии 0.24.

feature_names_in_ndarray формы (n_features_in_,)

Имена признаков, увиденные во время подгонки. Определены только тогда, когда X имеют имена признаков, которые являются строками.

Добавлен в версии 1.0.

n_samples_fit_int

Количество образцов в подгоняемых данных.

См. также

KNeighborsClassifier

Классификатор, реализующий голосование k ближайших соседей.

RadiusNeighborsClassifier

Классификатор, реализующий голосование среди соседей в заданном радиусе.

KNeighborsRegressor

Регрессия на основе k ближайших соседей.

RadiusNeighborsRegressor

Регрессия на основе соседей в фиксированном радиусе.

BallTree

Структура данных разбиения пространства для организации точек в многомерном пространстве, используемая для поиска ближайших соседей.

Примечания

См. Ближайшие соседи в онлайн-документации для обсуждения выбора algorithm и leaf_size.

https://en.wikipedia.org/wiki/K-nearest_neighbors_algorithm

Примеры

>>> import numpy as np
>>> from sklearn.neighbors import NearestNeighbors
>>> samples = [[0, 0, 2], [1, 0, 0], [0, 0, 1]]
>>> neigh = NearestNeighbors(n_neighbors=2, radius=0.4)
>>> neigh.fit(samples)
NearestNeighbors(...)
>>> neigh.kneighbors([[0, 0, 1.3]], 2, return_distance=False)
array([[2, 0]]...)
>>> nbrs = neigh.radius_neighbors(
...    [[0, 0, 1.3]], 0.4, return_distance=False
... )
>>> np.asarray(nbrs[0][0])
array(2)
fit(X, y=None)[source]

Обучение алгоритма поиска ближайших соседей на обучающей выборке.

Параметры:
X{array-like, sparse matrix} формы (n_samples, n_features) или (n_samples, n_samples), если metric=’precomputed’

Обучающие данные.

yИгнорируется

Не используется, присутствует для согласованности API по соглашению.

Возвращает:
selfNearestNeighbors

Обученный алгоритм поиска ближайших соседей.

get_metadata_routing()[source]

Получить маршрутизацию метаданных этого объекта.

Пожалуйста, обратитесь к Руководству пользователя для ознакомления с принципом работы механизма маршрутизации.

Возвращает:
routingMetadataRequest

A MetadataRequest encapsulating routing information.

get_params(deep=True)[source]

Получить параметры этого оценщика.

Параметры:
deepbool, по умолчанию=True

Если True, вернет параметры этого оценщика и вложенных под-объектов, являющихся оценщиками.

Возвращает:
paramsdict

Имена параметров, сопоставленные со значениями.

kneighbors(X=None, n_neighbors=None, return_distance=True)[source]

Найти K ближайших соседей точки.

Возвращает индексы и расстояния до ближайших соседей каждой точки.

Параметры:
X{array-like, разреженная матрица}, форма (n_queries, n_features), или (n_queries, n_indexed) если metric == ‘precomputed’, по умолчанию=None

Точка или точки запроса. Если не указано, возвращаются ближайшие соседи каждой индексированной точки. В этом случае точка запроса не считается своим соседом.

n_neighborsint, по умолчанию=None

Количество ближайших соседей, требуемых для каждой выборки. По умолчанию используется значение, переданное в конструктор.

return_distancebool, по умолчанию=True

Возвращать ли расстояния.

Возвращает:
neigh_distndarray формы (n_queries, n_neighbors)

Массив, представляющий длины до точек, присутствует только если return_distance=True.

neigh_indndarray формы (n_queries, n_neighbors)

Индексы ближайших точек в матрице популяции.

Примеры

В следующем примере мы создаём NearestNeighbors из массива, представляющего наш набор данных, и спрашиваем, какая точка ближе всего к [1,1,1]

>>> samples = [[0., 0., 0.], [0., .5, 0.], [1., 1., .5]]
>>> from sklearn.neighbors import NearestNeighbors
>>> neigh = NearestNeighbors(n_neighbors=1)
>>> neigh.fit(samples)
NearestNeighbors(n_neighbors=1)
>>> print(neigh.kneighbors([[1., 1., 1.]]))
(array([[0.5]]), array([[2]]))

Как видите, возвращается [[0.5]], и [[2]], что означает, что элемент находится на расстоянии 0.5 и является третьим элементом выборки (индексы начинаются с 0). Вы также можете запросить несколько точек:

>>> X = [[0., 1., 0.], [1., 0., 1.]]
>>> neigh.kneighbors(X, return_distance=False)
array([[1],
       [2]]...)
kneighbors_graph(X=None, n_neighbors=None, mode='connectivity')[source]

Вычислить (взвешенную) граф K-соседей для точек в X.

Параметры:
X{array-like, разреженная матрица} формы (n_queries, n_features), или (n_queries, n_indexed) если metric == ‘precomputed’, по умолчанию=None

Точка или точки запроса. Если не указано, возвращаются ближайшие соседи каждой индексированной точки. В этом случае точка запроса не считается своим соседом. Для metric='precomputed' форма должна быть (n_queries, n_indexed). В противном случае форма должна быть (n_queries, n_features).

n_neighborsint, по умолчанию=None

Количество соседей для каждой выборки. По умолчанию используется значение, переданное в конструктор.

mode{‘connectivity’, ‘distance’}, по умолчанию=’connectivity’

Тип возвращаемой матрицы: ‘connectivity’ вернет матрицу связности с единицами и нулями, в ‘distance’ ребра являются расстояниями между точками, тип расстояния зависит от выбранного параметра метрики в классе NearestNeighbors.

Возвращает:
Aразреженная матрица формы (n_queries, n_samples_fit)

n_samples_fit — количество выборок в подгоняемых данных. A[i, j] даёт вес ребра, соединяющего i с j. Матрица в формате CSR.

См. также

NearestNeighbors.radius_neighbors_graph

Вычислить (взвешенную) граф соседей для точек в X.

Примеры

>>> X = [[0], [3], [1]]
>>> from sklearn.neighbors import NearestNeighbors
>>> neigh = NearestNeighbors(n_neighbors=2)
>>> neigh.fit(X)
NearestNeighbors(n_neighbors=2)
>>> A = neigh.kneighbors_graph(X)
>>> A.toarray()
array([[1., 0., 1.],
       [0., 1., 1.],
       [1., 0., 1.]])
radius_neighbors(X=None, radius=None, return_distance=True, sort_results=False)[source]

Найти соседей в заданном радиусе от точки или точек.

Возвращает индексы и расстояния каждой точки из набора данных, лежащих в шаре размером radius вокруг точек массива запроса. Точки, лежащие на границе, включаются в результаты.

Возвращаемые точки не обязательно отсортированы по расстоянию до точки запроса.

Параметры:
X{array-like, разреженная матрица} формы (n_samples, n_features), по умолчанию=None

Точка или точки запроса. Если не указано, возвращаются ближайшие соседи каждой индексированной точки. В этом случае точка запроса не считается своим соседом.

radiusfloat, по умолчанию=None

Ограничивающее расстояние для возвращаемых соседей. По умолчанию используется значение, переданное в конструктор.

return_distancebool, по умолчанию=True

Возвращать ли расстояния.

sort_resultsbool, по умолчанию=False

Если True, расстояния и индексы будут отсортированы по возрастанию расстояний перед возвращением. Если return_distance=False, установка sort_results=True приведёт к ошибке.

Добавлен в версии 0.22.

Возвращает:
neigh_distndarray формы (n_samples,) массивов

Массив, представляющий расстояния до каждой точки, присутствует только если return_distance=True. Значения расстояний вычисляются в соответствии с параметром конструктора metric.

neigh_indndarray формы (n_samples,) массивов

Массив массивов индексов приближенных ближайших точек из матрицы популяции, которые лежат в шаре размером radius вокруг точек запроса.

Примечания

Поскольку количество соседей каждой точки не обязательно одинаково, результаты для нескольких точек запроса не могут быть помещены в стандартный массив данных. Для повышения эффективности radius_neighbors возвращает массивы объектов, где каждый объект — одномерный массив индексов или расстояний.

Примеры

В следующем примере мы создаем NeighborsClassifier из массива, представляющего наш набор данных, и спрашиваем, какая точка ближе всего к [1, 1, 1]:

>>> import numpy as np
>>> samples = [[0., 0., 0.], [0., .5, 0.], [1., 1., .5]]
>>> from sklearn.neighbors import NearestNeighbors
>>> neigh = NearestNeighbors(radius=1.6)
>>> neigh.fit(samples)
NearestNeighbors(radius=1.6)
>>> rng = neigh.radius_neighbors([[1., 1., 1.]])
>>> print(np.asarray(rng[0][0]))
[1.5 0.5]
>>> print(np.asarray(rng[1][0]))
[1 2]

Первый возвращаемый массив содержит расстояния до всех точек, которые ближе, чем 1.6, а второй массив содержит их индексы. В общем случае можно запросить сразу несколько точек.

radius_neighbors_graph(X=None, radius=None, mode='connectivity', sort_results=False)[source]

Вычисление графа (взвешенного) соседей для точек в X.

Соседства ограничены точками на расстоянии меньше радиуса.

Параметры:
X{array-like, разреженная матрица} формы (n_samples, n_features), по умолчанию=None

Точка или точки запроса. Если не указано, возвращаются соседи каждой индексированной точки. В этом случае точка запроса не считается своим соседом.

radiusfloat, по умолчанию=None

Радиус окрестностей. По умолчанию используется значение, переданное в конструктор.

mode{‘connectivity’, ‘distance’}, по умолчанию=’connectivity’

Тип возвращаемой матрицы: ‘connectivity’ вернёт матрицу связности с единицами и нулями, в ‘distance’ рёбра являются расстояниями между точками, тип расстояния зависит от выбранного параметра метрики в классе NearestNeighbors.

sort_resultsbool, по умолчанию=False

Если True, в каждой строке результата ненулевые значения будут отсортированы по возрастанию расстояний. Если False, ненулевые значения могут не быть отсортированы. Используется только с mode=’distance’.

Добавлена в версии 0.22.

Возвращаемое значение:
Aразреженная матрица формы (n_queries, n_samples_fit)

n_samples_fit — это количество образцов в наборе данных. A[i, j] задаёт вес ребра, соединяющего i с j. Матрица имеет формат CSR.

См. также

kneighbors_graph

Вычисление графа (взвешенного) k-соседей для точек в X.

Примеры

>>> X = [[0], [3], [1]]
>>> from sklearn.neighbors import NearestNeighbors
>>> neigh = NearestNeighbors(radius=1.5)
>>> neigh.fit(X)
NearestNeighbors(radius=1.5)
>>> A = neigh.radius_neighbors_graph(X)
>>> A.toarray()
array([[1., 0., 1.],
       [0., 1., 0.],
       [1., 0., 1.]])
set_params(**params)[source]

Устанавливает параметры этого оценщика.

Метод работает как с простыми оценщиками, так и с вложенными объектами (например, с Pipeline). Последние имеют параметры вида <component>__<parameter>, чтобы было возможно обновлять каждый компонент вложенного объекта.

Параметры:
**paramsdict

Параметры оценщика.

Возвращаемое значение:
selfэкземпляр оценщика

Экземпляр оценщика.

Примеры из галереи

Приближенные ближайшие соседи в TSNE

© 2007–2025 The scikit-learn developers
Licensed under the 3-clause BSD License.
https://scikit-learn.org/1.6/modules/generated/sklearn.neighbors.NearestNeighbors.html

Spec-Zone.ru

Настройки Оффлайн Что нового Помощь О нас
Spec-Zone .ru
спецификации, руководства, описания, API