NearestNeighbors
- classsklearn.neighbors.NearestNeighbors(*, n_neighbors=5, radius=1.0, algorithm='auto', leaf_size=30, metric='minkowski', p=2, metric_params=None, n_jobs=None)[source]
-
Неконтролируемый алгоритм для поиска ближайших соседей.
Подробнее см. в Руководстве пользователя.
Добавлен в версии 0.9.
- Параметры:
-
- n_neighborsint, по умолчанию=5
-
Количество соседей, используемых по умолчанию для запросов
kneighbors. - radiusfloat, по умолчанию=1.0
-
Диапазон параметрического пространства, используемый по умолчанию для запросов
radius_neighbors. - algorithm{‘auto’, ‘ball_tree’, ‘kd_tree’, ‘brute’}, по умолчанию=’auto’
-
Алгоритм, используемый для вычисления ближайших соседей:
- ‘ball_tree’ будет использовать
BallTree - ‘kd_tree’ будет использовать
KDTree - ‘brute’ будет использовать поиск с грубой силой.
- ‘auto’ попытается определить наиболее подходящий алгоритм на основе значений, переданных методу
fit.
Примечание: подгонка на разреженных данных переопределит значение этого параметра, используя метод грубой силы.
- ‘ball_tree’ будет использовать
- leaf_sizeint, по умолчанию=30
-
Размер листа, передаваемый в BallTree или KDTree. Это может повлиять на скорость построения и запроса, а также на требуемую память для хранения дерева. Оптимальное значение зависит от характера задачи.
- metricстрока или вызываемая функция, по умолчанию=’minkowski’
-
Метрика для вычисления расстояний. По умолчанию “minkowski”, что соответствует стандартному евклидову расстоянию при p = 2. Смотрите документацию scipy.spatial.distance и список метрик в
distance_metrics.Если метрика равна “precomputed”, X предполагается матрицей расстояний и должна быть квадратной при подгонке. X может быть разреженной графой, в этом случае только “ненулевые” элементы могут рассматриваться как соседи.
Если метрика является вызываемой функцией, она принимает два массива, представляющие 1D векторы, в качестве входных данных и должна возвращать одно значение, обозначающее расстояние между этими векторами. Это работает для метрик Scipy, но менее эффективно, чем передача имени метрики в виде строки.
- pfloat (положительное), по умолчанию=2
-
Параметр метрики Минковского из sklearn.metrics.pairwise.pairwise_distances. При p = 1 это эквивалентно использованию manhattan_distance (l1), а euclidean_distance (l2) для p = 2. Для произвольного p используется minkowski_distance (l_p).
- metric_paramsсловарь, по умолчанию=None
-
Дополнительные ключевые аргументы для функции метрики.
- n_jobsint, по умолчанию=None
-
Количество параллельных задач для поиска соседей.
Noneозначает 1, если не в контекстеjoblib.parallel_backend.-1означает использование всех процессоров. См. Глоссарий для получения дополнительной информации.
- Атрибуты:
-
- effective_metric_строка
-
Метрика, используемая для вычисления расстояний до соседей.
- effective_metric_params_словарь
-
Параметры метрики, используемой для вычисления расстояний до соседей.
- n_features_in_int
-
Количество признаков, увиденных во время подгонке.
Добавлен в версии 0.24.
-
feature_names_in_ndarray формы (
n_features_in_,) -
Имена признаков, увиденные во время подгонки. Определены только тогда, когда
Xимеют имена признаков, которые являются строками.Добавлен в версии 1.0.
- n_samples_fit_int
-
Количество образцов в подгоняемых данных.
См. также
KNeighborsClassifier-
Классификатор, реализующий голосование k ближайших соседей.
RadiusNeighborsClassifier-
Классификатор, реализующий голосование среди соседей в заданном радиусе.
KNeighborsRegressor-
Регрессия на основе k ближайших соседей.
RadiusNeighborsRegressor-
Регрессия на основе соседей в фиксированном радиусе.
BallTree-
Структура данных разбиения пространства для организации точек в многомерном пространстве, используемая для поиска ближайших соседей.
Примечания
См. Ближайшие соседи в онлайн-документации для обсуждения выбора
algorithmиleaf_size.https://en.wikipedia.org/wiki/K-nearest_neighbors_algorithm
Примеры
>>> import numpy as np >>> from sklearn.neighbors import NearestNeighbors >>> samples = [[0, 0, 2], [1, 0, 0], [0, 0, 1]] >>> neigh = NearestNeighbors(n_neighbors=2, radius=0.4) >>> neigh.fit(samples) NearestNeighbors(...) >>> neigh.kneighbors([[0, 0, 1.3]], 2, return_distance=False) array([[2, 0]]...) >>> nbrs = neigh.radius_neighbors( ... [[0, 0, 1.3]], 0.4, return_distance=False ... ) >>> np.asarray(nbrs[0][0]) array(2)
- fit(X, y=None)[source]
-
Обучение алгоритма поиска ближайших соседей на обучающей выборке.
- Параметры:
-
- X{array-like, sparse matrix} формы (n_samples, n_features) или (n_samples, n_samples), если metric=’precomputed’
-
Обучающие данные.
- yИгнорируется
-
Не используется, присутствует для согласованности API по соглашению.
- Возвращает:
-
- selfNearestNeighbors
-
Обученный алгоритм поиска ближайших соседей.
- get_metadata_routing()[source]
-
Получить маршрутизацию метаданных этого объекта.
Пожалуйста, обратитесь к Руководству пользователя для ознакомления с принципом работы механизма маршрутизации.
- Возвращает:
-
- routingMetadataRequest
-
A
MetadataRequestencapsulating routing information.
- get_params(deep=True)[source]
-
Получить параметры этого оценщика.
- Параметры:
-
- deepbool, по умолчанию=True
-
Если True, вернет параметры этого оценщика и вложенных под-объектов, являющихся оценщиками.
- Возвращает:
-
- paramsdict
-
Имена параметров, сопоставленные со значениями.
- kneighbors(X=None, n_neighbors=None, return_distance=True)[source]
-
Найти K ближайших соседей точки.
Возвращает индексы и расстояния до ближайших соседей каждой точки.
- Параметры:
-
- X{array-like, разреженная матрица}, форма (n_queries, n_features), или (n_queries, n_indexed) если metric == ‘precomputed’, по умолчанию=None
-
Точка или точки запроса. Если не указано, возвращаются ближайшие соседи каждой индексированной точки. В этом случае точка запроса не считается своим соседом.
- n_neighborsint, по умолчанию=None
-
Количество ближайших соседей, требуемых для каждой выборки. По умолчанию используется значение, переданное в конструктор.
- return_distancebool, по умолчанию=True
-
Возвращать ли расстояния.
- Возвращает:
-
- neigh_distndarray формы (n_queries, n_neighbors)
-
Массив, представляющий длины до точек, присутствует только если return_distance=True.
- neigh_indndarray формы (n_queries, n_neighbors)
-
Индексы ближайших точек в матрице популяции.
Примеры
В следующем примере мы создаём NearestNeighbors из массива, представляющего наш набор данных, и спрашиваем, какая точка ближе всего к [1,1,1]
>>> samples = [[0., 0., 0.], [0., .5, 0.], [1., 1., .5]] >>> from sklearn.neighbors import NearestNeighbors >>> neigh = NearestNeighbors(n_neighbors=1) >>> neigh.fit(samples) NearestNeighbors(n_neighbors=1) >>> print(neigh.kneighbors([[1., 1., 1.]])) (array([[0.5]]), array([[2]]))
Как видите, возвращается [[0.5]], и [[2]], что означает, что элемент находится на расстоянии 0.5 и является третьим элементом выборки (индексы начинаются с 0). Вы также можете запросить несколько точек:
>>> X = [[0., 1., 0.], [1., 0., 1.]] >>> neigh.kneighbors(X, return_distance=False) array([[1], [2]]...)
- kneighbors_graph(X=None, n_neighbors=None, mode='connectivity')[source]
-
Вычислить (взвешенную) граф K-соседей для точек в X.
- Параметры:
-
- X{array-like, разреженная матрица} формы (n_queries, n_features), или (n_queries, n_indexed) если metric == ‘precomputed’, по умолчанию=None
-
Точка или точки запроса. Если не указано, возвращаются ближайшие соседи каждой индексированной точки. В этом случае точка запроса не считается своим соседом. Для
metric='precomputed'форма должна быть (n_queries, n_indexed). В противном случае форма должна быть (n_queries, n_features). - n_neighborsint, по умолчанию=None
-
Количество соседей для каждой выборки. По умолчанию используется значение, переданное в конструктор.
- mode{‘connectivity’, ‘distance’}, по умолчанию=’connectivity’
-
Тип возвращаемой матрицы: ‘connectivity’ вернет матрицу связности с единицами и нулями, в ‘distance’ ребра являются расстояниями между точками, тип расстояния зависит от выбранного параметра метрики в классе NearestNeighbors.
- Возвращает:
-
- Aразреженная матрица формы (n_queries, n_samples_fit)
-
n_samples_fit— количество выборок в подгоняемых данных.A[i, j]даёт вес ребра, соединяющегоiсj. Матрица в формате CSR.
См. также
NearestNeighbors.radius_neighbors_graph-
Вычислить (взвешенную) граф соседей для точек в X.
Примеры
>>> X = [[0], [3], [1]] >>> from sklearn.neighbors import NearestNeighbors >>> neigh = NearestNeighbors(n_neighbors=2) >>> neigh.fit(X) NearestNeighbors(n_neighbors=2) >>> A = neigh.kneighbors_graph(X) >>> A.toarray() array([[1., 0., 1.], [0., 1., 1.], [1., 0., 1.]])
- radius_neighbors(X=None, radius=None, return_distance=True, sort_results=False)[source]
-
Найти соседей в заданном радиусе от точки или точек.
Возвращает индексы и расстояния каждой точки из набора данных, лежащих в шаре размером
radiusвокруг точек массива запроса. Точки, лежащие на границе, включаются в результаты.Возвращаемые точки не обязательно отсортированы по расстоянию до точки запроса.
- Параметры:
-
- X{array-like, разреженная матрица} формы (n_samples, n_features), по умолчанию=None
-
Точка или точки запроса. Если не указано, возвращаются ближайшие соседи каждой индексированной точки. В этом случае точка запроса не считается своим соседом.
- radiusfloat, по умолчанию=None
-
Ограничивающее расстояние для возвращаемых соседей. По умолчанию используется значение, переданное в конструктор.
- return_distancebool, по умолчанию=True
-
Возвращать ли расстояния.
- sort_resultsbool, по умолчанию=False
-
Если True, расстояния и индексы будут отсортированы по возрастанию расстояний перед возвращением. Если
return_distance=False, установкаsort_results=Trueприведёт к ошибке.Добавлен в версии 0.22.
- Возвращает:
-
- neigh_distndarray формы (n_samples,) массивов
-
Массив, представляющий расстояния до каждой точки, присутствует только если
return_distance=True. Значения расстояний вычисляются в соответствии с параметром конструктораmetric. - neigh_indndarray формы (n_samples,) массивов
-
Массив массивов индексов приближенных ближайших точек из матрицы популяции, которые лежат в шаре размером
radiusвокруг точек запроса.
Примечания
Поскольку количество соседей каждой точки не обязательно одинаково, результаты для нескольких точек запроса не могут быть помещены в стандартный массив данных. Для повышения эффективности
radius_neighborsвозвращает массивы объектов, где каждый объект — одномерный массив индексов или расстояний.Примеры
В следующем примере мы создаем NeighborsClassifier из массива, представляющего наш набор данных, и спрашиваем, какая точка ближе всего к [1, 1, 1]:
>>> import numpy as np >>> samples = [[0., 0., 0.], [0., .5, 0.], [1., 1., .5]] >>> from sklearn.neighbors import NearestNeighbors >>> neigh = NearestNeighbors(radius=1.6) >>> neigh.fit(samples) NearestNeighbors(radius=1.6) >>> rng = neigh.radius_neighbors([[1., 1., 1.]]) >>> print(np.asarray(rng[0][0])) [1.5 0.5] >>> print(np.asarray(rng[1][0])) [1 2]
Первый возвращаемый массив содержит расстояния до всех точек, которые ближе, чем 1.6, а второй массив содержит их индексы. В общем случае можно запросить сразу несколько точек.
- radius_neighbors_graph(X=None, radius=None, mode='connectivity', sort_results=False)[source]
-
Вычисление графа (взвешенного) соседей для точек в X.
Соседства ограничены точками на расстоянии меньше радиуса.
- Параметры:
-
- X{array-like, разреженная матрица} формы (n_samples, n_features), по умолчанию=None
-
Точка или точки запроса. Если не указано, возвращаются соседи каждой индексированной точки. В этом случае точка запроса не считается своим соседом.
- radiusfloat, по умолчанию=None
-
Радиус окрестностей. По умолчанию используется значение, переданное в конструктор.
- mode{‘connectivity’, ‘distance’}, по умолчанию=’connectivity’
-
Тип возвращаемой матрицы: ‘connectivity’ вернёт матрицу связности с единицами и нулями, в ‘distance’ рёбра являются расстояниями между точками, тип расстояния зависит от выбранного параметра метрики в классе NearestNeighbors.
- sort_resultsbool, по умолчанию=False
-
Если True, в каждой строке результата ненулевые значения будут отсортированы по возрастанию расстояний. Если False, ненулевые значения могут не быть отсортированы. Используется только с mode=’distance’.
Добавлена в версии 0.22.
- Возвращаемое значение:
-
- Aразреженная матрица формы (n_queries, n_samples_fit)
-
n_samples_fit— это количество образцов в наборе данных.A[i, j]задаёт вес ребра, соединяющегоiсj. Матрица имеет формат CSR.
См. также
kneighbors_graph-
Вычисление графа (взвешенного) k-соседей для точек в X.
Примеры
>>> X = [[0], [3], [1]] >>> from sklearn.neighbors import NearestNeighbors >>> neigh = NearestNeighbors(radius=1.5) >>> neigh.fit(X) NearestNeighbors(radius=1.5) >>> A = neigh.radius_neighbors_graph(X) >>> A.toarray() array([[1., 0., 1.], [0., 1., 0.], [1., 0., 1.]])
- set_params(**params)[source]
-
Устанавливает параметры этого оценщика.
Метод работает как с простыми оценщиками, так и с вложенными объектами (например, с
Pipeline). Последние имеют параметры вида<component>__<parameter>, чтобы было возможно обновлять каждый компонент вложенного объекта.- Параметры:
-
- **paramsdict
-
Параметры оценщика.
- Возвращаемое значение:
-
- selfэкземпляр оценщика
-
Экземпляр оценщика.
Примеры из галереи
© 2007–2025 The scikit-learn developers
Licensed under the 3-clause BSD License.
https://scikit-learn.org/1.6/modules/generated/sklearn.neighbors.NearestNeighbors.html