Spec-Zone.ru › pandas 0.24

pandas.Index.get_duplicates

Index.get_duplicates() [source]

Извлечение дублированных элементов индекса.

Устарело начиная с версии 0.23.0: Используйте idx[idx.duplicated()].unique() вместо этого

Возвращает отсортированный список элементов индекса, которые встречаются более одного раза в индексе.

Возвращает:
массив-подобный объект

Список дублированных индексов.

См. также

Index.duplicated
Возвращает булевый массив, обозначающий дубликаты.
Index.drop_duplicates
Возвращает индекс без дубликатов.

Примеры

Работает с разными типами индексов.

>>> pd.Index([1, 2, 2, 3, 3, 3, 4]).get_duplicates()  # doctest: +SKIP
[2, 3]

Обратите внимание, что для DatetimeIndex он не возвращает список, а новый DatetimeIndex:

>>> dates = pd.to_datetime(['2018-01-01', '2018-01-02', '2018-01-03',
...                         '2018-01-03', '2018-01-04', '2018-01-04'],
...                        format='%Y-%m-%d')
>>> pd.Index(dates).get_duplicates()  # doctest: +SKIP
DatetimeIndex(['2018-01-03', '2018-01-04'],
              dtype='datetime64[ns]', freq=None)

Сортирует дублированные элементы, даже если индексы неупорядочены.

>>> pd.Index([1, 2, 3, 2, 3, 4, 3]).get_duplicates()  # doctest: +SKIP
[2, 3]

Возвращает пустой массив-подобный объект, если все элементы уникальны.

>>> pd.Index([1, 2, 3, 4]).get_duplicates()  # doctest: +SKIP
[]
>>> dates = pd.to_datetime(['2018-01-01', '2018-01-02', '2018-01-03'],
...                        format='%Y-%m-%d')
>>> pd.Index(dates).get_duplicates()  # doctest: +SKIP
DatetimeIndex([], dtype='datetime64[ns]', freq=None)

© 2008–2012, AQR Capital Management, LLC, Lambda Foundry, Inc. and PyData Development Team
Licensed under the 3-clause BSD License.
https://pandas.pydata.org/pandas-docs/version/0.24.2/reference/api/pandas.Index.get_duplicates.html

Spec-Zone.ru

Настройки Оффлайн Что нового Помощь О нас
Spec-Zone .ru
спецификации, руководства, описания, API