Spec-Zone.ru › pandas 0.23

pandas.Index.get_duplicates

Index.get_duplicates() [source]

Извлечение дублирующихся элементов индекса.

Возвращает отсортированный список элементов индекса, которые появляются более одного раза в индексе.

Устарело начиная с версии 0.23.0: Используйте idx[idx.duplicated()].unique() вместо этого

Возвращает:

array-like

Список дублирующихся индексов.

См. также

Index.duplicated
Возвращает булевый массив, обозначающий дубликаты.
Index.drop_duplicates
Возвращает индекс с удаленными дубликатами.

Примеры

Работает с различными типами индексов.

>>> pd.Index([1, 2, 2, 3, 3, 3, 4]).get_duplicates()
[2, 3]
>>> pd.Index([1., 2., 2., 3., 3., 3., 4.]).get_duplicates()
[2.0, 3.0]
>>> pd.Index(['a', 'b', 'b', 'c', 'c', 'c', 'd']).get_duplicates()
['b', 'c']

Обратите внимание, что для DatetimeIndex он не возвращает список, а новый DatetimeIndex:

>>> dates = pd.to_datetime(['2018-01-01', '2018-01-02', '2018-01-03',
...                         '2018-01-03', '2018-01-04', '2018-01-04'],
...                        format='%Y-%m-%d')
>>> pd.Index(dates).get_duplicates()
DatetimeIndex(['2018-01-03', '2018-01-04'],
              dtype='datetime64[ns]', freq=None)

Сортирует дублирующиеся элементы, даже когда индексы не упорядочены.

>>> pd.Index([1, 2, 3, 2, 3, 4, 3]).get_duplicates()
[2, 3]

Возвращает пустую структуру array-like, когда все элементы уникальны.

>>> pd.Index([1, 2, 3, 4]).get_duplicates()
[]
>>> dates = pd.to_datetime(['2018-01-01', '2018-01-02', '2018-01-03'],
...                        format='%Y-%m-%d')
>>> pd.Index(dates).get_duplicates()
DatetimeIndex([], dtype='datetime64[ns]', freq=None)

© 2008–2012, AQR Capital Management, LLC, Lambda Foundry, Inc. and PyData Development Team
Licensed under the 3-clause BSD License.
https://pandas.pydata.org/pandas-docs/version/0.23.4/generated/pandas.Index.get_duplicates.html

Spec-Zone.ru

Настройки Оффлайн Что нового Помощь О нас
Spec-Zone .ru
спецификации, руководства, описания, API