pandas.Index.get_duplicates
-
Index.get_duplicates()[source] -
Извлечение дублирующихся элементов индекса.
Возвращает отсортированный список элементов индекса, которые появляются более одного раза в индексе.
Устарело начиная с версии 0.23.0: Используйте idx[idx.duplicated()].unique() вместо этого
Возвращает: array-like
Список дублирующихся индексов.
См. также
-
Index.duplicated - Возвращает булевый массив, обозначающий дубликаты.
-
Index.drop_duplicates - Возвращает индекс с удаленными дубликатами.
Примеры
Работает с различными типами индексов.
>>> pd.Index([1, 2, 2, 3, 3, 3, 4]).get_duplicates() [2, 3] >>> pd.Index([1., 2., 2., 3., 3., 3., 4.]).get_duplicates() [2.0, 3.0] >>> pd.Index(['a', 'b', 'b', 'c', 'c', 'c', 'd']).get_duplicates() ['b', 'c']
Обратите внимание, что для DatetimeIndex он не возвращает список, а новый DatetimeIndex:
>>> dates = pd.to_datetime(['2018-01-01', '2018-01-02', '2018-01-03', ... '2018-01-03', '2018-01-04', '2018-01-04'], ... format='%Y-%m-%d') >>> pd.Index(dates).get_duplicates() DatetimeIndex(['2018-01-03', '2018-01-04'], dtype='datetime64[ns]', freq=None)Сортирует дублирующиеся элементы, даже когда индексы не упорядочены.
>>> pd.Index([1, 2, 3, 2, 3, 4, 3]).get_duplicates() [2, 3]
Возвращает пустую структуру array-like, когда все элементы уникальны.
>>> pd.Index([1, 2, 3, 4]).get_duplicates() [] >>> dates = pd.to_datetime(['2018-01-01', '2018-01-02', '2018-01-03'], ... format='%Y-%m-%d') >>> pd.Index(dates).get_duplicates() DatetimeIndex([], dtype='datetime64[ns]', freq=None)
-
© 2008–2012, AQR Capital Management, LLC, Lambda Foundry, Inc. and PyData Development Team
Licensed under the 3-clause BSD License.
https://pandas.pydata.org/pandas-docs/version/0.23.4/generated/pandas.Index.get_duplicates.html