Spec-Zone.ru › pandas 2

pandas.Series.factorize

Series.factorize(sort=False, use_na_sentinel=True)[source]

Кодирование объекта как перечислимого типа или категориальной переменной.

Этот метод полезен для получения числового представления массива, когда важны только уникальные значения. factorize доступен как функция верхнего уровня pandas.factorize(), а также как метод Series.factorize() и Index.factorize().

Параметры:
sort:bool, по умолчанию False

Сортировать uniques и переупорядочить codes для поддержания соответствия.

use_na_sentinel:bool, по умолчанию True

Если True, для значений NaN будет использоваться метка -1. Если False, значения NaN будут закодированы как неотрицательные целые числа, и NaN не будет исключен из уникальных значений.

Введено в версии 1.5.0.

Возвращаемые значения:
codes:ndarray

Массив целых чисел, являющийся индексом в uniques. uniques.take(codes) будет содержать те же значения, что и values.

uniques:ndarray, Index или Categorical

Уникальные допустимые значения. Когда values — это Categorical, uniques — это Categorical. Когда values — это какой-либо другой объект pandas, возвращается Index. В противном случае возвращается одномерный массив.

Примечание

Даже если в values есть пропущенное значение, uniques не будет содержать запись для него.

См. также

cut

Дискретизация массива непрерывных значений.

unique

Нахождение уникального значения в массиве.

Примечания

Дополнительные примеры можно найти в руководстве пользователя.

Примеры

Эти примеры демонстрируют функцию factorize как функцию верхнего уровня, как pd.factorize(values). Результаты идентичны для методов, таких как Series.factorize().

>>> codes, uniques = pd.factorize(np.array(['b', 'b', 'a', 'c', 'b'], dtype="O"))
>>> codes
array([0, 0, 1, 2, 0])
>>> uniques
array(['b', 'a', 'c'], dtype=object)

При использовании параметра sort=True, uniques будут отсортированы, а codes будут переупорядочены, чтобы сохранить соответствие.

>>> codes, uniques = pd.factorize(np.array(['b', 'b', 'a', 'c', 'b'], dtype="O"),
...                               sort=True)
>>> codes
array([1, 1, 0, 2, 1])
>>> uniques
array(['a', 'b', 'c'], dtype=object)

Когда use_na_sentinel=True (значение по умолчанию), пропущенные значения в codes обозначаются меткой -1, и пропущенные значения не включаются в uniques.

>>> codes, uniques = pd.factorize(np.array(['b', None, 'a', 'c', 'b'], dtype="O"))
>>> codes
array([ 0, -1,  1,  2,  0])
>>> uniques
array(['b', 'a', 'c'], dtype=object)

До сих пор мы кодировали только списки (которые неявно преобразуются в массивы NumPy). При кодировании объектов pandas тип uniques будет отличаться. Для Categorical возвращается Categorical.

>>> cat = pd.Categorical(['a', 'a', 'c'], categories=['a', 'b', 'c'])
>>> codes, uniques = pd.factorize(cat)
>>> codes
array([0, 0, 1])
>>> uniques
['a', 'c']
Categories (3, object): ['a', 'b', 'c']

Обратите внимание, что 'b' находится в uniques.categories, хотя его нет в cat.values.

Для всех остальных объектов pandas возвращается соответствующий Index.

>>> cat = pd.Series(['a', 'a', 'c'])
>>> codes, uniques = pd.factorize(cat)
>>> codes
array([0, 0, 1])
>>> uniques
Index(['a', 'c'], dtype='object')

Если NaN есть в значениях, и нужно включить NaN в уникальные значения, это достигается установкой use_na_sentinel=False.

>>> values = np.array([1, 2, 1, np.nan])
>>> codes, uniques = pd.factorize(values)  # default: use_na_sentinel=True
>>> codes
array([ 0,  1,  0, -1])
>>> uniques
array([1., 2.])
>>> codes, uniques = pd.factorize(values, use_na_sentinel=False)
>>> codes
array([0, 1, 0, 2])
>>> uniques
array([ 1.,  2., nan])

© 2008–2022, AQR Capital Management, LLC, Lambda Foundry, Inc. and PyData Development Team
Licensed under the 3-clause BSD License.
https://pandas.pydata.org/pandas-docs/version/2.2.2/reference/api/pandas.Series.factorize.html

Spec-Zone.ru

Настройки Оффлайн Что нового Помощь О нас
Spec-Zone .ru
спецификации, руководства, описания, API