Spec-Zone.ru › pandas 0.19

pandas.cut

pandas.cut(x, bins, right=True, labels=None, retbins=False, precision=3, include_lowest=False) [source]

Возвращает индексы полуоткрытых интервалов, к которым принадлежит каждое значение x.

Параметры:

x : массив-подобный объект

Вводной массив для разбиения. Он должен быть одномерным.

bins : целое число или последовательность скаляров

Если bins - целое число, оно определяет количество равномерных интервалов в диапазоне x. Однако в этом случае диапазон x расширяется на 0,1% с каждой стороны, чтобы включить минимальное и максимальное значения x. Если bins - последовательность, она определяет границы интервалов, позволяя использовать неравномерную ширину интервалов. В этом случае диапазон x не расширяется.

right : bool, необязательно

Указывает, включает ли интервал правую границу или нет. Если right == True (по умолчанию), то интервалы [1,2,3,4] обозначают (1,2], (2,3], (3,4].

labels : массив или булево значение, по умолчанию None

Используется в качестве меток для полученных интервалов. Должен иметь такую же длину, как и полученные интервалы. Если False, возвращаются только целочисленные индикаторы интервалов.

retbins : bool, необязательно

Возвращать ли интервалы. Может быть полезно, если bins задано как скаляр.

precision : целое число

Точность хранения и отображения меток интервалов

include_lowest : bool

Является ли первый интервал лево-включительно?

Возвращает:

out : Categorical или Series или массив целых чисел, если labels равно False

Тип возвращаемого значения (Categorical или Series) зависит от входных данных: Series типа category, если входной параметр - Series, иначе Categorical. Интервалы представлены как категории, когда возвращаются категориальные данные.

bins : ndarray с плавающей точкой

Возвращается только если retbins равно True.

Примечания

Функция cut может быть полезна для преобразования непрерывной переменной в категориальную. Например, cut может преобразовать возраст в группы возрастных диапазонов.

Любые значения NA будут NA в результате. Значения вне диапазона будут NA в результирующем объекте Categorical

Примеры

>>> pd.cut(np.array([.2, 1.4, 2.5, 6.2, 9.7, 2.1]), 3, retbins=True)
([(0.191, 3.367], (0.191, 3.367], (0.191, 3.367], (3.367, 6.533],
  (6.533, 9.7], (0.191, 3.367]]
Categories (3, object): [(0.191, 3.367] < (3.367, 6.533] < (6.533, 9.7]],
array([ 0.1905    ,  3.36666667,  6.53333333,  9.7       ]))
>>> pd.cut(np.array([.2, 1.4, 2.5, 6.2, 9.7, 2.1]), 3,
           labels=["good","medium","bad"])
[good, good, good, medium, bad, good]
Categories (3, object): [good < medium < bad]
>>> pd.cut(np.ones(5), 4, labels=False)
array([1, 1, 1, 1, 1], dtype=int64)

© 2008–2012, AQR Capital Management, LLC, Lambda Foundry, Inc. and PyData Development Team
Licensed under the 3-clause BSD License.
https://pandas.pydata.org/pandas-docs/version/0.19.2/generated/pandas.cut.html

Spec-Zone.ru

Настройки Оффлайн Что нового Помощь О нас
Spec-Zone .ru
спецификации, руководства, описания, API