pandas.cut
-
pandas.cut(x, bins, right=True, labels=None, retbins=False, precision=3, include_lowest=False)[source] -
Возвращает индексы полуоткрытых интервалов, к которым принадлежит каждое значение
x.Параметры: x : массив-подобный объект
Входной массив для распределения по интервалам. Он должен быть одномерным.
bins : целое число, последовательность скаляров или IntervalIndex
Если
binsявляется целым числом, оно определяет количество интервалов с равной шириной в диапазонеx. Однако в этом случае диапазонxрасширяется на 0,1% с каждой стороны, чтобы включить минимальное и максимальное значенияx. Еслиbinsявляется последовательностью, она определяет границы интервалов, что позволяет использовать неравномерную ширину интервалов. В этом случае расширение диапазонаxне выполняется.right : bool, необязательно
Указывает, включает ли интервал правую границу или нет. Если right == True (по умолчанию), то интервалы [1,2,3,4] обозначают (1,2], (2,3], (3,4].
labels : массив или булево значение, по умолчанию None
Используется в качестве меток для полученных интервалов. Должен иметь такую же длину, как и полученные интервалы. Если False, возвращаются только целочисленные указатели на интервалы.
retbins : bool, необязательно
Возвращать ли интервалы. Может быть полезно, если bins задано как скаляр.
precision : целое число, необязательно
Точность хранения и отображения меток интервалов
include_lowest : bool, необязательно
Первый интервал должен быть левосторонне включительным или нет.
Возвращает: out : Categorical или Series или массив целых чисел, если labels равно False
Тип возвращаемого значения (Categorical или Series) зависит от входных данных: Series типа category, если вход — Series, иначе Categorical. Интервалы представлены как категории, когда возвращаются категориальные данные.
bins : одномерный массив с плавающей точкой
Возвращается только если
retbinsравно True.Примечания
Функция
cutможет быть полезна для перехода от непрерывной переменной к категориальной. Например,cutможет преобразовать возраст в группы возрастных диапазонов.Любые значения NA будут NA в результате. Значения вне границ будут NA в полученном объекте Categorical.
Примеры
>>> pd.cut(np.array([.2, 1.4, 2.5, 6.2, 9.7, 2.1]), 3, retbins=True) ... ([(0.19, 3.367], (0.19, 3.367], (0.19, 3.367], (3.367, 6.533], ... Categories (3, interval[float64]): [(0.19, 3.367] < (3.367, 6.533] ...
>>> pd.cut(np.array([.2, 1.4, 2.5, 6.2, 9.7, 2.1]), ... 3, labels=["good", "medium", "bad"]) ... [good, good, good, medium, bad, good] Categories (3, object): [good < medium < bad]
>>> pd.cut(np.ones(5), 4, labels=False) array([1, 1, 1, 1, 1])
© 2008–2012, AQR Capital Management, LLC, Lambda Foundry, Inc. and PyData Development Team
Licensed under the 3-clause BSD License.
https://pandas.pydata.org/pandas-docs/version/0.21.1/generated/pandas.cut.html