pandas.core.groupby.DataFrameGroupBy.describe
-
DataFrameGroupBy.describe(**kwargs)[source] -
Генерирует описательные статистики, которые обобщают центральную тенденцию, дисперсию и форму распределения набора данных, исключая
NaNзначения.Анализирует как числовые, так и строковые ряды, а также
DataFrameнаборы столбцов смешанных типов данных. Вывод будет отличаться в зависимости от предоставленных данных. Подробнее см. в примечаниях ниже.Параметры: percentiles : список чисел, необязательно
Процентили, которые нужно включить в вывод. Все значения должны быть в диапазоне от 0 до 1. По умолчанию
[.25, .5, .75], что возвращает 25-й, 50-й и 75-й процентили.include : ‘all’, список типов данных или None (по умолчанию), необязательно
Белый список типов данных, которые нужно включить в результат. Игнорируется для
Series. Вот доступные варианты:- ‘all’ : Все столбцы входных данных будут включены в вывод.
- Список типов данных : Ограничивает результаты предоставленными типами данных. Для ограничения результатов числовыми типами передайте
numpy.number. Для ограничения результата строковыми столбцами передайте тип данныхnumpy.object. Строки также можно использовать в форматеselect_dtypes(например,df.describe(include=['O'])). Для выбора столбцов pandas категориального типа используйте'category' - None (по умолчанию) : Результат будет включать все числовые столбцы.
exclude : список типов данных или None (по умолчанию), необязательно,
Черный список типов данных, которые нужно исключить из результата. Игнорируется для
Series. Вот доступные варианты:- Список типов данных : Исключает из результата предоставленные типы данных. Для исключения числовых типов передайте
numpy.number. Для исключения строковых столбцов передайте тип данныхnumpy.object. Строки также можно использовать в форматеselect_dtypes(например,df.describe(include=['O'])). Для исключения столбцов pandas категориального типа используйте'category' - None (по умолчанию) : Результат ничего не будет исключать.
Возвращает: - summary: Series/DataFrame сводных статистик
См. также
DataFrame.count,DataFrame.max,DataFrame.min,DataFrame.mean,DataFrame.std,DataFrame.select_dtypesПримечания
Для числовых данных индекс результата будет включать
count,mean,std,min,maxа также нижние,50и верхние процентили. По умолчанию нижний процентиль -25, а верхний -75.50процентиль совпадает со значением медианы.Для строковых данных (например, строк или временных меток) индекс результата будет включать
count,unique,top, иfreq.top- это наиболее часто встречающееся значение.freq- частота наиболее часто встречающегося значения. Временные метки также включают элементыfirstиlast.Если несколько строковых значений имеют наибольшее количество вхождений, результаты
countиtopбудут произвольно выбраны среди тех, у которых наибольшее количество вхождений.Для смешанных типов данных, предоставленных через
DataFrame, по умолчанию возвращается анализ только числовых столбцов. Если датафрейм содержит только строковые и категориальные данные без числовых столбцов, по умолчанию возвращается анализ и строковых, и категориальных столбцов. При указанииinclude='all', результат будет включать объединение атрибутов каждого типа.Параметры
includeиexcludeмогут использоваться для ограничения столбцов вDataFrame, анализируемых для вывода. Параметры игнорируются при анализеSeries.Примеры
Описание числового
Series.>>> s = pd.Series([1, 2, 3]) >>> s.describe() count 3.0 mean 2.0 std 1.0 min 1.0 25% 1.5 50% 2.0 75% 2.5 max 3.0
Описание категориального
Series.>>> s = pd.Series(['a', 'a', 'b', 'c']) >>> s.describe() count 4 unique 3 top a freq 2 dtype: object
Описание временной метки
Series.>>> s = pd.Series([ ... np.datetime64("2000-01-01"), ... np.datetime64("2010-01-01"), ... np.datetime64("2010-01-01") ... ]) >>> s.describe() count 3 unique 2 top 2010-01-01 00:00:00 freq 2 first 2000-01-01 00:00:00 last 2010-01-01 00:00:00 dtype: objectОписание
DataFrame. По умолчанию возвращаются только числовые поля.>>> df = pd.DataFrame({ 'object': ['a', 'b', 'c'], ... 'numeric': [1, 2, 3], ... 'categorical': pd.Categorical(['d','e','f']) ... }) >>> df.describe() numeric count 3.0 mean 2.0 std 1.0 min 1.0 25% 1.5 50% 2.0 75% 2.5 max 3.0Описание всех столбцов
DataFrameнезависимо от типа данных.>>> df.describe(include='all') categorical numeric object count 3 3.0 3 unique 3 NaN 3 top f NaN c freq 1 NaN 1 mean NaN 2.0 NaN std NaN 1.0 NaN min NaN 1.0 NaN 25% NaN 1.5 NaN 50% NaN 2.0 NaN 75% NaN 2.5 NaN max NaN 3.0 NaNОписание столбца из
DataFrameпутем доступа к нему как к атрибуту.>>> df.numeric.describe() count 3.0 mean 2.0 std 1.0 min 1.0 25% 1.5 50% 2.0 75% 2.5 max 3.0 Name: numeric, dtype: float64
Включение только числовых столбцов в описание
DataFrame.>>> df.describe(include=[np.number]) numeric count 3.0 mean 2.0 std 1.0 min 1.0 25% 1.5 50% 2.0 75% 2.5 max 3.0Включение только строковых столбцов в описание
DataFrame.>>> df.describe(include=[np.object]) object count 3 unique 3 top c freq 1Включение только категориальных столбцов в описание
DataFrame.>>> df.describe(include=['category']) categorical count 3 unique 3 top f freq 1Исключение числовых столбцов из описания
DataFrame.>>> df.describe(exclude=[np.number]) categorical object count 3 3 unique 3 3 top f c freq 1 1Исключение строковых столбцов из описания
DataFrame.>>> df.describe(exclude=[np.object]) categorical numeric count 3 3.0 unique 3 NaN top f NaN freq 1 NaN mean NaN 2.0 std NaN 1.0 min NaN 1.0 25% NaN 1.5 50% NaN 2.0 75% NaN 2.5 max NaN 3.0
© 2008–2012, AQR Capital Management, LLC, Lambda Foundry, Inc. and PyData Development Team
Licensed under the 3-clause BSD License.
https://pandas.pydata.org/pandas-docs/version/0.23.4/generated/pandas.core.groupby.DataFrameGroupBy.describe.html