pandas.core.groupby.DataFrameGroupBy.describe
-
DataFrameGroupBy.describe(**kwargs)[source] -
Генерация описательной статистики, которая суммирует центральную тенденцию, дисперсию и форму распределения набора данных, исключая
NaNзначения.Анализирует числовые и строковые ряды, а также
DataFrameнаборы столбцов смешанных типов данных. Вывод будет зависеть от предоставленных данных. Дополнительные сведения см. в примечаниях ниже.Параметры: -
percentiles : list-like of numbers, optional -
Процентили, которые следует включить в вывод. Все они должны находиться в диапазоне от 0 до 1. По умолчанию используется
[.25, .5, .75], что возвращает 25-й, 50-й и 75-й процентили. -
include : ‘all’, list-like of dtypes or None (default), optional -
Белый список типов данных, которые следует включить в результат. Игнорируется для
Series. Вот варианты:- ‘all’ : Все столбцы входных данных будут включены в вывод.
- Список типов данных : Ограничивает результаты предоставленными типами данных. Чтобы ограничить результат числовыми типами, отправьте
numpy.number. Чтобы ограничить его вместо этого столбцами типа object, отправьте тип данныхnumpy.object. Строки также могут использоваться в стилеselect_dtypes(например,df.describe(include=['O'])). Чтобы выбрать столбцы pandas категориального типа, используйте'category' - None (по умолчанию) : Результат будет включать все числовые столбцы.
-
exclude : list-like of dtypes or None (default), optional, -
Черный список типов данных, которые следует исключить из результата. Игнорируется для
Series. Вот варианты:- Список типов данных : Исключает предоставленные типы данных из результата. Чтобы исключить числовые типы, отправьте
numpy.number. Чтобы исключить столбцы типа object, отправьте тип данныхnumpy.object. Строки также могут использоваться в стилеselect_dtypes(например,df.describe(include=['O'])). Чтобы исключить столбцы pandas категориального типа, используйте'category' - None (по умолчанию) : Результат не будет исключать ничего.
- Список типов данных : Исключает предоставленные типы данных из результата. Чтобы исключить числовые типы, отправьте
Возвращает: - Ряд или DataFrame
-
Статистические данные сводки предоставленного ряда или DataFrame.
См. также
-
DataFrame.count - Подсчет числа наблюдений без пропусков/нулей.
-
DataFrame.max - Максимальное значение в объекте.
-
DataFrame.min - Минимальное значение в объекте.
-
DataFrame.mean - Среднее значение.
-
DataFrame.std - Среднеквадратичное отклонение наблюдений.
-
DataFrame.select_dtypes - Подмножество DataFrame, включающее/исключающее столбцы на основе их типа данных.
Примечания
Для числовых данных индекс результата будет включать
count,mean,std,min,max, а также нижние,50и верхние процентили. По умолчанию нижний процентиль25, а верхний75.50процентиль совпадает со значением медианы.Для данных типа object (например, строки или временные метки) индекс результата будет включать
count,unique,top, иfreq.top— это наиболее часто встречающееся значение.freq— это частота наиболее часто встречающегося значения. Временные метки также включаютfirstиlastэлементы.Если несколько значений типа object имеют одинаковую максимальную частоту, то результаты
countиtopбудут произвольно выбраны из числа тех, которые имеют максимальную частоту.Для смешанных типов данных, предоставляемых через
DataFrame, по умолчанию возвращается анализ только числовых столбцов. Если DataFrame содержит только данные типа object и категориальные данные без числовых столбцов, по умолчанию возвращается анализ как столбцов типа object, так и категориальных столбцов. Еслиinclude='all'задан в качестве опции, результат будет включать объединение атрибутов каждого типа.Параметры
includeиexcludeможно использовать для ограничения анализа столбцов вDataFrameдля вывода. Эти параметры игнорируются при анализеSeries.Примеры
Описание числового
Series.>>> s = pd.Series([1, 2, 3]) >>> s.describe() count 3.0 mean 2.0 std 1.0 min 1.0 25% 1.5 50% 2.0 75% 2.5 max 3.0 dtype: float64
Описание категориального
Series.>>> s = pd.Series(['a', 'a', 'b', 'c']) >>> s.describe() count 4 unique 3 top a freq 2 dtype: object
Описание временной метки
Series.>>> s = pd.Series([ ... np.datetime64("2000-01-01"), ... np.datetime64("2010-01-01"), ... np.datetime64("2010-01-01") ... ]) >>> s.describe() count 3 unique 2 top 2010-01-01 00:00:00 freq 2 first 2000-01-01 00:00:00 last 2010-01-01 00:00:00 dtype: objectОписание
DataFrame. По умолчанию возвращаются только числовые поля.>>> df = pd.DataFrame({'categorical': pd.Categorical(['d','e','f']), ... 'numeric': [1, 2, 3], ... 'object': ['a', 'b', 'c'] ... }) >>> df.describe() numeric count 3.0 mean 2.0 std 1.0 min 1.0 25% 1.5 50% 2.0 75% 2.5 max 3.0Описание всех столбцов
DataFrameнезависимо от типа данных.>>> df.describe(include='all') categorical numeric object count 3 3.0 3 unique 3 NaN 3 top f NaN c freq 1 NaN 1 mean NaN 2.0 NaN std NaN 1.0 NaN min NaN 1.0 NaN 25% NaN 1.5 NaN 50% NaN 2.0 NaN 75% NaN 2.5 NaN max NaN 3.0 NaNОписание столбца из
DataFrameпутем доступа к нему как к атрибуту.>>> df.numeric.describe() count 3.0 mean 2.0 std 1.0 min 1.0 25% 1.5 50% 2.0 75% 2.5 max 3.0 Name: numeric, dtype: float64
Включение только числовых столбцов в описании
DataFrame.>>> df.describe(include=[np.number]) numeric count 3.0 mean 2.0 std 1.0 min 1.0 25% 1.5 50% 2.0 75% 2.5 max 3.0Включение только строковых столбцов в описании
DataFrame.>>> df.describe(include=[np.object]) object count 3 unique 3 top c freq 1Включение только категориальных столбцов в описании
DataFrame.>>> df.describe(include=['category']) categorical count 3 unique 3 top f freq 1Исключение числовых столбцов из описания
DataFrame.>>> df.describe(exclude=[np.number]) categorical object count 3 3 unique 3 3 top f c freq 1 1Исключение столбцов типа object из описания
DataFrame.>>> df.describe(exclude=[np.object]) categorical numeric count 3 3.0 unique 3 NaN top f NaN freq 1 NaN mean NaN 2.0 std NaN 1.0 min NaN 1.0 25% NaN 1.5 50% NaN 2.0 75% NaN 2.5 max NaN 3.0 -
© 2008–2012, AQR Capital Management, LLC, Lambda Foundry, Inc. and PyData Development Team
Licensed under the 3-clause BSD License.
https://pandas.pydata.org/pandas-docs/version/0.24.2/reference/api/pandas.core.groupby.DataFrameGroupBy.describe.html