pandas.core.groupby.DataFrameGroupBy.describe
- DataFrameGroupBy.describe(percentiles=None, include=None, exclude=None)[source]
-
Генерация описательной статистики.
Описательная статистика включает в себя показатели центральной тенденции, дисперсии и формы распределения набора данных, исключая значения
NaN.Анализирует как числовые, так и строковые ряды, а также наборы столбцов
DataFrameсмешанных типов данных. Результат будет отличаться в зависимости от входных данных. Подробности см. в примечаниях ниже.- Параметры:
-
- percentiles:список чисел, необязательно
-
Процентили для включения в вывод. Все значения должны находиться в интервале от 0 до 1. По умолчанию используется
[.25, .5, .75], что возвращает 25-й, 50-й и 75-й процентили. - include:‘all’, список типов данных или None (по умолчанию), необязательно
-
Белый список типов данных для включения в результат. Игнорируется для
Series. Доступные варианты:‘all’ : Все столбцы входных данных будут включены в вывод.
Список типов данных : Ограничивает результаты предоставленными типами данных. Чтобы ограничить результат числовыми типами, отправьте
numpy.number. Чтобы ограничить результат строковыми столбцами, отправьте тип данныхnumpy.object. Строки также могут использоваться в стилеselect_dtypes(например,df.describe(include=['O'])). Для выбора столбцов типа pandas категория используйте'category'None (по умолчанию) : Результат будет включать все числовые столбцы.
- exclude:список типов данных или None (по умолчанию), необязательно
-
Черный список типов данных для исключения из результата. Игнорируется для
Series. Доступные варианты:Список типов данных : Исключает указанные типы данных из результата. Чтобы исключить числовые типы, отправьте
numpy.number. Чтобы исключить строковые столбцы, отправьте тип данныхnumpy.object. Строки также могут использоваться в стилеselect_dtypes(например,df.describe(exclude=['O'])). Для исключения столбцов типа pandas категория используйте'category'None (по умолчанию) : Ничего не будет исключено.
- Возвращает:
-
- Ряд или DataFrame
-
Статистические данные о предоставленном ряду или DataFrame.
См. также
DataFrame.count-
Подсчёт количества наблюдений без пропусков/null.
DataFrame.max-
Максимальное значение в строковом объекте.
DataFrame.min-
Минимальное значение в строковом объекте.
DataFrame.mean-
Среднее значение.
DataFrame.std-
Стандартное отклонение.
DataFrame.select_dtypes-
Подмножество DataFrame, включающее/исключающее столбцы на основе их типа.
Примечания
Для числовых данных индекс результата будет включать
count,mean,std,min,maxа также нижние,50и верхние процентили. По умолчанию нижний процентиль -25, а верхний -75.50процентиль совпадает с медианой.Для строковых данных (например, строк или метки времени), индекс результата будет включать
count,unique,top, иfreq.top— это наиболее часто встречающееся значение.freq- частота наиболее часто встречающегося значения. Для меток времени также доступныfirstиlast.Если несколько строковых значений имеют наибольшее количество вхождений, то
countиtopрезультаты будут произвольно выбраны из тех, которые имеют наибольшее количество вхождений.Для смешанных типов данных, предоставленных через
DataFrame, по умолчанию возвращается анализ только числовых столбцов. Если DataFrame состоит только из строковых и категориальных данных без числовых столбцов, по умолчанию возвращается анализ строковых и категориальных столбцов. Если параметрinclude='all'указан, результат будет включать объединение атрибутов каждого типа.Параметры include и exclude могут использоваться для ограничения столбцов в
DataFrame, которые анализируются для вывода. Параметры игнорируются при анализеSeries.Примеры
Описание числового
Series.>>> s = pd.Series([1, 2, 3]) >>> s.describe() count 3.0 mean 2.0 std 1.0 min 1.0 25% 1.5 50% 2.0 75% 2.5 max 3.0 dtype: float64
Описание категориального
Series.>>> s = pd.Series(['a', 'a', 'b', 'c']) >>> s.describe() count 4 unique 3 top a freq 2 dtype: object
Описание timestamp
Series.>>> s = pd.Series([ ... np.datetime64("2000-01-01"), ... np.datetime64("2010-01-01"), ... np.datetime64("2010-01-01") ... ]) >>> s.describe() count 3 mean 2006-09-01 08:00:00 min 2000-01-01 00:00:00 25% 2004-12-31 12:00:00 50% 2010-01-01 00:00:00 75% 2010-01-01 00:00:00 max 2010-01-01 00:00:00 dtype: objectОписание
DataFrame. По умолчанию возвращаются только числовые поля.>>> df = pd.DataFrame({'categorical': pd.Categorical(['d', 'e', 'f']), ... 'numeric': [1, 2, 3], ... 'object': ['a', 'b', 'c'] ... }) >>> df.describe() numeric count 3.0 mean 2.0 std 1.0 min 1.0 25% 1.5 50% 2.0 75% 2.5 max 3.0Описание всех столбцов
DataFrameнезависимо от типа данных.>>> df.describe(include='all') categorical numeric object count 3 3.0 3 unique 3 NaN 3 top f NaN a freq 1 NaN 1 mean NaN 2.0 NaN std NaN 1.0 NaN min NaN 1.0 NaN 25% NaN 1.5 NaN 50% NaN 2.0 NaN 75% NaN 2.5 NaN max NaN 3.0 NaNОписание столбца из
DataFrameчерез доступ к нему в качестве атрибута.>>> df.numeric.describe() count 3.0 mean 2.0 std 1.0 min 1.0 25% 1.5 50% 2.0 75% 2.5 max 3.0 Name: numeric, dtype: float64
Включение только числовых столбцов в описание
DataFrame.>>> df.describe(include=[np.number]) numeric count 3.0 mean 2.0 std 1.0 min 1.0 25% 1.5 50% 2.0 75% 2.5 max 3.0Включение только строковых столбцов в описание
DataFrame.>>> df.describe(include=[object]) object count 3 unique 3 top a freq 1Включение только категориальных столбцов в описание
DataFrame.>>> df.describe(include=['category']) categorical count 3 unique 3 top d freq 1Исключение числовых столбцов из описания
DataFrame.>>> df.describe(exclude=[np.number]) categorical object count 3 3 unique 3 3 top f a freq 1 1Исключение строковых столбцов из описания
DataFrame.>>> df.describe(exclude=[object]) categorical numeric count 3 3.0 unique 3 NaN top f NaN freq 1 NaN mean NaN 2.0 std NaN 1.0 min NaN 1.0 25% NaN 1.5 50% NaN 2.0 75% NaN 2.5 max NaN 3.0
© 2008–2022, AQR Capital Management, LLC, Lambda Foundry, Inc. and PyData Development Team
Licensed under the 3-clause BSD License.
https://pandas.pydata.org/pandas-docs/version/2.2.2/reference/api/pandas.core.groupby.DataFrameGroupBy.describe.html