pandas.core.groupby.DataFrameGroupBy.describe
-
DataFrameGroupBy.describe(self, **kwargs)[source] -
Генерировать описательные статистики, которые суммируют центральную тенденцию, дисперсию и форму распределения набора данных, исключая
NaNзначения.Анализирует как числовые, так и строковые ряды, а также
DataFrameнаборы столбцов смешанных типов данных. Выход будет зависеть от входных данных. Подробнее см. в примечаниях ниже.Параметры: -
percentiles : list-like of numbers, optional -
Процентили, которые нужно включить в вывод. Все они должны находиться в интервале от 0 до 1. По умолчанию это
[.25, .5, .75], что возвращает 25-й, 50-й и 75-й процентили. -
include : ‘all’, list-like of dtypes or None (default), optional -
Белый список типов данных, которые нужно включить в результат. Игнорируется для
Series. Доступные варианты:- ‘all’ : Все столбцы входных данных будут включены в вывод.
- Список типов данных : Ограничивает результаты предоставленными типами данных. Для ограничения результата числовыми типами используйте
numpy.number. Для ограничения результата строковыми столбцами используйте тип данныхnumpy.object. Строки также могут быть использованы по аналогии сselect_dtypes(например,df.describe(include=['O'])). Для выбора столбцов pandas категориального типа используйте'category' - None (по умолчанию) : Результат будет включать все числовые столбцы.
-
exclude : list-like of dtypes or None (default), optional, -
Черный список типов данных, которые нужно исключить из результата. Игнорируется для
Series. Доступные варианты:- Список типов данных : Исключение предоставленных типов данных из результата. Для исключения числовых типов используйте
numpy.number. Для исключения строковых столбцов используйте тип данныхnumpy.object. Строки также могут быть использованы по аналогии сselect_dtypes(например,df.describe(include=['O'])). Для исключения столбцов pandas категориального типа используйте'category' - None (по умолчанию) : Результат ничего не будет исключать.
- Список типов данных : Исключение предоставленных типов данных из результата. Для исключения числовых типов используйте
Возвращает: - Ряд или DataFrame
-
Статистические данные о предоставленном ряду или DataFrame.
См. также
-
DataFrame.count - Подсчет количества ненулевых/не-NaN наблюдений.
-
DataFrame.max - Максимальное значение в объекте.
-
DataFrame.min - Минимальное значение в объекте.
-
DataFrame.mean - Среднее значение.
-
DataFrame.std - Стандартное отклонение наблюдений.
-
DataFrame.select_dtypes - Подмножество DataFrame, включающее/исключающее столбцы на основе их типа данных.
Примечания
Для числовых данных индекс результата будет включать
count,mean,std,min,maxа также нижние,50и верхние процентили. По умолчанию нижний процентиль —25, а верхний —75.50процентиль совпадает со значением медианы.Для строковых данных (например, строк или временных меток) индекс результата будет включать
count,unique,top, иfreq.top— наиболее часто встречающееся значение.freq— частота наиболее часто встречающегося значения. Временные метки также включают элементыfirstиlast.Если несколько строковых значений имеют наибольшее количество вхождений, то результаты
countиtopбудут произвольно выбраны среди тех, которые имеют наибольшее количество вхождений.Для смешанных типов данных, предоставленных через
DataFrame, по умолчанию возвращается анализ только числовых столбцов. Если DataFrame состоит только из строковых и категориальных данных без числовых столбцов, по умолчанию возвращается анализ строковых и категориальных столбцов. Еслиinclude='all'предоставлен в качестве параметра, результат будет включать объединение атрибутов каждого типа.Параметры
includeиexcludeможно использовать для ограничения столбцов вDataFrame, которые анализируются для вывода. Эти параметры игнорируются при анализеSeries.Примеры
Описание числового
Series.>>> s = pd.Series([1, 2, 3]) >>> s.describe() count 3.0 mean 2.0 std 1.0 min 1.0 25% 1.5 50% 2.0 75% 2.5 max 3.0 dtype: float64
Описание категориального
Series.>>> s = pd.Series(['a', 'a', 'b', 'c']) >>> s.describe() count 4 unique 3 top a freq 2 dtype: object
Описание временной метки
Series.>>> s = pd.Series([ ... np.datetime64("2000-01-01"), ... np.datetime64("2010-01-01"), ... np.datetime64("2010-01-01") ... ]) >>> s.describe() count 3 unique 2 top 2010-01-01 00:00:00 freq 2 first 2000-01-01 00:00:00 last 2010-01-01 00:00:00 dtype: objectОписание
DataFrame. По умолчанию возвращаются только числовые поля.>>> df = pd.DataFrame({'categorical': pd.Categorical(['d','e','f']), ... 'numeric': [1, 2, 3], ... 'object': ['a', 'b', 'c'] ... }) >>> df.describe() numeric count 3.0 mean 2.0 std 1.0 min 1.0 25% 1.5 50% 2.0 75% 2.5 max 3.0Описание всех столбцов
DataFrameнезависимо от типа данных.>>> df.describe(include='all') categorical numeric object count 3 3.0 3 unique 3 NaN 3 top f NaN c freq 1 NaN 1 mean NaN 2.0 NaN std NaN 1.0 NaN min NaN 1.0 NaN 25% NaN 1.5 NaN 50% NaN 2.0 NaN 75% NaN 2.5 NaN max NaN 3.0 NaNОписание столбца из
DataFrame, обращаясь к нему как к атрибуту.>>> df.numeric.describe() count 3.0 mean 2.0 std 1.0 min 1.0 25% 1.5 50% 2.0 75% 2.5 max 3.0 Name: numeric, dtype: float64
Включение только числовых столбцов в описании
DataFrame.>>> df.describe(include=[np.number]) numeric count 3.0 mean 2.0 std 1.0 min 1.0 25% 1.5 50% 2.0 75% 2.5 max 3.0Включение только строковых столбцов в описании
DataFrame.>>> df.describe(include=[np.object]) object count 3 unique 3 top c freq 1Включение только категориальных столбцов в описании
DataFrame.>>> df.describe(include=['category']) categorical count 3 unique 3 top f freq 1Исключение числовых столбцов из описания
DataFrame.>>> df.describe(exclude=[np.number]) categorical object count 3 3 unique 3 3 top f c freq 1 1Исключение строковых столбцов из описания
DataFrame.>>> df.describe(exclude=[np.object]) categorical numeric count 3 3.0 unique 3 NaN top f NaN freq 1 NaN mean NaN 2.0 std NaN 1.0 min NaN 1.0 25% NaN 1.5 50% NaN 2.0 75% NaN 2.5 max NaN 3.0 -
© 2008–2012, AQR Capital Management, LLC, Lambda Foundry, Inc. and PyData Development Team
Licensed under the 3-clause BSD License.
https://pandas.pydata.org/pandas-docs/version/0.25.0/reference/api/pandas.core.groupby.DataFrameGroupBy.describe.html