pandas.Series.describe
-
Series.describe(percentiles=None, include=None, exclude=None)[source] -
Генерирует описательные статистики, которые суммируют центральную тенденцию, дисперсию и форму распределения набора данных, исключая
NaNзначения.Анализирует числовые и строковые ряды, а также
DataFrameнаборы столбцов смешанных типов данных. Выходные данные будут варьироваться в зависимости от входных данных. Для получения более подробной информации см. примечания ниже.Параметры: percentiles : список чисел, необязательно
Процентили, которые следует включить в вывод. Все они должны находиться в диапазоне от 0 до 1. По умолчанию используется
[.25, .5, .75], что возвращает 25-й, 50-й и 75-й процентили.include : ‘all’, список типов данных или None (по умолчанию), необязательно
Белый список типов данных, которые следует включить в результат. Игнорируется для
Series. Вот варианты:- ‘all’ : Все столбцы входных данных будут включены в вывод.
- Список типов данных : Ограничивает результаты предоставленными типами данных. Чтобы ограничить результат числовыми типами, передайте
numpy.number. Чтобы ограничить его строковыми столбцами, передайте тип данныхnumpy.object. Строки также могут использоваться в стилеselect_dtypes(например,df.describe(include=['O'])). Для выбора столбцов pandas категориального типа используйте'category'. - None (по умолчанию) : Результат будет включать все числовые столбцы.
exclude : список типов данных или None (по умолчанию), необязательно
Черный список типов данных, которые следует исключить из результата. Игнорируется для
Series. Вот варианты:- Список типов данных : Исключает указанные типы данных из результата. Чтобы исключить числовые типы, передайте
numpy.number. Чтобы исключить строковые столбцы, передайте тип данныхnumpy.object. Строки также могут использоваться в стилеselect_dtypes(например,df.describe(include=['O'])). Для исключения столбцов pandas категориального типа используйте'category' - None (по умолчанию) : Результат не будет исключать ничего.
Возвращает: summary: Ряд/Таблица сводных статистик
См. также
DataFrame.count,DataFrame.max,DataFrame.min,DataFrame.mean,DataFrame.std,DataFrame.select_dtypesПримечания
Для числовых данных индекс результата будет включать
count,mean,std,min,max, а также нижние,50и верхние процентили. По умолчанию нижний процентиль равен25, а верхний процентиль равен75.50процентиль соответствует медиане.Для строковых данных (например, строк или временных меток) индекс результата будет включать
count,unique,top, иfreq.top— это наиболее часто встречающееся значение.freq— это частота наиболее часто встречающегося значения. Временные метки также включают элементыfirstиlast.Если несколько строковых значений имеют наибольшее количество вхождений, то результаты
countиtopбудут произвольно выбраны из тех, которые имеют наибольшее количество вхождений.Для смешанных типов данных, предоставленных через
DataFrame, по умолчанию возвращается только анализ числовых столбцов. Если фрейм данных состоит только из строковых и категориальных данных без числовых столбцов, по умолчанию возвращается анализ как строковых, так и категориальных столбцов. Еслиinclude='all'указан как параметр, результат будет включать объединение атрибутов каждого типа.Параметры
includeиexcludeмогут быть использованы для ограничения анализа столбцов вDataFrameдля вывода. Параметры игнорируются при анализеSeries.Примеры
Описание числового
Series.>>> s = pd.Series([1, 2, 3]) >>> s.describe() count 3.0 mean 2.0 std 1.0 min 1.0 25% 1.5 50% 2.0 75% 2.5 max 3.0
Описание категориального
Series.>>> s = pd.Series(['a', 'a', 'b', 'c']) >>> s.describe() count 4 unique 3 top a freq 2 dtype: object
Описание временной метки
Series.>>> s = pd.Series([ ... np.datetime64("2000-01-01"), ... np.datetime64("2010-01-01"), ... np.datetime64("2010-01-01") ... ]) >>> s.describe() count 3 unique 2 top 2010-01-01 00:00:00 freq 2 first 2000-01-01 00:00:00 last 2010-01-01 00:00:00 dtype: objectОписание
DataFrame. По умолчанию возвращаются только числовые поля.>>> df = pd.DataFrame({ 'object': ['a', 'b', 'c'], ... 'numeric': [1, 2, 3], ... 'categorical': pd.Categorical(['d','e','f']) ... }) >>> df.describe() numeric count 3.0 mean 2.0 std 1.0 min 1.0 25% 1.5 50% 2.0 75% 2.5 max 3.0Описание всех столбцов
DataFrameнезависимо от типа данных.>>> df.describe(include='all') categorical numeric object count 3 3.0 3 unique 3 NaN 3 top f NaN c freq 1 NaN 1 mean NaN 2.0 NaN std NaN 1.0 NaN min NaN 1.0 NaN 25% NaN 1.5 NaN 50% NaN 2.0 NaN 75% NaN 2.5 NaN max NaN 3.0 NaNОписание столбца из
DataFrameпутем доступа к нему как к атрибуту.>>> df.numeric.describe() count 3.0 mean 2.0 std 1.0 min 1.0 25% 1.5 50% 2.0 75% 2.5 max 3.0 Name: numeric, dtype: float64
Включение только числовых столбцов в описание
DataFrame.>>> df.describe(include=[np.number]) numeric count 3.0 mean 2.0 std 1.0 min 1.0 25% 1.5 50% 2.0 75% 2.5 max 3.0Включение только строковых столбцов в описание
DataFrame.>>> df.describe(include=[np.object]) object count 3 unique 3 top c freq 1Включение только категориальных столбцов в описание
DataFrame.>>> df.describe(include=['category']) categorical count 3 unique 3 top f freq 1Исключение числовых столбцов из описания
DataFrame.>>> df.describe(exclude=[np.number]) categorical object count 3 3 unique 3 3 top f c freq 1 1Исключение строковых столбцов из описания
DataFrame.>>> df.describe(exclude=[np.object]) categorical numeric count 3 3.0 unique 3 NaN top f NaN freq 1 NaN mean NaN 2.0 std NaN 1.0 min NaN 1.0 25% NaN 1.5 50% NaN 2.0 75% NaN 2.5 max NaN 3.0
© 2008–2012, AQR Capital Management, LLC, Lambda Foundry, Inc. and PyData Development Team
Licensed under the 3-clause BSD License.
https://pandas.pydata.org/pandas-docs/version/0.22.0/generated/pandas.Series.describe.html