pandas.Series.describe
-
Series.describe(percentiles=None, include=None, exclude=None)[source] -
Генерирует описательные статистики, которые обобщают центральную тенденцию, дисперсию и форму распределения набора данных, исключая значения
NaN.Анализирует как числовые, так и строковые ряды, а также наборы столбцов
DataFrameсмешанных типов данных. Вывод будет зависеть от предоставленных данных. Подробнее см. примечания ниже.Параметры: percentiles : список чисел, необязательно
Процентили, которые следует включить в вывод. Все значения должны быть между 0 и 1. По умолчанию
[.25, .5, .75], что возвращает 25-й, 50-й и 75-й процентили.include : ‘all’, список типов данных или None (по умолчанию), необязательно
Белый список типов данных, которые следует включить в результат. Игнорируется для
Series. Вот доступные варианты:- ‘all’ : Все столбцы входных данных будут включены в вывод.
- Список типов данных : Ограничивает результаты предоставленными типами данных. Для ограничения результата числовыми типами отправьте
numpy.number. Чтобы ограничить его вместо этого столбцами типа object, отправьте тип данныхnumpy.object. Строки также могут быть использованы в стилеselect_dtypes(например,df.describe(include=['O'])). Чтобы выбрать столбцы pandas категориального типа, используйте'category' - None (по умолчанию) : Результат будет включать все числовые столбцы.
exclude : список типов данных или None (по умолчанию), необязательно
Черный список типов данных, которые следует исключить из результата. Игнорируется для
Series. Вот доступные варианты:- Список типов данных : Исключает указанные типы данных из результата. Чтобы исключить числовые типы, отправьте
numpy.number. Чтобы исключить столбцы типа object, отправьте тип данныхnumpy.object. Строки также могут быть использованы в стилеselect_dtypes(например,df.describe(include=['O'])). Чтобы исключить столбцы pandas категориального типа, используйте'category' - None (по умолчанию) : Результат ничего не будет исключать.
Возвращает: - summary: Series/DataFrame сводных статистик
См. также
DataFrame.count,DataFrame.max,DataFrame.min,DataFrame.mean,DataFrame.std,DataFrame.select_dtypesПримечания
Для числовых данных индекс результата будет содержать
count,mean,std,min,maxа также нижние,50и верхние процентили. По умолчанию нижний процентиль -25, а верхний -75.50процентиль совпадает с медианой.Для строковых данных (например, строк или временных меток) индекс результата будет содержать
count,unique,top, иfreq.top- это наиболее часто встречающееся значение.freq- это частота самого часто встречающегося значения. Временные метки также включаютfirstиlastэлементы.Если несколько значений имеют наибольший счет, то результаты
countиtopбудут произвольно выбраны среди тех, у которых наибольший счет.Для смешанных типов данных, предоставленных через
DataFrame, по умолчанию возвращается анализ только числовых столбцов. Если DataFrame состоит только из строковых и категориальных данных без числовых столбцов, по умолчанию возвращается анализ как строковых, так и категориальных столбцов. Еслиinclude='all'предоставляется в качестве опции, результат будет включать объединение атрибутов каждого типа.Параметры
includeиexcludeмогут быть использованы для ограничения анализа столбцов вDataFrameдля вывода. Параметры игнорируются при анализеSeries.Примеры
Описание числового
Series.>>> s = pd.Series([1, 2, 3]) >>> s.describe() count 3.0 mean 2.0 std 1.0 min 1.0 25% 1.5 50% 2.0 75% 2.5 max 3.0
Описание категориального
Series.>>> s = pd.Series(['a', 'a', 'b', 'c']) >>> s.describe() count 4 unique 3 top a freq 2 dtype: object
Описание временной метки
Series.>>> s = pd.Series([ ... np.datetime64("2000-01-01"), ... np.datetime64("2010-01-01"), ... np.datetime64("2010-01-01") ... ]) >>> s.describe() count 3 unique 2 top 2010-01-01 00:00:00 freq 2 first 2000-01-01 00:00:00 last 2010-01-01 00:00:00 dtype: objectОписание
DataFrame. По умолчанию возвращаются только числовые поля.>>> df = pd.DataFrame({ 'object': ['a', 'b', 'c'], ... 'numeric': [1, 2, 3], ... 'categorical': pd.Categorical(['d','e','f']) ... }) >>> df.describe() numeric count 3.0 mean 2.0 std 1.0 min 1.0 25% 1.5 50% 2.0 75% 2.5 max 3.0Описание всех столбцов
DataFrameнезависимо от типа данных.>>> df.describe(include='all') categorical numeric object count 3 3.0 3 unique 3 NaN 3 top f NaN c freq 1 NaN 1 mean NaN 2.0 NaN std NaN 1.0 NaN min NaN 1.0 NaN 25% NaN 1.5 NaN 50% NaN 2.0 NaN 75% NaN 2.5 NaN max NaN 3.0 NaNОписание столбца из
DataFrameпутем доступа к нему как к атрибуту.>>> df.numeric.describe() count 3.0 mean 2.0 std 1.0 min 1.0 25% 1.5 50% 2.0 75% 2.5 max 3.0 Name: numeric, dtype: float64
Включение только числовых столбцов в описание
DataFrame.>>> df.describe(include=[np.number]) numeric count 3.0 mean 2.0 std 1.0 min 1.0 25% 1.5 50% 2.0 75% 2.5 max 3.0Включение только строковых столбцов в описание
DataFrame.>>> df.describe(include=[np.object]) object count 3 unique 3 top c freq 1Включение только категориальных столбцов из описания
DataFrame.>>> df.describe(include=['category']) categorical count 3 unique 3 top f freq 1Исключение числовых столбцов из описания
DataFrame.>>> df.describe(exclude=[np.number]) categorical object count 3 3 unique 3 3 top f c freq 1 1Исключение строковых столбцов из описания
DataFrame.>>> df.describe(exclude=[np.object]) categorical numeric count 3 3.0 unique 3 NaN top f NaN freq 1 NaN mean NaN 2.0 std NaN 1.0 min NaN 1.0 25% NaN 1.5 50% NaN 2.0 75% NaN 2.5 max NaN 3.0
© 2008–2012, AQR Capital Management, LLC, Lambda Foundry, Inc. and PyData Development Team
Licensed under the 3-clause BSD License.
https://pandas.pydata.org/pandas-docs/version/0.23.4/generated/pandas.Series.describe.html