pandas.Panel.describe
-
Panel.describe(percentiles=None, include=None, exclude=None)[source] -
Генерирует описательные статистики, которые обобщают центральную тенденцию, рассеяние и форму распределения набора данных, исключая
NaNзначения.Анализирует как числовые, так и строковые ряды, а также
DataFrameстолбцы смешанных типов данных. Вывод будет зависеть от предоставленных данных. Дополнительную информацию см. в примечаниях ниже.Параметры: percentiles : список чисел, необязательно
Процентили, которые необходимо включить в вывод. Все они должны находиться в диапазоне от 0 до 1. По умолчанию используется
[.25, .5, .75], что возвращает 25-й, 50-й и 75-й процентили.include : ‘all’, список типов данных или None (по умолчанию), необязательно
Белый список типов данных, которые необходимо включить в результат. Игнорируется для
Series. Доступные варианты:- ‘all’ : Все столбцы входных данных будут включены в вывод.
- Список типов данных : Ограничивает результаты предоставленными типами данных. Для ограничения результата числовыми типами передайте
numpy.number. Для ограничения результата строковыми столбцами передайте тип данныхnumpy.object. Строки также можно использовать по образцуselect_dtypes(например,df.describe(include=['O'])). Для выбора категориальных столбцов pandas используйте'category' - None (по умолчанию) : Результат будет содержать все числовые столбцы.
exclude : список типов данных или None (по умолчанию), необязательно,
Черный список типов данных, которые необходимо исключить из результата. Игнорируется для
Series. Доступные варианты:- Список типов данных : Исключает предоставленные типы данных из результата. Для исключения числовых типов передайте
numpy.number. Для исключения строковых столбцов передайте тип данныхnumpy.object. Строки также можно использовать по образцуselect_dtypes(например,df.describe(include=['O'])). Для исключения категориальных столбцов pandas используйте'category' - None (по умолчанию) : Результат ничего не будет исключать.
Возвращает: summary: Ряд/таблица сводных статистик
См. также
DataFrame.count,DataFrame.max,DataFrame.min,DataFrame.mean,DataFrame.std,DataFrame.select_dtypesПримечания
Для числовых данных индекс результата будет содержать
count,mean,std,min,maxа также нижние,50и верхние процентили. По умолчанию нижний процентиль —25, а верхний —75.50процентиль — это медиана.Для строковых данных (например, строк или временных меток) индекс результата будет содержать
count,unique,top, иfreq.top— это наиболее часто встречающееся значение.freq— частота наиболее часто встречающегося значения. Временные метки также включаютfirstиlastэлементы.Если несколько строковых значений имеют наибольшее количество вхождений, то результаты
countиtopпроизвольно выбираются из тех, которые имеют наибольшее количество вхождений.Для смешанных типов данных, предоставленных через
DataFrame, по умолчанию возвращается анализ только числовых столбцов. Если фрейм данных состоит только из строковых и категориальных данных без числовых столбцов, по умолчанию возвращается анализ и строковых, и категориальных столбцов. При предоставленииinclude='all'в качестве опции результат будет включать объединенный набор атрибутов каждого типа.Параметры
includeиexcludeмогут использоваться для ограничения столбцов вDataFrameанализируемых в выводе. Эти параметры игнорируются при анализеSeries.Примеры
Описание числового
Series.>>> s = pd.Series([1, 2, 3]) >>> s.describe() count 3.0 mean 2.0 std 1.0 min 1.0 25% 1.5 50% 2.0 75% 2.5 max 3.0
Описание категориального
Series.>>> s = pd.Series(['a', 'a', 'b', 'c']) >>> s.describe() count 4 unique 3 top a freq 2 dtype: object
Описание временной метки
Series.>>> s = pd.Series([ ... np.datetime64("2000-01-01"), ... np.datetime64("2010-01-01"), ... np.datetime64("2010-01-01") ... ]) >>> s.describe() count 3 unique 2 top 2010-01-01 00:00:00 freq 2 first 2000-01-01 00:00:00 last 2010-01-01 00:00:00 dtype: objectОписание
DataFrame. По умолчанию возвращаются только числовые поля.>>> df = pd.DataFrame({ 'object': ['a', 'b', 'c'], ... 'numeric': [1, 2, 3], ... 'categorical': pd.Categorical(['d','e','f']) ... }) >>> df.describe() numeric count 3.0 mean 2.0 std 1.0 min 1.0 25% 1.5 50% 2.0 75% 2.5 max 3.0Описание всех столбцов
DataFrameнезависимо от типа данных.>>> df.describe(include='all') categorical numeric object count 3 3.0 3 unique 3 NaN 3 top f NaN c freq 1 NaN 1 mean NaN 2.0 NaN std NaN 1.0 NaN min NaN 1.0 NaN 25% NaN 1.5 NaN 50% NaN 2.0 NaN 75% NaN 2.5 NaN max NaN 3.0 NaNОписание столбца из
DataFrame, обращаясь к нему как к атрибуту.>>> df.numeric.describe() count 3.0 mean 2.0 std 1.0 min 1.0 25% 1.5 50% 2.0 75% 2.5 max 3.0 Name: numeric, dtype: float64
Включение только числовых столбцов в описании
DataFrame.>>> df.describe(include=[np.number]) numeric count 3.0 mean 2.0 std 1.0 min 1.0 25% 1.5 50% 2.0 75% 2.5 max 3.0Включение только строковых столбцов в описании
DataFrame.>>> df.describe(include=[np.object]) object count 3 unique 3 top c freq 1Включение только категориальных столбцов из описания
DataFrame.>>> df.describe(include=['category']) categorical count 3 unique 3 top f freq 1Исключение числовых столбцов из описания
DataFrame.>>> df.describe(exclude=[np.number]) categorical object count 3 3 unique 3 3 top f c freq 1 1Исключение строковых столбцов из описания
DataFrame.>>> df.describe(exclude=[np.object]) categorical numeric count 3 3.0 unique 3 NaN top f NaN freq 1 NaN mean NaN 2.0 std NaN 1.0 min NaN 1.0 25% NaN 1.5 50% NaN 2.0 75% NaN 2.5 max NaN 3.0
© 2008–2012, AQR Capital Management, LLC, Lambda Foundry, Inc. and PyData Development Team
Licensed under the 3-clause BSD License.
https://pandas.pydata.org/pandas-docs/version/0.22.0/generated/pandas.Panel.describe.html