pandas.Series.describe
-
Series.describe(percentiles=None, include=None, exclude=None)[source] -
Генерирует описательные статистики, которые обобщают центральную тенденцию, дисперсию и форму распределения набора данных, исключая
NaNзначения.Анализирует как числовые, так и строковые ряды, а также
DataFrameнаборы столбцов смешанных типов данных. Вывод будет зависеть от предоставленных данных. Более подробную информацию см. в примечаниях ниже.Параметры: percentiles : список чисел, необязательно
Процентили, которые нужно включить в вывод. Все они должны быть в диапазоне от 0 до 1. По умолчанию
[.25, .5, .75], что возвращает 25-й, 50-й и 75-й процентили.include : ‘all’, список типов данных или None (по умолчанию), необязательно
Белый список типов данных, которые нужно включить в результат. Игнорируется для
Series. Вот варианты:- ‘all’ : Все столбцы входных данных будут включены в выходные данные.
- Список типов данных : Ограничивает результаты предоставленными типами данных. Чтобы ограничить результат числовыми типами, отправьте
numpy.number. Чтобы ограничить результат категориальными объектами, отправьте тип данныхnumpy.object. Строки также могут быть использованы в стилеselect_dtypes(например,df.describe(include=['O'])) - None (по умолчанию) : Результат будет включать все числовые столбцы.
exclude : список типов данных или None (по умолчанию), необязательно
Черный список типов данных, которые нужно исключить из результата. Игнорируется для
Series. Вот варианты:- Список типов данных : Исключает предоставленные типы данных из результата. Чтобы выбрать числовые типы, отправьте
numpy.number. Чтобы выбрать категориальные объекты, отправьте тип данныхnumpy.object. Строки также могут быть использованы в стилеselect_dtypes(например,df.describe(include=['O'])) - None (по умолчанию) : Результат ничего не будет исключать.
Возвращаемое значение: summary: Ряд/таблица сводных статистик
См. также
DataFrame.count,DataFrame.max,DataFrame.min,DataFrame.mean,DataFrame.std,DataFrame.select_dtypesПримечания
Для числовых данных индекс результата будет содержать
count,mean,std,min,maxа также нижние,50и верхние процентили. По умолчанию нижний процентиль -25, а верхний -75.50процентиль совпадает с медианой.Для строковых данных (например, строк или временных меток) индекс результата будет содержать
count,unique,top, иfreq.top- это самое частое значение.freq- частота самого частого значения. Временные метки также включаютfirstиlastэлементы.Если несколько строковых значений имеют наибольшее количество, то результаты
countиtopбудут произвольно выбраны среди тех, которые имеют наибольшее количество.Для смешанных типов данных, предоставленных через
DataFrame, по умолчанию возвращается анализ только числовых столбцов. Еслиinclude='all'указан как параметр, результат будет включать объединение атрибутов каждого типа.Параметры
includeиexcludeмогут быть использованы для ограничения анализа столбцов вDataFrameдля вывода. Параметры игнорируются при анализеSeries.Примеры
Описание числового
Series.>>> s = pd.Series([1, 2, 3]) >>> s.describe() count 3.0 mean 2.0 std 1.0 min 1.0 25% 1.5 50% 2.0 75% 2.5 max 3.0
Описание категориального
Series.>>> s = pd.Series(['a', 'a', 'b', 'c']) >>> s.describe() count 4 unique 3 top a freq 2 dtype: object
Описание временной метки
Series.>>> s = pd.Series([ ... np.datetime64("2000-01-01"), ... np.datetime64("2010-01-01"), ... np.datetime64("2010-01-01") ... ]) >>> s.describe() count 3 unique 2 top 2010-01-01 00:00:00 freq 2 first 2000-01-01 00:00:00 last 2010-01-01 00:00:00 dtype: objectОписание
DataFrame. По умолчанию возвращаются только числовые поля.>>> df = pd.DataFrame([[1, 'a'], [2, 'b'], [3, 'c']], ... columns=['numeric', 'object']) >>> df.describe() numeric count 3.0 mean 2.0 std 1.0 min 1.0 25% 1.5 50% 2.0 75% 2.5 max 3.0Описание всех столбцов
DataFrameнезависимо от типа данных.>>> df.describe(include='all') numeric object count 3.0 3 unique NaN 3 top NaN b freq NaN 1 mean 2.0 NaN std 1.0 NaN min 1.0 NaN 25% 1.5 NaN 50% 2.0 NaN 75% 2.5 NaN max 3.0 NaNОписание столбца из
DataFrame, обращаясь к нему как к атрибуту.>>> df.numeric.describe() count 3.0 mean 2.0 std 1.0 min 1.0 25% 1.5 50% 2.0 75% 2.5 max 3.0 Name: numeric, dtype: float64
Включение только числовых столбцов в описание
DataFrame.>>> df.describe(include=[np.number]) numeric count 3.0 mean 2.0 std 1.0 min 1.0 25% 1.5 50% 2.0 75% 2.5 max 3.0Включение только строковых столбцов в описание
DataFrame.>>> df.describe(include=[np.object]) object count 3 unique 3 top b freq 1Исключение числовых столбцов из описания
DataFrame.>>> df.describe(exclude=[np.number]) object count 3 unique 3 top b freq 1Исключение строковых столбцов из описания
DataFrame.>>> df.describe(exclude=[np.object]) numeric count 3.0 mean 2.0 std 1.0 min 1.0 25% 1.5 50% 2.0 75% 2.5 max 3.0
© 2008–2012, AQR Capital Management, LLC, Lambda Foundry, Inc. and PyData Development Team
Licensed under the 3-clause BSD License.
https://pandas.pydata.org/pandas-docs/version/0.20.3/generated/pandas.Series.describe.html