pandas.Series.describe
- Series.describe(percentiles=None, include=None, exclude=None, datetime_is_numeric=False)[source]
-
Генерировать описательные статистики.
Описательные статистики включают те, которые обобщают центральную тенденцию, дисперсию и форму распределения набора данных, исключая значения
NaN.Анализирует как числовые, так и строковые ряды, а также
DataFrameнаборы столбцов со смешанными типами данных. Вывод будет варьироваться в зависимости от предоставленных данных. Дополнительные сведения см. в примечаниях ниже.- Параметры
-
- percentiles:список чисел, необязательно
-
Процентили, которые нужно включить в вывод. Все значения должны находиться в диапазоне от 0 до 1. По умолчанию используются
[.25, .5, .75], что возвращает 25-й, 50-й и 75-й процентили. - include:‘all’, список типов данных или None (по умолчанию), необязательно
-
Белый список типов данных, которые нужно включить в результат. Игнорируется для
Series. Доступные варианты:‘all’ : В вывод будут включены все столбцы входного набора.
Список типов данных : Ограничивает результаты предоставленными типами данных. Чтобы ограничить результат числовыми типами, отправьте
numpy.number. Чтобы ограничить результат строковыми столбцами, отправьте тип данныхnumpy.object. Строки также могут быть использованы в форматеselect_dtypes(например,df.describe(include=['O'])). Для выбора столбцов pandas категориального типа используйте'category'.None (по умолчанию) : Результат будет включать все числовые столбцы.
- exclude:список типов данных или None (по умолчанию), необязательно
-
Черный список типов данных, которые нужно исключить из результата. Игнорируется для
Series. Доступные варианты:Список типов данных : Исключает из результата предоставленные типы данных. Чтобы исключить числовые типы, отправьте
numpy.number. Чтобы исключить строковые столбцы, отправьте тип данныхnumpy.object. Строки также могут быть использованы в форматеselect_dtypes(например,df.describe(exclude=['O'])). Чтобы исключить столбцы pandas категориального типа, используйте'category'.None (по умолчанию) : Ничего не будет исключено.
- datetime_is_numeric:bool, по умолчанию False
-
Указывает, следует ли рассматривать типы datetime как числовые. Это влияет на статистику, вычисляемую для столбца. Для входного DataFrame это также контролирует, включаются ли столбцы datetime по умолчанию.
Новое в версии 1.1.0.
- Возвращаемое значение
-
- Ряд или DataFrame
-
Статистические данные о предоставленном ряде или DataFrame.
См. также
DataFrame.count-
Подсчет количества наблюдений без пропусков.
DataFrame.max-
Максимальное значение в объекте.
DataFrame.min-
Минимальное значение в объекте.
DataFrame.mean-
Среднее значение.
DataFrame.std-
Среднее квадратическое отклонение наблюдений.
DataFrame.select_dtypes-
Подмножество DataFrame, включающее/исключающее столбцы на основе их типа данных.
Примечания
Для числовых данных индекс результата будет включать
count,mean,std,min,max, а также нижние,50и верхние процентили. По умолчанию нижний процентиль25, а верхний -75.50процентиль совпадает с медианой.Для строковых данных (например, строк или временных меток) индекс результата будет включать
count,unique,top, иfreq.top- это наиболее часто встречающееся значение.freq- это частота наиболее часто встречающегося значения. Временные метки также включаютfirstиlastэлементы.Если несколько строковых значений имеют наибольшее количество вхождений, то результаты
countиtopбудут произвольно выбраны из тех, которые имеют наибольшее количество вхождений.Для смешанных типов данных, предоставленных с помощью
DataFrame, по умолчанию возвращается анализ только числовых столбцов. Если DataFrame содержит только строковые и категориальные данные без числовых столбцов, по умолчанию возвращается анализ как строковых, так и категориальных столбцов. Еслиinclude='all'используется в качестве параметра, результат будет включать объединение атрибутов каждого типа.Параметры include и exclude могут использоваться для ограничения столбцов в
DataFrame, анализируемых для вывода. Параметры игнорируются при анализеSeries.Примеры
Описание числового
Series.>>> s = pd.Series([1, 2, 3]) >>> s.describe() count 3.0 mean 2.0 std 1.0 min 1.0 25% 1.5 50% 2.0 75% 2.5 max 3.0 dtype: float64
Описание категориального
Series.>>> s = pd.Series(['a', 'a', 'b', 'c']) >>> s.describe() count 4 unique 3 top a freq 2 dtype: object
Описание временной метки
Series.>>> s = pd.Series([ ... np.datetime64("2000-01-01"), ... np.datetime64("2010-01-01"), ... np.datetime64("2010-01-01") ... ]) >>> s.describe(datetime_is_numeric=True) count 3 mean 2006-09-01 08:00:00 min 2000-01-01 00:00:00 25% 2004-12-31 12:00:00 50% 2010-01-01 00:00:00 75% 2010-01-01 00:00:00 max 2010-01-01 00:00:00 dtype: objectОписание
DataFrame. По умолчанию возвращаются только числовые поля.>>> df = pd.DataFrame({'categorical': pd.Categorical(['d','e','f']), ... 'numeric': [1, 2, 3], ... 'object': ['a', 'b', 'c'] ... }) >>> df.describe() numeric count 3.0 mean 2.0 std 1.0 min 1.0 25% 1.5 50% 2.0 75% 2.5 max 3.0Описание всех столбцов
DataFrameнезависимо от типа данных.>>> df.describe(include='all') categorical numeric object count 3 3.0 3 unique 3 NaN 3 top f NaN a freq 1 NaN 1 mean NaN 2.0 NaN std NaN 1.0 NaN min NaN 1.0 NaN 25% NaN 1.5 NaN 50% NaN 2.0 NaN 75% NaN 2.5 NaN max NaN 3.0 NaNОписание столбца из
DataFrameчерез доступ к нему как к атрибуту.>>> df.numeric.describe() count 3.0 mean 2.0 std 1.0 min 1.0 25% 1.5 50% 2.0 75% 2.5 max 3.0 Name: numeric, dtype: float64
Включение только числовых столбцов в описании
DataFrame.>>> df.describe(include=[np.number]) numeric count 3.0 mean 2.0 std 1.0 min 1.0 25% 1.5 50% 2.0 75% 2.5 max 3.0Включение только строковых столбцов в описании
DataFrame.>>> df.describe(include=[object]) object count 3 unique 3 top a freq 1Включение только категориальных столбцов в описании
DataFrame.>>> df.describe(include=['category']) categorical count 3 unique 3 top d freq 1Исключение числовых столбцов из описания
DataFrame.>>> df.describe(exclude=[np.number]) categorical object count 3 3 unique 3 3 top f a freq 1 1Исключение строковых столбцов из описания
DataFrame.>>> df.describe(exclude=[object]) categorical numeric count 3 3.0 unique 3 NaN top f NaN freq 1 NaN mean NaN 2.0 std NaN 1.0 min NaN 1.0 25% NaN 1.5 50% NaN 2.0 75% NaN 2.5 max NaN 3.0
© 2008–2022, AQR Capital Management, LLC, Lambda Foundry, Inc. and PyData Development Team
Licensed under the 3-clause BSD License.
https://pandas.pydata.org/pandas-docs/version/1.5.0/reference/api/pandas.Series.describe.html