pandas.DataFrame.describe
- DataFrame.describe(percentiles=None, include=None, exclude=None, datetime_is_numeric=False)[source]
-
Генерация описательной статистики.
Описательная статистика включает в себя показатели, которые обобщают центральную тенденцию, дисперсию и форму распределения набора данных, исключая значения
NaN.Анализирует как числовые, так и строковые ряды, а также
DataFrameнаборы столбцов смешанных типов данных. Вывод будет разным в зависимости от входных данных. Подробнее см. ниже.- Параметры
-
- percentiles:список чисел, необязательно
-
Процентили, которые нужно включить в вывод. Все значения должны быть в диапазоне от 0 до 1. По умолчанию
[.25, .5, .75], что возвращает 25-й, 50-й и 75-й процентили. - include:‘all’, список типов данных или None (по умолчанию), необязательно
-
Белый список типов данных, которые нужно включить в результат. Игнорируется для
Series. Доступные варианты:‘all’ : Все столбцы входных данных будут включены в вывод.
Список типов данных : Ограничивает результат предоставленными типами данных. Чтобы ограничить результат числовыми типами, отправьте
numpy.number. Чтобы ограничить его строковыми столбцами, отправьте тип данныхnumpy.object. Строки также можно использовать в стилеselect_dtypes(например,df.describe(include=['O'])). Для выбора столбцов pandas категориального типа используйте'category'None (по умолчанию) : Результат будет включать все числовые столбцы.
- exclude:список типов данных или None (по умолчанию), необязательно,
-
Черный список типов данных, которые нужно исключить из результата. Игнорируется для
Series. Доступные варианты:Список типов данных : Исключает указанные типы данных из результата. Чтобы исключить числовые типы, отправьте
numpy.number. Чтобы исключить строковые столбцы, отправьте тип данныхnumpy.object. Строки также можно использовать в стилеselect_dtypes(например,df.describe(exclude=['O'])). Для исключения столбцов pandas категориального типа используйте'category'None (по умолчанию) : Ничего не будет исключено из результата.
- datetime_is_numeric:bool, по умолчанию False
-
Обрабатывать ли типы datetime как числовые. Это влияет на вычисление статистики для столбца. Для входных данных DataFrame это также контролирует, включаются ли столбцы datetime по умолчанию.
Введено в версии 1.1.0.
- Возвращает
-
- Series или DataFrame
-
Статистические данные в сводной форме для предоставленного ряда или DataFrame.
См. также
DataFrame.count-
Подсчет числа наблюдений, не содержащих NaN/NULL.
DataFrame.max-
Максимальное значение в объекте.
DataFrame.min-
Минимальное значение в объекте.
DataFrame.mean-
Среднее значение.
DataFrame.std-
Стандартное отклонение.
DataFrame.select_dtypes-
Подмножество DataFrame, включающее/исключающее столбцы на основе их типа данных.
Примечания
Для числовых данных индекс результата будет включать
count,mean,std,min,max, а также нижние,50и верхние процентили. По умолчанию нижний процентиль —25, а верхний —75.50процентиль — это медиана.Для строковых данных (например, строки или отметки времени) индекс результата будет включать
count,unique,top, иfreq.top— это наиболее часто встречающееся значение.freq— это частота наиболее часто встречающегося значения. Отметки времени также включают элементыfirstиlast.Если несколько строковых значений имеют наибольшее количество вхождений, то результаты
countиtopбудут произвольно выбраны среди тех, которые имеют наибольшее количество.Для смешанных типов данных, предоставленных через
DataFrame, по умолчанию возвращается только анализ числовых столбцов. Если DataFrame состоит только из строковых и категориальных данных без каких-либо числовых столбцов, по умолчанию возвращается анализ как строковых, так и категориальных столбцов. Еслиinclude='all'задано как параметр, результат будет включать объединение атрибутов каждого типа.Параметры include и exclude можно использовать для ограничения столбцов в
DataFrame, которые анализируются для вывода. Параметры игнорируются при анализеSeries.Примеры
Описательная статистика для числового
Series.>>> s = pd.Series([1, 2, 3]) >>> s.describe() count 3.0 mean 2.0 std 1.0 min 1.0 25% 1.5 50% 2.0 75% 2.5 max 3.0 dtype: float64
Описательная статистика для категориального
Series.>>> s = pd.Series(['a', 'a', 'b', 'c']) >>> s.describe() count 4 unique 3 top a freq 2 dtype: object
Описательная статистика для отметки времени
Series.>>> s = pd.Series([ ... np.datetime64("2000-01-01"), ... np.datetime64("2010-01-01"), ... np.datetime64("2010-01-01") ... ]) >>> s.describe(datetime_is_numeric=True) count 3 mean 2006-09-01 08:00:00 min 2000-01-01 00:00:00 25% 2004-12-31 12:00:00 50% 2010-01-01 00:00:00 75% 2010-01-01 00:00:00 max 2010-01-01 00:00:00 dtype: objectОписательная статистика для
DataFrame. По умолчанию возвращаются только числовые поля.>>> df = pd.DataFrame({'categorical': pd.Categorical(['d','e','f']), ... 'numeric': [1, 2, 3], ... 'object': ['a', 'b', 'c'] ... }) >>> df.describe() numeric count 3.0 mean 2.0 std 1.0 min 1.0 25% 1.5 50% 2.0 75% 2.5 max 3.0Описательная статистика для всех столбцов
DataFrameнезависимо от типа данных.>>> df.describe(include='all') categorical numeric object count 3 3.0 3 unique 3 NaN 3 top f NaN a freq 1 NaN 1 mean NaN 2.0 NaN std NaN 1.0 NaN min NaN 1.0 NaN 25% NaN 1.5 NaN 50% NaN 2.0 NaN 75% NaN 2.5 NaN max NaN 3.0 NaNОписательная статистика для столбца из
DataFrameпутем доступа к нему как к атрибуту.>>> df.numeric.describe() count 3.0 mean 2.0 std 1.0 min 1.0 25% 1.5 50% 2.0 75% 2.5 max 3.0 Name: numeric, dtype: float64
Включение только числовых столбцов в описательную статистику
DataFrame.>>> df.describe(include=[np.number]) numeric count 3.0 mean 2.0 std 1.0 min 1.0 25% 1.5 50% 2.0 75% 2.5 max 3.0Включение только строковых столбцов в описательную статистику
DataFrame.>>> df.describe(include=[object]) object count 3 unique 3 top a freq 1Включение только категориальных столбцов в описательную статистику
DataFrame.>>> df.describe(include=['category']) categorical count 3 unique 3 top d freq 1Исключение числовых столбцов из описательной статистики
DataFrame.>>> df.describe(exclude=[np.number]) categorical object count 3 3 unique 3 3 top f a freq 1 1Исключение строковых столбцов из описательной статистики
DataFrame.>>> df.describe(exclude=[object]) categorical numeric count 3 3.0 unique 3 NaN top f NaN freq 1 NaN mean NaN 2.0 std NaN 1.0 min NaN 1.0 25% NaN 1.5 50% NaN 2.0 75% NaN 2.5 max NaN 3.0
© 2008–2022, AQR Capital Management, LLC, Lambda Foundry, Inc. and PyData Development Team
Licensed under the 3-clause BSD License.
https://pandas.pydata.org/pandas-docs/version/1.5.0/reference/api/pandas.DataFrame.describe.html