Spec-Zone.ru › pandas 1

pandas.DataFrame.describe

DataFrame.describe(percentiles=None, include=None, exclude=None, datetime_is_numeric=False)[source]

Генерация описательной статистики.

Описательная статистика включает в себя показатели, которые обобщают центральную тенденцию, дисперсию и форму распределения набора данных, исключая значения NaN.

Анализирует как числовые, так и строковые ряды, а также DataFrame наборы столбцов смешанных типов данных. Вывод будет разным в зависимости от входных данных. Подробнее см. ниже.

Параметры
percentiles:список чисел, необязательно

Процентили, которые нужно включить в вывод. Все значения должны быть в диапазоне от 0 до 1. По умолчанию [.25, .5, .75], что возвращает 25-й, 50-й и 75-й процентили.

include:‘all’, список типов данных или None (по умолчанию), необязательно

Белый список типов данных, которые нужно включить в результат. Игнорируется для Series. Доступные варианты:

  • ‘all’ : Все столбцы входных данных будут включены в вывод.

  • Список типов данных : Ограничивает результат предоставленными типами данных. Чтобы ограничить результат числовыми типами, отправьте numpy.number. Чтобы ограничить его строковыми столбцами, отправьте тип данных numpy.object. Строки также можно использовать в стиле select_dtypes (например, df.describe(include=['O'])). Для выбора столбцов pandas категориального типа используйте 'category'

  • None (по умолчанию) : Результат будет включать все числовые столбцы.

exclude:список типов данных или None (по умолчанию), необязательно,

Черный список типов данных, которые нужно исключить из результата. Игнорируется для Series. Доступные варианты:

  • Список типов данных : Исключает указанные типы данных из результата. Чтобы исключить числовые типы, отправьте numpy.number. Чтобы исключить строковые столбцы, отправьте тип данных numpy.object. Строки также можно использовать в стиле select_dtypes (например, df.describe(exclude=['O'])). Для исключения столбцов pandas категориального типа используйте 'category'

  • None (по умолчанию) : Ничего не будет исключено из результата.

datetime_is_numeric:bool, по умолчанию False

Обрабатывать ли типы datetime как числовые. Это влияет на вычисление статистики для столбца. Для входных данных DataFrame это также контролирует, включаются ли столбцы datetime по умолчанию.

Введено в версии 1.1.0.

Возвращает
Series или DataFrame

Статистические данные в сводной форме для предоставленного ряда или DataFrame.

См. также

DataFrame.count

Подсчет числа наблюдений, не содержащих NaN/NULL.

DataFrame.max

Максимальное значение в объекте.

DataFrame.min

Минимальное значение в объекте.

DataFrame.mean

Среднее значение.

DataFrame.std

Стандартное отклонение.

DataFrame.select_dtypes

Подмножество DataFrame, включающее/исключающее столбцы на основе их типа данных.

Примечания

Для числовых данных индекс результата будет включать count, mean, std, min, max, а также нижние, 50 и верхние процентили. По умолчанию нижний процентиль — 25, а верхний — 75. 50 процентиль — это медиана.

Для строковых данных (например, строки или отметки времени) индекс результата будет включать count, unique, top, и freq. top — это наиболее часто встречающееся значение. freq — это частота наиболее часто встречающегося значения. Отметки времени также включают элементы first и last.

Если несколько строковых значений имеют наибольшее количество вхождений, то результаты count и top будут произвольно выбраны среди тех, которые имеют наибольшее количество.

Для смешанных типов данных, предоставленных через DataFrame, по умолчанию возвращается только анализ числовых столбцов. Если DataFrame состоит только из строковых и категориальных данных без каких-либо числовых столбцов, по умолчанию возвращается анализ как строковых, так и категориальных столбцов. Если include='all' задано как параметр, результат будет включать объединение атрибутов каждого типа.

Параметры include и exclude можно использовать для ограничения столбцов в DataFrame, которые анализируются для вывода. Параметры игнорируются при анализе Series.

Примеры

Описательная статистика для числового Series.

>>> s = pd.Series([1, 2, 3])
>>> s.describe()
count    3.0
mean     2.0
std      1.0
min      1.0
25%      1.5
50%      2.0
75%      2.5
max      3.0
dtype: float64

Описательная статистика для категориального Series.

>>> s = pd.Series(['a', 'a', 'b', 'c'])
>>> s.describe()
count     4
unique    3
top       a
freq      2
dtype: object

Описательная статистика для отметки времени Series.

>>> s = pd.Series([
...   np.datetime64("2000-01-01"),
...   np.datetime64("2010-01-01"),
...   np.datetime64("2010-01-01")
... ])
>>> s.describe(datetime_is_numeric=True)
count                      3
mean     2006-09-01 08:00:00
min      2000-01-01 00:00:00
25%      2004-12-31 12:00:00
50%      2010-01-01 00:00:00
75%      2010-01-01 00:00:00
max      2010-01-01 00:00:00
dtype: object

Описательная статистика для DataFrame. По умолчанию возвращаются только числовые поля.

>>> df = pd.DataFrame({'categorical': pd.Categorical(['d','e','f']),
...                    'numeric': [1, 2, 3],
...                    'object': ['a', 'b', 'c']
...                   })
>>> df.describe()
       numeric
count      3.0
mean       2.0
std        1.0
min        1.0
25%        1.5
50%        2.0
75%        2.5
max        3.0

Описательная статистика для всех столбцов DataFrame независимо от типа данных.

>>> df.describe(include='all')  
       categorical  numeric object
count            3      3.0      3
unique           3      NaN      3
top              f      NaN      a
freq             1      NaN      1
mean           NaN      2.0    NaN
std            NaN      1.0    NaN
min            NaN      1.0    NaN
25%            NaN      1.5    NaN
50%            NaN      2.0    NaN
75%            NaN      2.5    NaN
max            NaN      3.0    NaN

Описательная статистика для столбца из DataFrame путем доступа к нему как к атрибуту.

>>> df.numeric.describe()
count    3.0
mean     2.0
std      1.0
min      1.0
25%      1.5
50%      2.0
75%      2.5
max      3.0
Name: numeric, dtype: float64

Включение только числовых столбцов в описательную статистику DataFrame.

>>> df.describe(include=[np.number])
       numeric
count      3.0
mean       2.0
std        1.0
min        1.0
25%        1.5
50%        2.0
75%        2.5
max        3.0

Включение только строковых столбцов в описательную статистику DataFrame.

>>> df.describe(include=[object])  
       object
count       3
unique      3
top         a
freq        1

Включение только категориальных столбцов в описательную статистику DataFrame.

>>> df.describe(include=['category'])
       categorical
count            3
unique           3
top              d
freq             1

Исключение числовых столбцов из описательной статистики DataFrame.

>>> df.describe(exclude=[np.number])  
       categorical object
count            3      3
unique           3      3
top              f      a
freq             1      1

Исключение строковых столбцов из описательной статистики DataFrame.

>>> df.describe(exclude=[object])  
       categorical  numeric
count            3      3.0
unique           3      NaN
top              f      NaN
freq             1      NaN
mean           NaN      2.0
std            NaN      1.0
min            NaN      1.0
25%            NaN      1.5
50%            NaN      2.0
75%            NaN      2.5
max            NaN      3.0

© 2008–2022, AQR Capital Management, LLC, Lambda Foundry, Inc. and PyData Development Team
Licensed under the 3-clause BSD License.
https://pandas.pydata.org/pandas-docs/version/1.5.0/reference/api/pandas.DataFrame.describe.html

Spec-Zone.ru

Настройки Оффлайн Что нового Помощь О нас
Spec-Zone .ru
спецификации, руководства, описания, API