Spec-Zone.ru › pandas 1

pandas.core.groupby.DataFrameGroupBy.describe

DataFrameGroupBy.describe(**kwargs)[source]

Генерировать описательные статистики.

Описательные статистики включают те, которые обобщают центральную тенденцию, дисперсию и форму распределения набора данных, исключая значения NaN.

Анализирует как числовые, так и строковые ряды, а также наборы столбцов DataFrame смешанных типов данных. Вывод будет варьироваться в зависимости от предоставленных данных. Подробнее см. ниже.

Параметры
percentiles:список чисел, необязательно

Квантили, которые нужно включить в вывод. Все они должны быть в диапазоне от 0 до 1. По умолчанию [.25, .5, .75], что возвращает 25-й, 50-й и 75-й процентили.

include:'all', список типов данных или None (по умолчанию), необязательно

Белый список типов данных, которые нужно включить в результат. Игнорируется для Series. Вот варианты:

  • ‘all’ : Все столбцы входных данных будут включены в вывод.

  • Список типов данных : Ограничивает результаты предоставленными типами данных. Чтобы ограничить результат только числовыми типами, отправьте numpy.number. Чтобы ограничить его строковыми столбцами, отправьте тип данных numpy.object. Строки также могут быть использованы в стиле select_dtypes (например, df.describe(include=['O'])). Чтобы выбрать столбцы pandas категориального типа, используйте 'category'

  • None (по умолчанию) : Результат будет включать все числовые столбцы.

exclude:список типов данных или None (по умолчанию), необязательно

Черный список типов данных, которые нужно исключить из результата. Игнорируется для Series. Вот варианты:

  • Список типов данных : Исключает указанные типы данных из результата. Чтобы исключить числовые типы, отправьте numpy.number. Чтобы исключить строковые столбцы, отправьте тип данных numpy.object. Строки также могут быть использованы в стиле select_dtypes (например, df.describe(exclude=['O'])). Чтобы исключить столбцы pandas категориального типа, используйте 'category'

  • None (по умолчанию) : Результат ничего не будет исключать.

datetime_is_numeric:bool, по умолчанию False

Указывает, следует ли рассматривать типы данных datetime как числовые. Это влияет на вычисление статистик для столбца. Для входных данных DataFrame это также определяет, включаются ли столбцы datetime по умолчанию.

В версии 1.1.0.

Возвращает
Ряд или DataFrame

Описательные статистики предоставленного ряда или DataFrame.

См. также

DataFrame.count
Подсчет количества наблюдений без пропущенных значений/null.
DataFrame.max
Максимальное значение в строке.
DataFrame.min
Минимальное значение в строке.
DataFrame.mean
Среднее значение.
DataFrame.std
Стандартное отклонение наблюдений.
DataFrame.select_dtypes
Подмножество DataFrame, включающее/исключающее столбцы на основе их типа данных.

Примечания

Для числовых данных индекс результата будет содержать count, mean, std, min, max, а также нижние, 50 и верхние квантили. По умолчанию нижний процентиль 25, а верхний 75. 50 квантиль — это медиана.

Для строковых данных (например, строк или временных меток) индекс результата будет содержать count, unique, top, и freq. top — это наиболее часто встречающееся значение. freq — это частота самого распространённого значения. Временные метки также включают элементы first и last.

Если несколько строковых значений имеют наибольшее количество вхождений, результаты count и top будут произвольно выбраны среди тех, которые имеют наибольшее количество.

Для смешанных типов данных, предоставляемых через DataFrame, по умолчанию возвращается только анализ числовых столбцов. Если DataFrame состоит только из строковых и категориальных данных без каких-либо числовых столбцов, по умолчанию возвращается анализ и строковых, и категориальных столбцов. Если include='all' используется в качестве опции, результат будет включать объединение атрибутов каждого типа.

Параметры include и exclude могут быть использованы для ограничения анализа столбцов в DataFrame для вывода. Параметры игнорируются при анализе Series.

Примеры

Описание числового Series.

>>> s = pd.Series([1, 2, 3])
>>> s.describe()
count    3.0
mean     2.0
std      1.0
min      1.0
25%      1.5
50%      2.0
75%      2.5
max      3.0
dtype: float64

Описание категориального Series.

>>> s = pd.Series(['a', 'a', 'b', 'c'])
>>> s.describe()
count     4
unique    3
top       a
freq      2
dtype: object

Описание временной метки Series.

>>> s = pd.Series([
...   np.datetime64("2000-01-01"),
...   np.datetime64("2010-01-01"),
...   np.datetime64("2010-01-01")
... ])
>>> s.describe(datetime_is_numeric=True)
count                      3
mean     2006-09-01 08:00:00
min      2000-01-01 00:00:00
25%      2004-12-31 12:00:00
50%      2010-01-01 00:00:00
75%      2010-01-01 00:00:00
max      2010-01-01 00:00:00
dtype: object

Описание DataFrame. По умолчанию возвращаются только числовые поля.

>>> df = pd.DataFrame({'categorical': pd.Categorical(['d','e','f']),
...                    'numeric': [1, 2, 3],
...                    'object': ['a', 'b', 'c']
...                   })
>>> df.describe()
       numeric
count      3.0
mean       2.0
std        1.0
min        1.0
25%        1.5
50%        2.0
75%        2.5
max        3.0

Описание всех столбцов DataFrame независимо от типа данных.

>>> df.describe(include='all')  
       categorical  numeric object
count            3      3.0      3
unique           3      NaN      3
top              f      NaN      a
freq             1      NaN      1
mean           NaN      2.0    NaN
std            NaN      1.0    NaN
min            NaN      1.0    NaN
25%            NaN      1.5    NaN
50%            NaN      2.0    NaN
75%            NaN      2.5    NaN
max            NaN      3.0    NaN

Описание столбца из DataFrame путём обращения к нему как к атрибуту.

>>> df.numeric.describe()
count    3.0
mean     2.0
std      1.0
min      1.0
25%      1.5
50%      2.0
75%      2.5
max      3.0
Name: numeric, dtype: float64

Включение только числовых столбцов в описании DataFrame.

>>> df.describe(include=[np.number])
       numeric
count      3.0
mean       2.0
std        1.0
min        1.0
25%        1.5
50%        2.0
75%        2.5
max        3.0

Включение только строковых столбцов в описании DataFrame.

>>> df.describe(include=[object])  
       object
count       3
unique      3
top         a
freq        1

Включение только категориальных столбцов в описании DataFrame.

>>> df.describe(include=['category'])
       categorical
count            3
unique           3
top              d
freq             1

Исключение числовых столбцов из описания DataFrame.

>>> df.describe(exclude=[np.number])  
       categorical object
count            3      3
unique           3      3
top              f      a
freq             1      1

Исключение строковых столбцов из описания DataFrame.

>>> df.describe(exclude=[object])  
       categorical  numeric
count            3      3.0
unique           3      NaN
top              f      NaN
freq             1      NaN
mean           NaN      2.0
std            NaN      1.0
min            NaN      1.0
25%            NaN      1.5
50%            NaN      2.0
75%            NaN      2.5
max            NaN      3.0

© 2008–2022, AQR Capital Management, LLC, Lambda Foundry, Inc. and PyData Development Team
Licensed under the 3-clause BSD License.
https://pandas.pydata.org/pandas-docs/version/1.5.0/reference/api/pandas.core.groupby.DataFrameGroupBy.describe.html

Spec-Zone.ru

Настройки Оффлайн Что нового Помощь О нас
Spec-Zone .ru
спецификации, руководства, описания, API