Spec-Zone.ru › pandas 0.24

pandas.core.groupby.DataFrameGroupBy.describe

DataFrameGroupBy.describe(**kwargs) [source]

Генерация описательной статистики, которая суммирует центральную тенденцию, дисперсию и форму распределения набора данных, исключая NaN значения.

Анализирует числовые и строковые ряды, а также DataFrame наборы столбцов смешанных типов данных. Вывод будет зависеть от предоставленных данных. Дополнительные сведения см. в примечаниях ниже.

Параметры:
percentiles : list-like of numbers, optional

Процентили, которые следует включить в вывод. Все они должны находиться в диапазоне от 0 до 1. По умолчанию используется [.25, .5, .75], что возвращает 25-й, 50-й и 75-й процентили.

include : ‘all’, list-like of dtypes or None (default), optional

Белый список типов данных, которые следует включить в результат. Игнорируется для Series. Вот варианты:

  • ‘all’ : Все столбцы входных данных будут включены в вывод.
  • Список типов данных : Ограничивает результаты предоставленными типами данных. Чтобы ограничить результат числовыми типами, отправьте numpy.number. Чтобы ограничить его вместо этого столбцами типа object, отправьте тип данных numpy.object. Строки также могут использоваться в стиле select_dtypes (например, df.describe(include=['O'])). Чтобы выбрать столбцы pandas категориального типа, используйте 'category'
  • None (по умолчанию) : Результат будет включать все числовые столбцы.
exclude : list-like of dtypes or None (default), optional,

Черный список типов данных, которые следует исключить из результата. Игнорируется для Series. Вот варианты:

  • Список типов данных : Исключает предоставленные типы данных из результата. Чтобы исключить числовые типы, отправьте numpy.number. Чтобы исключить столбцы типа object, отправьте тип данных numpy.object. Строки также могут использоваться в стиле select_dtypes (например, df.describe(include=['O'])). Чтобы исключить столбцы pandas категориального типа, используйте 'category'
  • None (по умолчанию) : Результат не будет исключать ничего.
Возвращает:
Ряд или DataFrame

Статистические данные сводки предоставленного ряда или DataFrame.

См. также

DataFrame.count
Подсчет числа наблюдений без пропусков/нулей.
DataFrame.max
Максимальное значение в объекте.
DataFrame.min
Минимальное значение в объекте.
DataFrame.mean
Среднее значение.
DataFrame.std
Среднеквадратичное отклонение наблюдений.
DataFrame.select_dtypes
Подмножество DataFrame, включающее/исключающее столбцы на основе их типа данных.

Примечания

Для числовых данных индекс результата будет включать count, mean, std, min, max, а также нижние, 50 и верхние процентили. По умолчанию нижний процентиль 25, а верхний 75. 50 процентиль совпадает со значением медианы.

Для данных типа object (например, строки или временные метки) индекс результата будет включать count, unique, top, и freq. top — это наиболее часто встречающееся значение. freq — это частота наиболее часто встречающегося значения. Временные метки также включают first и last элементы.

Если несколько значений типа object имеют одинаковую максимальную частоту, то результаты count и top будут произвольно выбраны из числа тех, которые имеют максимальную частоту.

Для смешанных типов данных, предоставляемых через DataFrame, по умолчанию возвращается анализ только числовых столбцов. Если DataFrame содержит только данные типа object и категориальные данные без числовых столбцов, по умолчанию возвращается анализ как столбцов типа object, так и категориальных столбцов. Если include='all' задан в качестве опции, результат будет включать объединение атрибутов каждого типа.

Параметры include и exclude можно использовать для ограничения анализа столбцов в DataFrame для вывода. Эти параметры игнорируются при анализе Series.

Примеры

Описание числового Series.

>>> s = pd.Series([1, 2, 3])
>>> s.describe()
count    3.0
mean     2.0
std      1.0
min      1.0
25%      1.5
50%      2.0
75%      2.5
max      3.0
dtype: float64

Описание категориального Series.

>>> s = pd.Series(['a', 'a', 'b', 'c'])
>>> s.describe()
count     4
unique    3
top       a
freq      2
dtype: object

Описание временной метки Series.

>>> s = pd.Series([
...   np.datetime64("2000-01-01"),
...   np.datetime64("2010-01-01"),
...   np.datetime64("2010-01-01")
... ])
>>> s.describe()
count                       3
unique                      2
top       2010-01-01 00:00:00
freq                        2
first     2000-01-01 00:00:00
last      2010-01-01 00:00:00
dtype: object

Описание DataFrame. По умолчанию возвращаются только числовые поля.

>>> df = pd.DataFrame({'categorical': pd.Categorical(['d','e','f']),
...                    'numeric': [1, 2, 3],
...                    'object': ['a', 'b', 'c']
...                   })
>>> df.describe()
       numeric
count      3.0
mean       2.0
std        1.0
min        1.0
25%        1.5
50%        2.0
75%        2.5
max        3.0

Описание всех столбцов DataFrame независимо от типа данных.

>>> df.describe(include='all')
        categorical  numeric object
count            3      3.0      3
unique           3      NaN      3
top              f      NaN      c
freq             1      NaN      1
mean           NaN      2.0    NaN
std            NaN      1.0    NaN
min            NaN      1.0    NaN
25%            NaN      1.5    NaN
50%            NaN      2.0    NaN
75%            NaN      2.5    NaN
max            NaN      3.0    NaN

Описание столбца из DataFrame путем доступа к нему как к атрибуту.

>>> df.numeric.describe()
count    3.0
mean     2.0
std      1.0
min      1.0
25%      1.5
50%      2.0
75%      2.5
max      3.0
Name: numeric, dtype: float64

Включение только числовых столбцов в описании DataFrame.

>>> df.describe(include=[np.number])
       numeric
count      3.0
mean       2.0
std        1.0
min        1.0
25%        1.5
50%        2.0
75%        2.5
max        3.0

Включение только строковых столбцов в описании DataFrame.

>>> df.describe(include=[np.object])
       object
count       3
unique      3
top         c
freq        1

Включение только категориальных столбцов в описании DataFrame.

>>> df.describe(include=['category'])
       categorical
count            3
unique           3
top              f
freq             1

Исключение числовых столбцов из описания DataFrame.

>>> df.describe(exclude=[np.number])
       categorical object
count            3      3
unique           3      3
top              f      c
freq             1      1

Исключение столбцов типа object из описания DataFrame.

>>> df.describe(exclude=[np.object])
       categorical  numeric
count            3      3.0
unique           3      NaN
top              f      NaN
freq             1      NaN
mean           NaN      2.0
std            NaN      1.0
min            NaN      1.0
25%            NaN      1.5
50%            NaN      2.0
75%            NaN      2.5
max            NaN      3.0

© 2008–2012, AQR Capital Management, LLC, Lambda Foundry, Inc. and PyData Development Team
Licensed under the 3-clause BSD License.
https://pandas.pydata.org/pandas-docs/version/0.24.2/reference/api/pandas.core.groupby.DataFrameGroupBy.describe.html

Spec-Zone.ru

Настройки Оффлайн Что нового Помощь О нас
Spec-Zone .ru
спецификации, руководства, описания, API