Spec-Zone.ru › pandas 0.22

pandas.Panel.describe

Panel.describe(percentiles=None, include=None, exclude=None) [source]

Генерирует описательные статистики, которые обобщают центральную тенденцию, рассеяние и форму распределения набора данных, исключая NaN значения.

Анализирует как числовые, так и строковые ряды, а также DataFrame столбцы смешанных типов данных. Вывод будет зависеть от предоставленных данных. Дополнительную информацию см. в примечаниях ниже.

Параметры:

percentiles : список чисел, необязательно

Процентили, которые необходимо включить в вывод. Все они должны находиться в диапазоне от 0 до 1. По умолчанию используется [.25, .5, .75], что возвращает 25-й, 50-й и 75-й процентили.

include : ‘all’, список типов данных или None (по умолчанию), необязательно

Белый список типов данных, которые необходимо включить в результат. Игнорируется для Series. Доступные варианты:

  • ‘all’ : Все столбцы входных данных будут включены в вывод.
  • Список типов данных : Ограничивает результаты предоставленными типами данных. Для ограничения результата числовыми типами передайте numpy.number. Для ограничения результата строковыми столбцами передайте тип данных numpy.object. Строки также можно использовать по образцу select_dtypes (например, df.describe(include=['O'])). Для выбора категориальных столбцов pandas используйте 'category'
  • None (по умолчанию) : Результат будет содержать все числовые столбцы.

exclude : список типов данных или None (по умолчанию), необязательно,

Черный список типов данных, которые необходимо исключить из результата. Игнорируется для Series. Доступные варианты:

  • Список типов данных : Исключает предоставленные типы данных из результата. Для исключения числовых типов передайте numpy.number. Для исключения строковых столбцов передайте тип данных numpy.object. Строки также можно использовать по образцу select_dtypes (например, df.describe(include=['O'])). Для исключения категориальных столбцов pandas используйте 'category'
  • None (по умолчанию) : Результат ничего не будет исключать.
Возвращает:

summary: Ряд/таблица сводных статистик

См. также

DataFrame.count, DataFrame.max, DataFrame.min, DataFrame.mean, DataFrame.std, DataFrame.select_dtypes

Примечания

Для числовых данных индекс результата будет содержать count, mean, std, min, max а также нижние, 50 и верхние процентили. По умолчанию нижний процентиль — 25, а верхний — 75. 50 процентиль — это медиана.

Для строковых данных (например, строк или временных меток) индекс результата будет содержать count, unique, top, и freq. top — это наиболее часто встречающееся значение. freq — частота наиболее часто встречающегося значения. Временные метки также включают first и last элементы.

Если несколько строковых значений имеют наибольшее количество вхождений, то результаты count и top произвольно выбираются из тех, которые имеют наибольшее количество вхождений.

Для смешанных типов данных, предоставленных через DataFrame, по умолчанию возвращается анализ только числовых столбцов. Если фрейм данных состоит только из строковых и категориальных данных без числовых столбцов, по умолчанию возвращается анализ и строковых, и категориальных столбцов. При предоставлении include='all' в качестве опции результат будет включать объединенный набор атрибутов каждого типа.

Параметры include и exclude могут использоваться для ограничения столбцов в DataFrame анализируемых в выводе. Эти параметры игнорируются при анализе Series.

Примеры

Описание числового Series.

>>> s = pd.Series([1, 2, 3])
>>> s.describe()
count    3.0
mean     2.0
std      1.0
min      1.0
25%      1.5
50%      2.0
75%      2.5
max      3.0

Описание категориального Series.

>>> s = pd.Series(['a', 'a', 'b', 'c'])
>>> s.describe()
count     4
unique    3
top       a
freq      2
dtype: object

Описание временной метки Series.

>>> s = pd.Series([
...   np.datetime64("2000-01-01"),
...   np.datetime64("2010-01-01"),
...   np.datetime64("2010-01-01")
... ])
>>> s.describe()
count                       3
unique                      2
top       2010-01-01 00:00:00
freq                        2
first     2000-01-01 00:00:00
last      2010-01-01 00:00:00
dtype: object

Описание DataFrame. По умолчанию возвращаются только числовые поля.

>>> df = pd.DataFrame({ 'object': ['a', 'b', 'c'],
...                     'numeric': [1, 2, 3],
...                     'categorical': pd.Categorical(['d','e','f'])
...                   })
>>> df.describe()
       numeric
count      3.0
mean       2.0
std        1.0
min        1.0
25%        1.5
50%        2.0
75%        2.5
max        3.0

Описание всех столбцов DataFrame независимо от типа данных.

>>> df.describe(include='all')
        categorical  numeric object
count            3      3.0      3
unique           3      NaN      3
top              f      NaN      c
freq             1      NaN      1
mean           NaN      2.0    NaN
std            NaN      1.0    NaN
min            NaN      1.0    NaN
25%            NaN      1.5    NaN
50%            NaN      2.0    NaN
75%            NaN      2.5    NaN
max            NaN      3.0    NaN

Описание столбца из DataFrame, обращаясь к нему как к атрибуту.

>>> df.numeric.describe()
count    3.0
mean     2.0
std      1.0
min      1.0
25%      1.5
50%      2.0
75%      2.5
max      3.0
Name: numeric, dtype: float64

Включение только числовых столбцов в описании DataFrame.

>>> df.describe(include=[np.number])
       numeric
count      3.0
mean       2.0
std        1.0
min        1.0
25%        1.5
50%        2.0
75%        2.5
max        3.0

Включение только строковых столбцов в описании DataFrame.

>>> df.describe(include=[np.object])
       object
count       3
unique      3
top         c
freq        1

Включение только категориальных столбцов из описания DataFrame.

>>> df.describe(include=['category'])
       categorical
count            3
unique           3
top              f
freq             1

Исключение числовых столбцов из описания DataFrame.

>>> df.describe(exclude=[np.number])
       categorical object
count            3      3
unique           3      3
top              f      c
freq             1      1

Исключение строковых столбцов из описания DataFrame.

>>> df.describe(exclude=[np.object])
        categorical  numeric
count            3      3.0
unique           3      NaN
top              f      NaN
freq             1      NaN
mean           NaN      2.0
std            NaN      1.0
min            NaN      1.0
25%            NaN      1.5
50%            NaN      2.0
75%            NaN      2.5
max            NaN      3.0

© 2008–2012, AQR Capital Management, LLC, Lambda Foundry, Inc. and PyData Development Team
Licensed under the 3-clause BSD License.
https://pandas.pydata.org/pandas-docs/version/0.22.0/generated/pandas.Panel.describe.html

Spec-Zone.ru

Настройки Оффлайн Что нового Помощь О нас
Spec-Zone .ru
спецификации, руководства, описания, API