Spec-Zone.ru › pandas 0.22

pandas.Series.describe

Series.describe(percentiles=None, include=None, exclude=None) [source]

Генерирует описательные статистики, которые суммируют центральную тенденцию, дисперсию и форму распределения набора данных, исключая NaN значения.

Анализирует числовые и строковые ряды, а также DataFrame наборы столбцов смешанных типов данных. Выходные данные будут варьироваться в зависимости от входных данных. Для получения более подробной информации см. примечания ниже.

Параметры:

percentiles : список чисел, необязательно

Процентили, которые следует включить в вывод. Все они должны находиться в диапазоне от 0 до 1. По умолчанию используется [.25, .5, .75], что возвращает 25-й, 50-й и 75-й процентили.

include : ‘all’, список типов данных или None (по умолчанию), необязательно

Белый список типов данных, которые следует включить в результат. Игнорируется для Series. Вот варианты:

  • ‘all’ : Все столбцы входных данных будут включены в вывод.
  • Список типов данных : Ограничивает результаты предоставленными типами данных. Чтобы ограничить результат числовыми типами, передайте numpy.number. Чтобы ограничить его строковыми столбцами, передайте тип данных numpy.object. Строки также могут использоваться в стиле select_dtypes (например, df.describe(include=['O'])). Для выбора столбцов pandas категориального типа используйте 'category'.
  • None (по умолчанию) : Результат будет включать все числовые столбцы.

exclude : список типов данных или None (по умолчанию), необязательно

Черный список типов данных, которые следует исключить из результата. Игнорируется для Series. Вот варианты:

  • Список типов данных : Исключает указанные типы данных из результата. Чтобы исключить числовые типы, передайте numpy.number. Чтобы исключить строковые столбцы, передайте тип данных numpy.object. Строки также могут использоваться в стиле select_dtypes (например, df.describe(include=['O'])). Для исключения столбцов pandas категориального типа используйте 'category'
  • None (по умолчанию) : Результат не будет исключать ничего.
Возвращает:

summary: Ряд/Таблица сводных статистик

См. также

DataFrame.count, DataFrame.max, DataFrame.min, DataFrame.mean, DataFrame.std, DataFrame.select_dtypes

Примечания

Для числовых данных индекс результата будет включать count, mean, std, min, max, а также нижние, 50 и верхние процентили. По умолчанию нижний процентиль равен 25, а верхний процентиль равен 75. 50 процентиль соответствует медиане.

Для строковых данных (например, строк или временных меток) индекс результата будет включать count, unique, top, и freq. top — это наиболее часто встречающееся значение. freq — это частота наиболее часто встречающегося значения. Временные метки также включают элементы first и last.

Если несколько строковых значений имеют наибольшее количество вхождений, то результаты count и top будут произвольно выбраны из тех, которые имеют наибольшее количество вхождений.

Для смешанных типов данных, предоставленных через DataFrame, по умолчанию возвращается только анализ числовых столбцов. Если фрейм данных состоит только из строковых и категориальных данных без числовых столбцов, по умолчанию возвращается анализ как строковых, так и категориальных столбцов. Если include='all' указан как параметр, результат будет включать объединение атрибутов каждого типа.

Параметры include и exclude могут быть использованы для ограничения анализа столбцов в DataFrame для вывода. Параметры игнорируются при анализе Series.

Примеры

Описание числового Series.

>>> s = pd.Series([1, 2, 3])
>>> s.describe()
count    3.0
mean     2.0
std      1.0
min      1.0
25%      1.5
50%      2.0
75%      2.5
max      3.0

Описание категориального Series.

>>> s = pd.Series(['a', 'a', 'b', 'c'])
>>> s.describe()
count     4
unique    3
top       a
freq      2
dtype: object

Описание временной метки Series.

>>> s = pd.Series([
...   np.datetime64("2000-01-01"),
...   np.datetime64("2010-01-01"),
...   np.datetime64("2010-01-01")
... ])
>>> s.describe()
count                       3
unique                      2
top       2010-01-01 00:00:00
freq                        2
first     2000-01-01 00:00:00
last      2010-01-01 00:00:00
dtype: object

Описание DataFrame. По умолчанию возвращаются только числовые поля.

>>> df = pd.DataFrame({ 'object': ['a', 'b', 'c'],
...                     'numeric': [1, 2, 3],
...                     'categorical': pd.Categorical(['d','e','f'])
...                   })
>>> df.describe()
       numeric
count      3.0
mean       2.0
std        1.0
min        1.0
25%        1.5
50%        2.0
75%        2.5
max        3.0

Описание всех столбцов DataFrame независимо от типа данных.

>>> df.describe(include='all')
        categorical  numeric object
count            3      3.0      3
unique           3      NaN      3
top              f      NaN      c
freq             1      NaN      1
mean           NaN      2.0    NaN
std            NaN      1.0    NaN
min            NaN      1.0    NaN
25%            NaN      1.5    NaN
50%            NaN      2.0    NaN
75%            NaN      2.5    NaN
max            NaN      3.0    NaN

Описание столбца из DataFrame путем доступа к нему как к атрибуту.

>>> df.numeric.describe()
count    3.0
mean     2.0
std      1.0
min      1.0
25%      1.5
50%      2.0
75%      2.5
max      3.0
Name: numeric, dtype: float64

Включение только числовых столбцов в описание DataFrame.

>>> df.describe(include=[np.number])
       numeric
count      3.0
mean       2.0
std        1.0
min        1.0
25%        1.5
50%        2.0
75%        2.5
max        3.0

Включение только строковых столбцов в описание DataFrame.

>>> df.describe(include=[np.object])
       object
count       3
unique      3
top         c
freq        1

Включение только категориальных столбцов в описание DataFrame.

>>> df.describe(include=['category'])
       categorical
count            3
unique           3
top              f
freq             1

Исключение числовых столбцов из описания DataFrame.

>>> df.describe(exclude=[np.number])
       categorical object
count            3      3
unique           3      3
top              f      c
freq             1      1

Исключение строковых столбцов из описания DataFrame.

>>> df.describe(exclude=[np.object])
        categorical  numeric
count            3      3.0
unique           3      NaN
top              f      NaN
freq             1      NaN
mean           NaN      2.0
std            NaN      1.0
min            NaN      1.0
25%            NaN      1.5
50%            NaN      2.0
75%            NaN      2.5
max            NaN      3.0

© 2008–2012, AQR Capital Management, LLC, Lambda Foundry, Inc. and PyData Development Team
Licensed under the 3-clause BSD License.
https://pandas.pydata.org/pandas-docs/version/0.22.0/generated/pandas.Series.describe.html

Spec-Zone.ru

Настройки Оффлайн Что нового Помощь О нас
Spec-Zone .ru
спецификации, руководства, описания, API