Spec-Zone.ru › pandas 2

pandas.Series.describe

Series.describe(percentiles=None, include=None, exclude=None)[source]

Генерация описательных статистик.

Описательные статистики включают те, которые обобщают центральную тенденцию, дисперсию и форму распределения набора данных, исключая значения NaN.

Анализирует как числовые, так и строковые ряды, а также DataFrame наборы смешанных типов данных. Вывод будет зависеть от того, что предоставлено. Подробнее см. в примечаниях ниже.

Параметры:
percentiles:последовательность чисел, необязательно

Процентили, которые следует включить в вывод. Все они должны находиться в диапазоне от 0 до 1. По умолчанию [.25, .5, .75], что возвращает 25-й, 50-й и 75-й процентили.

include:'all', последовательность типов данных или None (по умолчанию), необязательно

Белый список типов данных, которые следует включить в результат. Игнорируется для Series. Вот варианты:

  • ‘all’ : Все столбцы входных данных будут включены в выходные данные.

  • Последовательность типов данных : Ограничивает результаты предоставленными типами данных. Чтобы ограничить результат числовыми типами, отправьте numpy.number. Чтобы ограничить его строковыми столбцами, отправьте тип данных numpy.object. Строки также можно использовать в стиле select_dtypes, (например, df.describe(include=['O'])). Для выбора категориальных столбцов pandas используйте 'category'

  • None (по умолчанию) : Результат будет включать все числовые столбцы.

exclude:последовательность типов данных или None (по умолчанию), необязательно,

Черный список типов данных, которые следует исключить из результата. Игнорируется для Series. Вот варианты:

  • Последовательность типов данных : Исключает предоставленные типы данных из результата. Чтобы исключить числовые типы, отправьте numpy.number. Чтобы исключить строковые столбцы, отправьте тип данных numpy.object. Строки также можно использовать в стиле select_dtypes (например, df.describe(exclude=['O'])). Для исключения категориальных столбцов pandas используйте 'category'

  • None (по умолчанию) : Результат ничего не исключит.

Возвращает:
Series или DataFrame

Статистические сводки предоставленного ряда или DataFrame.

См. также

DataFrame.count

Подсчет количества наблюдений без NA/null.

DataFrame.max

Максимальное значение в объекте.

DataFrame.min

Минимальное значение в объекте.

DataFrame.mean

Среднее значение.

DataFrame.std

Среднее квадратическое отклонение наблюдений.

DataFrame.select_dtypes

Подмножество DataFrame, включающее/исключающее столбцы на основе их типа.

Примечания

Для числовых данных индекс результата будет включать count, mean, std, min, max , а также нижние, 50 и верхние процентили. По умолчанию нижний процентиль 25, а верхний 75. 50 процентиль совпадает со значением медианы.

Для строковых данных (например, строк или метки времени) индекс результата будет включать count, unique, top, и freq. top — это наиболее часто встречающееся значение. freq — частота наиболее часто встречающегося значения. Метки времени также включают first и last элементы.

Если несколько строковых значений имеют наибольшее количество вхождений, то count и top результаты будут произвольно выбраны среди тех, которые имеют наибольшее количество вхождений.

Для смешанных типов данных, предоставленных через DataFrame, по умолчанию возвращается анализ только числовых столбцов. Если dataframe состоит только из строковых и категориальных данных без числовых столбцов, по умолчанию возвращается анализ как строковых, так и категориальных столбцов. Если include='all' используется как опция, результат будет включать объединение атрибутов каждого типа.

Параметры include и exclude могут использоваться для ограничения того, какие столбцы в DataFrame анализируются для вывода. Параметры игнорируются при анализе Series.

Примеры

Описание числового Series.

>>> s = pd.Series([1, 2, 3])
>>> s.describe()
count    3.0
mean     2.0
std      1.0
min      1.0
25%      1.5
50%      2.0
75%      2.5
max      3.0
dtype: float64

Описание категориального Series.

>>> s = pd.Series(['a', 'a', 'b', 'c'])
>>> s.describe()
count     4
unique    3
top       a
freq      2
dtype: object

Описание временной метки Series.

>>> s = pd.Series([
...     np.datetime64("2000-01-01"),
...     np.datetime64("2010-01-01"),
...     np.datetime64("2010-01-01")
... ])
>>> s.describe()
count                      3
mean     2006-09-01 08:00:00
min      2000-01-01 00:00:00
25%      2004-12-31 12:00:00
50%      2010-01-01 00:00:00
75%      2010-01-01 00:00:00
max      2010-01-01 00:00:00
dtype: object

Описание DataFrame. По умолчанию возвращаются только числовые поля.

>>> df = pd.DataFrame({'categorical': pd.Categorical(['d', 'e', 'f']),
...                    'numeric': [1, 2, 3],
...                    'object': ['a', 'b', 'c']
...                    })
>>> df.describe()
       numeric
count      3.0
mean       2.0
std        1.0
min        1.0
25%        1.5
50%        2.0
75%        2.5
max        3.0

Описание всех столбцов DataFrame независимо от типа данных.

>>> df.describe(include='all')  
       categorical  numeric object
count            3      3.0      3
unique           3      NaN      3
top              f      NaN      a
freq             1      NaN      1
mean           NaN      2.0    NaN
std            NaN      1.0    NaN
min            NaN      1.0    NaN
25%            NaN      1.5    NaN
50%            NaN      2.0    NaN
75%            NaN      2.5    NaN
max            NaN      3.0    NaN

Описание столбца из DataFrame путем доступа к нему как к атрибуту.

>>> df.numeric.describe()
count    3.0
mean     2.0
std      1.0
min      1.0
25%      1.5
50%      2.0
75%      2.5
max      3.0
Name: numeric, dtype: float64

Включение только числовых столбцов в описание DataFrame.

>>> df.describe(include=[np.number])
       numeric
count      3.0
mean       2.0
std        1.0
min        1.0
25%        1.5
50%        2.0
75%        2.5
max        3.0

Включение только строковых столбцов в описание DataFrame.

>>> df.describe(include=[object])  
       object
count       3
unique      3
top         a
freq        1

Включение только категориальных столбцов в описании DataFrame.

>>> df.describe(include=['category'])
       categorical
count            3
unique           3
top              d
freq             1

Исключение числовых столбцов из описания DataFrame.

>>> df.describe(exclude=[np.number])  
       categorical object
count            3      3
unique           3      3
top              f      a
freq             1      1

Исключение строковых столбцов из описания DataFrame.

>>> df.describe(exclude=[object])  
       categorical  numeric
count            3      3.0
unique           3      NaN
top              f      NaN
freq             1      NaN
mean           NaN      2.0
std            NaN      1.0
min            NaN      1.0
25%            NaN      1.5
50%            NaN      2.0
75%            NaN      2.5
max            NaN      3.0

© 2008–2022, AQR Capital Management, LLC, Lambda Foundry, Inc. and PyData Development Team
Licensed under the 3-clause BSD License.
https://pandas.pydata.org/pandas-docs/version/2.2.2/reference/api/pandas.Series.describe.html

Spec-Zone.ru

Настройки Оффлайн Что нового Помощь О нас
Spec-Zone .ru
спецификации, руководства, описания, API