Spec-Zone.ru › pandas 0.20

pandas.Series.describe

Series.describe(percentiles=None, include=None, exclude=None) [source]

Генерирует описательные статистики, которые обобщают центральную тенденцию, дисперсию и форму распределения набора данных, исключая NaN значения.

Анализирует как числовые, так и строковые ряды, а также DataFrame наборы столбцов смешанных типов данных. Вывод будет зависеть от предоставленных данных. Более подробную информацию см. в примечаниях ниже.

Параметры:

percentiles : список чисел, необязательно

Процентили, которые нужно включить в вывод. Все они должны быть в диапазоне от 0 до 1. По умолчанию [.25, .5, .75], что возвращает 25-й, 50-й и 75-й процентили.

include : ‘all’, список типов данных или None (по умолчанию), необязательно

Белый список типов данных, которые нужно включить в результат. Игнорируется для Series. Вот варианты:

  • ‘all’ : Все столбцы входных данных будут включены в выходные данные.
  • Список типов данных : Ограничивает результаты предоставленными типами данных. Чтобы ограничить результат числовыми типами, отправьте numpy.number. Чтобы ограничить результат категориальными объектами, отправьте тип данных numpy.object. Строки также могут быть использованы в стиле select_dtypes (например, df.describe(include=['O']))
  • None (по умолчанию) : Результат будет включать все числовые столбцы.

exclude : список типов данных или None (по умолчанию), необязательно

Черный список типов данных, которые нужно исключить из результата. Игнорируется для Series. Вот варианты:

  • Список типов данных : Исключает предоставленные типы данных из результата. Чтобы выбрать числовые типы, отправьте numpy.number. Чтобы выбрать категориальные объекты, отправьте тип данных numpy.object. Строки также могут быть использованы в стиле select_dtypes (например, df.describe(include=['O']))
  • None (по умолчанию) : Результат ничего не будет исключать.
Возвращаемое значение:

summary: Ряд/таблица сводных статистик

См. также

DataFrame.count, DataFrame.max, DataFrame.min, DataFrame.mean, DataFrame.std, DataFrame.select_dtypes

Примечания

Для числовых данных индекс результата будет содержать count, mean, std, min, max а также нижние, 50 и верхние процентили. По умолчанию нижний процентиль - 25, а верхний - 75. 50 процентиль совпадает с медианой.

Для строковых данных (например, строк или временных меток) индекс результата будет содержать count, unique, top, и freq. top - это самое частое значение. freq - частота самого частого значения. Временные метки также включают first и last элементы.

Если несколько строковых значений имеют наибольшее количество, то результаты count и top будут произвольно выбраны среди тех, которые имеют наибольшее количество.

Для смешанных типов данных, предоставленных через DataFrame, по умолчанию возвращается анализ только числовых столбцов. Если include='all' указан как параметр, результат будет включать объединение атрибутов каждого типа.

Параметры include и exclude могут быть использованы для ограничения анализа столбцов в DataFrame для вывода. Параметры игнорируются при анализе Series.

Примеры

Описание числового Series.

>>> s = pd.Series([1, 2, 3])
>>> s.describe()
count    3.0
mean     2.0
std      1.0
min      1.0
25%      1.5
50%      2.0
75%      2.5
max      3.0

Описание категориального Series.

>>> s = pd.Series(['a', 'a', 'b', 'c'])
>>> s.describe()
count     4
unique    3
top       a
freq      2
dtype: object

Описание временной метки Series.

>>> s = pd.Series([
...   np.datetime64("2000-01-01"),
...   np.datetime64("2010-01-01"),
...   np.datetime64("2010-01-01")
... ])
>>> s.describe()
count                       3
unique                      2
top       2010-01-01 00:00:00
freq                        2
first     2000-01-01 00:00:00
last      2010-01-01 00:00:00
dtype: object

Описание DataFrame. По умолчанию возвращаются только числовые поля.

>>> df = pd.DataFrame([[1, 'a'], [2, 'b'], [3, 'c']],
...                   columns=['numeric', 'object'])
>>> df.describe()
       numeric
count      3.0
mean       2.0
std        1.0
min        1.0
25%        1.5
50%        2.0
75%        2.5
max        3.0

Описание всех столбцов DataFrame независимо от типа данных.

>>> df.describe(include='all')
        numeric object
count       3.0      3
unique      NaN      3
top         NaN      b
freq        NaN      1
mean        2.0    NaN
std         1.0    NaN
min         1.0    NaN
25%         1.5    NaN
50%         2.0    NaN
75%         2.5    NaN
max         3.0    NaN

Описание столбца из DataFrame, обращаясь к нему как к атрибуту.

>>> df.numeric.describe()
count    3.0
mean     2.0
std      1.0
min      1.0
25%      1.5
50%      2.0
75%      2.5
max      3.0
Name: numeric, dtype: float64

Включение только числовых столбцов в описание DataFrame.

>>> df.describe(include=[np.number])
       numeric
count      3.0
mean       2.0
std        1.0
min        1.0
25%        1.5
50%        2.0
75%        2.5
max        3.0

Включение только строковых столбцов в описание DataFrame.

>>> df.describe(include=[np.object])
       object
count       3
unique      3
top         b
freq        1

Исключение числовых столбцов из описания DataFrame.

>>> df.describe(exclude=[np.number])
       object
count       3
unique      3
top         b
freq        1

Исключение строковых столбцов из описания DataFrame.

>>> df.describe(exclude=[np.object])
       numeric
count      3.0
mean       2.0
std        1.0
min        1.0
25%        1.5
50%        2.0
75%        2.5
max        3.0

© 2008–2012, AQR Capital Management, LLC, Lambda Foundry, Inc. and PyData Development Team
Licensed under the 3-clause BSD License.
https://pandas.pydata.org/pandas-docs/version/0.20.3/generated/pandas.Series.describe.html

Spec-Zone.ru

Настройки Оффлайн Что нового Помощь О нас
Spec-Zone .ru
спецификации, руководства, описания, API