Spec-Zone.ru › pandas 0.22

pandas.Panel.resample

Panel.resample(rule, how=None, axis=0, fill_method=None, closed=None, label=None, convention='start', kind=None, loffset=None, limit=None, base=0, on=None, level=None) [source]

Удобный метод для преобразования частоты и ресемплирования временных рядов. Объект должен иметь индекс типа datetime (DatetimeIndex, PeriodIndex или TimedeltaIndex), или передать значения типа datetime в ключевое слово on или уровень.

Параметры:

rule : строка

строка или объект смещения, представляющие целевое преобразование

axis : int, необязательно, по умолчанию 0

closed : {‘right’, ‘left’}

Какая сторона интервала бина закрыта. По умолчанию это ‘left’ для всех сдвигов частоты, за исключением ‘M’, ‘A’, ‘Q’, ‘BM’, ‘BA’, ‘BQ’ и ‘W’, для которых по умолчанию используется ‘right’.

label : {‘right’, ‘left’}

Какую метку края бина использовать для метки корзины. По умолчанию это ‘left’ для всех сдвигов частоты, за исключением ‘M’, ‘A’, ‘Q’, ‘BM’, ‘BA’, ‘BQ’ и ‘W’, для которых по умолчанию используется ‘right’.

convention : {‘start’, ‘end’, ‘s’, ‘e’}

Только для PeriodIndex, управляет тем, использовать ли начало или конец

loffset : timedelta

Корректировка меток во временных рядах, полученных после ресемплирования

base : int, по умолчанию 0

Для частот, которые равномерно делят 1 день, «начало» агрегированных интервалов. Например, для частоты ‘5min’ значение base может изменяться от 0 до 4. По умолчанию равно 0

on : строка, необязательно

Для DataFrame, столбец, который использовать вместо индекса для ресемплирования. Столбец должен быть типа datetime.

Введено в версии 0.19.0.

level : строка или целое число, необязательно

Для MultiIndex, уровень (имя или номер) для использования при ресемплировании. Уровень должен быть типа datetime.

Введено в версии 0.19.0.

Примечания

Дополнительную информацию об обозначениях смещения см. на этой ссылке.

Примеры

Начните с создания последовательности из 9 временных меток с интервалом в одну минуту.

>>> index = pd.date_range('1/1/2000', periods=9, freq='T')
>>> series = pd.Series(range(9), index=index)
>>> series
2000-01-01 00:00:00    0
2000-01-01 00:01:00    1
2000-01-01 00:02:00    2
2000-01-01 00:03:00    3
2000-01-01 00:04:00    4
2000-01-01 00:05:00    5
2000-01-01 00:06:00    6
2000-01-01 00:07:00    7
2000-01-01 00:08:00    8
Freq: T, dtype: int64

Сгруппируйте последовательность в интервалы по 3 минуты и просуммируйте значения временных меток, попадающих в интервал.

>>> series.resample('3T').sum()
2000-01-01 00:00:00     3
2000-01-01 00:03:00    12
2000-01-01 00:06:00    21
Freq: 3T, dtype: int64

Сгруппируйте последовательность в интервалы по 3 минуты аналогично предыдущему примеру, но используйте правый край интервала в качестве метки вместо левого. Обратите внимание, что значение в корзине, используемое в качестве метки, не включено в корзину, которую оно маркирует. Например, в исходной последовательности корзина 2000-01-01 00:03:00 содержит значение 3, но суммарное значение в сгруппированной корзине с меткой 2000-01-01 00:03:00 не включает 3 (если бы включало, суммарное значение было бы 6, а не 3). Чтобы включить это значение, закройте правый край интервала корзины, как показано в примере ниже.

>>> series.resample('3T', label='right').sum()
2000-01-01 00:03:00     3
2000-01-01 00:06:00    12
2000-01-01 00:09:00    21
Freq: 3T, dtype: int64

Сгруппируйте последовательность в интервалы по 3 минуты, но закройте правый край интервала корзины.

>>> series.resample('3T', label='right', closed='right').sum()
2000-01-01 00:00:00     0
2000-01-01 00:03:00     6
2000-01-01 00:06:00    15
2000-01-01 00:09:00    15
Freq: 3T, dtype: int64

Увеличьте частоту последовательности до 30 секунд.

>>> series.resample('30S').asfreq()[0:5] #select first 5 rows
2000-01-01 00:00:00   0.0
2000-01-01 00:00:30   NaN
2000-01-01 00:01:00   1.0
2000-01-01 00:01:30   NaN
2000-01-01 00:02:00   2.0
Freq: 30S, dtype: float64

Увеличьте частоту последовательности до 30 секунд и заполните NaN значения с помощью метода pad.

>>> series.resample('30S').pad()[0:5]
2000-01-01 00:00:00    0
2000-01-01 00:00:30    0
2000-01-01 00:01:00    1
2000-01-01 00:01:30    1
2000-01-01 00:02:00    2
Freq: 30S, dtype: int64

Увеличьте частоту последовательности до 30 секунд и заполните NaN значения с помощью метода bfill.

>>> series.resample('30S').bfill()[0:5]
2000-01-01 00:00:00    0
2000-01-01 00:00:30    1
2000-01-01 00:01:00    1
2000-01-01 00:01:30    2
2000-01-01 00:02:00    2
Freq: 30S, dtype: int64

Передайте пользовательскую функцию через apply

>>> def custom_resampler(array_like):
...     return np.sum(array_like)+5
>>> series.resample('3T').apply(custom_resampler)
2000-01-01 00:00:00     8
2000-01-01 00:03:00    17
2000-01-01 00:06:00    26
Freq: 3T, dtype: int64

Для последовательности с PeriodIndex можно использовать ключевое слово convention для управления использованием начала или конца rule.

>>> s = pd.Series([1, 2], index=pd.period_range('2012-01-01',
                                                freq='A',
                                                periods=2))
>>> s
2012    1
2013    2
Freq: A-DEC, dtype: int64

Ресемплируйте по месяцам, используя ‘start’ convention. Значения присваиваются первому месяцу периода.

>>> s.resample('M', convention='start').asfreq().head()
2012-01    1.0
2012-02    NaN
2012-03    NaN
2012-04    NaN
2012-05    NaN
Freq: M, dtype: float64

Ресемплируйте по месяцам, используя ‘end’ convention. Значения присваиваются последнему месяцу периода.

>>> s.resample('M', convention='end').asfreq()
2012-12    1.0
2013-01    NaN
2013-02    NaN
2013-03    NaN
2013-04    NaN
2013-05    NaN
2013-06    NaN
2013-07    NaN
2013-08    NaN
2013-09    NaN
2013-10    NaN
2013-11    NaN
2013-12    2.0
Freq: M, dtype: float64

Для объектов DataFrame можно использовать ключевое слово on для указания столбца вместо индекса для ресемплирования.

>>> df = pd.DataFrame(data=9*[range(4)], columns=['a', 'b', 'c', 'd'])
>>> df['time'] = pd.date_range('1/1/2000', periods=9, freq='T')
>>> df.resample('3T', on='time').sum()
                     a  b  c  d
time
2000-01-01 00:00:00  0  3  6  9
2000-01-01 00:03:00  0  3  6  9
2000-01-01 00:06:00  0  3  6  9

Для DataFrame с MultiIndex можно использовать ключевое слово level для указания уровня, на котором необходимо выполнить ресемплирование.

>>> time = pd.date_range('1/1/2000', periods=5, freq='T')
>>> df2 = pd.DataFrame(data=10*[range(4)],
                       columns=['a', 'b', 'c', 'd'],
                       index=pd.MultiIndex.from_product([time, [1, 2]])
                       )
>>> df2.resample('3T', level=0).sum()
                     a  b   c   d
2000-01-01 00:00:00  0  6  12  18
2000-01-01 00:03:00  0  4   8  12

© 2008–2012, AQR Capital Management, LLC, Lambda Foundry, Inc. and PyData Development Team
Licensed under the 3-clause BSD License.
https://pandas.pydata.org/pandas-docs/version/0.22.0/generated/pandas.Panel.resample.html

Spec-Zone.ru

Настройки Оффлайн Что нового Помощь О нас
Spec-Zone .ru
спецификации, руководства, описания, API