Spec-Zone.ru › pandas 1

pandas.DataFrame.resample

DataFrame.resample(rule, axis=0, closed=None, label=None, convention='start', kind=None, loffset=None, base=None, on=None, level=None, origin='start_day', offset=None, group_keys=_NoDefault.no_default)[source]

Перевыборка временных рядов данных.

Удобный метод для преобразования частоты и перевыборки временных рядов. Объект должен иметь индекс типа datetime (DatetimeIndex, PeriodIndex или TimedeltaIndex), или вызывающий должен передать метку временного ряда/индекса типа datetime в параметр on/level.

Параметры
rule:DateOffset, Timedelta или str

Строка или объект смещения, представляющий целевое преобразование.

axis:{0 или ‘index’, 1 или ‘columns’}, по умолчанию 0

Ось для увеличения или уменьшения выборки. Для Series этот параметр не используется и по умолчанию равен 0. Должен быть DatetimeIndex, TimedeltaIndex или PeriodIndex.

closed:{‘right’, ‘left’}, по умолчанию None

Сторона интервала, которая закрыта. По умолчанию ‘left’ для всех смещений частоты, за исключением ‘M’, ‘A’, ‘Q’, ‘BM’, ‘BA’, ‘BQ’ и ‘W’, у которых по умолчанию ‘right’.

label:{‘right’, ‘left’}, по умолчанию None

Метка границы интервала, которая будет использоваться для метки корзины. По умолчанию ‘left’ для всех смещений частоты, за исключением ‘M’, ‘A’, ‘Q’, ‘BM’, ‘BA’, ‘BQ’ и ‘W’, у которых по умолчанию ‘right’.

convention:{‘start’, ‘end’, ‘s’, ‘e’}, по умолчанию ‘start’

Только для PeriodIndex, управляет использованием начала или конца rule.

kind:{‘timestamp’, ‘period’}, необязательно, по умолчанию None

Передайте ‘timestamp’, чтобы преобразовать результирующий индекс в DateTimeIndex, или ‘period’, чтобы преобразовать его в PeriodIndex. По умолчанию сохраняется исходное представление.

loffset:timedelta, по умолчанию None

Корректировка меток во времени перевыборки.

Устарело начиная с версии 1.1.0: Вы должны добавить loffset к df.index после перевыборки. См. ниже.

base:int, по умолчанию 0

Для частот, которые равномерно делят 1 день, «начало» агрегированных интервалов. Например, для частоты ‘5min’, base может изменяться от 0 до 4. По умолчанию 0.

Устарело начиная с версии 1.1.0: Новые аргументы, которые вы должны использовать, это ‘offset’ или ‘origin’.

on:str, необязательно

Для DataFrame, столбец, который следует использовать вместо индекса для перевыборки. Столбец должен быть временного типа.

level:str или int, необязательно

Для MultiIndex, уровень (имя или номер) для использования при перевыборке. level должен быть временного типа.

origin:Timestamp или str, по умолчанию ‘start_day’

Маркер времени, относительно которого производится корректировка группировки. Временная зона origin должна совпадать с временной зоной индекса. Если строка, должна быть одной из следующих:

  • ‘epoch’: origin — 1970-01-01

  • ‘start’: origin — первое значение временного ряда

  • ‘start_day’: origin — первый день в полночь временного ряда

Новое в версии 1.1.0.

  • ‘end’: origin — последнее значение временного ряда

  • ‘end_day’: origin — полная полночь последнего дня

Новое в версии 1.3.0.

offset:Timedelta или str, по умолчанию None

Смещение timedelta, добавляемое к origin.

Новое в версии 1.1.0.

group_keys:bool, необязательно

Включать ли ключи группы в индекс результата при использовании .apply() на перевыбранном объекте. Если не указать group_keys, сохраняется поведение, зависящее от значений, с pandas 1.4 и более ранних версий (см. Заметки о выпуске pandas 1.5.0 для примеров). В будущей версии pandas поведение будет по умолчанию таким же, как при указании group_keys=False.

Новое в версии 1.5.0.

Возвращаемое значение
pandas.core.Resampler

Объект Resampler.

См. также

Series.resample

Перевыборка Series.

DataFrame.resample

Перевыборка DataFrame.

groupby

Группировка DataFrame по отображению, функции, метке или списку меток.

asfreq

Переиндексация DataFrame с заданной частотой без группировки.

Примечания

См. руководство пользователя для получения дополнительной информации.

Дополнительную информацию о строках смещения см. на этой странице.

Примеры

Начните с создания ряда с 9 отметками времени с интервалом в одну минуту.

>>> index = pd.date_range('1/1/2000', periods=9, freq='T')
>>> series = pd.Series(range(9), index=index)
>>> series
2000-01-01 00:00:00    0
2000-01-01 00:01:00    1
2000-01-01 00:02:00    2
2000-01-01 00:03:00    3
2000-01-01 00:04:00    4
2000-01-01 00:05:00    5
2000-01-01 00:06:00    6
2000-01-01 00:07:00    7
2000-01-01 00:08:00    8
Freq: T, dtype: int64

Перевыберите ряд в интервалы по 3 минуты и суммируйте значения от меток времени, попадающих в интервал.

>>> series.resample('3T').sum()
2000-01-01 00:00:00     3
2000-01-01 00:03:00    12
2000-01-01 00:06:00    21
Freq: 3T, dtype: int64

Перевыберите ряд в интервалы по 3 минуты, как выше, но пометьте каждый интервал правой границей вместо левой. Обратите внимание, что значение в корзине, используемое в качестве метки, не включено в корзину, которую оно маркирует. Например, в исходном ряду корзина 2000-01-01 00:03:00 содержит значение 3, но суммированное значение в перевыбранной корзине с меткой 2000-01-01 00:03:00 не включает 3 (в противном случае суммарное значение было бы 6, а не 3). Чтобы включить это значение, закройте правый край интервала корзины, как показано в примере ниже.

>>> series.resample('3T', label='right').sum()
2000-01-01 00:03:00     3
2000-01-01 00:06:00    12
2000-01-01 00:09:00    21
Freq: 3T, dtype: int64

Перевыберите ряд в интервалы по 3 минуты, как выше, но закройте правый край интервала корзины.

>>> series.resample('3T', label='right', closed='right').sum()
2000-01-01 00:00:00     0
2000-01-01 00:03:00     6
2000-01-01 00:06:00    15
2000-01-01 00:09:00    15
Freq: 3T, dtype: int64

Увеличьте выборку ряда в интервалы по 30 секунд.

>>> series.resample('30S').asfreq()[0:5]   # Select first 5 rows
2000-01-01 00:00:00   0.0
2000-01-01 00:00:30   NaN
2000-01-01 00:01:00   1.0
2000-01-01 00:01:30   NaN
2000-01-01 00:02:00   2.0
Freq: 30S, dtype: float64

Увеличьте выборку ряда в интервалы по 30 секунд и заполните NaN значения с использованием ffill метода.

>>> series.resample('30S').ffill()[0:5]
2000-01-01 00:00:00    0
2000-01-01 00:00:30    0
2000-01-01 00:01:00    1
2000-01-01 00:01:30    1
2000-01-01 00:02:00    2
Freq: 30S, dtype: int64

Увеличьте выборку ряда в интервалы по 30 секунд и заполните NaN значения с использованием bfill метода.

>>> series.resample('30S').bfill()[0:5]
2000-01-01 00:00:00    0
2000-01-01 00:00:30    1
2000-01-01 00:01:00    1
2000-01-01 00:01:30    2
2000-01-01 00:02:00    2
Freq: 30S, dtype: int64

Передайте пользовательскую функцию через apply

>>> def custom_resampler(arraylike):
...     return np.sum(arraylike) + 5
...
>>> series.resample('3T').apply(custom_resampler)
2000-01-01 00:00:00     8
2000-01-01 00:03:00    17
2000-01-01 00:06:00    26
Freq: 3T, dtype: int64

Для Series с PeriodIndex, ключевое слово convention может быть использовано для управления использованием начала или конца rule.

Перевыберите год по кварталам, используя convention ‘start’. Значения назначаются первому кварталу периода.

>>> s = pd.Series([1, 2], index=pd.period_range('2012-01-01',
...                                             freq='A',
...                                             periods=2))
>>> s
2012    1
2013    2
Freq: A-DEC, dtype: int64
>>> s.resample('Q', convention='start').asfreq()
2012Q1    1.0
2012Q2    NaN
2012Q3    NaN
2012Q4    NaN
2013Q1    2.0
2013Q2    NaN
2013Q3    NaN
2013Q4    NaN
Freq: Q-DEC, dtype: float64

Перевыберите кварталы по месяцам, используя convention ‘end’. Значения назначаются последнему месяцу периода.

>>> q = pd.Series([1, 2, 3, 4], index=pd.period_range('2018-01-01',
...                                                   freq='Q',
...                                                   periods=4))
>>> q
2018Q1    1
2018Q2    2
2018Q3    3
2018Q4    4
Freq: Q-DEC, dtype: int64
>>> q.resample('M', convention='end').asfreq()
2018-03    1.0
2018-04    NaN
2018-05    NaN
2018-06    2.0
2018-07    NaN
2018-08    NaN
2018-09    3.0
2018-10    NaN
2018-11    NaN
2018-12    4.0
Freq: M, dtype: float64

Для объектов DataFrame, ключевое слово on может быть использовано для указания столбца вместо индекса для перевыборки.

>>> d = {'price': [10, 11, 9, 13, 14, 18, 17, 19],
...      'volume': [50, 60, 40, 100, 50, 100, 40, 50]}
>>> df = pd.DataFrame(d)
>>> df['week_starting'] = pd.date_range('01/01/2018',
...                                     periods=8,
...                                     freq='W')
>>> df
   price  volume week_starting
0     10      50    2018-01-07
1     11      60    2018-01-14
2      9      40    2018-01-21
3     13     100    2018-01-28
4     14      50    2018-02-04
5     18     100    2018-02-11
6     17      40    2018-02-18
7     19      50    2018-02-25
>>> df.resample('M', on='week_starting').mean()
               price  volume
week_starting
2018-01-31     10.75    62.5
2018-02-28     17.00    60.0

Для DataFrame с MultiIndex, ключевое слово level может быть использовано для указания уровня, на котором требуется произвести перевыборку.

>>> days = pd.date_range('1/1/2000', periods=4, freq='D')
>>> d2 = {'price': [10, 11, 9, 13, 14, 18, 17, 19],
...       'volume': [50, 60, 40, 100, 50, 100, 40, 50]}
>>> df2 = pd.DataFrame(
...     d2,
...     index=pd.MultiIndex.from_product(
...         [days, ['morning', 'afternoon']]
...     )
... )
>>> df2
                      price  volume
2000-01-01 morning       10      50
           afternoon     11      60
2000-01-02 morning        9      40
           afternoon     13     100
2000-01-03 morning       14      50
           afternoon     18     100
2000-01-04 morning       17      40
           afternoon     19      50
>>> df2.resample('D', level=0).sum()
            price  volume
2000-01-01     21     110
2000-01-02     22     140
2000-01-03     32     150
2000-01-04     36      90

Если вы хотите скорректировать начало интервалов на основе фиксированной отметки времени:

>>> start, end = '2000-10-01 23:30:00', '2000-10-02 00:30:00'
>>> rng = pd.date_range(start, end, freq='7min')
>>> ts = pd.Series(np.arange(len(rng)) * 3, index=rng)
>>> ts
2000-10-01 23:30:00     0
2000-10-01 23:37:00     3
2000-10-01 23:44:00     6
2000-10-01 23:51:00     9
2000-10-01 23:58:00    12
2000-10-02 00:05:00    15
2000-10-02 00:12:00    18
2000-10-02 00:19:00    21
2000-10-02 00:26:00    24
Freq: 7T, dtype: int64
>>> ts.resample('17min').sum()
2000-10-01 23:14:00     0
2000-10-01 23:31:00     9
2000-10-01 23:48:00    21
2000-10-02 00:05:00    54
2000-10-02 00:22:00    24
Freq: 17T, dtype: int64
>>> ts.resample('17min', origin='epoch').sum()
2000-10-01 23:18:00     0
2000-10-01 23:35:00    18
2000-10-01 23:52:00    27
2000-10-02 00:09:00    39
2000-10-02 00:26:00    24
Freq: 17T, dtype: int64
>>> ts.resample('17min', origin='2000-01-01').sum()
2000-10-01 23:24:00     3
2000-10-01 23:41:00    15
2000-10-01 23:58:00    45
2000-10-02 00:15:00    45
Freq: 17T, dtype: int64

Если вы хотите скорректировать начало интервалов с помощью смещения offset Timedelta, две строки ниже эквивалентны:

>>> ts.resample('17min', origin='start').sum()
2000-10-01 23:30:00     9
2000-10-01 23:47:00    21
2000-10-02 00:04:00    54
2000-10-02 00:21:00    24
Freq: 17T, dtype: int64
>>> ts.resample('17min', offset='23h30min').sum()
2000-10-01 23:30:00     9
2000-10-01 23:47:00    21
2000-10-02 00:04:00    54
2000-10-02 00:21:00    24
Freq: 17T, dtype: int64

Если вы хотите принять самую большую отметку времени как конец интервалов:

>>> ts.resample('17min', origin='end').sum()
2000-10-01 23:35:00     0
2000-10-01 23:52:00    18
2000-10-02 00:09:00    27
2000-10-02 00:26:00    63
Freq: 17T, dtype: int64

В отличие от start_day, вы можете использовать end_day для взятия верхней границы полночи самой поздней отметки времени в качестве конца интервалов и удаления интервалов, не содержащих данных:

>>> ts.resample('17min', origin='end_day').sum()
2000-10-01 23:38:00     3
2000-10-01 23:55:00    15
2000-10-02 00:12:00    45
2000-10-02 00:29:00    45
Freq: 17T, dtype: int64

Для замены устаревшего аргумента base, теперь можно использовать offset, в этом примере это эквивалентно base=2:

>>> ts.resample('17min', offset='2min').sum()
2000-10-01 23:16:00     0
2000-10-01 23:33:00     9
2000-10-01 23:50:00    36
2000-10-02 00:07:00    39
2000-10-02 00:24:00    24
Freq: 17T, dtype: int64

Для замены устаревшего аргумента loffset:

>>> from pandas.tseries.frequencies import to_offset
>>> loffset = '19min'
>>> ts_out = ts.resample('17min').sum()
>>> ts_out.index = ts_out.index + to_offset(loffset)
>>> ts_out
2000-10-01 23:33:00     0
2000-10-01 23:50:00     9
2000-10-02 00:07:00    21
2000-10-02 00:24:00    54
2000-10-02 00:41:00    24
Freq: 17T, dtype: int64

© 2008–2022, AQR Capital Management, LLC, Lambda Foundry, Inc. and PyData Development Team
Licensed under the 3-clause BSD License.
https://pandas.pydata.org/pandas-docs/version/1.5.0/reference/api/pandas.DataFrame.resample.html

Spec-Zone.ru

Настройки Оффлайн Что нового Помощь О нас
Spec-Zone .ru
спецификации, руководства, описания, API