pandas.DataFrame.resample
- DataFrame.resample(rule, axis=0, closed=None, label=None, convention='start', kind=None, loffset=None, base=None, on=None, level=None, origin='start_day', offset=None, group_keys=_NoDefault.no_default)[source]
-
Перевыборка временных рядов данных.
Удобный метод для преобразования частоты и перевыборки временных рядов. Объект должен иметь индекс типа datetime (DatetimeIndex, PeriodIndex или TimedeltaIndex), или вызывающий должен передать метку временного ряда/индекса типа datetime в параметр
on/level.- Параметры
-
- rule:DateOffset, Timedelta или str
-
Строка или объект смещения, представляющий целевое преобразование.
- axis:{0 или ‘index’, 1 или ‘columns’}, по умолчанию 0
-
Ось для увеличения или уменьшения выборки. Для Series этот параметр не используется и по умолчанию равен 0. Должен быть DatetimeIndex, TimedeltaIndex или PeriodIndex.
- closed:{‘right’, ‘left’}, по умолчанию None
-
Сторона интервала, которая закрыта. По умолчанию ‘left’ для всех смещений частоты, за исключением ‘M’, ‘A’, ‘Q’, ‘BM’, ‘BA’, ‘BQ’ и ‘W’, у которых по умолчанию ‘right’.
- label:{‘right’, ‘left’}, по умолчанию None
-
Метка границы интервала, которая будет использоваться для метки корзины. По умолчанию ‘left’ для всех смещений частоты, за исключением ‘M’, ‘A’, ‘Q’, ‘BM’, ‘BA’, ‘BQ’ и ‘W’, у которых по умолчанию ‘right’.
- convention:{‘start’, ‘end’, ‘s’, ‘e’}, по умолчанию ‘start’
-
Только для PeriodIndex, управляет использованием начала или конца rule.
- kind:{‘timestamp’, ‘period’}, необязательно, по умолчанию None
-
Передайте ‘timestamp’, чтобы преобразовать результирующий индекс в DateTimeIndex, или ‘period’, чтобы преобразовать его в PeriodIndex. По умолчанию сохраняется исходное представление.
- loffset:timedelta, по умолчанию None
-
Корректировка меток во времени перевыборки.
Устарело начиная с версии 1.1.0: Вы должны добавить loffset к df.index после перевыборки. См. ниже.
- base:int, по умолчанию 0
-
Для частот, которые равномерно делят 1 день, «начало» агрегированных интервалов. Например, для частоты ‘5min’, base может изменяться от 0 до 4. По умолчанию 0.
Устарело начиная с версии 1.1.0: Новые аргументы, которые вы должны использовать, это ‘offset’ или ‘origin’.
- on:str, необязательно
-
Для DataFrame, столбец, который следует использовать вместо индекса для перевыборки. Столбец должен быть временного типа.
- level:str или int, необязательно
-
Для MultiIndex, уровень (имя или номер) для использования при перевыборке. level должен быть временного типа.
- origin:Timestamp или str, по умолчанию ‘start_day’
-
Маркер времени, относительно которого производится корректировка группировки. Временная зона origin должна совпадать с временной зоной индекса. Если строка, должна быть одной из следующих:
‘epoch’: origin — 1970-01-01
‘start’: origin — первое значение временного ряда
‘start_day’: origin — первый день в полночь временного ряда
Новое в версии 1.1.0.
‘end’: origin — последнее значение временного ряда
‘end_day’: origin — полная полночь последнего дня
Новое в версии 1.3.0.
- offset:Timedelta или str, по умолчанию None
-
Смещение timedelta, добавляемое к origin.
Новое в версии 1.1.0.
- group_keys:bool, необязательно
-
Включать ли ключи группы в индекс результата при использовании
.apply()на перевыбранном объекте. Если не указатьgroup_keys, сохраняется поведение, зависящее от значений, с pandas 1.4 и более ранних версий (см. Заметки о выпуске pandas 1.5.0 для примеров). В будущей версии pandas поведение будет по умолчанию таким же, как при указанииgroup_keys=False.Новое в версии 1.5.0.
- Возвращаемое значение
-
- pandas.core.Resampler
-
Объект
Resampler.
См. также
Series.resample-
Перевыборка Series.
DataFrame.resample-
Перевыборка DataFrame.
groupby-
Группировка DataFrame по отображению, функции, метке или списку меток.
asfreq-
Переиндексация DataFrame с заданной частотой без группировки.
Примечания
См. руководство пользователя для получения дополнительной информации.
Дополнительную информацию о строках смещения см. на этой странице.
Примеры
Начните с создания ряда с 9 отметками времени с интервалом в одну минуту.
>>> index = pd.date_range('1/1/2000', periods=9, freq='T') >>> series = pd.Series(range(9), index=index) >>> series 2000-01-01 00:00:00 0 2000-01-01 00:01:00 1 2000-01-01 00:02:00 2 2000-01-01 00:03:00 3 2000-01-01 00:04:00 4 2000-01-01 00:05:00 5 2000-01-01 00:06:00 6 2000-01-01 00:07:00 7 2000-01-01 00:08:00 8 Freq: T, dtype: int64Перевыберите ряд в интервалы по 3 минуты и суммируйте значения от меток времени, попадающих в интервал.
>>> series.resample('3T').sum() 2000-01-01 00:00:00 3 2000-01-01 00:03:00 12 2000-01-01 00:06:00 21 Freq: 3T, dtype: int64Перевыберите ряд в интервалы по 3 минуты, как выше, но пометьте каждый интервал правой границей вместо левой. Обратите внимание, что значение в корзине, используемое в качестве метки, не включено в корзину, которую оно маркирует. Например, в исходном ряду корзина
2000-01-01 00:03:00содержит значение 3, но суммированное значение в перевыбранной корзине с меткой2000-01-01 00:03:00не включает 3 (в противном случае суммарное значение было бы 6, а не 3). Чтобы включить это значение, закройте правый край интервала корзины, как показано в примере ниже.>>> series.resample('3T', label='right').sum() 2000-01-01 00:03:00 3 2000-01-01 00:06:00 12 2000-01-01 00:09:00 21 Freq: 3T, dtype: int64Перевыберите ряд в интервалы по 3 минуты, как выше, но закройте правый край интервала корзины.
>>> series.resample('3T', label='right', closed='right').sum() 2000-01-01 00:00:00 0 2000-01-01 00:03:00 6 2000-01-01 00:06:00 15 2000-01-01 00:09:00 15 Freq: 3T, dtype: int64Увеличьте выборку ряда в интервалы по 30 секунд.
>>> series.resample('30S').asfreq()[0:5] # Select first 5 rows 2000-01-01 00:00:00 0.0 2000-01-01 00:00:30 NaN 2000-01-01 00:01:00 1.0 2000-01-01 00:01:30 NaN 2000-01-01 00:02:00 2.0 Freq: 30S, dtype: float64Увеличьте выборку ряда в интервалы по 30 секунд и заполните
NaNзначения с использованиемffillметода.>>> series.resample('30S').ffill()[0:5] 2000-01-01 00:00:00 0 2000-01-01 00:00:30 0 2000-01-01 00:01:00 1 2000-01-01 00:01:30 1 2000-01-01 00:02:00 2 Freq: 30S, dtype: int64Увеличьте выборку ряда в интервалы по 30 секунд и заполните
NaNзначения с использованиемbfillметода.>>> series.resample('30S').bfill()[0:5] 2000-01-01 00:00:00 0 2000-01-01 00:00:30 1 2000-01-01 00:01:00 1 2000-01-01 00:01:30 2 2000-01-01 00:02:00 2 Freq: 30S, dtype: int64Передайте пользовательскую функцию через
apply>>> def custom_resampler(arraylike): ... return np.sum(arraylike) + 5 ... >>> series.resample('3T').apply(custom_resampler) 2000-01-01 00:00:00 8 2000-01-01 00:03:00 17 2000-01-01 00:06:00 26 Freq: 3T, dtype: int64Для Series с PeriodIndex, ключевое слово convention может быть использовано для управления использованием начала или конца rule.
Перевыберите год по кварталам, используя convention ‘start’. Значения назначаются первому кварталу периода.
>>> s = pd.Series([1, 2], index=pd.period_range('2012-01-01', ... freq='A', ... periods=2)) >>> s 2012 1 2013 2 Freq: A-DEC, dtype: int64 >>> s.resample('Q', convention='start').asfreq() 2012Q1 1.0 2012Q2 NaN 2012Q3 NaN 2012Q4 NaN 2013Q1 2.0 2013Q2 NaN 2013Q3 NaN 2013Q4 NaN Freq: Q-DEC, dtype: float64Перевыберите кварталы по месяцам, используя convention ‘end’. Значения назначаются последнему месяцу периода.
>>> q = pd.Series([1, 2, 3, 4], index=pd.period_range('2018-01-01', ... freq='Q', ... periods=4)) >>> q 2018Q1 1 2018Q2 2 2018Q3 3 2018Q4 4 Freq: Q-DEC, dtype: int64 >>> q.resample('M', convention='end').asfreq() 2018-03 1.0 2018-04 NaN 2018-05 NaN 2018-06 2.0 2018-07 NaN 2018-08 NaN 2018-09 3.0 2018-10 NaN 2018-11 NaN 2018-12 4.0 Freq: M, dtype: float64Для объектов DataFrame, ключевое слово on может быть использовано для указания столбца вместо индекса для перевыборки.
>>> d = {'price': [10, 11, 9, 13, 14, 18, 17, 19], ... 'volume': [50, 60, 40, 100, 50, 100, 40, 50]} >>> df = pd.DataFrame(d) >>> df['week_starting'] = pd.date_range('01/01/2018', ... periods=8, ... freq='W') >>> df price volume week_starting 0 10 50 2018-01-07 1 11 60 2018-01-14 2 9 40 2018-01-21 3 13 100 2018-01-28 4 14 50 2018-02-04 5 18 100 2018-02-11 6 17 40 2018-02-18 7 19 50 2018-02-25 >>> df.resample('M', on='week_starting').mean() price volume week_starting 2018-01-31 10.75 62.5 2018-02-28 17.00 60.0Для DataFrame с MultiIndex, ключевое слово level может быть использовано для указания уровня, на котором требуется произвести перевыборку.
>>> days = pd.date_range('1/1/2000', periods=4, freq='D') >>> d2 = {'price': [10, 11, 9, 13, 14, 18, 17, 19], ... 'volume': [50, 60, 40, 100, 50, 100, 40, 50]} >>> df2 = pd.DataFrame( ... d2, ... index=pd.MultiIndex.from_product( ... [days, ['morning', 'afternoon']] ... ) ... ) >>> df2 price volume 2000-01-01 morning 10 50 afternoon 11 60 2000-01-02 morning 9 40 afternoon 13 100 2000-01-03 morning 14 50 afternoon 18 100 2000-01-04 morning 17 40 afternoon 19 50 >>> df2.resample('D', level=0).sum() price volume 2000-01-01 21 110 2000-01-02 22 140 2000-01-03 32 150 2000-01-04 36 90Если вы хотите скорректировать начало интервалов на основе фиксированной отметки времени:
>>> start, end = '2000-10-01 23:30:00', '2000-10-02 00:30:00' >>> rng = pd.date_range(start, end, freq='7min') >>> ts = pd.Series(np.arange(len(rng)) * 3, index=rng) >>> ts 2000-10-01 23:30:00 0 2000-10-01 23:37:00 3 2000-10-01 23:44:00 6 2000-10-01 23:51:00 9 2000-10-01 23:58:00 12 2000-10-02 00:05:00 15 2000-10-02 00:12:00 18 2000-10-02 00:19:00 21 2000-10-02 00:26:00 24 Freq: 7T, dtype: int64
>>> ts.resample('17min').sum() 2000-10-01 23:14:00 0 2000-10-01 23:31:00 9 2000-10-01 23:48:00 21 2000-10-02 00:05:00 54 2000-10-02 00:22:00 24 Freq: 17T, dtype: int64>>> ts.resample('17min', origin='epoch').sum() 2000-10-01 23:18:00 0 2000-10-01 23:35:00 18 2000-10-01 23:52:00 27 2000-10-02 00:09:00 39 2000-10-02 00:26:00 24 Freq: 17T, dtype: int64>>> ts.resample('17min', origin='2000-01-01').sum() 2000-10-01 23:24:00 3 2000-10-01 23:41:00 15 2000-10-01 23:58:00 45 2000-10-02 00:15:00 45 Freq: 17T, dtype: int64Если вы хотите скорректировать начало интервалов с помощью смещения offset Timedelta, две строки ниже эквивалентны:
>>> ts.resample('17min', origin='start').sum() 2000-10-01 23:30:00 9 2000-10-01 23:47:00 21 2000-10-02 00:04:00 54 2000-10-02 00:21:00 24 Freq: 17T, dtype: int64>>> ts.resample('17min', offset='23h30min').sum() 2000-10-01 23:30:00 9 2000-10-01 23:47:00 21 2000-10-02 00:04:00 54 2000-10-02 00:21:00 24 Freq: 17T, dtype: int64Если вы хотите принять самую большую отметку времени как конец интервалов:
>>> ts.resample('17min', origin='end').sum() 2000-10-01 23:35:00 0 2000-10-01 23:52:00 18 2000-10-02 00:09:00 27 2000-10-02 00:26:00 63 Freq: 17T, dtype: int64В отличие от start_day, вы можете использовать end_day для взятия верхней границы полночи самой поздней отметки времени в качестве конца интервалов и удаления интервалов, не содержащих данных:
>>> ts.resample('17min', origin='end_day').sum() 2000-10-01 23:38:00 3 2000-10-01 23:55:00 15 2000-10-02 00:12:00 45 2000-10-02 00:29:00 45 Freq: 17T, dtype: int64Для замены устаревшего аргумента base, теперь можно использовать offset, в этом примере это эквивалентно base=2:
>>> ts.resample('17min', offset='2min').sum() 2000-10-01 23:16:00 0 2000-10-01 23:33:00 9 2000-10-01 23:50:00 36 2000-10-02 00:07:00 39 2000-10-02 00:24:00 24 Freq: 17T, dtype: int64Для замены устаревшего аргумента loffset:
>>> from pandas.tseries.frequencies import to_offset >>> loffset = '19min' >>> ts_out = ts.resample('17min').sum() >>> ts_out.index = ts_out.index + to_offset(loffset) >>> ts_out 2000-10-01 23:33:00 0 2000-10-01 23:50:00 9 2000-10-02 00:07:00 21 2000-10-02 00:24:00 54 2000-10-02 00:41:00 24 Freq: 17T, dtype: int64
© 2008–2022, AQR Capital Management, LLC, Lambda Foundry, Inc. and PyData Development Team
Licensed under the 3-clause BSD License.
https://pandas.pydata.org/pandas-docs/version/1.5.0/reference/api/pandas.DataFrame.resample.html