pandas.DataFrame.resample
-
DataFrame.resample(rule, how=None, axis=0, fill_method=None, closed=None, label=None, convention='start', kind=None, loffset=None, limit=None, base=0) -
Удобный метод для преобразования частоты и ресемплирования данных регулярных временных рядов.
Параметры: rule : строка
строка или объект смещения, представляющий целевое преобразование
axis : целое число, необязательно, по умолчанию 0
closed : {‘right’, ‘left’}
Какая сторона интервала ячейки закрыта
label : {‘right’, ‘left’}
Какой край ячейки использовать для метки корзины
convention : {‘start’, ‘end’, ‘s’, ‘e’}
loffset : timedelta
Настройка меток ресемплированных временных рядов
base : целое число, по умолчанию 0
Для частот, которые равномерно делят 1 день, «начало» агрегированных интервалов. Например, для частоты ‘5min’, base может принимать значения от 0 до 4. По умолчанию 0
Примеры
Начните с создания временного ряда с 9 временными отметками по одной минуте.
>>> index = pd.date_range('1/1/2000', periods=9, freq='T') >>> series = pd.Series(range(9), index=index) >>> series 2000-01-01 00:00:00 0 2000-01-01 00:01:00 1 2000-01-01 00:02:00 2 2000-01-01 00:03:00 3 2000-01-01 00:04:00 4 2000-01-01 00:05:00 5 2000-01-01 00:06:00 6 2000-01-01 00:07:00 7 2000-01-01 00:08:00 8 Freq: T, dtype: int64Уменьшите частоту временного ряда до 3-минутных интервалов и просуммируйте значения временных отметок, попадающих в интервал.
>>> series.resample('3T').sum() 2000-01-01 00:00:00 3 2000-01-01 00:03:00 12 2000-01-01 00:06:00 21 Freq: 3T, dtype: int64Уменьшите частоту временного ряда до 3-минутных интервалов, как указано выше, но используйте правый край для метки каждого интервала вместо левого. Обратите внимание, что значение в корзине, используемое в качестве метки, не включено в эту корзину. Например, в исходном временном ряду корзина
2000-01-01 00:03:00содержит значение 3, но суммарное значение в ресемплированном интервале с меткой ``2000-01-01 00:03:00`` не включает 3 (если бы оно включалось, суммарное значение составляло бы 6, а не 3). Чтобы включить это значение, закройте правый край интервала, как показано в примере ниже.>>> series.resample('3T', label='right').sum() 2000-01-01 00:03:00 3 2000-01-01 00:06:00 12 2000-01-01 00:09:00 21 Freq: 3T, dtype: int64Уменьшите частоту временного ряда до 3-минутных интервалов, как указано выше, но закройте правый край интервала.
>>> series.resample('3T', label='right', closed='right').sum() 2000-01-01 00:00:00 0 2000-01-01 00:03:00 6 2000-01-01 00:06:00 15 2000-01-01 00:09:00 15 Freq: 3T, dtype: int64Увеличьте частоту временного ряда до 30-секундных интервалов.
>>> series.resample('30S').asfreq()[0:5] #select first 5 rows 2000-01-01 00:00:00 0 2000-01-01 00:00:30 NaN 2000-01-01 00:01:00 1 2000-01-01 00:01:30 NaN 2000-01-01 00:02:00 2 Freq: 30S, dtype: float64Увеличьте частоту временного ряда до 30-секундных интервалов и заполните
NaNзначения с помощью методаpad.>>> series.resample('30S').pad()[0:5] 2000-01-01 00:00:00 0 2000-01-01 00:00:30 0 2000-01-01 00:01:00 1 2000-01-01 00:01:30 1 2000-01-01 00:02:00 2 Freq: 30S, dtype: int64Увеличьте частоту временного ряда до 30-секундных интервалов и заполните
NaNзначения с помощью методаbfill.>>> series.resample('30S').bfill()[0:5] 2000-01-01 00:00:00 0 2000-01-01 00:00:30 1 2000-01-01 00:01:00 1 2000-01-01 00:01:30 2 2000-01-01 00:02:00 2 Freq: 30S, dtype: int64Передайте пользовательскую функцию через
apply>>> def custom_resampler(array_like): ... return np.sum(array_like)+5
>>> series.resample('3T').apply(custom_resampler) 2000-01-01 00:00:00 8 2000-01-01 00:03:00 17 2000-01-01 00:06:00 26 Freq: 3T, dtype: int64
© 2008–2012, AQR Capital Management, LLC, Lambda Foundry, Inc. and PyData Development Team
Licensed under the 3-clause BSD License.
https://pandas.pydata.org/pandas-docs/version/0.18.1/generated/pandas.DataFrame.resample.html