pandas.DataFrame.to_orc
- DataFrame.to_orc(path=None, *, engine='pyarrow', index=None, engine_kwargs=None)[source]
-
Запись DataFrame в формате ORC.
В версии 1.5.0.
- Параметры:
-
- path:str, файл-подобный объект или None, по умолчанию None
-
Если строка, она будет использоваться в качестве корневого пути при записи разбиения данных. Файл-подобным объектом мы называем объект с методом write(), например, дескриптор файла (например, с помощью встроенной функции open). Если path равно None, возвращается объект типа bytes.
- engine:{‘pyarrow’}, по умолчанию ‘pyarrow’
-
Библиотека ORC для использования.
- index:bool, необязательно
-
Если
True, включить индекс(ы) DataFrame в выходной файл. ЕслиFalse, они не будут записаны в файл. ЕслиNone, аналогичноinfer, индекс(ы) DataFrame будут сохранены. Однако вместо сохранения значений индекс RangeIndex будет сохранен как диапазон в метаданных, поэтому он занимает мало места и быстрее. Другие индексы будут включены в файл в качестве столбцов. - engine_kwargs:dict[str, Any] или None, по умолчанию None
-
Дополнительные ключевые параметры, передаваемые в
pyarrow.orc.write_table().
- Возвращает:
-
- bytes, если аргумент path не указан, иначе None
- Возбуждает:
-
- NotImplementedError
-
Тип данных одного или нескольких столбцов — категориальный, беззнаковые целые числа, интервалы, периоды или разреженные.
- ValueError
-
engine не равен pyarrow.
См. также
read_orc-
Чтение файла ORC.
DataFrame.to_parquet-
Запись файла parquet.
DataFrame.to_csv-
Запись файла csv.
DataFrame.to_sql-
Запись в таблицу SQL.
DataFrame.to_hdf-
Запись в hdf.
Примечания
Перед использованием этой функции необходимо прочитать руководство пользователя по ORC и установить дополнительные зависимости.
Для использования этой функции требуется библиотека pyarrow.
Список поддерживаемых типов данных см. в поддерживаемых функциях ORC в Arrow.
В настоящее время часовые пояса в столбцах datetime не сохраняются при преобразовании DataFrame в файлы ORC.
Примеры
>>> df = pd.DataFrame(data={'col1': [1, 2], 'col2': [4, 3]}) >>> df.to_orc('df.orc') >>> pd.read_orc('df.orc') col1 col2 0 1 4 1 2 3Если требуется получить буфер с содержимым orc, можно записать его в io.BytesIO
>>> import io >>> b = io.BytesIO(df.to_orc()) >>> b.seek(0) 0 >>> content = b.read()
© 2008–2022, AQR Capital Management, LLC, Lambda Foundry, Inc. and PyData Development Team
Licensed under the 3-clause BSD License.
https://pandas.pydata.org/pandas-docs/version/2.2.2/reference/api/pandas.DataFrame.to_orc.html