Spec-Zone.ru › pandas 2

pandas.DataFrame.to_orc

DataFrame.to_orc(path=None, *, engine='pyarrow', index=None, engine_kwargs=None)[source]

Запись DataFrame в формате ORC.

В версии 1.5.0.

Параметры:
path:str, файл-подобный объект или None, по умолчанию None

Если строка, она будет использоваться в качестве корневого пути при записи разбиения данных. Файл-подобным объектом мы называем объект с методом write(), например, дескриптор файла (например, с помощью встроенной функции open). Если path равно None, возвращается объект типа bytes.

engine:{‘pyarrow’}, по умолчанию ‘pyarrow’

Библиотека ORC для использования.

index:bool, необязательно

Если True, включить индекс(ы) DataFrame в выходной файл. Если False, они не будут записаны в файл. Если None, аналогично infer, индекс(ы) DataFrame будут сохранены. Однако вместо сохранения значений индекс RangeIndex будет сохранен как диапазон в метаданных, поэтому он занимает мало места и быстрее. Другие индексы будут включены в файл в качестве столбцов.

engine_kwargs:dict[str, Any] или None, по умолчанию None

Дополнительные ключевые параметры, передаваемые в pyarrow.orc.write_table().

Возвращает:
bytes, если аргумент path не указан, иначе None
Возбуждает:
NotImplementedError

Тип данных одного или нескольких столбцов — категориальный, беззнаковые целые числа, интервалы, периоды или разреженные.

ValueError

engine не равен pyarrow.

См. также

read_orc

Чтение файла ORC.

DataFrame.to_parquet

Запись файла parquet.

DataFrame.to_csv

Запись файла csv.

DataFrame.to_sql

Запись в таблицу SQL.

DataFrame.to_hdf

Запись в hdf.

Примечания

  • Перед использованием этой функции необходимо прочитать руководство пользователя по ORC и установить дополнительные зависимости.

  • Для использования этой функции требуется библиотека pyarrow.

  • Список поддерживаемых типов данных см. в поддерживаемых функциях ORC в Arrow.

  • В настоящее время часовые пояса в столбцах datetime не сохраняются при преобразовании DataFrame в файлы ORC.

Примеры

>>> df = pd.DataFrame(data={'col1': [1, 2], 'col2': [4, 3]})
>>> df.to_orc('df.orc')  
>>> pd.read_orc('df.orc')  
   col1  col2
0     1     4
1     2     3

Если требуется получить буфер с содержимым orc, можно записать его в io.BytesIO

>>> import io
>>> b = io.BytesIO(df.to_orc())  
>>> b.seek(0)  
0
>>> content = b.read()  

© 2008–2022, AQR Capital Management, LLC, Lambda Foundry, Inc. and PyData Development Team
Licensed under the 3-clause BSD License.
https://pandas.pydata.org/pandas-docs/version/2.2.2/reference/api/pandas.DataFrame.to_orc.html

Spec-Zone.ru

Настройки Оффлайн Что нового Помощь О нас
Spec-Zone .ru
спецификации, руководства, описания, API