Spec-Zone.ru › pandas 1

pandas.DataFrame.to_parquet

DataFrame.to_parquet(path=None, engine='auto', compression='snappy', index=None, partition_cols=None, storage_options=None, **kwargs)[source]

Записать DataFrame в двоичный формат parquet.

Данная функция записывает DataFrame в файл parquet. Вы можете выбрать разные бэкэнды parquet и указать сжатие. Более подробную информацию см. в руководстве пользователя.

Параметры
path:str, объект пути, файл-подобный объект или None, по умолчанию None

Строка, объект пути (реализующий os.PathLike[str]), или файл-подобный объект, реализующий двоичную write() функцию. Если None, результат возвращается в виде байтов. Если строка или путь, он будет использоваться в качестве пути к корневой директории при записи разбиения набора данных.

Изменено в версии 1.2.0.

Ранее это было «fname»

engine:{‘auto’, ‘pyarrow’, ‘fastparquet’}, по умолчанию ‘auto’

Библиотека parquet, которую использовать. Если ‘auto’, то используется io.parquet.engine. По умолчанию io.parquet.engine поведение заключается в попытке использовать ‘pyarrow’, если ‘pyarrow’ недоступен, то используется ‘fastparquet’.

compression:{‘snappy’, ‘gzip’, ‘brotli’, None}, по умолчанию ‘snappy’

Имя сжатия, которое использовать. Используйте None для отсутствия сжатия.

index:bool, по умолчанию None

Если True, включить индексы DataFrame в выходной файл. Если False, они не будут записаны в файл. Если None, аналогично True, индексы DataFrame будут сохранены. Однако вместо сохранения значений RangeIndex будет сохранён диапазон в метаданных, чтобы он занимал мало места и был быстрее. Другие индексы будут включены в выходной файл в виде столбцов.

partition_cols:список, необязательно, по умолчанию None

Имена столбцов, по которым разбить набор данных. Столбцы разбиваются в порядке их предоставления. Должно быть None, если path не является строкой.

storage_options:словарь, необязательно

Дополнительные параметры, которые имеют смысл для определённого подключения к хранилищу, например, хост, порт, имя пользователя, пароль и т. д. Для HTTP(S) URL-адресов пары ключ-значение передаются в urllib.request.Request в качестве параметров заголовка. Для других URL-адресов (например, начинающихся с «s3://», и «gcs://») пары ключ-значение передаются в fsspec.open. Подробнее см. fsspec и urllib, а дополнительные примеры параметров хранения см. здесь.

Добавлен в версии 1.2.0.

**kwargs

Дополнительные аргументы, передаваемые библиотеке parquet. Подробнее см. pandas io.

Возвращает
байты, если аргумент path не указан, иначе None

См. также

read_parquet

Чтение файла parquet.

DataFrame.to_orc

Запись файла orc.

DataFrame.to_csv

Запись файла csv.

DataFrame.to_sql

Запись в таблицу sql.

DataFrame.to_hdf

Запись в hdf.

Примечания

Для этой функции требуется библиотека fastparquet или pyarrow.

Примеры

>>> df = pd.DataFrame(data={'col1': [1, 2], 'col2': [3, 4]})
>>> df.to_parquet('df.parquet.gzip',
...               compression='gzip')  
>>> pd.read_parquet('df.parquet.gzip')  
   col1  col2
0     1     3
1     2     4

Если вам нужно получить буфер с содержимым parquet, вы можете использовать объект io.BytesIO, но при этом нельзя использовать partition_cols, так как он создаёт несколько файлов.

>>> import io
>>> f = io.BytesIO()
>>> df.to_parquet(f)
>>> f.seek(0)
0
>>> content = f.read()

© 2008–2022, AQR Capital Management, LLC, Lambda Foundry, Inc. and PyData Development Team
Licensed under the 3-clause BSD License.
https://pandas.pydata.org/pandas-docs/version/1.5.0/reference/api/pandas.DataFrame.to_parquet.html

Spec-Zone.ru

Настройки Оффлайн Что нового Помощь О нас
Spec-Zone .ru
спецификации, руководства, описания, API