Spec-Zone.ru › pandas 2

pandas.DataFrame.to_parquet

DataFrame.to_parquet(path=None, *, engine='auto', compression='snappy', index=None, partition_cols=None, storage_options=None, **kwargs)[source]

Запись DataFrame в двоичный формат parquet.

Эта функция записывает DataFrame в файл parquet. Вы можете выбрать разные бэкэнды parquet и указать сжатие. Более подробную информацию см. в руководстве пользователя.

Parameters:
path:str, path object, file-like object, or None, default None

Строка, объект пути (реализующий os.PathLike[str]), или файлоподобный объект, реализующий двоичную write() функцию. Если None, результат возвращается как байты. Если строка или путь, он будет использоваться в качестве корневого каталога при записи разбиения данных.

engine:{‘auto’, ‘pyarrow’, ‘fastparquet’}, default ‘auto’

Библиотека parquet для использования. Если ‘auto’, то используется io.parquet.engine. По умолчанию io.parquet.engine используется попытка 'pyarrow', а в случае его отсутствия - 'fastparquet'.

compression:str or None, default ‘snappy’

Название используемого сжатия. Для отключения сжатия используйте None. Поддерживаемые варианты: ‘snappy’, ‘gzip’, ‘brotli’, ‘lz4’, ‘zstd’.

index:bool, default None

Если True, включать индексы DataFrame в выходной файл. Если False, они не будут записаны в файл. Если None, аналогично True, индексы DataFrame будут сохранены. Однако вместо значений будет сохранен диапазон RangeIndex, что экономит место и ускоряет процесс. Другие типы индексов будут включены в выходной файл в качестве столбцов.

partition_cols:list, optional, default None

Имена столбцов, по которым следует разбить данные. Столбцы разбиваются в порядке их указания. Должно быть None, если path не является строкой.

storage_options:dict, optional

Дополнительные параметры, которые имеют смысл для определённого подключения к хранилищу, например, хост, порт, имя пользователя, пароль и т. д. Для HTTP(S) URL параметры передаются в urllib.request.Request в качестве параметров заголовка. Для других URL (например, начинающихся с “s3://”, и “gcs://”) ключи-значения передаются в fsspec.open. Подробнее см. fsspec и urllib. Дополнительные примеры параметров хранения см. здесь.

**kwargs

Дополнительные аргументы, передаваемые библиотеке parquet. Подробности см. в разделе pandas io.

Returns:
байты, если аргумент path не указан, иначе None

См. также

read_parquet

Чтение файла parquet.

DataFrame.to_orc

Запись файла orc.

DataFrame.to_csv

Запись файла csv.

DataFrame.to_sql

Запись в таблицу sql.

DataFrame.to_hdf

Запись в hdf.

Примечания

Для работы этой функции требуется библиотека fastparquet или pyarrow.

Примеры

>>> df = pd.DataFrame(data={'col1': [1, 2], 'col2': [3, 4]})
>>> df.to_parquet('df.parquet.gzip',
...               compression='gzip')  
>>> pd.read_parquet('df.parquet.gzip')  
   col1  col2
0     1     3
1     2     4

Если вы хотите получить буфер с содержимым parquet, вы можете использовать объект io.BytesIO, при условии, что вы не используете partition_cols, который создает несколько файлов.

>>> import io
>>> f = io.BytesIO()
>>> df.to_parquet(f)
>>> f.seek(0)
0
>>> content = f.read()

© 2008–2022, AQR Capital Management, LLC, Lambda Foundry, Inc. and PyData Development Team
Licensed under the 3-clause BSD License.
https://pandas.pydata.org/pandas-docs/version/2.2.2/reference/api/pandas.DataFrame.to_parquet.html

Spec-Zone.ru

Настройки Оффлайн Что нового Помощь О нас
Spec-Zone .ru
спецификации, руководства, описания, API