pandas.DataFrame.to_parquet
- DataFrame.to_parquet(path=None, *, engine='auto', compression='snappy', index=None, partition_cols=None, storage_options=None, **kwargs)[source]
-
Запись DataFrame в двоичный формат parquet.
Эта функция записывает DataFrame в файл parquet. Вы можете выбрать разные бэкэнды parquet и указать сжатие. Более подробную информацию см. в руководстве пользователя.
- Parameters:
-
- path:str, path object, file-like object, or None, default None
-
Строка, объект пути (реализующий
os.PathLike[str]), или файлоподобный объект, реализующий двоичнуюwrite()функцию. Если None, результат возвращается как байты. Если строка или путь, он будет использоваться в качестве корневого каталога при записи разбиения данных. - engine:{‘auto’, ‘pyarrow’, ‘fastparquet’}, default ‘auto’
-
Библиотека parquet для использования. Если ‘auto’, то используется
io.parquet.engine. По умолчаниюio.parquet.engineиспользуется попытка 'pyarrow', а в случае его отсутствия - 'fastparquet'. - compression:str or None, default ‘snappy’
-
Название используемого сжатия. Для отключения сжатия используйте
None. Поддерживаемые варианты: ‘snappy’, ‘gzip’, ‘brotli’, ‘lz4’, ‘zstd’. - index:bool, default None
-
Если
True, включать индексы DataFrame в выходной файл. ЕслиFalse, они не будут записаны в файл. ЕслиNone, аналогичноTrue, индексы DataFrame будут сохранены. Однако вместо значений будет сохранен диапазон RangeIndex, что экономит место и ускоряет процесс. Другие типы индексов будут включены в выходной файл в качестве столбцов. - partition_cols:list, optional, default None
-
Имена столбцов, по которым следует разбить данные. Столбцы разбиваются в порядке их указания. Должно быть None, если path не является строкой.
- storage_options:dict, optional
-
Дополнительные параметры, которые имеют смысл для определённого подключения к хранилищу, например, хост, порт, имя пользователя, пароль и т. д. Для HTTP(S) URL параметры передаются в
urllib.request.Requestв качестве параметров заголовка. Для других URL (например, начинающихся с “s3://”, и “gcs://”) ключи-значения передаются вfsspec.open. Подробнее см.fsspecиurllib. Дополнительные примеры параметров хранения см. здесь. - **kwargs
-
Дополнительные аргументы, передаваемые библиотеке parquet. Подробности см. в разделе pandas io.
- Returns:
-
- байты, если аргумент path не указан, иначе None
См. также
read_parquet-
Чтение файла parquet.
DataFrame.to_orc-
Запись файла orc.
DataFrame.to_csv-
Запись файла csv.
DataFrame.to_sql-
Запись в таблицу sql.
DataFrame.to_hdf-
Запись в hdf.
Примечания
Для работы этой функции требуется библиотека fastparquet или pyarrow.
Примеры
>>> df = pd.DataFrame(data={'col1': [1, 2], 'col2': [3, 4]}) >>> df.to_parquet('df.parquet.gzip', ... compression='gzip') >>> pd.read_parquet('df.parquet.gzip') col1 col2 0 1 3 1 2 4Если вы хотите получить буфер с содержимым parquet, вы можете использовать объект io.BytesIO, при условии, что вы не используете partition_cols, который создает несколько файлов.
>>> import io >>> f = io.BytesIO() >>> df.to_parquet(f) >>> f.seek(0) 0 >>> content = f.read()
© 2008–2022, AQR Capital Management, LLC, Lambda Foundry, Inc. and PyData Development Team
Licensed under the 3-clause BSD License.
https://pandas.pydata.org/pandas-docs/version/2.2.2/reference/api/pandas.DataFrame.to_parquet.html