pandas.DataFrame.to_parquet
- DataFrame.to_parquet(path=None, engine='auto', compression='snappy', index=None, partition_cols=None, storage_options=None, **kwargs)[source]
-
Записать DataFrame в двоичный формат parquet.
Данная функция записывает DataFrame в файл parquet. Вы можете выбрать разные бэкэнды parquet и указать сжатие. Более подробную информацию см. в руководстве пользователя.
- Параметры
-
- path:str, объект пути, файл-подобный объект или None, по умолчанию None
-
Строка, объект пути (реализующий
os.PathLike[str]), или файл-подобный объект, реализующий двоичнуюwrite()функцию. Если None, результат возвращается в виде байтов. Если строка или путь, он будет использоваться в качестве пути к корневой директории при записи разбиения набора данных.Изменено в версии 1.2.0.
Ранее это было «fname»
- engine:{‘auto’, ‘pyarrow’, ‘fastparquet’}, по умолчанию ‘auto’
-
Библиотека parquet, которую использовать. Если ‘auto’, то используется
io.parquet.engine. По умолчаниюio.parquet.engineповедение заключается в попытке использовать ‘pyarrow’, если ‘pyarrow’ недоступен, то используется ‘fastparquet’. - compression:{‘snappy’, ‘gzip’, ‘brotli’, None}, по умолчанию ‘snappy’
-
Имя сжатия, которое использовать. Используйте
Noneдля отсутствия сжатия. - index:bool, по умолчанию None
-
Если
True, включить индексы DataFrame в выходной файл. ЕслиFalse, они не будут записаны в файл. ЕслиNone, аналогичноTrue, индексы DataFrame будут сохранены. Однако вместо сохранения значений RangeIndex будет сохранён диапазон в метаданных, чтобы он занимал мало места и был быстрее. Другие индексы будут включены в выходной файл в виде столбцов. - partition_cols:список, необязательно, по умолчанию None
-
Имена столбцов, по которым разбить набор данных. Столбцы разбиваются в порядке их предоставления. Должно быть None, если path не является строкой.
- storage_options:словарь, необязательно
-
Дополнительные параметры, которые имеют смысл для определённого подключения к хранилищу, например, хост, порт, имя пользователя, пароль и т. д. Для HTTP(S) URL-адресов пары ключ-значение передаются в
urllib.request.Requestв качестве параметров заголовка. Для других URL-адресов (например, начинающихся с «s3://», и «gcs://») пары ключ-значение передаются вfsspec.open. Подробнее см.fsspecиurllib, а дополнительные примеры параметров хранения см. здесь.Добавлен в версии 1.2.0.
- **kwargs
-
Дополнительные аргументы, передаваемые библиотеке parquet. Подробнее см. pandas io.
- Возвращает
-
- байты, если аргумент path не указан, иначе None
См. также
read_parquet-
Чтение файла parquet.
DataFrame.to_orc-
Запись файла orc.
DataFrame.to_csv-
Запись файла csv.
DataFrame.to_sql-
Запись в таблицу sql.
DataFrame.to_hdf-
Запись в hdf.
Примечания
Для этой функции требуется библиотека fastparquet или pyarrow.
Примеры
>>> df = pd.DataFrame(data={'col1': [1, 2], 'col2': [3, 4]}) >>> df.to_parquet('df.parquet.gzip', ... compression='gzip') >>> pd.read_parquet('df.parquet.gzip') col1 col2 0 1 3 1 2 4Если вам нужно получить буфер с содержимым parquet, вы можете использовать объект io.BytesIO, но при этом нельзя использовать partition_cols, так как он создаёт несколько файлов.
>>> import io >>> f = io.BytesIO() >>> df.to_parquet(f) >>> f.seek(0) 0 >>> content = f.read()
© 2008–2022, AQR Capital Management, LLC, Lambda Foundry, Inc. and PyData Development Team
Licensed under the 3-clause BSD License.
https://pandas.pydata.org/pandas-docs/version/1.5.0/reference/api/pandas.DataFrame.to_parquet.html