Экспорт Parquet в S3
Для записи файла Parquet в S3 требуется расширение httpfs. Его можно установить с помощью команды SQL INSTALL. Это необходимо сделать только один раз.
INSTALL httpfs;
Для загрузки расширения httpfs для использования используйте команду SQL LOAD:
LOAD httpfs;
После загрузки расширения httpfs настройте учетные данные для записи данных. Обратите внимание, что параметр region должен соответствовать региону ведра, к которому вы хотите получить доступ.
CREATE SECRET (
TYPE S3,
KEY_ID 'AKIAIOSFODNN7EXAMPLE',
SECRET 'wJalrXUtnFEMI/K7MDENG/bPxRfiCYEXAMPLEKEY',
REGION 'us-east-1'
); Подсказка Если возникает ошибка IO (
Connection error for HTTP HEAD), явно настройте конечную точку с помощьюENDPOINT 's3.⟨your-region⟩.amazonaws.com'.
В качестве альтернативы, используйте расширение aws для автоматического получения учетных данных:
CREATE SECRET (
TYPE S3,
PROVIDER CREDENTIAL_CHAIN
); После настройки расширения httpfs и правильной настройки учетных данных S3, файлы Parquet можно записать в S3 с помощью следующей команды:
COPY ⟨table_name⟩ TO 's3://bucket/file.parquet';
Аналогично, поддержка Google Cloud Storage (GCS) осуществляется через API межсетевого взаимодействия. Вам необходимо создать ключи HMAC и предоставить учетные данные следующим образом:
CREATE SECRET (
TYPE GCS,
KEY_ID 'AKIAIOSFODNN7EXAMPLE',
SECRET 'wJalrXUtnFEMI/K7MDENG/bPxRfiCYEXAMPLEKEY'
); После настройки учетных данных GCS, экспорт можно выполнить с помощью:
COPY ⟨table_name⟩ TO 'gs://gcs_bucket/file.parquet';
© Copyright 2018–2024 Stichting DuckDB Foundation
Licensed under the MIT License.
https://duckdb.org/docs/guides/network_cloud_storage/s3_export.html