Импорт Parquet из S3
Предварительные требования
Для загрузки файла Parquet из S3 требуется httpfs расширение. Его можно установить с помощью команды SQL INSTALL. Это нужно выполнить только один раз.
INSTALL httpfs;
Чтобы загрузить httpfs расширение для использования, используйте команду SQL LOAD:
LOAD httpfs;
Учетные данные и настройка
После загрузки httpfs расширения настройте учетные данные и регион S3 для чтения данных:
CREATE SECRET (
TYPE S3,
KEY_ID 'AKIAIOSFODNN7EXAMPLE',
SECRET 'wJalrXUtnFEMI/K7MDENG/bPxRfiCYEXAMPLEKEY',
REGION 'us-east-1'
); Подсказка Если у вас возникает ошибка IO (
Connection error for HTTP HEAD), явно настройте конечную точку с помощьюENDPOINT 's3.⟨your-region⟩.amazonaws.com'.
В качестве альтернативы, используйте aws расширение для автоматического получения учетных данных:
CREATE SECRET (
TYPE S3,
PROVIDER CREDENTIAL_CHAIN
); Запросы
После настройки httpfs расширения и корректной настройки конфигурации S3, файлы Parquet можно читать из S3 с помощью следующей команды:
SELECT * FROM read_parquet('s3://⟨bucket⟩/⟨file⟩'); Google Cloud Storage (GCS) и Cloudflare R2
DuckDB также может обрабатывать Google Cloud Storage (GCS) и Cloudflare R2 через API S3. Подробности можно найти в соответствующих руководствах.
© Copyright 2018–2024 Stichting DuckDB Foundation
Licensed under the MIT License.
https://duckdb.org/docs/guides/network_cloud_storage/s3_import.html