Spec-Zone.ru › DuckDB

Импорт Parquet из S3

Предварительные требования

Для загрузки файла Parquet из S3 требуется httpfs расширение. Его можно установить с помощью команды SQL INSTALL. Это нужно выполнить только один раз.

INSTALL httpfs;

Чтобы загрузить httpfs расширение для использования, используйте команду SQL LOAD:

LOAD httpfs;

Учетные данные и настройка

После загрузки httpfs расширения настройте учетные данные и регион S3 для чтения данных:

CREATE SECRET (
    TYPE S3,
    KEY_ID 'AKIAIOSFODNN7EXAMPLE',
    SECRET 'wJalrXUtnFEMI/K7MDENG/bPxRfiCYEXAMPLEKEY',
    REGION 'us-east-1'
);

Подсказка Если у вас возникает ошибка IO (Connection error for HTTP HEAD), явно настройте конечную точку с помощью ENDPOINT 's3.⟨your-region⟩.amazonaws.com'.

В качестве альтернативы, используйте aws расширение для автоматического получения учетных данных:

CREATE SECRET (
    TYPE S3,
    PROVIDER CREDENTIAL_CHAIN
);

Запросы

После настройки httpfs расширения и корректной настройки конфигурации S3, файлы Parquet можно читать из S3 с помощью следующей команды:

SELECT * FROM read_parquet('s3://⟨bucket⟩/⟨file⟩');

Google Cloud Storage (GCS) и Cloudflare R2

DuckDB также может обрабатывать Google Cloud Storage (GCS) и Cloudflare R2 через API S3. Подробности можно найти в соответствующих руководствах.

© Copyright 2018–2024 Stichting DuckDB Foundation
Licensed under the MIT License.
https://duckdb.org/docs/guides/network_cloud_storage/s3_import.html

Spec-Zone.ru

Настройки Оффлайн Что нового Помощь О нас
Spec-Zone .ru
спецификации, руководства, описания, API