Spec-Zone.ru › Polars

polars.read_parquet

polars.read_parquet(
    source: FileSource,
    *,
    columns: list[int] | list[str] | None = None,
    n_rows: int | None = None,
    row_index_name: str | None = None,
    row_index_offset: int = 0,
    parallel: ParallelStrategy = 'auto',
    use_statistics: bool = True,
    hive_partitioning: bool | None = None,
    glob: bool = True,
    schema: SchemaDict | None = None,
    hive_schema: SchemaDict | None = None,
    try_parse_hive_dates: bool = True,
    rechunk: bool | None = None,
    low_memory: bool = False,
    storage_options: StorageOptionsDict | None = None,
    credential_provider: CredentialProviderFunction | Literal['auto'] | None = 'auto',
    retries: int | None = None,
    use_pyarrow: bool = False,
    pyarrow_options: dict[str,
    Any] | None = None,
    memory_map: bool = True,
    include_file_paths: str | None = None,
    missing_columns: Literal['insert',
    'raise'] = 'raise',
    allow_missing_columns: bool | None = None,
) → DataFrame

Читает данные из файла Parquet в DataFrame.

Изменено в версии 0.20.4: * Параметр row_count_name переименован в row_index_name. * Параметр row_count_offset переименован в row_index_offset.

Параметры:
source

Путь или пути к файлу или каталогу. Если для сканирования облачных расположений требуется аутентификация, см. параметр storage_options.

Поддерживаются файловые объекты (под «файловым объектом» подразумеваются объекты с методом read(), например файловый дескриптор, такой как встроенная функция open, или экземпляр BytesIO). После чтения позиция потока файловых объектов может обновиться некорректно.

columns

Столбцы для выбора. Принимает список индексов столбцов (начиная с нуля) или список имён столбцов.

n_rows

Прекратить чтение файла Parquet после чтения n_rows. Допустимо только при use_pyarrow=False.

row_index_name

Добавить в DataFrame столбец индекса строк с указанным именем в качестве первого столбца. Если задано None (по умолчанию), столбец индекса строк не создаётся.

row_index_offset

Начать отсчёт индекса строк с этого смещения. Не может быть отрицательным. Используется, только если задано row_index_name.

parallel{‘auto’, ‘columns’, ‘row_groups’, ‘none’}

Определяет направление параллелизма. Значение ‘auto’ позволяет попытаться определить оптимальное направление.

use_statistics

Использовать статистику в файле Parquet, чтобы определить, можно ли пропускать страницы при чтении.

hive_partitioning

Выводить статистику и схему из URL с разбиением на разделы Hive и использовать их для исключения данных из чтения. По умолчанию параметр не задан (то есть None): он включается автоматически, если передан один каталог, и отключается в остальных случаях.

glob

Раскрывать путь с использованием шаблонов glob.

schema

Указать типы данных столбцов. Типы данных должны совпадать с типами данных в файле или файлах. Если указаны дополнительные столбцы, отсутствующие в файле или файлах, рассмотрите возможность также передать missing_columns='insert'.

Предупреждение

Эта функциональность считается нестабильной. Она может измениться в любой момент, и это не будет считаться нарушением обратной совместимости.

hive_schema

Имена и типы данных столбцов, по которым разбиты данные. Если задано None (по умолчанию), схема разделов Hive выводится автоматически.

Предупреждение

Эта функциональность считается нестабильной. Она может измениться в любой момент, и это не будет считаться нарушением обратной совместимости.

try_parse_hive_dates

Пытаться ли преобразовывать значения Hive в типы date/datetime.

rechunk

Обеспечить непрерывное размещение всех столбцов в памяти, объединив их фрагменты в один массив.

Устарело с версии 1.43.2: Вызовите rechunk для возвращённого DataFrame.

low_memory

Снизить нагрузку на память за счёт производительности.

storage_options

Параметры, определяющие способ подключения к облачному провайдеру.

В настоящее время поддерживаются облачные провайдеры AWS, GCP и Azure. Список поддерживаемых ключей:

  • aws
  • gcp
  • azure
  • Hugging Face (hf://): принимает API-ключ в параметре token: {'token': '...'} или через переменную среды HF_TOKEN.

Если storage_options не задан, Polars попытается получить необходимые сведения из переменных среды.

credential_provider

Функция, которую можно вызвать для предоставления учётных данных облачного хранилища. Функция должна возвращать словарь с ключами учётных данных и необязательное время истечения срока их действия.

Предупреждение

Эта функциональность считается нестабильной. Она может измениться в любой момент, и это не будет считаться нарушением обратной совместимости.

retries

Количество повторных попыток при сбое доступа к облачному экземпляру.

Устарело с версии 1.37.1: Вместо этого передайте {“max_retries”: n} через storage_options.

use_pyarrow

Использовать PyArrow вместо встроенного в Rust средства чтения Parquet. Средство чтения PyArrow стабильнее.

pyarrow_options

Аргументы-ключевые слова для pyarrow.parquet.read_table.

memory_map

Использовать отображение файла в память. Вероятно, это повысит производительность. Используется, только если use_pyarrow=True.

include_file_paths

Добавить путь к исходному файлу или файлам в виде столбца с этим именем. Допустимо только при use_pyarrow=False.

missing_columns

Настройка поведения в случае отсутствия в данных столбцов, указанных в схеме:

  • insert: вставляет отсутствующие столбцы, используя NULL в качестве значений строк.
  • raise: вызывает ошибку.
allow_missing_columns

При чтении списка файлов Parquet, если столбец, существующий в первом файле, не найден в последующих файлах, по умолчанию возникает ошибка. Однако если allow_missing_columns задано как True, вместо ошибки для файлов, в которых нет этого столбца, возвращается столбец, заполненный NULL.

Устарело с версии 1.30.0: Используйте параметр missing_columns и передайте одно из значений ('insert', 'raise').

Возвращает:
DataFrame

Предупреждение

Вызов read_parquet().lazy() считается антипаттерном, поскольку заставляет Polars материализовать весь файл Parquet и не позволяет применять оптимизации при чтении. Поэтому, если вы хотите работать с LazyFrame, всегда предпочитайте scan_parquet.

См. также

scan_parquet

Лениво читает один или несколько файлов Parquet с использованием шаблонов glob.

scan_pyarrow_dataset

© 2020 Ritchie Vink
© 2022 Polars contributors
Licensed under the MIT License.
https://docs.pola.rs/api/python/stable/reference/api/polars.read_parquet.html

Spec-Zone.ru

Настройки Оффлайн Что нового Помощь О нас
Spec-Zone .ru
спецификации, руководства, описания, API