polars.read_parquet
-
Читает данные из файла Parquet в DataFrame.
Изменено в версии 0.20.4: * Параметр
row_count_nameпереименован вrow_index_name. * Параметрrow_count_offsetпереименован вrow_index_offset.- Параметры:
-
- source
-
Путь или пути к файлу или каталогу. Если для сканирования облачных расположений требуется аутентификация, см. параметр
storage_options.Поддерживаются файловые объекты (под «файловым объектом» подразумеваются объекты с методом
read(), например файловый дескриптор, такой как встроенная функцияopen, или экземплярBytesIO). После чтения позиция потока файловых объектов может обновиться некорректно. - columns
-
Столбцы для выбора. Принимает список индексов столбцов (начиная с нуля) или список имён столбцов.
- n_rows
-
Прекратить чтение файла Parquet после чтения
n_rows. Допустимо только приuse_pyarrow=False. - row_index_name
-
Добавить в DataFrame столбец индекса строк с указанным именем в качестве первого столбца. Если задано
None(по умолчанию), столбец индекса строк не создаётся. - row_index_offset
-
Начать отсчёт индекса строк с этого смещения. Не может быть отрицательным. Используется, только если задано
row_index_name. -
parallel{‘auto’, ‘columns’, ‘row_groups’, ‘none’} -
Определяет направление параллелизма. Значение ‘auto’ позволяет попытаться определить оптимальное направление.
- use_statistics
-
Использовать статистику в файле Parquet, чтобы определить, можно ли пропускать страницы при чтении.
- hive_partitioning
-
Выводить статистику и схему из URL с разбиением на разделы Hive и использовать их для исключения данных из чтения. По умолчанию параметр не задан (то есть
None): он включается автоматически, если передан один каталог, и отключается в остальных случаях. - glob
-
Раскрывать путь с использованием шаблонов glob.
- schema
-
Указать типы данных столбцов. Типы данных должны совпадать с типами данных в файле или файлах. Если указаны дополнительные столбцы, отсутствующие в файле или файлах, рассмотрите возможность также передать
missing_columns='insert'.Предупреждение
Эта функциональность считается нестабильной. Она может измениться в любой момент, и это не будет считаться нарушением обратной совместимости.
- hive_schema
-
Имена и типы данных столбцов, по которым разбиты данные. Если задано
None(по умолчанию), схема разделов Hive выводится автоматически.Предупреждение
Эта функциональность считается нестабильной. Она может измениться в любой момент, и это не будет считаться нарушением обратной совместимости.
- try_parse_hive_dates
-
Пытаться ли преобразовывать значения Hive в типы date/datetime.
- rechunk
-
Обеспечить непрерывное размещение всех столбцов в памяти, объединив их фрагменты в один массив.
Устарело с версии 1.43.2: Вызовите rechunk для возвращённого DataFrame.
- low_memory
-
Снизить нагрузку на память за счёт производительности.
- storage_options
-
Параметры, определяющие способ подключения к облачному провайдеру.
В настоящее время поддерживаются облачные провайдеры AWS, GCP и Azure. Список поддерживаемых ключей:
- aws
- gcp
- azure
- Hugging Face (
hf://): принимает API-ключ в параметреtoken:{'token': '...'}или через переменную средыHF_TOKEN.
Если
storage_optionsне задан, Polars попытается получить необходимые сведения из переменных среды. - credential_provider
-
Функция, которую можно вызвать для предоставления учётных данных облачного хранилища. Функция должна возвращать словарь с ключами учётных данных и необязательное время истечения срока их действия.
Предупреждение
Эта функциональность считается нестабильной. Она может измениться в любой момент, и это не будет считаться нарушением обратной совместимости.
- retries
-
Количество повторных попыток при сбое доступа к облачному экземпляру.
Устарело с версии 1.37.1: Вместо этого передайте {“max_retries”: n} через
storage_options. - use_pyarrow
-
Использовать PyArrow вместо встроенного в Rust средства чтения Parquet. Средство чтения PyArrow стабильнее.
- pyarrow_options
-
Аргументы-ключевые слова для pyarrow.parquet.read_table.
- memory_map
-
Использовать отображение файла в память. Вероятно, это повысит производительность. Используется, только если
use_pyarrow=True. - include_file_paths
-
Добавить путь к исходному файлу или файлам в виде столбца с этим именем. Допустимо только при
use_pyarrow=False. - missing_columns
-
Настройка поведения в случае отсутствия в данных столбцов, указанных в схеме:
-
insert: вставляет отсутствующие столбцы, используя NULL в качестве значений строк. -
raise: вызывает ошибку.
-
- allow_missing_columns
-
При чтении списка файлов Parquet, если столбец, существующий в первом файле, не найден в последующих файлах, по умолчанию возникает ошибка. Однако если
allow_missing_columnsзадано какTrue, вместо ошибки для файлов, в которых нет этого столбца, возвращается столбец, заполненный NULL.Устарело с версии 1.30.0: Используйте параметр
missing_columnsи передайте одно из значений('insert', 'raise').
- Возвращает:
-
- DataFrame
Предупреждение
Вызов
read_parquet().lazy()считается антипаттерном, поскольку заставляет Polars материализовать весь файл Parquet и не позволяет применять оптимизации при чтении. Поэтому, если вы хотите работать сLazyFrame, всегда предпочитайтеscan_parquet.См. также
-
scan_parquet -
Лениво читает один или несколько файлов Parquet с использованием шаблонов glob.
-
scan_pyarrow_dataset
polars.read_parquet(
source: FileSource,
*,
columns: list[int] | list[str] | None = None,
n_rows: int | None = None,
row_index_name: str | None = None,
row_index_offset: int = 0,
parallel: ParallelStrategy = 'auto',
use_statistics: bool = True,
hive_partitioning: bool | None = None,
glob: bool = True,
schema: SchemaDict | None = None,
hive_schema: SchemaDict | None = None,
try_parse_hive_dates: bool = True,
rechunk: bool | None = None,
low_memory: bool = False,
storage_options: StorageOptionsDict | None = None,
credential_provider: CredentialProviderFunction | Literal['auto'] | None = 'auto',
retries: int | None = None,
use_pyarrow: bool = False,
pyarrow_options: dict[str,
Any] | None = None,
memory_map: bool = True,
include_file_paths: str | None = None,
missing_columns: Literal['insert',
'raise'] = 'raise',
allow_missing_columns: bool | None = None,
) → DataFrame
© 2020 Ritchie Vink
© 2022 Polars contributors
Licensed under the MIT License.
https://docs.pola.rs/api/python/stable/reference/api/polars.read_parquet.html