polars.from_arrow
-
Создаёт DataFrame или Series из таблицы или массива Arrow.
В большинстве случаев эта операция не требует копирования данных. Типы, не поддерживаемые Polars, могут быть приведены к ближайшему поддерживаемому типу.
Подсказка: если тип результата известен, можно напрямую передать таблицы Arrow в
pl.DataFrame()/ массивы Arrow вpl.Series(), чтобы избежать проблем с типизацией.- Параметры:
-
-
datapyarrow.Table, pyarrow.Array, one or more pyarrow.RecordBatch -
Данные в виде таблицы Arrow, массива, последовательности RecordBatch или таблиц либо другого объекта, поддерживающего интерфейс Arrow PyCapsule.
-
schemaSequence of str, (str,DataType) pairs, or a {str:DataType,} dict -
Схему DataFrame можно задать несколькими способами:
- В виде словаря пар {имя:тип}; если тип равен None, он будет определён автоматически.
- В виде списка имён столбцов; в этом случае типы определяются автоматически.
- В виде списка пар (имя,тип); это эквивалентно словарю.
Элементы схемы применяются позиционно, в соответствии с порядком элементов словаря Python. Переданная схема имеет приоритет над схемой исходных данных Arrow. Поэтому, если имена в переданной схеме не совпадают с именами в исходных данных Arrow, имена столбцов Arrow будут заменены именами, заданными в этом аргументе. Количество имён в схеме должно соответствовать размерности исходных данных.
-
schema_overridesdict, default None -
Позволяет задать или переопределить тип одного или нескольких столбцов; обратите внимание, что любые типы, определённые на основе параметра schema, будут переопределены.
-
rechunkbool, default True -
Гарантирует, что все данные находятся в непрерывной области памяти.
-
- Возвращает:
-
- DataFrame или Series
Примеры
Создание DataFrame из таблицы Arrow:
>>> import pyarrow as pa >>> data = pa.table({"a": [1, 2, 3], "b": [4, 5, 6]}) >>> pl.from_arrow(data) shape: (3, 2) ┌─────┬─────┐ │ a ┆ b │ │ --- ┆ --- │ │ i64 ┆ i64 │ ╞═════╪═════╡ │ 1 ┆ 4 │ │ 2 ┆ 5 │ │ 3 ┆ 6 │ └─────┴─────┘Создание Series из массива Arrow:
>>> import pyarrow as pa >>> data = pa.array([1, 2, 3]) >>> pl.from_arrow(data, schema={"s": pl.Int32}) shape: (3,) Series: 's' [i32] [ 1 2 3 ]
polars.from_arrow(
data: pa.Table | pa.Array | pa.ChunkedArray | pa.RecordBatch | Iterable[pa.RecordBatch | pa.Table] | ArrowArrayExportable | ArrowStreamExportable,
schema: SchemaDefinition | None = None,
*,
schema_overrides: SchemaDict | None = None,
rechunk: bool = True,
) → DataFrame | Series
© 2020 Ritchie Vink
© 2022 Polars contributors
Licensed under the MIT License.
https://docs.pola.rs/api/python/stable/reference/api/polars.from_arrow.html