Spec-Zone.ru › pandas 0.21

pandas.read_fwf

pandas.read_fwf(filepath_or_buffer, colspecs='infer', widths=None, **kwds) [source]

Чтение таблицы с фиксированной шириной строк в DataFrame

Также поддерживает необязательное итерационное чтение или разбитие файла на части.

Дополнительную помощь можно найти в документации по инструментам ввода-вывода.

Параметры:

filepath_or_buffer : str, pathlib.Path, py._path.local.LocalPath или любой объект с методом read() (например, дескриптор файла или StringIO)

Строка может быть URL-адресом. Поддерживаемые схемы URL включают http, ftp, s3 и file. Для URL-адресов файлов ожидается хост. Например, локальный файл может быть file://localhost/путь/к/таблице.csv

colspecs : список пар (int, int) или ‘infer’. необязательно

Список пар (кортежей), задающих границы полей с фиксированной шириной каждой строки в виде полуоткрытых интервалов (т. е. [от, до[ ). Строковое значение ‘infer’ может быть использовано для инструкции парсеру попробовать определить спецификации столбцов из первых 100 строк данных, которые не пропускаются с помощью skiprows (по умолчанию=’infer’).

widths : список целых чисел. необязательно

Список ширины полей, которые могут быть использованы вместо ‘colspecs’, если интервалы являются непрерывными.

delimiter : str, по умолчанию '    ' + ' '

Символы, которые следует рассматривать как символы заполнения в файле с фиксированной шириной. Может использоваться для указания символа заполнения полей, если он не является пробелом (например, ‘~’).

delim_whitespace : boolean, по умолчанию False

Указывает, будут ли пробелы (например, ' ' или '    ') использоваться в качестве разделителя. Эквивалентно установлению sep='\s+'. Если этот параметр установлен в True, то параметр delimiter не должен передаваться.

Введено в версии 0.18.1: поддержка парсера Python.

header : int или список целых чисел, по умолчанию ‘infer’

Номер(а) строки, используемые в качестве имён столбцов и начала данных. По умолчанию имена столбцов выводятся: если имена не переданы, поведение идентично header=0, а имена столбцов выводятся из первой строки файла; если имена столбцов явно переданы, поведение идентично header=None. Явно передайте header=0 для возможности замены имеющихся имён. Заголовок может быть списком целых чисел, которые указывают позиции строк для многоуровневого индекса по столбцам, например [0,1,3]. Промежуточные строки, которые не указаны, будут пропущены (например, 2 в данном примере пропущена). Обратите внимание, что этот параметр игнорирует строки с комментариями и пустые строки, если skip_blank_lines=True, поэтому header=0 обозначает первую строку данных, а не первую строку файла.

names : array-like, по умолчанию None

Список имён столбцов для использования. Если файл не содержит строки заголовка, то вы должны явно передать header=None. Дубликаты в этом списке приведут к выдаче UserWarning

index_col : int или последовательность или False, по умолчанию None

Столбец для использования в качестве меток строк DataFrame. Если задана последовательность, используется многоуровневый индекс. Если у вас есть повреждённый файл с разделителями в конце каждой строки, вы можете рассмотреть возможность index_col=False для того, чтобы принудительно не использовать первый столбец в качестве индекса (имён строк)

usecols : array-like или вызываемый объект, по умолчанию None

Возвращает подмножество столбцов. Если array-like, все элементы должны быть либо позиционными (т. е. целочисленными индексами в столбцы документа) или строками, соответствующими именам столбцов, предоставленными пользователем в names или выведенными из строки(строк) заголовка документа. Например, допустимый параметр array-like usecols будет [0, 1, 2] или [‘foo’, ‘bar’, ‘baz’].

Если вызываемый объект, вызываемая функция будет оцениваться по именам столбцов, возвращая имена, где вызываемая функция оценивается как True. Примером допустимого аргумента вызываемого объекта будет lambda x: x.upper() in ['AAA', 'BBB', 'DDD']. Использование этого параметра приводит к значительно более быстрому времени разбора и меньшему использованию памяти.

as_recarray : boolean, по умолчанию False

Устарело начиная с версии 0.19.0: Пожалуйста, вызовите pd.read_csv(...).to_records() вместо этого.

Возвращает NumPy recarray вместо DataFrame после разбора данных. Если установлено в True, этот параметр имеет приоритет над squeeze параметром. Кроме того, поскольку индексы строк недоступны в таком формате, параметр index_col будет проигнорирован.

squeeze : boolean, по умолчанию False

Если разобранные данные содержат только один столбец, возвращает Series

prefix : str, по умолчанию None

Префикс, добавляемый к номерам столбцов, если нет заголовка, например ‘X’ для X0, X1, ...

mangle_dupe_cols : boolean, по умолчанию True

Дублирующиеся столбцы будут указаны как ‘X.0’...’X.N’, а не ‘X’...’X’. Передача False приведёт к перезаписи данных, если в столбцах есть дублирующие имена.

dtype : Имя типа или словарь столбец -> тип, по умолчанию None

Тип данных для данных или столбцов. Например, {‘a’: np.float64, ‘b’: np.int32} Используйте str или object для сохранения и не интерпретации типа dtype. Если заданы преобразователи, они будут применены ВМЕСТО преобразования типа dtype.

converters : словарь, по умолчанию None

Словарь функций для преобразования значений в определённых столбцах. Ключи могут быть целыми числами или метками столбцов

true_values : список, по умолчанию None

Значения, рассматриваемые как True

false_values : список, по умолчанию None

Значения, рассматриваемые как False

skipinitialspace : boolean, по умолчанию False

Пропустить пробелы после разделителя.

skiprows : список или целое число или вызываемый объект, по умолчанию None

Номера строк для пропуска (индексирование с 0) или количество строк для пропуска (целое число) в начале файла.

Если вызываемый объект, вызываемая функция будет оцениваться по индексам строк, возвращая True, если строка должна быть пропущена, и False в противном случае. Пример допустимого вызываемого аргумента lambda x: x in [0, 2].

skipfooter : int, по умолчанию 0

Количество строк в конце файла для пропуска (не поддерживается с engine=’c’)

skip_footer : int, по умолчанию 0

Устарело начиная с версии 0.19.0: Используйте параметр skipfooter вместо него, так как они идентичны

nrows : int, по умолчанию None

Количество строк файла для чтения. Полезно для чтения фрагментов больших файлов

na_values : скаляр, строка, список или словарь, по умолчанию None

Дополнительные строки для распознавания как NA/NaN. Если передан словарь, то специфичные значения NA для каждого столбца. По умолчанию следующие значения интерпретируются как NaN: ‘’, ‘#N/A’, ‘#N/A N/A’, ‘#NA’, ‘-1.#IND’, ‘-1.#QNAN’, ‘-NaN’, ‘-nan’, ‘1.#IND’, ‘1.#QNAN’, ‘N/A’, ‘NA’, ‘NULL’, ‘NaN’, ‘n/a’, ‘nan’, ‘null’.

keep_default_na : bool, по умолчанию True

Если na_values указаны и keep_default_na False, значения NaN по умолчанию перезаписываются, иначе они добавляются.

na_filter : boolean, по умолчанию True

Обнаружить маркеры отсутствующих значений (пустые строки и значения na_values). В данных без каких-либо NA передача na_filter=False может улучшить производительность чтения большого файла

verbose : boolean, по умолчанию False

Указать количество значений NA, помещённых в нечисловые столбцы

skip_blank_lines : boolean, по умолчанию True

Если True, пропускать пустые строки вместо интерпретации как значений NaN

parse_dates : boolean или список целых чисел или имён или список списков или словарь, по умолчанию False

  • boolean. Если True -> попробовать разобрать индекс.
  • список целых чисел или имён. Например, если [1, 2, 3] -> попробовать разобрать столбцы 1, 2, 3 каждый как отдельный столбец даты.
  • список списков. Например, если [[1, 3]] -> объединить столбцы 1 и 3 и разобрать как один столбец даты.
  • словарь, например {‘foo’ : [1, 3]} -> разобрать столбцы 1, 3 как дату и назвать результат ‘foo’

Если столбец или индекс содержит неразборную дату, весь столбец или индекс будет возвращён неизменным как тип данных object. Для нестандартного разбора дат используйте pd.to_datetime после pd.read_csv

Примечание: Для дат в формате iso8601 существует быстрый путь.

infer_datetime_format : boolean, по умолчанию False

Если True и parse_dates включено, pandas попытается вывести формат строк дат в столбцах и, если это возможно, переключится на более быстрый способ их разбора. В некоторых случаях это может увеличить скорость разбора на 5-10 раз.

keep_date_col : boolean, по умолчанию False

Если True и parse_dates указывает на объединение нескольких столбцов, то сохранить исходные столбцы.

date_parser : функция, по умолчанию None

Функция для преобразования последовательности столбцов строк в массив экземпляров дат. По умолчанию используется dateutil.parser.parser для выполнения преобразования. Pandas попытается вызвать date_parser тремя различными способами, переходя к следующему, если возникает исключение: 1) Передать один или несколько массивов (как определено parse_dates) в качестве аргументов; 2) конкатенировать (по строкам) строковые значения из столбцов, определённых parse_dates в один массив и передать его; и 3) вызвать date_parser один раз для каждой строки, используя одну или несколько строк (соответствующих столбцам, определённым parse_dates) в качестве аргументов.

dayfirst : boolean, по умолчанию False

Даты в формате ДД/ММ, международный и европейский формат

iterator : boolean, по умолчанию False

Возвращает объект TextFileReader для итерации или получения фрагментов с get_chunk().

chunksize : int, по умолчанию None

Возвращает объект TextFileReader для итерации. См. документацию по инструментам ввода-вывода для получения дополнительной информации о iterator и chunksize.

compression : {‘infer’, ‘gzip’, ‘bz2’, ‘zip’, ‘xz’, None}, по умолчанию ‘infer’

Для сжатия на лету данных на диске. Если ‘infer’ и filepath_or_buffer является файлоподобным объектом, тогда распознать сжатие по следующим расширениям: ‘.gz’, ‘.bz2’, ‘.zip’ или ‘.xz’ (в противном случае сжатие отсутствует). Если используется ‘zip’, то ZIP-файл должен содержать только один файл данных для чтения. Установить в None для отсутствия сжатия.

Введено в версии 0.18.1: поддержка сжатия ‘zip’ и ‘xz’.

thousands : строка, по умолчанию None

Разделитель тысяч

decimal : строка, по умолчанию ‘.’

Символ, распознаваемый как десятичная точка (например, используйте ‘,’ для европейских данных).

float_precision : строка, по умолчанию None

Указывает, какой конвертер C-движок должен использовать для чисел с плавающей запятой. Доступные варианты: None для обычного преобразователя, high для высокоточного преобразователя и round_trip для обратного преобразователя.

lineterminator : строка (длиной 1), по умолчанию None

Символ для разделения файла на строки. Действительно только с C-парсером.

quotechar : строка (длиной 1), необязательно

Символ, используемый для обозначения начала и конца цитируемого элемента. Цитируемые элементы могут включать разделитель, и он будет проигнорирован.

quoting : int или экземпляр csv.QUOTE_*, по умолчанию 0

Управление поведением цитирования полей по csv.QUOTE_* константам. Используйте одно из значений QUOTE_MINIMAL (0), QUOTE_ALL (1), QUOTE_NONNUMERIC (2) или QUOTE_NONE (3).

doublequote : boolean, по умолчанию True

Когда quotechar указан и quoting не QUOTE_NONE, укажите, интерпретировать ли два последовательных элемента quotechar ВНУТРИ поля как один quotechar элемент.

escapechar : str (длина 1), по умолчанию None

Односимвольная строка, используемая для экранирования разделителя, когда quoting равно QUOTE_NONE.

comment : str, по умолчанию None

Указывает, что остальная часть строки не должна анализироваться. Если встречается в начале строки, вся строка будет проигнорирована. Этот параметр должен быть одним символом. Как и пустые строки (пока skip_blank_lines=True), полностью прокомментированные строки игнорируются параметром header , но не skiprows. Например, если comment=’#’, анализ ‘#emptyna,b,cn1,2,3’ с header=0 приведет к тому, что ‘a,b,c’ будет обработано как заголовок.

encoding : str, по умолчанию None

Кодировка для использования для UTF при чтении/записи (например, ‘utf-8’). Список стандартных кодировок Python

dialect : str или экземпляр csv.Dialect, по умолчанию None

Если предоставлено, этот параметр переопределит значения (по умолчанию или нет) для следующих параметров: delimiter, doublequote, escapechar, skipinitialspace, quotechar, и quoting. Если необходимо переопределить значения, будет выведено предупреждение ParserWarning. См. документацию csv.Dialect для получения более подробной информации.

tupleize_cols : boolean, по умолчанию False

Устаревшее с версии 0.21.0: Этот аргумент будет удален и всегда будет преобразован в MultiIndex

Оставить список кортежей по столбцам как есть (по умолчанию преобразовать в MultiIndex по столбцам)

error_bad_lines : boolean, по умолчанию True

Строки с слишком большим количеством полей (например, строка csv со слишком большим количеством запятых) по умолчанию приведут к ошибке, и DataFrame не будет возвращён. Если False, то эти «плохие строки» будут удалены из возвращаемого DataFrame.

warn_bad_lines : boolean, по умолчанию True

Если error_bad_lines равно False, а warn_bad_lines равно True, будет выведено предупреждение для каждой «плохой строки».

low_memory : boolean, по умолчанию True

Внутренне обрабатывать файл частями, что приводит к меньшему использованию памяти во время парсинга, но, возможно, смешанному выводу типов. Чтобы гарантировать отсутствие смешанных типов, установите False или укажите тип с помощью параметра dtype. Обратите внимание, что весь файл читается в один DataFrame независимо, используйте параметр chunksize или iterator для возврата данных частями. (Действительно только с C-парсером)

buffer_lines : int, по умолчанию None

Устаревшее с версии 0.19.0: Этот аргумент не учитывается парсером

compact_ints : boolean, по умолчанию False

Устаревшее с версии 0.19.0: Аргумент перемещен в pd.to_numeric

Если compact_ints равно True, то для любого столбца целочисленного типа парсер попытается привести его к самому малому возможному целочисленному типу, либо со знаком, либо без знака, в зависимости от спецификации из параметра use_unsigned.

use_unsigned : boolean, по умолчанию False

Устаревшее с версии 0.19.0: Аргумент перемещен в pd.to_numeric

Если целочисленные столбцы компактируются (т.е. compact_ints=True), укажите, должен ли столбец быть сжат до наименьшего целочисленного типа со знаком или без знака.

memory_map : boolean, по умолчанию False

Если для filepath_or_buffer указан путь к файлу, отобразить объект файла непосредственно в памяти и получить доступ к данным непосредственно оттуда. Использование этого параметра может повысить производительность, потому что теперь нет накладных расходов на ввод-вывод.

Возвращаемое значение:

result : DataFrame или TextParser

© 2008–2012, AQR Capital Management, LLC, Lambda Foundry, Inc. and PyData Development Team
Licensed under the 3-clause BSD License.
https://pandas.pydata.org/pandas-docs/version/0.21.1/generated/pandas.read_fwf.html

Spec-Zone.ru

Настройки Оффлайн Что нового Помощь О нас
Spec-Zone .ru
спецификации, руководства, описания, API