Spec-Zone.ru › pandas 0.18

pandas.read_fwf

pandas.read_fwf(filepath_or_buffer, colspecs='infer', widths=None, **kwds)

Считывает таблицу фиксированной ширины в DataFrame

Также поддерживает необязательную итерацию или разбиение файла на фрагменты.

Дополнительную помощь можно найти в документации по инструментам ввода-вывода.

Параметры:

filepath_or_buffer : str, pathlib.Path, py._path.local.LocalPath или любой объект с методом read() (например, дескриптор файла или StringIO)

Строка может быть URL. Допустимые схемы URL включают http, ftp, s3 и file. Для URL файлов ожидается хост. Например, локальный файл может быть file://localhost/путь/к/таблице.csv

colspecs : список пар (int, int) или ‘infer’. необязательно

Список пар (кортежей), задающих границы полей с фиксированной шириной каждой строки как полуоткрытые интервалы (т.е. [от, до[ ). Строковое значение ‘infer’ может быть использовано для того, чтобы указать парсеру попытаться определить спецификации столбцов из первых 100 строк данных (по умолчанию=’infer’).

widths : список целых чисел. необязательно

Список ширины полей, который может быть использован вместо ‘colspecs’, если интервалы являются непрерывными.

delimiter : str, по умолчанию None

Альтернативное имя аргумента для sep.

delim_whitespace : boolean, по умолчанию False

Указывает, использовать ли пробелы (например, ' ' или ' ') в качестве разделителя. Эквивалентно установке sep='\+s'. Если этот параметр установлен в True, то для параметра delimiter не должно быть передано никакого значения.

Добавлено в версии 0.18.1: поддержка Python-парсера.

header : int или список целых чисел, по умолчанию ‘infer’

Номер(а) строки(ок), используемых в качестве имен столбцов и начала данных. По умолчанию ведёт себя так, как если бы был установлен в 0, если не был передан names, иначе None. Явно передайте header=0, чтобы иметь возможность заменить существующие имена. Заголовок может быть списком целых чисел, которые указывают позиции строк для многоуровневого индекса по столбцам, например, [0,1,3]. Промежуточные строки, которые не указаны, будут пропущены (например, 2 в данном примере пропускается). Обратите внимание, что этот параметр игнорирует прокомментированные строки и пустые строки, если skip_blank_lines=True, поэтому header=0 обозначает первую строку данных, а не первую строку файла.

names : массив-подобный объект, по умолчанию None

Список имен столбцов для использования. Если файл не содержит строку заголовка, то вы должны явно передать header=None

index_col : int или последовательность или False, по умолчанию None

Столбец для использования в качестве меток строк DataFrame. Если задана последовательность, используется MultiIndex. Если у вас есть повреждённый файл с разделителями в конце каждой строки, то вы можете рассмотреть возможность установки index_col=False, чтобы принудительно не использовать первый столбец в качестве индекса (имен строк)

usecols : массив-подобный объект, по умолчанию None

Возвращает подмножество столбцов. Все элементы в этом массиве должны быть либо позиционными (т.е. целочисленными индексами в столбцах документа), либо строками, которые соответствуют именам столбцов, предоставленным пользователем в names или полученным из строки(ок) заголовка документа. Например, допустимым значением параметра usecols будет [0, 1, 2] или [‘foo’, ‘bar’, ‘baz’]. Использование этого параметра приводит к значительно более быстрому парсингу и меньшему использованию памяти.

squeeze : boolean, по умолчанию False

Если парсируемые данные содержат только один столбец, то возвращается Series

prefix : str, по умолчанию None

Префикс для добавления к номерам столбцов при отсутствии заголовка, например, ‘X’ для X0, X1, ...

mangle_dupe_cols : boolean, по умолчанию True

Дублирующиеся столбцы будут указаны как ‘X.0’...’X.N’, а не ‘X’...’X’

dtype : Имя типа или словарь столбец -> тип, по умолчанию None

Тип данных для данных или столбцов. Например, {‘a’: np.float64, ‘b’: np.int32} (не поддерживается с engine=’python’). Используйте str или object для сохранения и не интерпретации типа dtype.

converters : словарь, по умолчанию None

Словарь функций для преобразования значений в определенных столбцах. Ключи могут быть целыми числами или метками столбцов

true_values : список, по умолчанию None

Значения, которые нужно рассматривать как True

false_values : список, по умолчанию None

Значения, которые нужно рассматривать как False

skipinitialspace : boolean, по умолчанию False

Пропустить пробелы после разделителя.

skiprows : список или целое число, по умолчанию None

Номера строк для пропуска (индексируются с 0) или количество строк для пропуска (целое число) в начале файла

skipfooter : int, по умолчанию 0

Количество строк в конце файла для пропуска (не поддерживается с engine=’c’)

nrows : int, по умолчанию None

Количество строк файла для чтения. Полезно для чтения фрагментов больших файлов

na_values : str или массив-подобный объект или словарь, по умолчанию None

Дополнительные строки для распознавания как NA/NaN. Если передан словарь, то специфичные значения NA для каждого столбца. По умолчанию следующие значения интерпретируются как NaN: ‘’, ‘#N/A’, ‘#N/A N/A’, ‘#NA’, ‘-1.#IND’, ‘-1.#QNAN’, ‘-NaN’, ‘-nan’, ‘1.#IND’, ‘1.#QNAN’, ‘N/A’, ‘NA’, ‘NULL’, ‘NaN’, ‘nan’.

keep_default_na : bool, по умолчанию True

Если заданы na_values и keep_default_na False, то значения NaN по умолчанию переопределяются, иначе они добавляются.

na_filter : boolean, по умолчанию True

Обнаруживать маркеры пропущенных значений (пустые строки и значение na_values). В данных без каких-либо NA, передача na_filter=False может улучшить производительность чтения большого файла

verbose : boolean, по умолчанию False

Указывать количество значений NA, помещённых в нечисловые столбцы

skip_blank_lines : boolean, по умолчанию True

Если True, пропускать пустые строки вместо интерпретации как NaN

parse_dates : boolean или список целых чисел или имён или список списков или словарь, по умолчанию False

  • boolean. Если True -> пытаться разобрать индекс.
  • список целых чисел или имён. Например, Если [1, 2, 3] -> пытаться разобрать столбцы 1, 2, 3 каждый как отдельный столбец дат.
  • список списков. Например, Если [[1, 3]] -> объединить столбцы 1 и 3 и разобрать как

    один столбец дат.

  • словарь, например, {‘foo’ : [1, 3]} -> разобрать столбцы 1, 3 как дату и назвать результат ‘foo’

Примечание: Существует быстрый путь для дат в формате iso8601.

infer_datetime_format : boolean, по умолчанию False

Если True и parse_dates включено, pandas будет пытаться определить формат строк дат в столбцах и, если он может быть определён, переключиться на более быстрый метод их разбора. В некоторых случаях это может увеличить скорость разбора на ~5-10 раз.

keep_date_col : boolean, по умолчанию False

Если True и parse_dates указывает на объединение нескольких столбцов, то сохранить исходные столбцы.

date_parser : функция, по умолчанию None

Функция для преобразования последовательности столбцов строк в массив экземпляров дат. По умолчанию используется dateutil.parser.parser для выполнения преобразования. Pandas будет пытаться вызвать date_parser тремя различными способами, переходя к следующему, если произойдет исключение: 1) Передать один или несколько массивов (как определено в parse_dates) в качестве аргументов; 2) конкатенировать (по строкам) строковые значения из столбцов, определённых в parse_dates, в один массив и передать его; и 3) вызвать date_parser один раз для каждой строки, используя одно или несколько строк (соответствующих столбцам, определённым в parse_dates) в качестве аргументов.

dayfirst : boolean, по умолчанию False

Даты в формате ДД/ММ, международный и европейский формат

iterator : boolean, по умолчанию False

Возвратить объект TextFileReader для итерации или получения фрагментов с get_chunk().

chunksize : int, по умолчанию None

Возвращает объект TextFileReader для итерации. См. документацию по инструментам ввода/вывода для получения дополнительной информации о iterator и chunksize.

compression : {‘infer’, ‘gzip’, ‘bz2’, ‘zip’, ‘xz’, None}, по умолчанию ‘infer’

Для динамического распаковки данных на диске. Если ‘infer’, то использовать gzip, bz2, zip или xz, если filepath_or_buffer — строка, оканчивающаяся на ‘.gz’, ‘.bz2’, ‘.zip’ или ‘xz’, соответственно, и без распаковки в противном случае. При использовании ‘zip’, ZIP-файл должен содержать только один файл данных для чтения. Установите в None для отключения распаковки.

Добавлено в версии 0.18.1: поддержка сжатия ‘zip’ и ‘xz’.

thousands : str, по умолчанию None

Разделитель тысяч

decimal : str, по умолчанию ‘.’

Символ, распознаваемый как десятичная точка (например, используйте ‘,’ для европейских данных).

lineterminator : str (длина 1), по умолчанию None

Символ для разделения файла на строки. Действителен только с C-парсером.

quotechar : str (длина 1), необязательно

Символ, используемый для обозначения начала и конца цитируемого элемента. Цитаты могут включать разделитель, и он будет проигнорирован.

quoting : int или экземпляр csv.QUOTE_*, по умолчанию None

Управление поведением цитирования полей согласно csv.QUOTE_* константам. Используйте одну из QUOTE_MINIMAL (0), QUOTE_ALL (1), QUOTE_NONNUMERIC (2) или QUOTE_NONE (3). По умолчанию (None) используется поведение QUOTE_MINIMAL.

escapechar : str (длина 1), по умолчанию None

Символ длиной один символ, используемый для экранирования разделителя, когда цитирование — QUOTE_NONE.

comment : str, по умолчанию None

Указывает, что остальная часть строки не должна анализироваться. Если он найден в начале строки, то строка будет проигнорирована. Этот параметр должен быть одиночным символом. Как и пустые строки (пока skip_blank_lines=True), полностью прокомментированные строки игнорируются параметром header, но не skiprows. Например, если comment=’#’, парсирование ‘#emptyna,b,cn1,2,3’ с header=0 приведёт к тому, что ‘a,b,c’ будет рассматриваться как заголовок.

encoding : str, по умолчанию None

Кодировка для использования для UTF при чтении/записи (например, ‘utf-8’). Список стандартных кодировок Python

dialect : str или экземпляр csv.Dialect, по умолчанию None

Если None, по умолчанию использует Excel-диалект. Игнорируется, если sep длиннее 1 символа. См. документацию csv.Dialect для получения дополнительной информации

tupleize_cols : boolean, по умолчанию False

Оставить список кортежей в столбцах как есть (по умолчанию преобразуется в многоуровневый индекс по столбцам)

error_bad_lines : boolean, по умолчанию True

Строки с избыточным количеством полей (например, строка csv со слишком многими запятыми) по умолчанию вызывают исключение, и DataFrame не возвращается. Если False, то эти «плохие строки» будут удалены из возвращаемого DataFrame. (Действительно только с C-парсером)

warn_bad_lines : boolean, по умолчанию True

Если error_bad_lines — False, и warn_bad_lines — True, то будет выведено предупреждение для каждой «плохой строки». (Действительно только с C-парсером).

Возвращает:

результат : DataFrame или TextParser

Также, ‘разделитель’ используется для указания символа заполнения полей,

если это не пробелы (например, ‘~’).

© 2008–2012, AQR Capital Management, LLC, Lambda Foundry, Inc. and PyData Development Team
Licensed under the 3-clause BSD License.
https://pandas.pydata.org/pandas-docs/version/0.18.1/generated/pandas.read_fwf.html

Spec-Zone.ru

Настройки Оффлайн Что нового Помощь О нас
Spec-Zone .ru
спецификации, руководства, описания, API