Spec-Zone.ru › pandas 0.19

pandas.read_table

pandas.read_table(filepath_or_buffer, sep='\t', delimiter=None, header='infer', names=None, index_col=None, usecols=None, squeeze=False, prefix=None, mangle_dupe_cols=True, dtype=None, engine=None, converters=None, true_values=None, false_values=None, skipinitialspace=False, skiprows=None, nrows=None, na_values=None, keep_default_na=True, na_filter=True, verbose=False, skip_blank_lines=True, parse_dates=False, infer_datetime_format=False, keep_date_col=False, date_parser=None, dayfirst=False, iterator=False, chunksize=None, compression='infer', thousands=None, decimal='.', lineterminator=None, quotechar='"', quoting=0, escapechar=None, comment=None, encoding=None, dialect=None, tupleize_cols=False, error_bad_lines=True, warn_bad_lines=True, skipfooter=0, skip_footer=0, doublequote=True, delim_whitespace=False, as_recarray=False, compact_ints=False, use_unsigned=False, low_memory=True, buffer_lines=None, memory_map=False, float_precision=None) [source]

Чтение общего текстового файла в DataFrame

Также поддерживает необязательное итеративное чтение или разбитие файла на фрагменты.

Дополнительную помощь можно найти в онлайн-документации по инструментам ввода/вывода.

Параметры:

filepath_or_buffer : str, pathlib.Path, py._path.local.LocalPath или любой объект с методом read() (например, дескриптор файла или StringIO)

Строка может быть URL. Допустимые схемы URL включают http, ftp, s3 и file. Для URL файлов ожидается хост. Например, локальный файл может быть file://localhost/path/to/table.csv

sep : str, по умолчанию \t (табуляция)

Разделитель. Если sep равно None, будет попытка автоматического определения. Разделители длиной более 1 символа и отличные от '\s+' будут интерпретироваться как регулярные выражения, будут принудительно использоваться парсер Python и игнорировать кавычки в данных. Пример регулярного выражения: '\r\t'

delimiter : str, по умолчанию None

Альтернативное имя аргумента для sep.

delim_whitespace : boolean, по умолчанию False

Указывает, будут ли пробелы (например, ' ' или '    ') использоваться в качестве разделителя. Эквивалентно установке sep='\s+'. Если этот параметр установлен в True, параметр delimiter не должен передаваться.

Введено в версии 0.18.1: поддержка парсера Python.

header : int или список целых чисел, по умолчанию ‘infer’

Номер(а) строки(ок), используемых в качестве имен столбцов и начала данных. По умолчанию поведение такое же, как при установке в 0, если names не передано, иначе None. Явно передайте header=0, чтобы заменить существующие имена. Заголовок может быть списком целых чисел, указывающих на расположение строк для многоуровневого индекса по столбцам, например [0,1,3]. Промежуточные строки, которые не указаны, будут пропущены (например, 2 в этом примере пропущена). Обратите внимание, что этот параметр игнорирует прокомментированные строки и пустые строки, если skip_blank_lines=True, поэтому header=0 обозначает первую строку данных, а не первую строку файла.

names : массив-подобный объект, по умолчанию None

Список имен столбцов для использования. Если файл не содержит строку заголовка, необходимо явно передать header=None. Дубликаты в этом списке не допускаются, за исключением случая mangle_dupe_cols=True, которое установлено по умолчанию.

index_col : int или последовательность или False, по умолчанию None

Столбец для использования в качестве меток строк DataFrame. Если передана последовательность, используется MultiIndex. Если у вас есть поврежденный файл с разделителями в конце каждой строки, можно рассмотреть возможность index_col=False, чтобы принудительно заставить pandas _не_ использовать первый столбец в качестве индекса (имен строк)

usecols : массив-подобный объект, по умолчанию None

Возвращает подмножество столбцов. Все элементы в этом массиве должны быть позиционными (т. е. целочисленными индексами в столбцах документа) или строками, соответствующими именам столбцов, предоставленными пользователем в names или определенными из строки(ок) заголовка документа. Например, допустимым значением параметра usecols будет [0, 1, 2] или [‘foo’, ‘bar’, ‘baz’]. Использование этого параметра приводит к значительно более быстрому времени разбора и меньшей потребности в памяти.

as_recarray : boolean, по умолчанию False

УСТЕРЕЖДЕН: этот аргумент будет удален в будущих версиях. Пожалуйста, вызовите pd.read_csv(...).to_records() вместо этого.

Возвращает NumPy recarray вместо DataFrame после разбора данных. Если установлено в True, этот параметр имеет приоритет над параметром squeeze. Кроме того, так как индексы строк недоступны в таком формате, параметр index_col будет игнорироваться.

squeeze : boolean, по умолчанию False

Если прочитанные данные содержат только один столбец, вернуть Series

prefix : str, по умолчанию None

Префикс для добавления к номерам столбцов, если нет заголовка, например, ‘X’ для X0, X1, …

mangle_dupe_cols : boolean, по умолчанию True

Дублирующиеся столбцы будут указаны как ‘X.0’...’X.N’, а не ‘X’...’X’. Передача False приведет к перезаписи данных, если в столбцах есть дублирующиеся имена.

dtype : Имя типа или словарь столбец -> тип, по умолчанию None

Тип данных для данных или столбцов. Например, {‘a’: np.float64, ‘b’: np.int32} (не поддерживается с engine=’python’). Используйте str или object для сохранения и не интерпретации dtype.

engine : {‘c’, ‘python’}, необязательно

Использовать парсер C или Python. C-движок быстрее, а Python-движок в настоящее время более функционален.

converters : словарь, по умолчанию None

Словарь функций для преобразования значений в определенных столбцах. Ключи могут быть целыми числами или метками столбцов

true_values : список, по умолчанию None

Значения, рассматриваемые как True

false_values : список, по умолчанию None

Значения, рассматриваемые как False

skipinitialspace : boolean, по умолчанию False

Пропускать пробелы после разделителя.

skiprows : список или целое число, по умолчанию None

Номера строк для пропуска (индексируется с 0) или количество строк для пропуска (целое число) в начале файла

skipfooter : int, по умолчанию 0

Количество строк в конце файла для пропуска (не поддерживается с engine=’c’)

skip_footer : int, по умолчанию 0

УСТЕРЕЖДЕН: используйте вместо этого параметр skipfooter, так как они идентичны

nrows : int, по умолчанию None

Количество строк файла для чтения. Полезно для чтения фрагментов больших файлов

na_values : скаляр, строка, массив-подобный объект или словарь, по умолчанию None

Дополнительные строки для распознавания как NA/NaN. Если передается словарь, специфические значения NA для каждого столбца. По умолчанию следующие значения интерпретируются как NaN: ‘’, ‘#N/A’, ‘#N/A N/A’, ‘#NA’, ‘-1.#IND’, ‘-1.#QNAN’, ‘-NaN’, ‘-nan’,

‘1.#IND’, ‘1.#QNAN’, ‘N/A’, ‘NA’, ‘NULL’, ‘NaN’, ‘nan’`.

keep_default_na : bool, по умолчанию True

Если значения na_values указаны и keep_default_na False, значения NaN по умолчанию перезаписываются, в противном случае они добавляются.

na_filter : boolean, по умолчанию True

Обнаружение маркеров отсутствующих значений (пустые строки и значения na_values). В данных без отсутствующих значений передача na_filter=False может улучшить производительность чтения большого файла

verbose : boolean, по умолчанию False

Указывает количество значений NA, помещенных в нечисловые столбцы

skip_blank_lines : boolean, по умолчанию True

Если True, пропускает пустые строки, а не интерпретирует их как значения NaN

parse_dates : boolean или список целых чисел или имен или список списков или словарь, по умолчанию False

  • boolean. Если True -> попытка анализа индекса.
  • список целых чисел или имен. Например, если [1, 2, 3] -> попытка анализа столбцов 1, 2, 3 как отдельных столбцов дат.
  • список списков. Например, если [[1, 3]] -> объединение столбцов 1 и 3 и анализ как

    одного столбца дат.

  • словарь, например {‘foo’ : [1, 3]} -> анализ столбцов 1, 3 как даты и присвоение результата ‘foo’

Примечание: существует быстрый путь для дат в формате iso8601.

infer_datetime_format : boolean, по умолчанию False

Если True и parse_dates включен, pandas попытается определить формат строк дат в столбцах и, если это возможно, переключится на более быстрый метод их анализа. В некоторых случаях это может увеличить скорость анализа на 5-10 раз.

keep_date_col : boolean, по умолчанию False

Если True и parse_dates указывает на объединение нескольких столбцов, сохранить исходные столбцы.

date_parser : функция, по умолчанию None

Функция для преобразования последовательности столбцов строк в массив экземпляров дат. По умолчанию используется dateutil.parser.parser для преобразования. Pandas попытается вызвать date_parser тремя различными способами, переходя к следующему, если произойдет исключение: 1) Передать один или несколько массивов (как определено parse_dates) в качестве аргументов; 2) конкатенировать (по строкам) строковые значения из столбцов, определенных parse_dates, в один массив и передать его; и 3) вызвать date_parser один раз для каждой строки, используя одну или несколько строк (соответствующих столбцам, определенным parse_dates) в качестве аргументов.

dayfirst : boolean, по умолчанию False

Даты в формате ДД/ММ, международный и европейский формат

iterator : boolean, по умолчанию False

Возвращает объект TextFileReader для итерации или получения фрагментов с get_chunk().

chunksize : int, по умолчанию None

Возвращает объект TextFileReader для итерации. См. документацию по инструментам ввода-вывода для получения дополнительной информации об iterator и chunksize.

compression : {‘infer’, ‘gzip’, ‘bz2’, ‘zip’, ‘xz’, None}, по умолчанию ‘infer’

Для динамической распаковки данных на диске. Если ‘infer’, использовать gzip, bz2, zip или xz, если filepath_or_buffer является строкой, оканчивающейся на ‘.gz’, ‘.bz2’, ‘.zip’ или ‘xz’, соответственно, и не использовать распаковку в противном случае. При использовании ‘zip’ ZIP-файл должен содержать только один файл данных для чтения. Установить в None для отключения распаковки.

Введено в версии 0.18.1: поддержка сжатия ‘zip’ и ‘xz’.

thousands : str, по умолчанию None

Разделитель тысяч

decimal : str, по умолчанию ‘.’

Символ, распознаваемый как десятичная точка (например, используйте ‘,’ для европейских данных).

float_precision : строка, по умолчанию None

Указывает, какой преобразователь C-движка должен использоваться для чисел с плавающей точкой. Доступные параметры: None для обычного преобразователя, high для преобразователя высокой точности и round_trip для преобразователя обратного преобразования.

lineterminator : строка (длина 1), по умолчанию None

Символ для разбиения файла на строки. Действительно только с C-парсером.

quotechar : строка (длина 1), необязательно

Символ, используемый для обозначения начала и конца цитируемого элемента. Цитаты могут содержать разделитель, и он будет проигнорирован.

quoting : целое число или экземпляр csv.QUOTE_*, по умолчанию 0

Управление поведением цитирования полей в соответствии с csv.QUOTE_* константами. Используйте один из QUOTE_MINIMAL (0), QUOTE_ALL (1), QUOTE_NONNUMERIC (2) или QUOTE_NONE (3).

doublequote : boolean, по умолчанию True

Когда quotechar указан и quoting не QUOTE_NONE, указывает, следует ли интерпретировать два последовательных элемента quotechar ВНУТРИ поля как один quotechar элемент.

escapechar : строка (длина 1), по умолчанию None

Строка длиной в один символ, используемая для экранирования разделителя, когда quoting равно QUOTE_NONE.

comment : строка, по умолчанию None

Указывает, что остальная часть строки не должна анализироваться. Если обнаружен в начале строки, вся строка будет пропущена. Этот параметр должен быть одним символом. Как и пустые строки (пока skip_blank_lines=True), полностью прокомментированные строки игнорируются параметром header, но не параметром skiprows. Например, если comment=’#’, анализ ‘#emptyna,b,cn1,2,3’ с header=0 приведет к тому, что ‘a,b,c’ будет обработано как заголовок.

encoding : str, default None

Кодировка для использования при чтении/записи UTF (например, ‘utf-8’). Список стандартных кодировок Python

dialect : str или csv.Dialect instance, по умолчанию None

Если None, используется диалект Excel. Игнорируется, если sep длиннее 1 символа. См. документацию csv.Dialect для получения дополнительной информации

tupleize_cols : boolean, по умолчанию False

Оставить список кортежей в столбцах как есть (по умолчанию преобразуется в Многоиндексные столбцы)

error_bad_lines : boolean, по умолчанию True

Строки с слишком большим количеством полей (например, строка csv с слишком многими запятыми) по умолчанию вызывают исключение, и DataFrame не возвращается. Если False, то эти «плохие строки» будут удалены из возвращаемого DataFrame. (Действительно только с C парсером)

warn_bad_lines : boolean, по умолчанию True

Если error_bad_lines False, а warn_bad_lines True, то для каждой «плохой строки» будет выведено предупреждение. (Действительно только с C парсером).

low_memory : boolean, по умолчанию True

Внутренне обрабатывает файл частями, что приводит к меньшему использованию памяти во время парсинга, но, возможно, к смешанному типу вывода. Чтобы гарантировать отсутствие смешанных типов, установите False или укажите тип с параметром dtype. Обратите внимание, что весь файл считывается в один DataFrame независимо, используйте параметры chunksize или iterator, чтобы вернуть данные частями. (Действительно только с C парсером)

buffer_lines : int, по умолчанию None

УСТАРЕЛО: этот аргумент будет удален в будущей версии, потому что его значение не учитывается парсером

compact_ints : boolean, по умолчанию False

УСТАРЕЛО: этот аргумент будет удален в будущей версии

Если compact_ints True, то для любого столбца целочисленного типа, парсер попытается привести его к целочисленному типу наименьшего размера, либо со знаком, либо без знака, в зависимости от спецификации из параметра use_unsigned.

use_unsigned : boolean, по умолчанию False

УСТАРЕЛО: этот аргумент будет удален в будущей версии

Если целочисленные столбцы сжимаются (т.е. compact_ints=True), укажите, следует ли сжимать столбец до целочисленного типа наименьшего размера со знаком или без знака.

memory_map : boolean, по умолчанию False

Если для filepath_or_buffer указан путь к файлу, отобразить объект файла непосредственно в памяти и получить доступ к данным непосредственно из него. Использование этого параметра может улучшить производительность, так как теперь нет накладных расходов на ввод-вывод.

Возвращает:

result : DataFrame или TextParser

© 2008–2012, AQR Capital Management, LLC, Lambda Foundry, Inc. and PyData Development Team
Licensed under the 3-clause BSD License.
https://pandas.pydata.org/pandas-docs/version/0.19.2/generated/pandas.read_table.html

Spec-Zone.ru

Настройки Оффлайн Что нового Помощь О нас
Spec-Zone .ru
спецификации, руководства, описания, API