pandas.read_table
-
pandas.read_table(filepath_or_buffer, sep='\t', delimiter=None, header='infer', names=None, index_col=None, usecols=None, squeeze=False, prefix=None, mangle_dupe_cols=True, dtype=None, engine=None, converters=None, true_values=None, false_values=None, skipinitialspace=False, skiprows=None, skipfooter=None, nrows=None, na_values=None, keep_default_na=True, na_filter=True, verbose=False, skip_blank_lines=True, parse_dates=False, infer_datetime_format=False, keep_date_col=False, date_parser=None, dayfirst=False, iterator=False, chunksize=None, compression='infer', thousands=None, decimal='.', lineterminator=None, quotechar='"', quoting=0, escapechar=None, comment=None, encoding=None, dialect=None, tupleize_cols=False, error_bad_lines=True, warn_bad_lines=True, skip_footer=0, doublequote=True, delim_whitespace=False, as_recarray=False, compact_ints=False, use_unsigned=False, low_memory=True, buffer_lines=None, memory_map=False, float_precision=None) -
Чтение общего текстового файла с разделителями в DataFrame
Также поддерживает необязательное итеративное чтение или разбиение файла на куски.
Дополнительную помощь можно найти в документации по инструментам ввода-вывода.
Параметры: filepath_or_buffer : str, pathlib.Path, py._path.local.LocalPath или любой объект с методом read() (например, дескриптор файла или StringIO)
Строка может быть URL. Поддерживаемые схемы URL включают http, ftp, s3 и file. Для URL-адресов файлов ожидается хост. Например, локальный файл может быть file://localhost/путь/к/таблице.csv
sep : str, по умолчанию t (табуляция)
Разделитель. Если sep равно None, будет попытка автоматического определения. Разделители длиной более 1 символа и отличные от ‘s+’ будут интерпретироваться как регулярные выражения, приведут к использованию парсера Python и пропустят кавычки в данных. Пример регулярного выражения: ‘rt’
delimiter : str, по умолчанию
NoneАльтернативное имя аргумента для sep.
delim_whitespace : boolean, по умолчанию False
Указывает, будет ли использоваться пробел (например,
' 'или' ') в качестве разделителя. Эквивалентно установкеsep='\+s'. Если этот параметр установлен в True, для параметраdelimiterне должно быть передано никакого значения.Введено в версии 0.18.1: поддержка парсера Python.
header : int или список целых чисел, по умолчанию ‘infer’
Номер(а) строки(ок) для использования в качестве имен столбцов и начала данных. По умолчанию поведение такое же, как если бы оно было установлено в 0, если не было передано
names, в противном случаеNone. Явно передайтеheader=0для возможности замены существующих имен. Заголовок может быть списком целых чисел, указывающих расположения строк для многоуровневого индекса по столбцам, например, [0,1,3]. Промежуточные строки, которые не указаны, будут пропущены (например, 2 в этом примере пропущена). Обратите внимание, что этот параметр игнорирует прокомментированные строки и пустые строки, еслиskip_blank_lines=True, поэтому header=0 обозначает первую строку данных, а не первую строку файла.names : массив-подобный объект, по умолчанию None
Список имен столбцов для использования. Если файл не содержит заголовка строки, то вы должны явно передать header=None
index_col : int или последовательность или False, по умолчанию None
Столбец для использования в качестве меток строк DataFrame. Если задана последовательность, используется MultiIndex. Если у вас есть поврежденный файл с разделителями в конце каждой строки, вы можете рассмотреть index_col=False, чтобы заставить pandas не использовать первый столбец в качестве индекса (имен строк)
usecols : массив-подобный объект, по умолчанию None
Возвращает подмножество столбцов. Все элементы в этом массиве должны быть либо позиционными (т. е. целочисленными индексами в столбцах документа), либо строками, соответствующими именам столбцов, предоставленным пользователем в
namesили выведенным из строки(ок) заголовка документа. Например, допустимым значением параметраusecolsбудет [0, 1, 2] или [‘foo’, ‘bar’, ‘baz’]. Использование этого параметра приводит к значительно более быстрому времени парсинга и меньшему использованию памяти.squeeze : boolean, по умолчанию False
Если проанализированные данные содержат только один столбец, возвращается Series
prefix : str, по умолчанию None
Префикс, добавляемый к номерам столбцов, когда нет заголовка, например, ‘X’ для X0, X1, …
mangle_dupe_cols : boolean, по умолчанию True
Дублирующиеся столбцы будут указаны как ‘X.0’...’X.N’, а не ‘X’...’X’
dtype : Имя типа или словарь столбец -> тип, по умолчанию None
Тип данных для данных или столбцов. Например, {‘a’: np.float64, ‘b’: np.int32} (не поддерживается с engine=’python’). Используйте
strилиobjectдля сохранения и не интерпретации dtype.engine : {‘c’, ‘python’}, необязательно
Использовать движок парсера. Движок C быстрее, в то время как движок Python в настоящее время более функционален.
converters : словарь, по умолчанию None
Словарь функций для преобразования значений в определенных столбцах. Ключи могут быть целыми числами или метками столбцов
true_values : список, по умолчанию None
Значения, рассматриваемые как True
false_values : список, по умолчанию None
Значения, рассматриваемые как False
skipinitialspace : boolean, по умолчанию False
Пропускать пробелы после разделителя.
skiprows : массив-подобный объект или целое число, по умолчанию None
Номера строк для пропуска (индексированы с 0) или количество строк для пропуска (целое число) в начале файла
skipfooter : int, по умолчанию 0
Количество строк в конце файла для пропуска (не поддерживается с engine=’c’)
nrows : int, по умолчанию None
Количество строк файла для чтения. Полезно для чтения частей больших файлов
na_values : str или массив-подобный объект или словарь, по умолчанию None
Дополнительные строки для распознавания как NA/NaN. Если передан словарь, то специфичные значения NA для каждого столбца. По умолчанию следующие значения интерпретируются как NaN:
‘’,‘#N/A’,‘#N/A N/A’,‘#NA’,‘-1.#IND’,‘-1.#QNAN’,‘-NaN’,‘-nan’,‘1.#IND’,‘1.#QNAN’,‘N/A’,‘NA’,‘NULL’,‘NaN’,‘nan’.keep_default_na : bool, по умолчанию True
Если заданы na_values и keep_default_na равно False, значения NaN по умолчанию переопределяются, в противном случае они добавляются.
na_filter : boolean, по умолчанию True
Обнаруживать маркеры пропущенных значений (пустые строки и значения из na_values). В данных без каких-либо значений NA передача na_filter=False может улучшить производительность чтения большого файла
verbose : boolean, по умолчанию False
Указывать количество значений NA, помещенных в нечисловые столбцы
skip_blank_lines : boolean, по умолчанию True
Если True, пропускать пустые строки вместо интерпретации как значений NaN
parse_dates : boolean или список целых чисел или имен или список списков или словарь, по умолчанию False
- boolean. Если True -> пытаться проанализировать индекс.
- список целых чисел или имен. Например, если [1, 2, 3] -> пытаться проанализировать столбцы 1, 2, 3 каждый как отдельный столбец даты.
-
- список списков. Например, если [[1, 3]] -> объединить столбцы 1 и 3 и проанализировать как
-
один столбец даты.
- словарь, например, {‘foo’ : [1, 3]} -> проанализировать столбцы 1, 3 как дату и назвать результат ‘foo’
Примечание: Существует быстрый путь для дат в формате iso8601.
infer_datetime_format : boolean, по умолчанию False
Если True и parse_dates включен, pandas попытается определить формат строк дат в столбцах, и если он может быть определен, переключится на более быстрый метод их анализа. В некоторых случаях это может увеличить скорость парсинга в ~5-10 раз.
keep_date_col : boolean, по умолчанию False
Если True и parse_dates задает объединение нескольких столбцов, то сохраняются исходные столбцы.
date_parser : функция, по умолчанию None
Функция для преобразования последовательности столбцов строк в массив экземпляров дат. По умолчанию используется
dateutil.parser.parser, чтобы выполнить преобразование. Pandas попытается вызвать date_parser тремя разными способами, переходя к следующему, если произойдет исключение: 1) Передать один или несколько массивов (как определено parse_dates) в качестве аргументов; 2) склеить (по строкам) строковые значения из столбцов, определенных parse_dates, в один массив и передать его; и 3) вызвать date_parser один раз для каждой строки, используя одну или несколько строк (соответствующих столбцам, определенным parse_dates) в качестве аргументов.dayfirst : boolean, по умолчанию False
Даты в формате ДД/ММ, международный и европейский формат
iterator : boolean, по умолчанию False
Возвращает объект TextFileReader для итерации или получения кусков с
get_chunk().chunksize : int, по умолчанию None
Возвращает объект TextFileReader для итерации. См. документацию по инструментам ввода-вывода для получения дополнительной информации о
iteratorиchunksize.compression : {‘infer’, ‘gzip’, ‘bz2’, ‘zip’, ‘xz’, None}, по умолчанию ‘infer’
Для онлайн-распаковки данных на диске. Если ‘infer’, то использовать gzip, bz2, zip или xz, если filepath_or_buffer является строкой, заканчивающейся на ‘.gz’, ‘.bz2’, ‘.zip’ или ‘xz’ соответственно, и без распаковки в противном случае. Если используется ‘zip’, архив ZIP должен содержать только один файл данных для чтения. Установите None для отсутствия распаковки.
Введено в версии 0.18.1: поддержка сжатия ‘zip’ и ‘xz’.
thousands : str, по умолчанию None
Разделитель разрядов
decimal : str, по умолчанию ‘.’
Символ, распознаваемый как десятичная точка (например, используйте ‘,’ для европейских данных).
lineterminator : str (длина 1), по умолчанию None
Символ для разделения файла на строки. Действителен только для C парсера.
quotechar : str (длина 1), необязательно
Символ, используемый для обозначения начала и конца цитируемого элемента. Цитаты могут включать разделитель, и он будет пропущен.
quoting : int или экземпляр csv.QUOTE_*, по умолчанию None
Управление поведением цитирования полей согласно
csv.QUOTE_*константам. Используйте один из QUOTE_MINIMAL (0), QUOTE_ALL (1), QUOTE_NONNUMERIC (2) или QUOTE_NONE (3). По умолчанию (None) используется поведение QUOTE_MINIMAL.escapechar : str (длина 1), по умолчанию None
Строка длиной в один символ, используемая для экранирования разделителя, когда цитирование равно QUOTE_NONE.
comment : str, по умолчанию None
Указывает, что остальная часть строки не должна анализироваться. Если встречается в начале строки, то строка будет полностью пропущена. Этот параметр должен быть одиночным символом. Как и пустые строки (пока что
skip_blank_lines=True), полностью прокомментированные строки игнорируются параметромheader, но неskiprows. Например, если comment=’#’, парсинг ‘#emptyna,b,cn1,2,3’ сheader=0приведет к тому, что ‘a,b,c’ будет обработано как заголовок.encoding : str, по умолчанию None
Кодировка для использования для UTF при чтении/записи (например, ‘utf-8’). Список стандартных кодировок Python
dialect : str или экземпляр csv.Dialect, по умолчанию None
Если None, по умолчанию используется диалект Excel. Игнорируется, если sep длиннее 1 символа. См. документацию csv.Dialect для получения дополнительной информации
tupleize_cols : boolean, по умолчанию False
Оставить список кортежей по столбцам как есть (по умолчанию - преобразовать в многоуровневый индекс по столбцам)
error_bad_lines : boolean, по умолчанию True
Строки с слишком большим количеством полей (например, строка csv со слишком большим количеством запятых) по умолчанию вызовут исключение, и DataFrame не будет возвращен. Если False, то эти «плохие строки» будут удалены из возвращаемого DataFrame. (Действительно только с C парсером)
warn_bad_lines : boolean, по умолчанию True
Если error_bad_lines равно False, а warn_bad_lines равно True, то для каждой «плохой строки» будет выведено предупреждение. (Действительно только с C парсером).
Возвращаемое значение: result : DataFrame или TextParser
© 2008–2012, AQR Capital Management, LLC, Lambda Foundry, Inc. and PyData Development Team
Licensed under the 3-clause BSD License.
https://pandas.pydata.org/pandas-docs/version/0.18.1/generated/pandas.read_table.html