pandas.read_csv
-
pandas.read_csv(filepath_or_buffer, sep=', ', delimiter=None, header='infer', names=None, index_col=None, usecols=None, squeeze=False, prefix=None, mangle_dupe_cols=True, dtype=None, engine=None, converters=None, true_values=None, false_values=None, skipinitialspace=False, skiprows=None, nrows=None, na_values=None, keep_default_na=True, na_filter=True, verbose=False, skip_blank_lines=True, parse_dates=False, infer_datetime_format=False, keep_date_col=False, date_parser=None, dayfirst=False, iterator=False, chunksize=None, compression='infer', thousands=None, decimal=b'.', lineterminator=None, quotechar='"', quoting=0, escapechar=None, comment=None, encoding=None, dialect=None, tupleize_cols=False, error_bad_lines=True, warn_bad_lines=True, skipfooter=0, skip_footer=0, doublequote=True, delim_whitespace=False, as_recarray=False, compact_ints=False, use_unsigned=False, low_memory=True, buffer_lines=None, memory_map=False, float_precision=None)[source] -
Чтение CSV-файла (разделенного запятыми) в DataFrame
Также поддерживает необязательное итеративное чтение или разбиение файла на части.
Дополнительную помощь можно найти в документации по инструментам ввода-вывода.
Параметры: filepath_or_buffer : str, pathlib.Path, py._path.local.LocalPath или любой объект с методом read() (например, дескриптор файла или StringIO)
Строка может быть URL-адресом. Допустимые схемы URL включают http, ftp, s3 и file. Для URL-адресов файлов ожидается хост. Например, локальный файл может быть file://localhost/path/to/table.csv
sep : str, по умолчанию ‘,’
Разделитель. Если sep равен None, C-движок не может автоматически определить разделитель, но Python-движок может, поэтому он будет автоматически использован. Кроме того, разделители длиной более 1 символа и отличные от
'\s+'будут интерпретироваться как регулярные выражения и также заставят использовать Python-движок. Обратите внимание, что разделители-регулярные выражения могут игнорировать цитированные данные. Пример регулярного выражения:'\r\t'delimiter : str, по умолчанию
NoneАльтернативное имя аргумента для sep.
delim_whitespace : boolean, по умолчанию False
Указывает, использовать ли пробелы (например,
' 'или' ') в качестве разделителя. Эквивалентно установкеsep='\s+'. Если этот параметр установлен в True, для параметраdelimiterничего не должно передаваться.Добавлена в версии 0.18.1: поддержка Python-парсера.
header : int или список целых чисел, по умолчанию ‘infer’
Номер(а) строки, используемые в качестве имён столбцов и начала данных. По умолчанию поведение такое же, как при установке в 0, если не было передано
names, в противном случаеNone. Явно передайтеheader=0для возможности замены существующих имён. Заголовок может быть списком целых чисел, которые указывают позиции строк для многоуровневого индекса столбцов, например, [0,1,3]. Промежуточные строки, которые не указаны, будут пропущены (например, 2 в этом примере пропущена). Обратите внимание, что этот параметр игнорирует комментированные и пустые строки, еслиskip_blank_lines=True, поэтому header=0 обозначает первую строку данных, а не первую строку файла.names : массив-подобный объект, по умолчанию None
Список имён столбцов для использования. Если файл не содержит заголовка, необходимо явно передать header=None. Дубликаты в этом списке не допускаются, за исключением случаев mangle_dupe_cols=True, по умолчанию.
index_col : int, последовательность или False, по умолчанию None
Столбец для использования в качестве меток строк DataFrame. Если задана последовательность, используется MultiIndex. Если у вас есть повреждённый файл с разделителями в конце каждой строки, вы можете рассмотреть возможность index_col=False для принудительного отказа pandas от использования первого столбца в качестве индекса (имён строк)
usecols : массив-подобный объект или вызываемая функция, по умолчанию None
Возвращает подмножество столбцов. Если массив-подобный объект, все элементы должны быть либо позиционными (т.е. целочисленными индексами в столбцах документа), либо строками, соответствующими именам столбцов, предоставленными пользователем в
namesили выведенными из заголовка(ов) документа. Например, допустимым массивоподобнымusecolsпараметром будет [0, 1, 2] или [‘foo’, ‘bar’, ‘baz’].Если вызываемая функция, вызываемая функция будет вычисляться относительно имён столбцов, возвращая имена, где вызываемая функция возвращает True. Пример допустимого аргумента вызываемой функции
lambda x: x.upper() in ['AAA', 'BBB', 'DDD']. Использование этого параметра приводит к значительно более быстрому времени парсинга и меньшему использованию памяти.as_recarray : boolean, по умолчанию False
УСТАРЕВШИЙ параметр: этот аргумент будет удален в будущей версии. Пожалуйста, вызовите
pd.read_csv(...).to_records()вместо этого.Возвращает массив NumPy recarray вместо DataFrame после парсинга данных. Если установлено в True, этот параметр имеет приоритет над
squeezeпараметром. Кроме того, поскольку индексы строк недоступны в таком формате, параметрindex_colбудет проигнорирован.squeeze : boolean, по умолчанию False
Если проанализированные данные содержат только один столбец, возвращает Series
prefix : str, по умолчанию None
Префикс для добавления к номерам столбцов при отсутствии заголовка, например, ‘X’ для X0, X1, ...
mangle_dupe_cols : boolean, по умолчанию True
Дублирующие столбцы будут указаны как ‘X.0’...’X.N’, а не ‘X’...’X’. Передача False приведет к перезаписи данных, если в столбцах есть дублирующие имена.
dtype : Имя типа или словарь столбец -> тип, по умолчанию None
Тип данных для данных или столбцов. Например, {‘a’: np.float64, ‘b’: np.int32}. Используйте
strилиobjectдля сохранения и не интерпретации dtype. Если заданы преобразующие функции, они будут применяться ВМЕСТО преобразования dtype.engine : {‘c’, ‘python’}, необязательно
Движок парсера для использования. C-движок быстрее, тогда как Python-движок в настоящее время более функционально полный.
converters : словарь, по умолчанию None
Словарь функций для преобразования значений в определённых столбцах. Ключи могут быть целыми числами или метками столбцов
true_values : список, по умолчанию None
Значения, которые следует рассматривать как True
false_values : список, по умолчанию None
Значения, которые следует рассматривать как False
skipinitialspace : boolean, по умолчанию False
Пропустить пробелы после разделителя.
skiprows : список или целое число или вызываемая функция, по умолчанию None
Номера строк для пропуска (индексирование с 0) или количество строк для пропуска (целое число) в начале файла.
Если это вызываемая функция, вызываемая функция будет вычисляться по индексам строк, возвращая True, если строка должна быть пропущена, и False в противном случае. Пример допустимого аргумента вызываемой функции
lambda x: x in [0, 2].skipfooter : целое число, по умолчанию 0
Количество строк в конце файла для пропуска (не поддерживается с engine=’c’)
skip_footer : целое число, по умолчанию 0
УСТАРЕВШИЙ: используйте параметр
skipfooterвместо него, так как они идентичныnrows : целое число, по умолчанию None
Количество строк файла для чтения. Полезно для чтения фрагментов больших файлов
na_values : скаляр, строка, список или словарь, по умолчанию None
Дополнительные строки для распознавания как NA/NaN. Если передан словарь, то конкретные значения NA для каждого столбца. По умолчанию следующие значения интерпретируются как NaN: ‘’, ‘#N/A’, ‘#N/A N/A’, ‘#NA’, ‘-1.#IND’, ‘-1.#QNAN’, ‘-NaN’, ‘-nan’, ‘1.#IND’, ‘1.#QNAN’, ‘N/A’, ‘NA’, ‘NULL’, ‘NaN’, ‘nan’`.
keep_default_na : bool, по умолчанию True
Если na_values заданы и keep_default_na False, значения NaN по умолчанию переопределяются, иначе они добавляются.
na_filter : boolean, по умолчанию True
Обнаружение маркеров пропущенных значений (пустые строки и значения na_values). В данных без каких-либо NA передача na_filter=False может повысить производительность чтения большого файла
verbose : boolean, по умолчанию False
Указывает количество значений NA, помещённых в нечисленные столбцы
skip_blank_lines : boolean, по умолчанию True
Если True, пропускаются пустые строки вместо интерпретации как значений NaN
parse_dates : boolean или список целых чисел или имён или список списков или словарь, по умолчанию False
- boolean. Если True -> попытка парсинга индекса.
- список целых чисел или имён. Например, Если [1, 2, 3] -> попытка парсинга столбцов 1, 2, 3 по отдельности как столбцов дат.
- список списков. Например, Если [[1, 3]] -> объединение столбцов 1 и 3 и парсинг как одного столбца дат.
- словарь, например, {‘foo’ : [1, 3]} -> парсинг столбцов 1, 3 как дат и присвоение результата имени ‘foo’
Если столбец или индекс содержит неразбираемую дату, весь столбец или индекс возвращаются неизменёнными как тип данных object. Для нестандартного парсинга дат используйте
pd.to_datetimeпослеpd.read_csvПримечание: существует быстрый путь для дат в формате iso8601.
infer_datetime_format : boolean, по умолчанию False
Если True и parse_dates включено, pandas попытается определить формат строк дат в столбцах и, если это возможно, переключиться на более быстрый метод их парсинга. В некоторых случаях это может увеличить скорость парсинга в 5-10 раз.
keep_date_col : boolean, по умолчанию False
Если True и parse_dates задаёт объединение нескольких столбцов, то сохранить исходные столбцы.
date_parser : функция, по умолчанию None
Функция для преобразования последовательности столбцов строк в массив экземпляров datetime. По умолчанию используется
dateutil.parser.parserдля преобразования. Pandas попытается вызвать date_parser тремя различными способами, переходя к следующему, если произойдёт исключение: 1) Передать один или несколько массивов (как определено parse_dates) в качестве аргументов; 2) конкатенировать (по строкам) строковые значения из столбцов, определённых parse_dates, в один массив и передать его; и 3) вызвать date_parser один раз для каждой строки, используя одну или несколько строк (соответствующих столбцам, определённым parse_dates) в качестве аргументов.dayfirst : boolean, по умолчанию False
Даты в формате ДД/ММ, международный и европейский формат
iterator : boolean, по умолчанию False
Возвращает объект TextFileReader для итерации или получения фрагментов с
get_chunk().chunksize : целое число, по умолчанию None
Возвращает объект TextFileReader для итерации. См. документацию по средствам ввода-вывода для получения дополнительной информации о
iteratorиchunksize.compression : {‘infer’, ‘gzip’, ‘bz2’, ‘zip’, ‘xz’, None}, по умолчанию ‘infer’
Для онлайн-распаковки данных на диске. Если ‘infer’, то использовать gzip, bz2, zip или xz, если filepath_or_buffer — строка, заканчивающаяся на ‘.gz’, ‘.bz2’, ‘.zip’ или ‘xz’ соответственно, и без распаковки в противном случае. При использовании ‘zip’, ZIP-файл должен содержать только один файл данных для чтения. Установите в None для отключения распаковки.
Добавлена в версии 0.18.1: поддержка сжатия ‘zip’ и ‘xz’.
thousands : str, по умолчанию None
Разделитель разрядов
decimal : str, по умолчанию ‘.’
Символ, распознаваемый как десятичная точка (например, используйте ‘,’ для европейских данных).
float_precision : строка, по умолчанию None
Указывает, какой преобразователь C-движок должен использовать для чисел с плавающей запятой. Доступные варианты
Noneдля обычного преобразователя,highдля высокоточного преобразователя иround_tripдля преобразователя с обратным преобразованием.lineterminator : str (длина 1), по умолчанию None
Символ для разделения файла на строки. Только допустимо с C-парсером.
quotechar : str (длина 1), необязательно
Символ, используемый для обозначения начала и конца цитируемого элемента. Цитируемые элементы могут включать разделитель, и он будет проигнорирован.
quoting : целое число или экземпляр csv.QUOTE_*, по умолчанию 0
Управление поведением цитирования полей по
csv.QUOTE_*константам. Используйте один из QUOTE_MINIMAL (0), QUOTE_ALL (1), QUOTE_NONNUMERIC (2) или QUOTE_NONE (3).doublequote : boolean, по умолчанию
True
При указании параметра
quotecharи если параметрquotingнеQUOTE_NONE, укажите, нужно ли интерпретировать два последовательных элементаquotecharВНУТРИ поля как одинquotecharэлемент.escapechar: str (длина 1), по умолчанию NoneОдносимвольная строка, используемая для экранирования разделителя, когда
quotingравноQUOTE_NONE.comment: str, по умолчанию NoneУказывает, что оставшаяся часть строки не должна анализироваться. Если он находится в начале строки, вся строка будет пропущена. Этот параметр должен быть одиночным символом. Как и пустые строки (пока
skip_blank_lines=True), полностью прокомментированные строки игнорируются параметромheaderно неskiprows. Например, если comment=’#’, при анализе ‘#emptyna,b,cn1,2,3’ сheader=0будет получено ‘a,b,c’, что будет считаться заголовком.encoding: str, по умолчанию NoneКодировка для использования для UTF при чтении/записи (например, ‘utf-8’). Список стандартных кодировок Python
dialect: str или экземпляр csv.Dialect, по умолчанию NoneПри указании этот параметр переопределит значения (по умолчанию или нет) для следующих параметров:
delimiter,doublequote,escapechar,skipinitialspace,quotechar, иquoting. Если требуется переопределение, будет выведено предупреждение ParserWarning. Дополнительные сведения см. в документации csv.Dialect.tupleize_cols: boolean, по умолчанию FalseОставить список кортежей в столбцах в исходном виде (по умолчанию преобразовать в Многоиндексные столбцы)
error_bad_lines: boolean, по умолчанию TrueСтроки с слишком большим количеством полей (например, строка CSV со слишком многими запятыми) по умолчанию вызывают исключение, и DataFrame не возвращается. Если False, то эти «плохие строки» будут удалены из возвращаемого DataFrame.
warn_bad_lines: boolean, по умолчанию TrueЕсли error_bad_lines равно False, а warn_bad_lines равно True, для каждой «плохой строки» будет выведено предупреждение.
low_memory: boolean, по умолчанию TrueВнутренне обрабатывает файл частями, что приводит к меньшему использованию памяти во время анализа, но, возможно, к смешанному выводу типов. Чтобы избежать смешанных типов, установите False или укажите тип с параметром
dtype. Обратите внимание, что весь файл считывается в один DataFrame независимо, используйте параметрchunksizeилиiteratorдля возврата данных частями. (Только с C парсером)buffer_lines: int, по умолчанию NoneУСТАРЕВШИЙ параметр: этот параметр будет удален в будущей версии, так как его значение не учитывается парсером
compact_ints: boolean, по умолчанию FalseУСТАРЕВШИЙ параметр: этот параметр будет удален в будущей версии
Если
compact_intsTrue, то для любого столбца целого типа данных парсер попытается привести его к наименьшему возможному целому типу данных, как со знаком, так и без знака, в зависимости от спецификации из параметраuse_unsigned.use_unsigned: boolean, по умолчанию FalseУСТАРЕВШИЙ параметр: этот параметр будет удален в будущей версии
Если столбцы целых чисел сжимаются (т.е.
compact_ints=True), укажите, должен ли столбец быть сжат до наименьшего целочисленного типа со знаком или без знака.memory_map: boolean, по умолчанию FalseЕсли для
filepath_or_bufferзадан путь к файлу, отобразить файл непосредственно в памяти и получать данные напрямую оттуда. Использование этого параметра может улучшить производительность, так как больше нет накладных расходов на ввод-вывод.Возвращает: result: DataFrame или TextParser
© 2008–2012, AQR Capital Management, LLC, Lambda Foundry, Inc. and PyData Development Team
Licensed under the 3-clause BSD License.
https://pandas.pydata.org/pandas-docs/version/0.20.3/generated/pandas.read_csv.html