Spec-Zone.ru › pandas 0.23

pandas.read_csv

pandas.read_csv(filepath_or_buffer, sep=', ', delimiter=None, header='infer', names=None, index_col=None, usecols=None, squeeze=False, prefix=None, mangle_dupe_cols=True, dtype=None, engine=None, converters=None, true_values=None, false_values=None, skipinitialspace=False, skiprows=None, nrows=None, na_values=None, keep_default_na=True, na_filter=True, verbose=False, skip_blank_lines=True, parse_dates=False, infer_datetime_format=False, keep_date_col=False, date_parser=None, dayfirst=False, iterator=False, chunksize=None, compression='infer', thousands=None, decimal=b'.', lineterminator=None, quotechar='"', quoting=0, escapechar=None, comment=None, encoding=None, dialect=None, tupleize_cols=None, error_bad_lines=True, warn_bad_lines=True, skipfooter=0, doublequote=True, delim_whitespace=False, low_memory=True, memory_map=False, float_precision=None) [source]

Чтение CSV-файла (разделённого запятыми) в DataFrame

Также поддерживает необязательное итеративное чтение или разделение файла на части.

Дополнительную помощь можно найти в документации по инструментам ввода-вывода.

Параметры:
filepath_or_buffer : str, pathlib.Path, py._path.local.LocalPath or any \

объект с методом read() (например, дескриптор файла или StringIO)

Строка может быть URL. Допустимые схемы URL включают http, ftp, s3 и file. Для URL-адресов файлов ожидается хост. Например, локальный файл может быть file://localhost/path/to/table.csv

sep : str, по умолчанию ‘,’

Разделитель для использования. Если sep равен None, движок C не может автоматически определить разделитель, но движок Python может, что означает, что последний будет использоваться и автоматически определять разделитель с помощью встроенного инструмента анализа Python, csv.Sniffer. Кроме того, разделители длиной более 1 символа и отличные от '\s+' будут интерпретироваться как регулярные выражения и также будут принудительно использовать движок Python. Обратите внимание, что разделители регулярных выражений склонны игнорировать цитированные данные. Пример регулярного выражения: '\r\t'

delimiter : str, по умолчанию None

Альтернативное имя аргумента для sep.

delim_whitespace : boolean, по умолчанию False

Указывает, будут ли пробелы (например, ' ' или '\t') использоваться в качестве разделителя. Эквивалентно установке sep='\s+'. Если этот параметр установлен в True, для параметра delimiter ничего не должно быть передано.

Введено в версии 0.18.1: поддержка парсера Python.

header : int или список целых чисел, по умолчанию ‘infer’

Номер(а) строки, используемые в качестве имен столбцов и начала данных. Поведение по умолчанию – вывести имена столбцов: если имена не переданы, поведение идентично header=0 и имена столбцов выводятся из первой строки файла, если имена столбцов явно переданы, тогда поведение идентично header=None. Явно передайте header=0 чтобы заменить существующие имена. Заголовок может быть списком целых чисел, которые указывают расположения строк для многоиндексов по столбцам, например [0,1,3]. Промежуточные строки, которые не указаны, будут пропущены (например, 2 в этом примере пропущена). Обратите внимание, что этот параметр игнорирует комментированные строки и пустые строки, если skip_blank_lines=True, поэтому header=0 обозначает первую строку данных, а не первую строку файла.

names : массив-подобный объект, по умолчанию None

Список имен столбцов для использования. Если файл не содержит строки заголовка, необходимо явно передать header=None. Дубликаты в этом списке приведут к UserWarning.

index_col : целое число или последовательность или False, по умолчанию None

Столбец для использования в качестве меток строк DataFrame. Если задана последовательность, используется MultiIndex. Если у вас есть повреждённый файл с разделителями в конце каждой строки, вы можете рассмотреть возможность index_col=False, чтобы принудительно не использовать первый столбец в качестве индекса (имен строк)

usecols : список-подобный объект или вызываемый объект, по умолчанию None

Возвращает подмножество столбцов. Если список-подобный объект, все элементы должны быть либо позиционными (т. е. целочисленными индексами в столбцы документа), либо строками, соответствующими именам столбцов, предоставленными пользователем в names или выведенными из строки(строк) заголовка документа. Например, допустимым параметром список-подобного объекта usecols будет [0, 1, 2] или [‘foo’, ‘bar’, ‘baz’]. Порядок элементов игнорируется, поэтому usecols=[0, 1] равно [1, 0]. Для создания DataFrame из data с сохранением порядка элементов используйте pd.read_csv(data, usecols=['foo', 'bar'])[['foo', 'bar']] для столбцов в ['foo', 'bar'] порядке или pd.read_csv(data, usecols=['foo', 'bar'])[['bar', 'foo']] для ['bar', 'foo'] порядка.

Если вызываемый объект, вызываемая функция будет оцениваться по именам столбцов, возвращая имена, где вызываемая функция принимает значение True. Примером допустимого аргумента вызываемого объекта будет lambda x: x.upper() in ['AAA', 'BBB', 'DDD']. Использование этого параметра приводит к значительно более быстрому времени парсинга и меньшему использованию памяти.

squeeze : boolean, по умолчанию False

Если анализируемые данные содержат только один столбец, возвращается Series

prefix : str, по умолчанию None

Префикс, добавляемый к номерам столбцов, если нет заголовка, например ‘X’ для X0, X1, …

mangle_dupe_cols : boolean, по умолчанию True

Дублирующие столбцы будут указаны как ‘X’, ‘X.1’, …’X.N’, а не ‘X’…’X’. Передача False приведет к перезаписи данных, если в столбцах есть дублирующие имена.

dtype : Имя типа или словарь столбец -> тип, по умолчанию None

Тип данных для данных или столбцов. Например, {‘a’: np.float64, ‘b’: np.int32} Используйте str или object вместе с подходящими na_values настройками, чтобы сохранить и не интерпретировать dtype. Если указаны преобразователи, они будут применяться ВМЕСТО преобразования dtype.

engine : {‘c’, ‘python’}, необязательно

Используемый движок парсера. Движок C быстрее, в то время как движок Python в настоящее время более функционален.

converters : словарь, по умолчанию None

Словарь функций для преобразования значений в определенных столбцах. Ключи могут быть либо целыми числами, либо метками столбцов

true_values : список, по умолчанию None

Значения, которые следует рассматривать как True

false_values : список, по умолчанию None

Значения, которые следует рассматривать как False

skipinitialspace : boolean, по умолчанию False

Пропустить пробелы после разделителя.

skiprows : список-подобный объект или целое число или вызываемый объект, по умолчанию None

Номера строк для пропуска (индексированы с 0) или количество строк для пропуска (целое число) в начале файла.

Если вызываемый объект, вызываемая функция будет оцениваться по индексам строк, возвращая True, если строка должна быть пропущена, и False в противном случае. Примером допустимого аргумента вызываемого объекта будет lambda x: x in [0, 2].

skipfooter : целое число, по умолчанию 0

Количество строк в конце файла для пропуска (не поддерживается с engine=’c’)

nrows : целое число, по умолчанию None

Количество строк файла для чтения. Полезно для чтения фрагментов больших файлов

na_values : скаляр, строка, список-подобный объект или словарь, по умолчанию None

Дополнительные строки для распознавания как NA/NaN. Если передан словарь, то специфические значения NA для каждого столбца. По умолчанию следующие значения интерпретируются как NaN: ‘’, ‘#N/A’, ‘#N/A N/A’, ‘#NA’, ‘-1.#IND’, ‘-1.#QNAN’, ‘-NaN’, ‘-nan’, ‘1.#IND’, ‘1.#QNAN’, ‘N/A’, ‘NA’, ‘NULL’, ‘NaN’, ‘n/a’, ‘nan’, ‘null’.

keep_default_na : bool, по умолчанию True

Включать или нет значения NaN по умолчанию при разборе данных. В зависимости от того, na_values передаётся или нет, поведение следующее:

  • Если keep_default_na равно True, и na_values указаны, na_values добавляется к значениям NaN по умолчанию, используемым для разбора.
  • Если keep_default_na равно True, и na_values не указаны, для разбора используются только значения NaN по умолчанию.
  • Если keep_default_na равно False, и na_values указаны, для разбора используются только значения NaN, указанные na_values.
  • Если keep_default_na равно False, и na_values не указаны, никакие строки не будут разбираться как NaN.

Обратите внимание, что если na_filter передаётся как False, параметры keep_default_na и na_values будут проигнорированы.

na_filter : boolean, по умолчанию True

Обнаружить маркеры пропущенных значений (пустые строки и значение na_values). В данных без каких-либо значений NA передача na_filter=False может улучшить производительность чтения большого файла

verbose : boolean, по умолчанию False

Указать количество значений NA, размещённых в столбцах, не являющихся числовыми

skip_blank_lines : boolean, по умолчанию True

Если True, пропускать пустые строки вместо интерпретации как NaN значений

parse_dates : boolean или список целых чисел или имён или список списков или словарь, по умолчанию False

  • boolean. Если True -> попытаться разобрать индекс.
  • список целых чисел или имён. Например, если [1, 2, 3] -> попытаться разобрать столбцы 1, 2, 3 каждый как отдельный столбец дат.
  • список списков. Например, если [[1, 3]] -> объединить столбцы 1 и 3 и разобрать как один столбец дат.
  • словарь, например {‘foo’ : [1, 3]} -> разобрать столбцы 1, 3 как даты и назвать результат ‘foo’

Если столбец или индекс содержит неразбираемую дату, весь столбец или индекс будут возвращены без изменения как тип данных object. Для нестандартного разбора даты-времени используйте pd.to_datetime после pd.read_csv

Примечание: существует быстрый путь для дат в формате iso8601.

infer_datetime_format : boolean, по умолчанию False

Если True и parse_dates включено, pandas попытается определить формат строк дат-времени в столбцах и, если это возможно, переключиться на более быстрый метод их разбора. В некоторых случаях это может увеличить скорость разбора на 5–10 раз.

keep_date_col : boolean, по умолчанию False

Если True и parse_dates указывает на объединение нескольких столбцов, сохранить исходные столбцы.

date_parser : функция, по умолчанию None

Функция для преобразования последовательности столбцов строк в массив экземпляров дат-времени. По умолчанию используется dateutil.parser.parser для выполнения преобразования. Pandas попытается вызвать date_parser тремя различными способами, переходя к следующему, если произойдёт исключение: 1) Передать один или несколько массивов (как определено parse_dates) в качестве аргументов; 2) конкатенировать (по строкам) строковые значения из столбцов, определённых parse_dates, в один массив и передать его; и 3) вызвать date_parser один раз для каждой строки, используя одну или несколько строк (соответствующих столбцам, определённым parse_dates) в качестве аргументов.

dayfirst : boolean, по умолчанию False

Даты в формате ДД/ММ, международный и европейский формат

iterator : boolean, по умолчанию False

Возвратить объект TextFileReader для итерации или получения фрагментов с get_chunk().

chunksize : целое число, по умолчанию None

Возвратить объект TextFileReader для итерации. См. документацию по средствам ввода-вывода для получения дополнительной информации о iterator и chunksize.

compression : {‘infer’, ‘gzip’, ‘bz2’, ‘zip’, ‘xz’, None}, по умолчанию ‘infer’

Для онлайн-распаковки данных на диске. Если ‘infer’ и filepath_or_buffer является объектом-путем, определить сжатие по расширениям: ‘.gz’, ‘.bz2’, ‘.zip’ или ‘.xz’ (иначе нет сжатия). Если используется ‘zip’, файл ZIP должен содержать только один файл данных для чтения. Установить в None для отсутствия распаковки.

Введено в версии 0.18.1: поддержка сжатия ‘zip’ и ‘xz’.

thousands : строка, по умолчанию None

Разделитель тысяч

decimal : строка, по умолчанию ‘.’

Символ для распознавания десятичной точки (например, используйте ‘,’ для европейских данных).

float_precision : строка, по умолчанию None

Указывает, какой конвертер должен использовать C-движок для значений с плавающей точкой. Доступные варианты: None для обычного конвертера, high для конвертера высокой точности и round_trip для конвертера обратного преобразования.

lineterminator : str (длина 1), по умолчанию None

Символ, используемый для разделения файла на строки. Действителен только с C-парсером.

quotechar : str (длина 1), необязательно

Символ, используемый для обозначения начала и конца цитируемого элемента. Цитаты могут включать разделитель, который будет пропущен.

quoting : int или экземпляр csv.QUOTE_*, по умолчанию 0

Управление цитированием полей по csv.QUOTE_* константам. Используйте один из QUOTE_MINIMAL (0), QUOTE_ALL (1), QUOTE_NONNUMERIC (2) или QUOTE_NONE (3).

doublequote : boolean, по умолчанию True

Когда quotechar указан и quoting не QUOTE_NONE, указывает, следует ли интерпретировать два последовательных элемента quotechar ВНУТРИ поля как один quotechar элемент.

escapechar : str (длина 1), по умолчанию None

Односимвольная строка, используемая для экранирования разделителя, когда quoting равен QUOTE_NONE.

comment : str, по умолчанию None

Указывает, что остальная часть строки не должна анализироваться. Если он находится в начале строки, строка игнорируется полностью. Этот параметр должен быть одиночным символом. Как и пустые строки (пока skip_blank_lines=True), полностью прокомментированные строки игнорируются параметром header, но не skiprows. Например, если comment='#', парсинг #empty\na,b,c\n1,2,3 с header=0 приведет к тому, что ‘a,b,c’ будет обработано как заголовок.

encoding : str, по умолчанию None

Кодировка для использования с UTF при чтении/записи (например, ‘utf-8’). Список стандартных кодировок Python

dialect : str или экземпляр csv.Dialect, по умолчанию None

Если предоставлено, этот параметр переопределит значения (по умолчанию или нет) следующих параметров: delimiter, doublequote, escapechar, skipinitialspace, quotechar, и quoting. Если необходимо переопределить значения, будет выведено предупреждение ParserWarning. Более подробную информацию см. в документации csv.Dialect.

tupleize_cols : boolean, по умолчанию False

Устарело начиная с версии 0.21.0: Этот аргумент будет удален, и преобразование всегда будет в MultiIndex

Оставляет список кортежей в столбцах как есть (по умолчанию — преобразование в MultiIndex для столбцов)

error_bad_lines : boolean, по умолчанию True

Строки с слишком большим количеством полей (например, строка csv с слишком многими запятыми) по умолчанию вызывают исключение, и DataFrame не возвращается. Если False, эти «плохие строки» удаляются из возвращаемого DataFrame.

warn_bad_lines : boolean, по умолчанию True

Если error_bad_lines равно False, а warn_bad_lines равно True, будет выведено предупреждение для каждой «плохой строки».

low_memory : boolean, по умолчанию True

Внутренне обрабатывает файл частями, что приводит к меньшему использованию памяти во время парсинга, но, возможно, к смешанному определению типов. Чтобы гарантировать отсутствие смешанных типов, установите False или укажите тип с параметром dtype. Обратите внимание, что весь файл все равно читается в один DataFrame. Используйте параметр chunksize или iterator для возвращения данных частями. (Действительно только для C-парсера)

memory_map : boolean, по умолчанию False

Если для filepath_or_buffer предоставлен путь к файлу, отображает объект файла напрямую в памяти и получает доступ к данным непосредственно из него. Использование этого варианта может улучшить производительность, так как теперь нет накладных расходов ввода-вывода.

Возвращает:
result : DataFrame or TextParser

© 2008–2012, AQR Capital Management, LLC, Lambda Foundry, Inc. and PyData Development Team
Licensed under the 3-clause BSD License.
https://pandas.pydata.org/pandas-docs/version/0.23.4/generated/pandas.read_csv.html

Spec-Zone.ru

Настройки Оффлайн Что нового Помощь О нас
Spec-Zone .ru
спецификации, руководства, описания, API