pandas.read_excel
-
pandas.read_excel(io, sheet_name=0, header=0, names=None, index_col=None, usecols=None, squeeze=False, dtype=None, engine=None, converters=None, true_values=None, false_values=None, skiprows=None, nrows=None, na_values=None, parse_dates=False, date_parser=None, thousands=None, comment=None, skipfooter=0, convert_float=True, **kwds)[source] -
Чтение таблицы Excel в pandas DataFrame
Параметры: io : строка, объект пути (pathlib.Path или py._path.local.LocalPath),
объект типа «поток данных», pandas ExcelFile или рабочая книга xlrd. Строка может быть URL-адресом. Допустимые схемы URL включают http, ftp, s3 и file. Для URL-адресов файлов ожидается хост. Например, локальный файл может быть file://localhost/path/to/workbook.xlsx
sheet_name : строка, целое число, смешанный список строк/целых чисел или None, по умолчанию 0
Строки используются для имен листов, целые числа — для нумерации листов (с нулевым индексом).
Списки строк/целых чисел используются для запроса нескольких листов.
Укажите None, чтобы получить все листы.
str|int -> возвращается DataFrame. list|None -> возвращается словарь DataFrame, с ключами, представляющими листы.
Доступные варианты
- По умолчанию 0 -> 1-й лист в виде DataFrame
- 1 -> 2-й лист в виде DataFrame
- “Sheet1” -> 1-й лист в виде DataFrame
- [0,1,”Sheet5”] -> 1-й, 2-й и 5-й листы в виде словаря DataFrame
- None -> все листы в виде словаря DataFrame
sheetname : строка, целое число, смешанный список строк/целых чисел или None, по умолчанию 0
Устарело начиная с версии 0.21.0: Используйте
sheet_nameвместо этого.header : целое число, список целых чисел, по умолчанию 0
Строка (с нулевым индексом) для использования в качестве меток столбцов анализируемого DataFrame. Если передан список целых чисел, эти позиции строк будут объединены в
MultiIndex. Используйте None, если нет заголовка.names : массив-подобный объект, по умолчанию None
Список имен столбцов для использования. Если файл не содержит строки заголовка, необходимо явно указать header=None
index_col : целое число, список целых чисел, по умолчанию None
Столбец (с нулевым индексом) для использования в качестве меток строк DataFrame. Передайте None, если такого столбца нет. Если передан список, эти столбцы будут объединены в
MultiIndex. Если выбран подмножество данных сusecols, index_col основывается на подмножестве.parse_cols : целое число или список, по умолчанию None
Устарело начиная с версии 0.21.0: Передайте
usecolsвместо этого.usecols : целое число или список, по умолчанию None
- Если None, анализируются все столбцы,
- Если целое число, указывает последний столбец для анализа,
- Если список целых чисел, указывает список номеров столбцов для анализа,
- Если строка, указывает список столбцов (через запятую) буквенных обозначений Excel и диапазонов столбцов (например, “A:E” или “A,C,E:F”). Диапазоны включают оба крайних значения.
squeeze : логическое значение, по умолчанию False
Если анализируемые данные содержат только один столбец, возвращается Series
dtype : Имя типа или словарь столбец -> тип, по умолчанию None
Тип данных для данных или столбцов. Например, {‘a’: np.float64, ‘b’: np.int32}. Используйте
objectдля сохранения данных в том виде, в котором они хранятся в Excel, а не для интерпретации типа данных. Если указаны converters, они будут применены ВМЕСТО преобразования типа данных.Добавлена в версии 0.20.0.
engine: строка, по умолчанию None
Если io не буфер или путь, это необходимо для идентификации io. Допустимые значения — None или xlrd
converters : словарь, по умолчанию None
Словарь функций для преобразования значений в определенных столбцах. Ключи могут быть целыми числами или метками столбцов, значения — функциями, которые принимают один аргумент — содержимое ячейки Excel — и возвращают преобразованное содержимое.
true_values : список, по умолчанию None
Значения, которые рассматриваются как True
Добавлена в версии 0.19.0.
false_values : список, по умолчанию None
Значения, которые рассматриваются как False
Добавлена в версии 0.19.0.
skiprows : список-подобный объект
Строки, которые нужно пропустить в начале (с нулевым индексом)
nrows : целое число, по умолчанию None
Количество строк для анализа
Добавлена в версии 0.23.0.
na_values : скаляр, строка, список-подобный объект или словарь, по умолчанию None
Дополнительные строки, распознаваемые как NA/NaN. Если передан словарь, специфичные значения NA для каждого столбца. По умолчанию следующие значения интерпретируются как NaN: ‘’, ‘#N/A’, ‘#N/A N/A’, ‘#NA’, ‘-1.#IND’, ‘-1.#QNAN’, ‘-NaN’, ‘-nan’, ‘1.#IND’, ‘1.#QNAN’, ‘N/A’, ‘NA’, ‘NULL’, ‘NaN’, ‘n/a’, ‘nan’, ‘null’.
keep_default_na : булево значение, по умолчанию True
Если указаны na_values и keep_default_na имеет значение False, значения NaN по умолчанию переопределяются, в противном случае они добавляются.
verbose : булево значение, по умолчанию False
Указывает количество значений NA, размещенных в нечисловых столбцах
thousands : строка, по умолчанию None
Разделитель тысяч для анализа столбцов в формате строк в числовой формат. Обратите внимание, что этот параметр необходим только для столбцов, хранящихся в Excel как TEXT, любые числовые столбцы будут автоматически анализироваться независимо от формата отображения.
comment : строка, по умолчанию None
Комментарии к остальной части строки. Передайте символ или символы этому аргументу для указания комментариев в входном файле. Любые данные между строкой комментария и концом текущей строки игнорируются.
skip_footer : целое число, по умолчанию 0
Устарело начиная с версии 0.23.0: Передайте
skipfooterвместо этого.skipfooter : целое число, по умолчанию 0
Строки в конце, которые нужно пропустить (с нулевым индексом)
convert_float : булево значение, по умолчанию True
Преобразовать целочисленные числа с плавающей точкой в целые числа (например, 1,0 -> 1). Если False, все числовые данные будут читаться как числа с плавающей точкой: Excel хранит все числа как числа с плавающей точкой внутри.
Возвращает: parsed : DataFrame или словарь DataFrame
DataFrame из переданного файла Excel. См. примечания к аргументу sheet_name для получения дополнительной информации о том, когда возвращается словарь DataFrame.
Примеры
Пример DataFrame, записанный в локальный файл
>>> df_out = pd.DataFrame([('string1', 1), ... ('string2', 2), ... ('string3', 3)], ... columns=['Name', 'Value']) >>> df_out Name Value 0 string1 1 1 string2 2 2 string3 3 >>> df_out.to_excel('tmp.xlsx')Файл можно прочитать, используя имя файла как строку или открытый объект файла:
>>> pd.read_excel('tmp.xlsx') Name Value 0 string1 1 1 string2 2 2 string3 3>>> pd.read_excel(open('tmp.xlsx','rb')) Name Value 0 string1 1 1 string2 2 2 string3 3Индекс и заголовок можно указать с помощью аргументов
index_colиheader>>> pd.read_excel('tmp.xlsx', index_col=None, header=None) 0 1 2 0 NaN Name Value 1 0.0 string1 1 2 1.0 string2 2 3 2.0 string3 3Типы столбцов определяются автоматически, но могут быть явно указаны
>>> pd.read_excel('tmp.xlsx', dtype={'Name':str, 'Value':float}) Name Value 0 string1 1.0 1 string2 2.0 2 string3 3.0Значения True, False и NA, а также разделители тысяч имеют значения по умолчанию, но могут быть явно указаны. Укажите значения, которые вы хотите, как строки или списки строк!
>>> pd.read_excel('tmp.xlsx', ... na_values=['string1', 'string2']) Name Value 0 NaN 1 1 NaN 2 2 string3 3Строки комментариев во входном файле Excel могут быть пропущены с помощью аргумента
comment>>> df = pd.DataFrame({'a': ['1', '#2'], 'b': ['2', '3']}) >>> df.to_excel('tmp.xlsx', index=False) >>> pd.read_excel('tmp.xlsx') a b 0 1 2 1 #2 3>>> pd.read_excel('tmp.xlsx', comment='#') a b 0 1 2
© 2008–2012, AQR Capital Management, LLC, Lambda Foundry, Inc. and PyData Development Team
Licensed under the 3-clause BSD License.
https://pandas.pydata.org/pandas-docs/version/0.23.4/generated/pandas.read_excel.html