Spec-Zone.ru › pandas 0.23

pandas.read_excel

pandas.read_excel(io, sheet_name=0, header=0, names=None, index_col=None, usecols=None, squeeze=False, dtype=None, engine=None, converters=None, true_values=None, false_values=None, skiprows=None, nrows=None, na_values=None, parse_dates=False, date_parser=None, thousands=None, comment=None, skipfooter=0, convert_float=True, **kwds) [source]

Чтение таблицы Excel в pandas DataFrame

Параметры:

io : строка, объект пути (pathlib.Path или py._path.local.LocalPath),

объект типа «поток данных», pandas ExcelFile или рабочая книга xlrd. Строка может быть URL-адресом. Допустимые схемы URL включают http, ftp, s3 и file. Для URL-адресов файлов ожидается хост. Например, локальный файл может быть file://localhost/path/to/workbook.xlsx

sheet_name : строка, целое число, смешанный список строк/целых чисел или None, по умолчанию 0

Строки используются для имен листов, целые числа — для нумерации листов (с нулевым индексом).

Списки строк/целых чисел используются для запроса нескольких листов.

Укажите None, чтобы получить все листы.

str|int -> возвращается DataFrame. list|None -> возвращается словарь DataFrame, с ключами, представляющими листы.

Доступные варианты

  • По умолчанию 0 -> 1-й лист в виде DataFrame
  • 1 -> 2-й лист в виде DataFrame
  • “Sheet1” -> 1-й лист в виде DataFrame
  • [0,1,”Sheet5”] -> 1-й, 2-й и 5-й листы в виде словаря DataFrame
  • None -> все листы в виде словаря DataFrame

sheetname : строка, целое число, смешанный список строк/целых чисел или None, по умолчанию 0

Устарело начиная с версии 0.21.0: Используйте sheet_name вместо этого.

header : целое число, список целых чисел, по умолчанию 0

Строка (с нулевым индексом) для использования в качестве меток столбцов анализируемого DataFrame. Если передан список целых чисел, эти позиции строк будут объединены в MultiIndex. Используйте None, если нет заголовка.

names : массив-подобный объект, по умолчанию None

Список имен столбцов для использования. Если файл не содержит строки заголовка, необходимо явно указать header=None

index_col : целое число, список целых чисел, по умолчанию None

Столбец (с нулевым индексом) для использования в качестве меток строк DataFrame. Передайте None, если такого столбца нет. Если передан список, эти столбцы будут объединены в MultiIndex. Если выбран подмножество данных с usecols, index_col основывается на подмножестве.

parse_cols : целое число или список, по умолчанию None

Устарело начиная с версии 0.21.0: Передайте usecols вместо этого.

usecols : целое число или список, по умолчанию None

  • Если None, анализируются все столбцы,
  • Если целое число, указывает последний столбец для анализа,
  • Если список целых чисел, указывает список номеров столбцов для анализа,
  • Если строка, указывает список столбцов (через запятую) буквенных обозначений Excel и диапазонов столбцов (например, “A:E” или “A,C,E:F”). Диапазоны включают оба крайних значения.

squeeze : логическое значение, по умолчанию False

Если анализируемые данные содержат только один столбец, возвращается Series

dtype : Имя типа или словарь столбец -> тип, по умолчанию None

Тип данных для данных или столбцов. Например, {‘a’: np.float64, ‘b’: np.int32}. Используйте object для сохранения данных в том виде, в котором они хранятся в Excel, а не для интерпретации типа данных. Если указаны converters, они будут применены ВМЕСТО преобразования типа данных.

Добавлена в версии 0.20.0.

engine: строка, по умолчанию None

Если io не буфер или путь, это необходимо для идентификации io. Допустимые значения — None или xlrd

converters : словарь, по умолчанию None

Словарь функций для преобразования значений в определенных столбцах. Ключи могут быть целыми числами или метками столбцов, значения — функциями, которые принимают один аргумент — содержимое ячейки Excel — и возвращают преобразованное содержимое.

true_values : список, по умолчанию None

Значения, которые рассматриваются как True

Добавлена в версии 0.19.0.

false_values : список, по умолчанию None

Значения, которые рассматриваются как False

Добавлена в версии 0.19.0.

skiprows : список-подобный объект

Строки, которые нужно пропустить в начале (с нулевым индексом)

nrows : целое число, по умолчанию None

Количество строк для анализа

Добавлена в версии 0.23.0.

na_values : скаляр, строка, список-подобный объект или словарь, по умолчанию None

Дополнительные строки, распознаваемые как NA/NaN. Если передан словарь, специфичные значения NA для каждого столбца. По умолчанию следующие значения интерпретируются как NaN: ‘’, ‘#N/A’, ‘#N/A N/A’, ‘#NA’, ‘-1.#IND’, ‘-1.#QNAN’, ‘-NaN’, ‘-nan’, ‘1.#IND’, ‘1.#QNAN’, ‘N/A’, ‘NA’, ‘NULL’, ‘NaN’, ‘n/a’, ‘nan’, ‘null’.

keep_default_na : булево значение, по умолчанию True

Если указаны na_values и keep_default_na имеет значение False, значения NaN по умолчанию переопределяются, в противном случае они добавляются.

verbose : булево значение, по умолчанию False

Указывает количество значений NA, размещенных в нечисловых столбцах

thousands : строка, по умолчанию None

Разделитель тысяч для анализа столбцов в формате строк в числовой формат. Обратите внимание, что этот параметр необходим только для столбцов, хранящихся в Excel как TEXT, любые числовые столбцы будут автоматически анализироваться независимо от формата отображения.

comment : строка, по умолчанию None

Комментарии к остальной части строки. Передайте символ или символы этому аргументу для указания комментариев в входном файле. Любые данные между строкой комментария и концом текущей строки игнорируются.

skip_footer : целое число, по умолчанию 0

Устарело начиная с версии 0.23.0: Передайте skipfooter вместо этого.

skipfooter : целое число, по умолчанию 0

Строки в конце, которые нужно пропустить (с нулевым индексом)

convert_float : булево значение, по умолчанию True

Преобразовать целочисленные числа с плавающей точкой в целые числа (например, 1,0 -> 1). Если False, все числовые данные будут читаться как числа с плавающей точкой: Excel хранит все числа как числа с плавающей точкой внутри.

Возвращает:

parsed : DataFrame или словарь DataFrame

DataFrame из переданного файла Excel. См. примечания к аргументу sheet_name для получения дополнительной информации о том, когда возвращается словарь DataFrame.

Примеры

Пример DataFrame, записанный в локальный файл

>>> df_out = pd.DataFrame([('string1', 1),
...                        ('string2', 2),
...                        ('string3', 3)],
...                       columns=['Name', 'Value'])
>>> df_out
      Name  Value
0  string1      1
1  string2      2
2  string3      3
>>> df_out.to_excel('tmp.xlsx')

Файл можно прочитать, используя имя файла как строку или открытый объект файла:

>>> pd.read_excel('tmp.xlsx')
      Name  Value
0  string1      1
1  string2      2
2  string3      3
>>> pd.read_excel(open('tmp.xlsx','rb'))
      Name  Value
0  string1      1
1  string2      2
2  string3      3

Индекс и заголовок можно указать с помощью аргументов index_col и header

>>> pd.read_excel('tmp.xlsx', index_col=None, header=None)
     0        1      2
0  NaN     Name  Value
1  0.0  string1      1
2  1.0  string2      2
3  2.0  string3      3

Типы столбцов определяются автоматически, но могут быть явно указаны

>>> pd.read_excel('tmp.xlsx', dtype={'Name':str, 'Value':float})
      Name  Value
0  string1    1.0
1  string2    2.0
2  string3    3.0

Значения True, False и NA, а также разделители тысяч имеют значения по умолчанию, но могут быть явно указаны. Укажите значения, которые вы хотите, как строки или списки строк!

>>> pd.read_excel('tmp.xlsx',
...               na_values=['string1', 'string2'])
      Name  Value
0      NaN      1
1      NaN      2
2  string3      3

Строки комментариев во входном файле Excel могут быть пропущены с помощью аргумента comment

>>> df = pd.DataFrame({'a': ['1', '#2'], 'b': ['2', '3']})
>>> df.to_excel('tmp.xlsx', index=False)
>>> pd.read_excel('tmp.xlsx')
    a  b
0   1  2
1  #2  3
>>> pd.read_excel('tmp.xlsx', comment='#')
   a  b
0  1  2

© 2008–2012, AQR Capital Management, LLC, Lambda Foundry, Inc. and PyData Development Team
Licensed under the 3-clause BSD License.
https://pandas.pydata.org/pandas-docs/version/0.23.4/generated/pandas.read_excel.html

Spec-Zone.ru

Настройки Оффлайн Что нового Помощь О нас
Spec-Zone .ru
спецификации, руководства, описания, API