pandas.read_html
-
pandas.read_html(io, match='.+', flavor=None, header=None, index_col=None, skiprows=None, attrs=None, parse_dates=False, tupleize_cols=False, thousands=', ', encoding=None, decimal='.', converters=None, na_values=None, keep_default_na=True)[source] -
Чтение HTML-таблиц в
listизDataFrameобъектов.Параметры: io : str или file-like
URL, файл-подобный объект или строка, содержащая HTML. Обратите внимание, что lxml принимает только протоколы URL http, ftp и file. Если у вас есть URL, начинающийся с
'https', попробуйте удалить's'.match : str или скомпилированное регулярное выражение, необязательно
Будут возвращены наборы таблиц, содержащих текст, соответствующий этому регулярному выражению или строке. За исключением чрезвычайно простых HTML-документов, вам, вероятно, нужно будет передать здесь непустую строку. По умолчанию «.+» (соответствует любой непустой строке). Значение по умолчанию вернёт все таблицы, содержащиеся на странице. Это значение преобразуется в регулярное выражение, чтобы обеспечить согласованное поведение между Beautiful Soup и lxml.
flavor : str или None, контейнер строк
Двигатель разбора. ‘bs4’ и ‘html5lib’ являются синонимами, они оба присутствуют для обратной совместимости. Значение по умолчанию
Noneпытается использоватьlxmlдля разбора, и если это не удаётся, переходит кbs4+html5lib.header : int или list-like или None, необязательно
Строка (или список строк для
MultiIndex) для создания заголовков столбцов.index_col : int или list-like или None, необязательно
Столбец (или список столбцов) для создания индекса.
skiprows : int или list-like или slice или None, необязательно
С индексом 0. Количество строк, которые нужно пропустить после разбора столбца целого числа. Если указана последовательность целых чисел или срез, пропустит строки с указанными индексами. Обратите внимание, что последовательность одного элемента означает «пропустить n-ю строку», а целое число означает «пропустить n строк».
attrs : dict или None, необязательно
Это словарь атрибутов, которые можно передать для идентификации таблицы в HTML. Эти атрибуты не проверяются на корректность перед передачей в lxml или Beautiful Soup. Однако эти атрибуты должны быть допустимыми атрибутами HTML-таблицы для корректной работы. Например,
attrs = {'id': 'table'}является допустимым словарем атрибутов, потому что атрибут тега «id» HTML является допустимым атрибутом HTML для любого HTML-тега в соответствии с этим документом.
attrs = {'asdf': 'table'}является не допустимым словарем атрибутов, потому что «asdf» не является допустимым атрибутом HTML, даже если это допустимый атрибут XML. Допустимые атрибуты HTML 4.01 для таблиц можно найти здесь. Рабочий черновик спецификации HTML 5 можно найти здесь. Он содержит последнюю информацию об атрибутах таблиц для современного веб-сайта.
parse_dates : bool, необязательно
См.
read_csv()для получения дополнительной информации.tupleize_cols : bool, необязательно
Если
Falseпопытаться разобрать несколько строк заголовков вMultiIndex, в противном случае вернуть исходные кортежи. Значение по умолчаниюFalse.thousands : str, необязательно
Разделитель, используемый для разбора тысяч. По умолчанию
','.encoding : str или None, необязательно
Кодировка, используемая для декодирования веб-страницы. По умолчанию
None.``None`` сохраняет предыдущее поведение кодировки, которое зависит от библиотеки разбора (например, библиотека разбора попытается использовать кодировку, предоставленную документом).decimal : str, значение по умолчанию ‘.’
Символ, распознаваемый как десятичная точка (например, используйте ‘,’ для европейских данных).
Добавлена в версии 0.19.0.
converters : dict, значение по умолчанию None
Словарь функций для преобразования значений в определённых столбцах. Ключи могут быть целыми числами или именами столбцов, значения — функциями, которые принимают один входной аргумент — содержимое ячейки (не столбца), и возвращают преобразованное содержимое.
Добавлена в версии 0.19.0.
na_values : iterable, значение по умолчанию None
Пользовательские значения NA
Добавлена в версии 0.19.0.
keep_default_na : bool, значение по умолчанию True
Если значения na_values указаны, и keep_default_na равно False, значения NaN по умолчанию переопределяются, в противном случае они добавляются к
Добавлена в версии 0.19.0.
Возвращает: dfs : список DataFrames
См. также
Примечания
Перед использованием этой функции прочитайте Примечания по HTML-библиотекам разбора.
Ожидайте необходимость некоторой обработки после вызова этой функции. Например, возможно, вам потребуется вручную назначить имена столбцов, если имена столбцов преобразуются в NaN при передаче
header=0аргумента. Мы стараемся предположить как можно меньше о структуре таблицы и передать особенности HTML, содержащегося в таблице, пользователю.Эта функция ищет элементы
<table>и только<tr>и<th>строки и<td>элементы внутри каждого<tr>или<th>элемента в таблице.<td>означает «данные таблицы».Аналогично
read_csv(),headerаргумент применяется послеskiprows.Эта функция всегда вернёт список
DataFrameили провалится, например, она не вернёт пустой список.Примеры
См. документацию по read_html в разделе IO документации для примеров чтения HTML-таблиц.
© 2008–2012, AQR Capital Management, LLC, Lambda Foundry, Inc. and PyData Development Team
Licensed under the 3-clause BSD License.
https://pandas.pydata.org/pandas-docs/version/0.19.2/generated/pandas.read_html.html