pandas.read_html
-
pandas.read_html(io, match='.+', flavor=None, header=None, index_col=None, skiprows=None, attrs=None, parse_dates=False, tupleize_cols=False, thousands=', ', encoding=None, decimal='.', converters=None, na_values=None, keep_default_na=True)[source] -
Чтение HTML-таблиц в
listизDataFrameобъектов.Параметры: io : str или file-like
URL, file-like объект или сырой строковый HTML-контент. Обратите внимание, что lxml принимает только протоколы http, ftp и file url. Если у вас URL, начинающийся с
'https'вы можете попробовать удалить's'.match : str или скомпилированное регулярное выражение, необязательно
Будут возвращены наборы таблиц, содержащие текст, соответствующий этому регулярному выражению или строке. Если HTML не очень простой, вам, вероятно, нужно будет передать здесь непустую строку. По умолчанию ‘.+’ (соответствует любой непустой строке). Значение по умолчанию вернёт все таблицы, содержащиеся на странице. Это значение преобразуется в регулярное выражение, чтобы обеспечить согласованное поведение между Beautiful Soup и lxml.
flavor : str или None, контейнер строк
Двигатель разбора. ‘bs4’ и ‘html5lib’ являются синонимами друг друга, оба предназначены для обратной совместимости. Значение по умолчанию
Noneпытается использоватьlxmlдля разбора, и если это не удается, то используетbs4+html5lib.header : int или list-like или None, необязательно
Строка (или список строк для
MultiIndex) для создания заголовков столбцов.index_col : int или list-like или None, необязательно
Столбец (или список столбцов) для создания индекса.
skiprows : int или list-like или срез или None, необязательно
Основано на 0. Количество строк для пропуска после разбора целочисленного столбца. Если задана последовательность целых чисел или срез, строки с указанными индексами будут пропущены. Обратите внимание, что последовательность из одного элемента означает «пропустить n-ую строку», в то время как целое число означает «пропустить n строк».
attrs : dict или None, необязательно
Это словарь атрибутов, которые вы можете передать для идентификации таблицы в HTML. Эти атрибуты не проверяются на корректность перед передачей в lxml или Beautiful Soup. Однако эти атрибуты должны быть допустимыми атрибутами HTML-таблиц для правильной работы. Например,
attrs = {'id': 'table'}является допустимым словарем атрибутов, так как атрибут тега ‘id’ HTML является допустимым атрибутом HTML для любого тега HTML в соответствии с этим документом.
attrs = {'asdf': 'table'}не является допустимым словарем атрибутов, так как ‘asdf’ не является допустимым атрибутом HTML, даже если он является допустимым XML-атрибутом. Допустимые атрибуты HTML 4.01 для таблиц можно найти здесь. Рабочий черновик спецификации HTML 5 можно найти здесь. Он содержит последнюю информацию об атрибутах таблиц для современной веб-технологии.
parse_dates : bool, необязательно
См.
read_csv()для получения более подробной информации.tupleize_cols : bool, необязательно
Если
Falseпопытаться разобрать несколько строк заголовков вMultiIndex, в противном случае возвращаются исходные кортежи. По умолчаниюFalse.thousands : str, необязательно
Разделитель для разбора тысяч. По умолчанию
','.encoding : str или None, необязательно
Кодировка, используемая для декодирования веб-страницы. По умолчанию
None.``None`` сохраняет предыдущее поведение кодирования, которое зависит от библиотеки парсера (например, библиотека парсера попытается использовать кодировку, предоставленную документом).decimal : str, по умолчанию ‘.’
Символ, распознаваемый как десятичная точка (например, используйте ‘,’ для европейских данных).
Введено в версии 0.19.0.
converters : dict, по умолчанию None
Словарь функций для преобразования значений в определённых столбцах. Ключи могут быть целыми числами или метками столбцов, значения являются функциями, которые принимают один входной аргумент, содержимое ячейки (не столбца), и возвращают преобразованное содержимое.
Введено в версии 0.19.0.
na_values : итерируемый объект, по умолчанию None
Пользовательские значения NA
Введено в версии 0.19.0.
keep_default_na : bool, по умолчанию True
Если na_values заданы и keep_default_na имеет значение False, значения по умолчанию NaN перезаписываются, в противном случае они добавляются к
Введено в версии 0.19.0.
Возвращает: dfs : список DataFrames
См. также
Примечания
Перед использованием этой функции необходимо прочитать Примечания по библиотекам разбора HTML.
Ожидайте, что после вызова этой функции придётся провести некоторую очистку. Например, возможно, вам нужно будет вручную назначить имена столбцов, если имена столбцов были преобразованы в NaN при передаче
header=0аргумента. Мы стараемся максимально избегать предположений о структуре таблицы и переложить особенности HTML-кода таблицы на пользователя.Эта функция ищет элементы
<table>и только для<tr>и<th>строк и<td>элементов внутри каждого<tr>или<th>элемента в таблице.<td>означает «данные таблицы».Аналогично
read_csv()аргументheaderприменяется после примененияskiprows.Эта функция всегда вернёт список
DataFrameили она завершится ошибкой, например, она не вернёт пустой список.Примеры
См. документацию read_html в разделе Ввода-вывода документации для примеров чтения HTML-таблиц.
© 2008–2012, AQR Capital Management, LLC, Lambda Foundry, Inc. and PyData Development Team
Licensed under the 3-clause BSD License.
https://pandas.pydata.org/pandas-docs/version/0.20.3/generated/pandas.read_html.html