pandas.read_html
-
pandas.read_html(io, match='.+', flavor=None, header=None, index_col=None, skiprows=None, attrs=None, parse_dates=False, thousands=', ', encoding=None, decimal='.', converters=None, na_values=None, keep_default_na=True, displayed_only=True)[source] -
Чтение HTML-таблиц в список объектов
list.Параметры: -
io : str, path object or file-like object -
URL, файл-подобный объект или строка с HTML-кодом. Обратите внимание, что lxml принимает только протоколы URL http, ftp и file. Если у вас есть URL, который начинается с
'https', попробуйте удалить's'. -
match : str or compiled regular expression, optional -
Множество таблиц, содержащих текст, соответствующий этому регулярному выражению или строке, будет возвращено. Если HTML не очень простой, вам, вероятно, потребуется передать здесь непустую строку. По умолчанию «.+» (соответствие любой непустой строке). Значение по умолчанию вернёт все таблицы, содержащиеся на странице. Это значение преобразуется в регулярное выражение, чтобы обеспечить согласованное поведение между Beautiful Soup и lxml.
-
flavor : str or None, container of strings -
Использовать движок разбора. ‘bs4’ и ‘html5lib’ являются синонимами и существуют для обратной совместимости. Значение по умолчанию
Noneпытается использоватьlxmlдля разбора, и если это не удается, то используетсяbs4+html5lib. -
header : int or list-like or None, optional -
Строка (или список строк для
MultiIndex) для создания заголовков столбцов. -
index_col : int or list-like or None, optional -
Столбец (или список столбцов) для создания индекса.
-
skiprows : int or list-like or slice or None, optional -
0-основание. Число строк, пропускаемых после разбора целочисленных столбцов. Если задана последовательность целых чисел или срез, строки, индексированные этой последовательностью, будут пропущены. Обратите внимание, что последовательность из одного элемента означает «пропустить n-ю строку», а целое число означает «пропустить n строк».
-
attrs : dict or None, optional -
Это словарь атрибутов, которые вы можете передать, чтобы идентифицировать таблицу в HTML. Эти атрибуты проверяются на соответствие формату перед передачей в lxml или Beautiful Soup. Однако эти атрибуты должны быть действительными HTML-атрибутами таблицы для правильной работы. Например,
attrs = {'id': 'table'}является допустимым словарем атрибутов, поскольку атрибут тега HTML «id» является допустимым атрибутом HTML для любого тега HTML в соответствии с этим документом.
attrs = {'asdf': 'table'}является не допустимым словарем атрибутов, поскольку «asdf» не является допустимым атрибутом HTML, даже если это допустимый XML-атрибут. Допустимые атрибуты HTML-таблиц 4.01 можно найти здесь. Черновик спецификации HTML 5 можно найти здесь. Он содержит самую последнюю информацию об атрибутах таблиц для современного веб-сайта.
-
parse_dates : bool, optional -
См.
read_csv()для получения дополнительной информации. -
thousands : str, optional -
Разделитель для разбора тысяч. По умолчанию
','. -
encoding : str or None, optional -
Кодировка, используемая для декодирования веб-страницы. По умолчанию
None.``None`` сохраняет предыдущее поведение кодировки, которое зависит от используемой библиотеки парсера (например, библиотека парсера будет пытаться использовать кодировку, предоставленную документом). -
decimal : str, default ‘.’ -
Символ, распознаваемый как десятичная точка (например, используйте «,» для европейских данных).
Введено в версии 0.19.0.
-
converters : dict, default None -
Словарь функций для преобразования значений в определенных столбцах. Ключи могут быть целыми числами или метками столбцов, значения — это функции, которые принимают один входной аргумент — содержимое ячейки (не столбца) — и возвращают преобразованное содержимое.
Введено в версии 0.19.0.
-
na_values : iterable, default None -
Пользовательские значения NA
Введено в версии 0.19.0.
-
keep_default_na : bool, default True -
Если значения na_values заданы, а keep_default_na — False, значения NaN по умолчанию перезаписываются; в противном случае они добавляются к
Введено в версии 0.19.0.
-
displayed_only : bool, default True -
Элементы с «display: none» должны быть обработаны
Введено в версии 0.23.0.
Возвращает: -
dfs : list of DataFrames
См. также
Примечания
Перед использованием этой функции необходимо ознакомиться с подводными камнями библиотек парсинга HTML.
Ожидайте некоторой очистки после вызова этой функции. Например, вам может потребоваться вручную назначить имена столбцов, если имена столбцов преобразуются в NaN при передаче аргумента
header=0. Мы стараемся предположить как можно меньше о структуре таблицы и переложить особенности HTML-кода таблицы на пользователя.Эта функция ищет элементы
<table>и только для строк<tr>и<th>и элементов<td>внутри каждого элемента<tr>или<th>в таблице.<td>обозначает «данные таблицы». Эта функция пытается правильно обработать атрибутыcolspanиrowspan. Если у функции есть аргумент<thead>, он используется для построения заголовка, в противном случае функция пытается найти заголовок внутри тела (поместив строки только с элементами<th>в заголовок).Введено в версии 0.21.0.
Подобно
read_csv(), аргументheaderприменяется после примененияskiprows.Эта функция всегда вернет список
DataFrameили потерпит неудачу, например, она не вернет пустой список.Примеры
См. документацию по read_html в разделе Ввода/вывода документации для некоторых примеров чтения HTML-таблиц.
-
© 2008–2012, AQR Capital Management, LLC, Lambda Foundry, Inc. and PyData Development Team
Licensed under the 3-clause BSD License.
https://pandas.pydata.org/pandas-docs/version/0.25.0/reference/api/pandas.read_html.html