pandas.read_html
-
pandas.read_html(io, match='.+', flavor=None, header=None, index_col=None, skiprows=None, attrs=None, parse_dates=False, tupleize_cols=None, thousands=', ', encoding=None, decimal='.', converters=None, na_values=None, keep_default_na=True, displayed_only=True)[source] -
Чтение HTML-таблиц в
listDataFrameобъектов.Параметры: io : str или file-like
URL, объект file-like или строка с HTML-кодом. Обратите внимание, что lxml принимает только протоколы URL http, ftp и file. Если у вас есть URL, который начинается с
'https', попробуйте удалить's'.match : str или скомпилированный регулярное выражение, необязательно
Будут возвращены таблицы, содержащие текст, соответствующий этому регулярному выражению или строке. Если HTML не очень простой, вам, вероятно, понадобится передать здесь непустую строку. По умолчанию «.+» (соответствует любой непустой строке). Значение по умолчанию вернёт все таблицы, содержащиеся на странице. Это значение преобразуется в регулярное выражение для обеспечения согласованного поведения между Beautiful Soup и lxml.
flavor : str или None, контейнер строк
Движок парсинга. «bs4» и «html5lib» являются синонимами и существуют для обратной совместимости. По умолчанию
Noneпытается использоватьlxmlдля парсинга, а если это не удается, используетсяbs4+html5lib.header : int или list-like или None, необязательно
Строка (или список строк для
MultiIndex) для создания заголовков столбцов.index_col : int или list-like или None, необязательно
Столбец (или список столбцов) для создания индекса.
skiprows : int или list-like или срез или None, необязательно
Индексируется с 0. Количество строк для пропуска после парсинга столбца целого числа. Если задан список целых чисел или срез, будут пропущены строки с индексами в этом списке. Заметьте, что последовательность с одним элементом означает «пропустить n-ую строку», тогда как целое число означает «пропустить n строк».
attrs : dict или None, необязательно
Это словарь атрибутов, который можно передать для идентификации таблицы в HTML. Эти атрибуты не проверяются на корректность перед передачей в lxml или Beautiful Soup. Однако эти атрибуты должны быть допустимыми атрибутами HTML таблицы для корректной работы. Например,
attrs = {'id': 'table'}является допустимым словарем атрибутов, потому что атрибут тега «id» HTML является допустимым атрибутом HTML для любого HTML-тега, согласно этому документу.
attrs = {'asdf': 'table'}является не допустимым словарем атрибутов, потому что «asdf» не является допустимым атрибутом HTML, даже если он является допустимым атрибутом XML. Допустимые атрибуты HTML 4.01 таблицы можно найти здесь. Рабочий черновик спецификации HTML 5 можно найти здесь. Он содержит последнюю информацию об атрибутах таблиц для современного веб-сайта.
parse_dates : bool, необязательно
См.
read_csv()для получения дополнительных сведений.tupleize_cols : bool, необязательно
Если
Falseпопытка проанализировать несколько строк заголовков вMultiIndex, иначе возвращаются исходные кортежи. По умолчаниюFalse.Устарело начиная с версии 0.21.0: Этот аргумент будет удален и всегда будет преобразован в MultiIndex
thousands : str, необязательно
Разделитель для разбора тысяч. По умолчанию
','.encoding : str или None, необязательно
Кодировка, используемая для декодирования веб-страницы. По умолчанию
None.``None`` сохраняет предыдущее поведение кодировки, которое зависит от используемой библиотеки парсера (например, библиотека парсера попытается использовать кодировку, предоставленную документом).decimal : str, по умолчанию ‘.’
Символ, распознаваемый как десятичная точка (например, используйте ‘,’ для европейских данных).
Новое в версии 0.19.0.
converters : dict, по умолчанию None
Словарь функций для преобразования значений в определенных столбцах. Ключи могут быть целыми числами или метками столбцов, значениями являются функциями, которые принимают один аргумент, содержимое ячейки (не столбца), и возвращают преобразованное содержимое.
Новое в версии 0.19.0.
na_values : iterable, по умолчанию None
Настраиваемые значения NA
Новое в версии 0.19.0.
keep_default_na : bool, по умолчанию True
Если na_values указаны и keep_default_na равен False, значения NaN по умолчанию перезаписываются, в противном случае они добавляются к
Новое в версии 0.19.0.
display_only : bool, по умолчанию True
Включает ли парсинг элементов с "display: none"
Новое в версии 0.23.0.
Возвращает: -
dfs : list of DataFrames
См. также
Примечания
Перед использованием этой функции необходимо ознакомиться с подробностями о библиотеках HTML-парсинга.
Ожидайте выполнение некоторой очистки после вызова этой функции. Например, возможно, вам нужно вручную назначить имена столбцов, если имена столбцов преобразуются в NaN при передаче
header=0аргумента. Мы стараемся как можно меньше предполагать о структуре таблицы и переложить особенности HTML, содержащегося в таблице, на пользователя.Эта функция ищет
<table>элементы и только для<tr>и<th>строк и<td>элементы внутри каждого<tr>или<th>элемента в таблице.<td>означает "данные таблицы".Подобно
read_csv()headerаргумент применяется послеskiprows.Эта функция всегда вернёт список
DataFrameили она завершится ошибкой, например, она не вернёт пустой список.Примеры
См. документацию по read_html в разделе Ввод-вывод документации для некоторых примеров чтения HTML-таблиц.
-
© 2008–2012, AQR Capital Management, LLC, Lambda Foundry, Inc. and PyData Development Team
Licensed under the 3-clause BSD License.
https://pandas.pydata.org/pandas-docs/version/0.23.4/generated/pandas.read_html.html