pandas.read_html
-
pandas.read_html(io, match='.+', flavor=None, header=None, index_col=None, skiprows=None, attrs=None, parse_dates=False, tupleize_cols=None, thousands=', ', encoding=None, decimal='.', converters=None, na_values=None, keep_default_na=True)[source] -
Чтение HTML-таблиц в список
listDataFrameобъектов.Параметры: io : str или file-like
URL, объект file-like или строка, содержащая HTML. Обратите внимание, что lxml принимает только протоколы http, ftp и file url. Если у вас есть URL, начинающийся с
'https', вы можете попробовать удалить's'.match : str или скомпилированное регулярное выражение, необязательно
Будут возвращены наборы таблиц, содержащие текст, соответствующий этому регулярному выражению или строке. Если HTML не слишком прост, вам, вероятно, потребуется передать здесь непустую строку. По умолчанию ‘.+’ (соответствует любой непустой строке). Значение по умолчанию вернет все таблицы, содержащиеся на странице. Это значение преобразуется в регулярное выражение, чтобы обеспечить согласованное поведение между Beautiful Soup и lxml.
flavor : str или None, контейнер строк
Движок для разбора. ‘bs4’ и ‘html5lib’ являются синонимами друг друга, они оба существуют для обратной совместимости. По умолчанию
Noneпытается использоватьlxmlдля разбора, и если это не удается, то переходит кbs4+html5lib.header : int или list-like или None, необязательно
Строка (или список строк для
MultiIndex) для создания заголовков столбцов.index_col : int или list-like или None, необязательно
Столбец (или список столбцов) для создания индекса.
skiprows : int или list-like или slice или None, необязательно
0-основанный. Количество строк для пропуска после разбора целочисленного столбца. Если задана последовательность целых чисел или срез, будут пропущены строки с индексами в этой последовательности. Обратите внимание, что последовательность с одним элементом означает «пропустить n-ую строку», а целое число означает «пропустить n строк».
attrs : dict или None, необязательно
Это словарь атрибутов, который можно передать для идентификации таблицы в HTML. Эти значения не проверяются на допустимость перед передачей в lxml или Beautiful Soup. Однако эти атрибуты должны быть допустимыми атрибутами HTML-таблицы, чтобы работать правильно. Например,
attrs = {'id': 'table'}является допустимым словарем атрибутов, поскольку атрибут тега HTML «id» является допустимым атрибутом HTML для любого тега HTML в соответствии с этим документом.
attrs = {'asdf': 'table'}не является допустимым словарем атрибутов, поскольку «asdf» не является допустимым атрибутом HTML, даже если он является допустимым атрибутом XML. Допустимые атрибуты HTML 4.01 таблицы можно найти здесь. Черновик спецификации HTML 5 можно найти здесь. Он содержит последнюю информацию об атрибутах таблиц для современного веб-сайта.
parse_dates : bool, необязательно
См.
read_csv()для получения дополнительных сведений.tupleize_cols : bool, необязательно
Если
Falseпопытаться разобрать несколько строк заголовков вMultiIndex, иначе вернуть кортежи. По умолчаниюFalse.Устарело начиная с версии 0.21.0: Этот аргумент будет удален и всегда будет преобразован в MultiIndex
thousands : str, необязательно
Разделитель, используемый для разбора тысяч. По умолчанию
','.encoding : str или None, необязательно
Кодировка, используемая для декодирования веб-страницы. По умолчанию
None. ``None`` сохраняет предыдущее поведение кодировки, которое зависит от используемой библиотеки парсера (например, библиотека парсера попытается использовать кодировку, предоставленную документом).decimal : str, по умолчанию ‘.’
Символ, распознаваемый как десятичная точка (например, используйте ‘,’ для европейских данных).
Введено в версии 0.19.0.
converters : dict, по умолчанию None
Словарь функций для преобразования значений в определенных столбцах. Ключи могут быть целыми числами или метками столбцов, значения — функциями, которые принимают один аргумент — содержимое ячейки (не столбца) — и возвращают преобразованное содержимое.
Введено в версии 0.19.0.
na_values : iterable, по умолчанию None
Пользовательские значения NA
Введено в версии 0.19.0.
keep_default_na : bool, по умолчанию True
Если значения na_values заданы, а keep_default_na — False, значения NaN по умолчанию переопределяются, иначе они добавляются к
Введено в версии 0.19.0.
Возвращает: dfs : список DataFrames
См. также
Примечания
Перед использованием этой функции необходимо прочитать примечания о библиотеках разбора HTML.
Ожидайте выполнения некоторой очистки после вызова этой функции. Например, возможно, вам потребуется вручную назначить имена столбцов, если имена столбцов преобразуются в NaN при передаче
header=0аргумента. Мы стараемся максимально исключить предположения о структуре таблицы и передать особенности HTML, содержащегося в таблице, пользователю.Эта функция ищет
<table>элементы и только<tr>и<th>строки и<td>элементы внутри каждого<tr>или<th>элемента в таблице.<td>обозначает «данные таблицы».Аналогично
read_csv()аргументheaderприменяется после примененияskiprows.Эта функция всегда возвращает список
DataFrameили потерпит неудачу, например, она не вернет пустой список.Примеры
См. документацию read_html в разделе «Ввод/вывод» документации для некоторых примеров чтения HTML-таблиц.
© 2008–2012, AQR Capital Management, LLC, Lambda Foundry, Inc. and PyData Development Team
Licensed under the 3-clause BSD License.
https://pandas.pydata.org/pandas-docs/version/0.21.1/generated/pandas.read_html.html