pandas.read_html
-
pandas.read_html(io, match='.+', flavor=None, header=None, index_col=None, skiprows=None, attrs=None, parse_dates=False, tupleize_cols=None, thousands=', ', encoding=None, decimal='.', converters=None, na_values=None, keep_default_na=True, displayed_only=True)[source] -
Чтение HTML-таблиц в список
listобъектовDataFrame.Параметры: -
io : str or file-like -
URL, объект типа файла или строка, содержащая HTML. Обратите внимание, что lxml принимает только протоколы URL http, ftp и file. Если у вас есть URL, начинающийся с
'https', попробуйте удалить's'. -
match : str or compiled regular expression, optional -
Множество таблиц, содержащих текст, соответствующий этому регулярному выражению или строке, будут возвращены. Если HTML не очень простой, вам, вероятно, понадобится передать здесь непустую строку. По умолчанию «.+» (соответствует любой непустой строке). Значение по умолчанию вернёт все таблицы, содержащиеся на странице. Это значение преобразуется в регулярное выражение, чтобы обеспечить согласованное поведение между Beautiful Soup и lxml.
-
flavor : str or None, container of strings -
Двигатель разбора. ‘bs4’ и ‘html5lib’ являются синонимами, они оба существуют для обратной совместимости. По умолчанию
Noneпытается использоватьlxmlдля разбора, и если это не удаётся, используетbs4+html5lib. -
header : int or list-like or None, optional -
Строка (или список строк для
MultiIndex) для создания заголовков столбцов. -
index_col : int or list-like or None, optional -
Столбец (или список столбцов) для создания индекса.
-
skiprows : int or list-like or slice or None, optional -
С нулевой базой. Количество строк, которые нужно пропустить после разбора целочисленных столбцов. Если указана последовательность целых чисел или срез, строки с индексом, указанным в этой последовательности, будут пропущены. Обратите внимание, что последовательность из одного элемента означает «пропустить n-ую строку», а целое число означает «пропустить n строк».
-
attrs : dict or None, optional -
Это словарь атрибутов, которые можно передать, чтобы идентифицировать таблицу в HTML. Эти атрибуты не проверяются на валидность перед передачей в lxml или Beautiful Soup. Однако эти атрибуты должны быть действительными атрибутами HTML-таблиц для корректной работы. Например,
attrs = {'id': 'table'}является допустимым словарем атрибутов, поскольку атрибут тега HTML «id» является допустимым атрибутом HTML для любого тега HTML в соответствии с этим документом.
attrs = {'asdf': 'table'}не является допустимым словарем атрибутов, поскольку «asdf» не является допустимым атрибутом HTML, даже если это допустимый атрибут XML. Действительные атрибуты таблицы HTML 4.01 можно найти здесь. Рабочий черновик спецификации HTML 5 можно найти здесь. Он содержит последнюю информацию об атрибутах таблиц для современной сети.
-
parse_dates : bool, optional -
См.
read_csv()для получения дополнительной информации. -
tupleize_cols : bool, optional -
Если
Falseпытаются разобрать несколько строк заголовков вMultiIndex, иначе возвращает исходные кортежи. По умолчаниюFalse.Устарело начиная с версии 0.21.0: Этот аргумент будет удалён и всегда будет преобразован в MultiIndex
-
thousands : str, optional -
Разделитель для разбора тысяч. По умолчанию
','. -
encoding : str or None, optional -
Кодировка, используемая для декодирования веб-страницы. По умолчанию
None. ``None`` сохраняет предыдущее поведение кодировки, которое зависит от используемой библиотеки парсера (например, библиотека парсера попытается использовать кодировку, предоставленную документом). -
decimal : str, default ‘.’ -
Символ, распознаваемый как десятичная точка (например, используйте «,» для европейских данных).
Введено в версии 0.19.0.
-
converters : dict, default None -
Словарь функций для преобразования значений в определённых столбцах. Ключи могут быть целыми числами или метками столбцов, значения — функциями, принимающими один аргумент — содержимое ячейки (не столбца) — и возвращающими преобразованное содержимое.
Введено в версии 0.19.0.
-
na_values : iterable, default None -
Пользовательские значения NaN
Введено в версии 0.19.0.
-
keep_default_na : bool, default True -
Если значения na_values указаны и keep_default_na = False, значения NaN по умолчанию переопределяются, иначе они добавляются к
Введено в версии 0.19.0.
-
displayed_only : bool, default True -
Нужно ли парсить элементы с «display: none»
Введено в версии 0.23.0.
Возвращает: -
dfs : list of DataFrames
См. также
Примечания
Перед использованием этой функции следует прочитать примечания о библиотеках разбора HTML.
Ожидайте выполнения некоторой очистки после вызова этой функции. Например, возможно, вам придётся вручную назначить имена столбцов, если имена столбцов преобразуются в NaN при передаче аргумента
header=0. Мы пытаемся предположить как можно меньше о структуре таблицы и переложить особенности HTML, содержащегося в таблице, на пользователя.Эта функция ищет элементы
<table>и только<tr>и<th>строк и<td>элементы внутри каждого<tr>или<th>элемента в таблице.<td>означает «данные таблицы». Эта функция пытается правильно обработать атрибутыcolspanиrowspan. Если у функции есть аргумент<thead>, он используется для построения заголовка, в противном случае функция пытается найти заголовок в теле (путем помещения строк, содержащих только<th>элементы, в заголовок).Введено в версии 0.21.0.
Подобно
read_csv(), аргументheaderприменяется после примененияskiprows.Эта функция всегда возвращает список
DataFrameили она терпит неудачу, например, она не возвращает пустой список.Примеры
См. документацию read_html в разделе IO документации для некоторых примеров чтения HTML-таблиц.
-
© 2008–2012, AQR Capital Management, LLC, Lambda Foundry, Inc. and PyData Development Team
Licensed under the 3-clause BSD License.
https://pandas.pydata.org/pandas-docs/version/0.24.2/reference/api/pandas.read_html.html