Spec-Zone.ru › pandas 0.25

pandas.read_html

pandas.read_html(io, match='.+', flavor=None, header=None, index_col=None, skiprows=None, attrs=None, parse_dates=False, thousands=', ', encoding=None, decimal='.', converters=None, na_values=None, keep_default_na=True, displayed_only=True) [source]

Чтение HTML-таблиц в список объектов list.

Параметры:
io : str, path object or file-like object

URL, файл-подобный объект или строка с HTML-кодом. Обратите внимание, что lxml принимает только протоколы URL http, ftp и file. Если у вас есть URL, который начинается с 'https', попробуйте удалить 's'.

match : str or compiled regular expression, optional

Множество таблиц, содержащих текст, соответствующий этому регулярному выражению или строке, будет возвращено. Если HTML не очень простой, вам, вероятно, потребуется передать здесь непустую строку. По умолчанию «.+» (соответствие любой непустой строке). Значение по умолчанию вернёт все таблицы, содержащиеся на странице. Это значение преобразуется в регулярное выражение, чтобы обеспечить согласованное поведение между Beautiful Soup и lxml.

flavor : str or None, container of strings

Использовать движок разбора. ‘bs4’ и ‘html5lib’ являются синонимами и существуют для обратной совместимости. Значение по умолчанию None пытается использовать lxml для разбора, и если это не удается, то используется bs4 + html5lib.

header : int or list-like or None, optional

Строка (или список строк для MultiIndex) для создания заголовков столбцов.

index_col : int or list-like or None, optional

Столбец (или список столбцов) для создания индекса.

skiprows : int or list-like or slice or None, optional

0-основание. Число строк, пропускаемых после разбора целочисленных столбцов. Если задана последовательность целых чисел или срез, строки, индексированные этой последовательностью, будут пропущены. Обратите внимание, что последовательность из одного элемента означает «пропустить n-ю строку», а целое число означает «пропустить n строк».

attrs : dict or None, optional

Это словарь атрибутов, которые вы можете передать, чтобы идентифицировать таблицу в HTML. Эти атрибуты проверяются на соответствие формату перед передачей в lxml или Beautiful Soup. Однако эти атрибуты должны быть действительными HTML-атрибутами таблицы для правильной работы. Например,

attrs = {'id': 'table'}

является допустимым словарем атрибутов, поскольку атрибут тега HTML «id» является допустимым атрибутом HTML для любого тега HTML в соответствии с этим документом.

attrs = {'asdf': 'table'}

является не допустимым словарем атрибутов, поскольку «asdf» не является допустимым атрибутом HTML, даже если это допустимый XML-атрибут. Допустимые атрибуты HTML-таблиц 4.01 можно найти здесь. Черновик спецификации HTML 5 можно найти здесь. Он содержит самую последнюю информацию об атрибутах таблиц для современного веб-сайта.

parse_dates : bool, optional

См. read_csv() для получения дополнительной информации.

thousands : str, optional

Разделитель для разбора тысяч. По умолчанию ','.

encoding : str or None, optional

Кодировка, используемая для декодирования веб-страницы. По умолчанию None.``None`` сохраняет предыдущее поведение кодировки, которое зависит от используемой библиотеки парсера (например, библиотека парсера будет пытаться использовать кодировку, предоставленную документом).

decimal : str, default ‘.’

Символ, распознаваемый как десятичная точка (например, используйте «,» для европейских данных).

Введено в версии 0.19.0.

converters : dict, default None

Словарь функций для преобразования значений в определенных столбцах. Ключи могут быть целыми числами или метками столбцов, значения — это функции, которые принимают один входной аргумент — содержимое ячейки (не столбца) — и возвращают преобразованное содержимое.

Введено в версии 0.19.0.

na_values : iterable, default None

Пользовательские значения NA

Введено в версии 0.19.0.

keep_default_na : bool, default True

Если значения na_values заданы, а keep_default_na — False, значения NaN по умолчанию перезаписываются; в противном случае они добавляются к

Введено в версии 0.19.0.

displayed_only : bool, default True

Элементы с «display: none» должны быть обработаны

Введено в версии 0.23.0.

Возвращает:
dfs : list of DataFrames

См. также

read_csv

Примечания

Перед использованием этой функции необходимо ознакомиться с подводными камнями библиотек парсинга HTML.

Ожидайте некоторой очистки после вызова этой функции. Например, вам может потребоваться вручную назначить имена столбцов, если имена столбцов преобразуются в NaN при передаче аргумента header=0. Мы стараемся предположить как можно меньше о структуре таблицы и переложить особенности HTML-кода таблицы на пользователя.

Эта функция ищет элементы <table> и только для строк <tr> и <th> и элементов <td> внутри каждого элемента <tr> или <th> в таблице. <td> обозначает «данные таблицы». Эта функция пытается правильно обработать атрибуты colspan и rowspan. Если у функции есть аргумент <thead>, он используется для построения заголовка, в противном случае функция пытается найти заголовок внутри тела (поместив строки только с элементами <th> в заголовок).

Введено в версии 0.21.0.

Подобно read_csv(), аргумент header применяется после применения skiprows.

Эта функция всегда вернет список DataFrame или потерпит неудачу, например, она не вернет пустой список.

Примеры

См. документацию по read_html в разделе Ввода/вывода документации для некоторых примеров чтения HTML-таблиц.

© 2008–2012, AQR Capital Management, LLC, Lambda Foundry, Inc. and PyData Development Team
Licensed under the 3-clause BSD License.
https://pandas.pydata.org/pandas-docs/version/0.25.0/reference/api/pandas.read_html.html

Spec-Zone.ru

Настройки Оффлайн Что нового Помощь О нас
Spec-Zone .ru
спецификации, руководства, описания, API