Spec-Zone.ru › pandas 1

pandas.read_html

pandas.read_html(io, match='.+', flavor=None, header=None, index_col=None, skiprows=None, attrs=None, parse_dates=False, thousands=',', encoding=None, decimal='.', converters=None, na_values=None, keep_default_na=True, displayed_only=True, extract_links=None)[source]

Чтение HTML-таблиц в list объектов DataFrame.

Параметры
io:str, path object, or file-like object

Строка, объект пути (реализующий os.PathLike[str]), или объект, подобный файлу, реализующий строковую функцию read(). Строка может представлять URL или сам HTML. Обратите внимание, что lxml принимает только протоколы URL http, ftp и file. Если у вас есть URL, начинающийся с 'https', попробуйте удалить 's'.

match:str or compiled regular expression, optional

Будут возвращены наборы таблиц, содержащие текст, соответствующий этому регулярному выражению или строке. Если HTML не слишком прост, вам, вероятно, потребуется передать здесь непустую строку. По умолчанию «.+» (соответствует любой непустой строке). Значение по умолчанию вернёт все таблицы, содержащиеся на странице. Это значение преобразуется в регулярное выражение, чтобы обеспечить согласованное поведение между Beautiful Soup и lxml.

flavor:str, optional

Движок разбора. ‘bs4’ и ‘html5lib’ синонимичны друг другу, они оба нужны для обратной совместимости. По умолчанию None пытается использовать lxml для разбора, и если это не удаётся, использует bs4 + html5lib.

header:int or list-like, optional

Строка (или список строк для MultiIndex) для создания заголовков столбцов.

index_col:int or list-like, optional

Столбец (или список столбцов) для создания индекса.

skiprows:int, list-like or slice, optional

Количество строк для пропуска после разбора целочисленных столбцов. Нумерация с 0. Если задана последовательность целых чисел или срез, будут пропущены строки, индексированные этой последовательностью. Обратите внимание, что последовательность одного элемента означает «пропустить n-ую строку», а целое число — «пропустить n строк».

attrs:dict, optional

Это словарь атрибутов, которые вы можете передать для идентификации таблицы в HTML. Эти атрибуты проверяются на корректность перед передачей в lxml или Beautiful Soup. Однако эти атрибуты должны быть допустимыми атрибутами HTML-таблицы для правильной работы. Например,

attrs = {'id': 'table'}

является допустимым словарем атрибутов, так как атрибут тега HTML «id» является допустимым атрибутом HTML для любого HTML-тега в соответствии с этим документом.

attrs = {'asdf': 'table'}

не является допустимым словарем атрибутов, так как «asdf» не является допустимым атрибутом HTML, даже если он является допустимым атрибутом XML. Допустимые атрибуты таблицы HTML 4.01 можно найти здесь. Рабочий черновик спецификации HTML 5 можно найти здесь. Он содержит последнюю информацию об атрибутах таблиц для современного веб.

parse_dates:bool, optional

См. read_csv() для получения дополнительной информации.

thousands:str, optional

Разделитель для разбора тысяч. По умолчанию ','.

encoding:str, optional

Кодировка, используемая для декодирования веб-страницы. По умолчанию None.``None`` сохраняет предыдущее поведение кодировки, которое зависит от библиотеки парсера (например, библиотека парсера попытается использовать кодировку, предоставленную документом).

decimal:str, default ‘.’

Символ, распознаваемый как десятичная точка (например, используйте «,» для европейских данных).

converters:dict, default None

Словарь функций для преобразования значений в определённых столбцах. Ключи могут быть целыми числами или метками столбцов, значения — функциями, которые принимают один входной аргумент, содержимое ячейки (а не столбца), и возвращают преобразованное содержимое.

na_values:iterable, default None

Пользовательские значения NA.

keep_default_na:bool, default True

Если na_values указаны и keep_default_na имеет значение False, значения NaN по умолчанию переопределяются, в противном случае они добавляются.

displayed_only:bool, default True

Нужно ли анализировать элементы с «display: none».

extract_links:{None, “all”, “header”, “body”, “footer”}

У элементов таблицы в указанных секциях с тегами <a> будут извлечены href.

Добавлено в версии 1.5.0.

Возвращает
dfs

Список DataFrames.

См. также

read_csv

Чтение файла значений, разделённых запятыми (csv), в DataFrame.

Примечания

Перед использованием этой функции ознакомьтесь с примечаниями о библиотеках разбора HTML.

Ожидайте необходимости выполнить некоторую очистку после вызова этой функции. Например, вам может потребоваться вручную назначить имена столбцов, если имена столбцов преобразуются в NaN при передаче аргумента header=0. Мы стараемся как можно меньше предполагать о структуре таблицы и передаём особенности HTML, содержащегося в таблице, пользователю.

Эта функция ищет элементы <table> и только для строк <tr> и <th> и элементов <td> внутри каждого элемента <tr> или <th> в таблице. <td> означает «данные таблицы». Эта функция пытается правильно обрабатывать атрибуты colspan и rowspan. Если функция имеет аргумент <thead>, он используется для построения заголовка, в противном случае функция пытается найти заголовок внутри тела (путем помещения строк, содержащих только элементы <th> в заголовок).

Подобно read_csv(), аргумент header применяется после применения skiprows.

Эта функция всегда возвращает список DataFrame или завершается ошибкой, например, она не возвращает пустой список.

Примеры

См. документацию read_html в разделе IO документов для некоторых примеров чтения HTML-таблиц.

© 2008–2022, AQR Capital Management, LLC, Lambda Foundry, Inc. and PyData Development Team
Licensed under the 3-clause BSD License.
https://pandas.pydata.org/pandas-docs/version/1.5.0/reference/api/pandas.read_html.html

Spec-Zone.ru

Настройки Оффлайн Что нового Помощь О нас
Spec-Zone .ru
спецификации, руководства, описания, API