Spec-Zone.ru › pandas 0.18

pandas.read_html

pandas.read_html(io, match='.+', flavor=None, header=None, index_col=None, skiprows=None, attrs=None, parse_dates=False, tupleize_cols=False, thousands=', ', encoding=None)

Чтение HTML-таблиц в list из DataFrame объектов.

Параметры:

io : str или file-like

URL, объект file-like или необработанная строка, содержащая HTML. Обратите внимание, что lxml принимает только протоколы URL http, ftp и file. Если у вас есть URL, начинающийся с 'https' , попробуйте удалить 's'.

match : str или скомпилированное регулярное выражение, необязательно

Будут возвращены наборы таблиц, содержащие текст, соответствующий этому регулярному выражению или строке. Если HTML не очень простой, вам, вероятно, нужно будет передать здесь непустую строку. По умолчанию «.+» (соответствует любой непустой строке). Значение по умолчанию вернёт все таблицы, содержащиеся на странице. Это значение преобразуется в регулярное выражение, чтобы обеспечить согласованное поведение между Beautiful Soup и lxml.

flavor : str или None, контейнер строк

Используемый движок анализа. «bs4» и «html5lib» синонимичны друг другу; они оба присутствуют для обратной совместимости. Значение по умолчанию None пытается использовать lxml для анализа, и если это не удаётся, использует bs4 + html5lib.

header : int или список или None, необязательно

Строка (или список строк для MultiIndex) для создания заголовков столбцов.

index_col : int или список или None, необязательно

Столбец (или список столбцов) для создания индекса.

skiprows : int или список или срез или None, необязательно

0-основание. Количество строк, которые нужно пропустить после анализа столбца целого числа. Если задан список целых чисел или срез, пропускаются строки с индексами из этого списка. Обратите внимание, что список с одним элементом означает «пропустить n-ую строку», а целое число — «пропустить n строк».

attrs : dict или None, необязательно

Это словарь атрибутов, которые можно передать для идентификации таблицы в HTML. Эти атрибуты проверяются на корректность перед передачей в lxml или Beautiful Soup. Однако эти атрибуты должны быть допустимыми атрибутами HTML-таблицы для корректной работы. Например,

attrs = {'id': 'table'}

— это допустимый словарь атрибутов, поскольку атрибут тега «id» HTML является допустимым атрибутом HTML для любого тега HTML в соответствии с этим документом.

attrs = {'asdf': 'table'}

— не является допустимым словарем атрибутов, поскольку «asdf» не является допустимым атрибутом HTML, даже если он является допустимым атрибутом XML. Допустимые атрибуты HTML 4.01 для таблиц можно найти здесь. Рабочий черновик спецификации HTML 5 можно найти здесь. Он содержит последнюю информацию об атрибутах таблиц для современного веб-сайта.

parse_dates : bool, необязательно

См. read_csv() для получения дополнительной информации.

tupleize_cols : bool, необязательно

Если False пытаться проанализировать несколько строк заголовков в MultiIndex, иначе вернуть исходные кортежи. Значение по умолчанию False.

thousands : str, необязательно

Разделитель для парсинга тысяч. По умолчанию ','.

encoding : str или None, необязательно

Кодировка, используемая для декодирования веб-страницы. По умолчанию None.``None`` сохраняет предыдущее поведение кодировки, которое зависит от библиотеки базового парсера (например, библиотека парсера попытается использовать кодировку, предоставленную документом).

Возвращает:

dfs : список DataFrames

См. также

pandas.read_csv

Примечания

Перед использованием этой функции следует ознакомиться с подробными сведениями об HTML-библиотеках парсинга.

Ожидайте выполнить некоторую очистку после вызова этой функции. Например, вам может потребоваться вручную назначить имена столбцов, если имена столбцов преобразуются в NaN при передаче header=0 аргумента. Мы стараемся предполагать как можно меньше о структуре таблицы и передавать особенности HTML, содержащиеся в таблице, пользователю.

Эта функция ищет элементы <table> и только строки <tr> и <th> и элементы <td> внутри каждого элемента <tr> или <th> в таблице. <td> обозначает «данные таблицы».

Аналогично read_csv() аргумент header применяется после применения skiprows.

Эта функция всегда вернёт список DataFrame или потерпит неудачу, например, она не вернёт пустой список.

Примеры

См. документацию по read_html в разделе Ввод/вывод (IO) документации для примеров чтения HTML-таблиц.

© 2008–2012, AQR Capital Management, LLC, Lambda Foundry, Inc. and PyData Development Team
Licensed under the 3-clause BSD License.
https://pandas.pydata.org/pandas-docs/version/0.18.1/generated/pandas.read_html.html

Spec-Zone.ru

Настройки Оффлайн Что нового Помощь О нас
Spec-Zone .ru
спецификации, руководства, описания, API