Spec-Zone.ru › pandas 0.23

pandas.read_html

pandas.read_html(io, match='.+', flavor=None, header=None, index_col=None, skiprows=None, attrs=None, parse_dates=False, tupleize_cols=None, thousands=', ', encoding=None, decimal='.', converters=None, na_values=None, keep_default_na=True, displayed_only=True) [source]

Чтение HTML-таблиц в list DataFrame объектов.

Параметры:

io : str или file-like

URL, объект file-like или строка с HTML-кодом. Обратите внимание, что lxml принимает только протоколы URL http, ftp и file. Если у вас есть URL, который начинается с 'https' , попробуйте удалить 's'.

match : str или скомпилированный регулярное выражение, необязательно

Будут возвращены таблицы, содержащие текст, соответствующий этому регулярному выражению или строке. Если HTML не очень простой, вам, вероятно, понадобится передать здесь непустую строку. По умолчанию «.+» (соответствует любой непустой строке). Значение по умолчанию вернёт все таблицы, содержащиеся на странице. Это значение преобразуется в регулярное выражение для обеспечения согласованного поведения между Beautiful Soup и lxml.

flavor : str или None, контейнер строк

Движок парсинга. «bs4» и «html5lib» являются синонимами и существуют для обратной совместимости. По умолчанию None пытается использовать lxml для парсинга, а если это не удается, используется bs4 + html5lib.

header : int или list-like или None, необязательно

Строка (или список строк для MultiIndex) для создания заголовков столбцов.

index_col : int или list-like или None, необязательно

Столбец (или список столбцов) для создания индекса.

skiprows : int или list-like или срез или None, необязательно

Индексируется с 0. Количество строк для пропуска после парсинга столбца целого числа. Если задан список целых чисел или срез, будут пропущены строки с индексами в этом списке. Заметьте, что последовательность с одним элементом означает «пропустить n-ую строку», тогда как целое число означает «пропустить n строк».

attrs : dict или None, необязательно

Это словарь атрибутов, который можно передать для идентификации таблицы в HTML. Эти атрибуты не проверяются на корректность перед передачей в lxml или Beautiful Soup. Однако эти атрибуты должны быть допустимыми атрибутами HTML таблицы для корректной работы. Например,

attrs = {'id': 'table'}

является допустимым словарем атрибутов, потому что атрибут тега «id» HTML является допустимым атрибутом HTML для любого HTML-тега, согласно этому документу.

attrs = {'asdf': 'table'}

является не допустимым словарем атрибутов, потому что «asdf» не является допустимым атрибутом HTML, даже если он является допустимым атрибутом XML. Допустимые атрибуты HTML 4.01 таблицы можно найти здесь. Рабочий черновик спецификации HTML 5 можно найти здесь. Он содержит последнюю информацию об атрибутах таблиц для современного веб-сайта.

parse_dates : bool, необязательно

См. read_csv() для получения дополнительных сведений.

tupleize_cols : bool, необязательно

Если False попытка проанализировать несколько строк заголовков в MultiIndex, иначе возвращаются исходные кортежи. По умолчанию False.

Устарело начиная с версии 0.21.0: Этот аргумент будет удален и всегда будет преобразован в MultiIndex

thousands : str, необязательно

Разделитель для разбора тысяч. По умолчанию ','.

encoding : str или None, необязательно

Кодировка, используемая для декодирования веб-страницы. По умолчанию None.``None`` сохраняет предыдущее поведение кодировки, которое зависит от используемой библиотеки парсера (например, библиотека парсера попытается использовать кодировку, предоставленную документом).

decimal : str, по умолчанию ‘.’

Символ, распознаваемый как десятичная точка (например, используйте ‘,’ для европейских данных).

Новое в версии 0.19.0.

converters : dict, по умолчанию None

Словарь функций для преобразования значений в определенных столбцах. Ключи могут быть целыми числами или метками столбцов, значениями являются функциями, которые принимают один аргумент, содержимое ячейки (не столбца), и возвращают преобразованное содержимое.

Новое в версии 0.19.0.

na_values : iterable, по умолчанию None

Настраиваемые значения NA

Новое в версии 0.19.0.

keep_default_na : bool, по умолчанию True

Если na_values указаны и keep_default_na равен False, значения NaN по умолчанию перезаписываются, в противном случае они добавляются к

Новое в версии 0.19.0.

display_only : bool, по умолчанию True

Включает ли парсинг элементов с "display: none"

Новое в версии 0.23.0.

Возвращает:
dfs : list of DataFrames

См. также

pandas.read_csv

Примечания

Перед использованием этой функции необходимо ознакомиться с подробностями о библиотеках HTML-парсинга.

Ожидайте выполнение некоторой очистки после вызова этой функции. Например, возможно, вам нужно вручную назначить имена столбцов, если имена столбцов преобразуются в NaN при передаче header=0 аргумента. Мы стараемся как можно меньше предполагать о структуре таблицы и переложить особенности HTML, содержащегося в таблице, на пользователя.

Эта функция ищет <table> элементы и только для <tr> и <th> строк и <td> элементы внутри каждого <tr> или <th> элемента в таблице. <td> означает "данные таблицы".

Подобно read_csv() header аргумент применяется после skiprows.

Эта функция всегда вернёт список DataFrame или она завершится ошибкой, например, она не вернёт пустой список.

Примеры

См. документацию по read_html в разделе Ввод-вывод документации для некоторых примеров чтения HTML-таблиц.

© 2008–2012, AQR Capital Management, LLC, Lambda Foundry, Inc. and PyData Development Team
Licensed under the 3-clause BSD License.
https://pandas.pydata.org/pandas-docs/version/0.23.4/generated/pandas.read_html.html

Spec-Zone.ru

Настройки Оффлайн Что нового Помощь О нас
Spec-Zone .ru
спецификации, руководства, описания, API