Spec-Zone.ru › pandas 0.20

pandas.read_html

pandas.read_html(io, match='.+', flavor=None, header=None, index_col=None, skiprows=None, attrs=None, parse_dates=False, tupleize_cols=False, thousands=', ', encoding=None, decimal='.', converters=None, na_values=None, keep_default_na=True) [source]

Чтение HTML-таблиц в list из DataFrame объектов.

Параметры:

io : str или file-like

URL, file-like объект или сырой строковый HTML-контент. Обратите внимание, что lxml принимает только протоколы http, ftp и file url. Если у вас URL, начинающийся с 'https' вы можете попробовать удалить 's'.

match : str или скомпилированное регулярное выражение, необязательно

Будут возвращены наборы таблиц, содержащие текст, соответствующий этому регулярному выражению или строке. Если HTML не очень простой, вам, вероятно, нужно будет передать здесь непустую строку. По умолчанию ‘.+’ (соответствует любой непустой строке). Значение по умолчанию вернёт все таблицы, содержащиеся на странице. Это значение преобразуется в регулярное выражение, чтобы обеспечить согласованное поведение между Beautiful Soup и lxml.

flavor : str или None, контейнер строк

Двигатель разбора. ‘bs4’ и ‘html5lib’ являются синонимами друг друга, оба предназначены для обратной совместимости. Значение по умолчанию None пытается использовать lxml для разбора, и если это не удается, то использует bs4 + html5lib.

header : int или list-like или None, необязательно

Строка (или список строк для MultiIndex) для создания заголовков столбцов.

index_col : int или list-like или None, необязательно

Столбец (или список столбцов) для создания индекса.

skiprows : int или list-like или срез или None, необязательно

Основано на 0. Количество строк для пропуска после разбора целочисленного столбца. Если задана последовательность целых чисел или срез, строки с указанными индексами будут пропущены. Обратите внимание, что последовательность из одного элемента означает «пропустить n-ую строку», в то время как целое число означает «пропустить n строк».

attrs : dict или None, необязательно

Это словарь атрибутов, которые вы можете передать для идентификации таблицы в HTML. Эти атрибуты не проверяются на корректность перед передачей в lxml или Beautiful Soup. Однако эти атрибуты должны быть допустимыми атрибутами HTML-таблиц для правильной работы. Например,

attrs = {'id': 'table'}

является допустимым словарем атрибутов, так как атрибут тега ‘id’ HTML является допустимым атрибутом HTML для любого тега HTML в соответствии с этим документом.

attrs = {'asdf': 'table'}

не является допустимым словарем атрибутов, так как ‘asdf’ не является допустимым атрибутом HTML, даже если он является допустимым XML-атрибутом. Допустимые атрибуты HTML 4.01 для таблиц можно найти здесь. Рабочий черновик спецификации HTML 5 можно найти здесь. Он содержит последнюю информацию об атрибутах таблиц для современной веб-технологии.

parse_dates : bool, необязательно

См. read_csv() для получения более подробной информации.

tupleize_cols : bool, необязательно

Если False попытаться разобрать несколько строк заголовков в MultiIndex, в противном случае возвращаются исходные кортежи. По умолчанию False.

thousands : str, необязательно

Разделитель для разбора тысяч. По умолчанию ','.

encoding : str или None, необязательно

Кодировка, используемая для декодирования веб-страницы. По умолчанию None.``None`` сохраняет предыдущее поведение кодирования, которое зависит от библиотеки парсера (например, библиотека парсера попытается использовать кодировку, предоставленную документом).

decimal : str, по умолчанию ‘.’

Символ, распознаваемый как десятичная точка (например, используйте ‘,’ для европейских данных).

Введено в версии 0.19.0.

converters : dict, по умолчанию None

Словарь функций для преобразования значений в определённых столбцах. Ключи могут быть целыми числами или метками столбцов, значения являются функциями, которые принимают один входной аргумент, содержимое ячейки (не столбца), и возвращают преобразованное содержимое.

Введено в версии 0.19.0.

na_values : итерируемый объект, по умолчанию None

Пользовательские значения NA

Введено в версии 0.19.0.

keep_default_na : bool, по умолчанию True

Если na_values заданы и keep_default_na имеет значение False, значения по умолчанию NaN перезаписываются, в противном случае они добавляются к

Введено в версии 0.19.0.

Возвращает:

dfs : список DataFrames

См. также

pandas.read_csv

Примечания

Перед использованием этой функции необходимо прочитать Примечания по библиотекам разбора HTML.

Ожидайте, что после вызова этой функции придётся провести некоторую очистку. Например, возможно, вам нужно будет вручную назначить имена столбцов, если имена столбцов были преобразованы в NaN при передаче header=0 аргумента. Мы стараемся максимально избегать предположений о структуре таблицы и переложить особенности HTML-кода таблицы на пользователя.

Эта функция ищет элементы <table> и только для <tr> и <th> строк и <td> элементов внутри каждого <tr> или <th> элемента в таблице. <td> означает «данные таблицы».

Аналогично read_csv() аргумент header применяется после применения skiprows.

Эта функция всегда вернёт список DataFrame или она завершится ошибкой, например, она не вернёт пустой список.

Примеры

См. документацию read_html в разделе Ввода-вывода документации для примеров чтения HTML-таблиц.

© 2008–2012, AQR Capital Management, LLC, Lambda Foundry, Inc. and PyData Development Team
Licensed under the 3-clause BSD License.
https://pandas.pydata.org/pandas-docs/version/0.20.3/generated/pandas.read_html.html

Spec-Zone.ru

Настройки Оффлайн Что нового Помощь О нас
Spec-Zone .ru
спецификации, руководства, описания, API