Spec-Zone.ru › pandas 0.22

pandas.read_html

pandas.read_html(io, match='.+', flavor=None, header=None, index_col=None, skiprows=None, attrs=None, parse_dates=False, tupleize_cols=None, thousands=', ', encoding=None, decimal='.', converters=None, na_values=None, keep_default_na=True) [source]

Чтение HTML-таблиц в list из DataFrame объектов.

Параметры:

io : str или file-like

URL, файл-подобный объект или необработанная строка, содержащая HTML. Обратите внимание, что lxml принимает только протоколы URL http, ftp и file. Если у вас есть URL, начинающийся с 'https', попробуйте удалить 's'.

match : str или скомпилированное регулярное выражение, необязательно

Будут возвращены таблицы, содержащие текст, соответствующий этому регулярному выражению или строке. Если HTML не слишком простой, вам, вероятно, нужно будет передать здесь непустую строку. По умолчанию «.+» (соответствует любой непустой строке). Значение по умолчанию вернет все таблицы, содержащиеся на странице. Это значение преобразуется в регулярное выражение, чтобы обеспечить согласованное поведение между Beautiful Soup и lxml.

flavor : str или None, контейнер строк

Двигатель разбора. ‘bs4’ и ‘html5lib’ являются синонимами и существуют для обратной совместимости. Значение по умолчанию None пытается использовать lxml для разбора, и если это не удается, то использует bs4 + html5lib.

header : int или list-like или None, необязательно

Строка (или список строк для MultiIndex) для создания заголовков столбцов.

index_col : int или list-like или None, необязательно

Столбец (или список столбцов) для создания индекса.

skiprows : int или list-like или срез или None, необязательно

0-базис. Количество строк для пропуска после разбора целочисленного столбца. Если задан последовательность целых чисел или срез, пропустятся строки с указанными индексами. Обратите внимание, что последовательность с одним элементом означает «пропустить n-ю строку», в то время как целое число означает «пропустить n строк».

attrs : dict или None, необязательно

Это словарь атрибутов, которые вы можете передать для идентификации таблицы в HTML. Эти атрибуты не проверяются на валидность перед передачей в lxml или Beautiful Soup. Однако эти атрибуты должны быть допустимыми атрибутами HTML-таблиц, чтобы работать корректно. Например,

attrs = {'id': 'table'}

является допустимым словарем атрибутов, потому что атрибут тега «id» HTML является допустимым HTML-атрибутом для любого HTML-тега в соответствии с этим документом.

attrs = {'asdf': 'table'}

не является допустимым словарем атрибутов, потому что «asdf» не является допустимым HTML-атрибутом, даже если это допустимый XML-атрибут. Допустимые атрибуты HTML 4.01 таблиц можно найти здесь. Рабочий черновик спецификации HTML 5 можно найти здесь. Он содержит последнюю информацию об атрибутах таблиц для современной веб-страницы.

parse_dates : bool, необязательно

См. read_csv() для получения дополнительной информации.

tupleize_cols : bool, необязательно

Если False попробовать разобрать несколько строк заголовков в MultiIndex, в противном случае вернуть обычные кортежи. По умолчанию False.

Устарело начиная с версии 0.21.0: Этот аргумент будет удален и всегда будет преобразовываться в MultiIndex

thousands : str, необязательно

Разделитель для разбора тысяч. По умолчанию ','.

encoding : str или None, необязательно

Кодировка, используемая для декодирования веб-страницы. По умолчанию None. ``None`` сохраняет предыдущее поведение кодировки, которое зависит от используемой библиотеки парсера (например, библиотека парсера попытается использовать кодировку, предоставленную документом).

decimal : str, по умолчанию ‘.’

Символ, распознаваемый как десятичная точка (например, используйте ‘,’ для европейских данных).

Введено в версии 0.19.0.

converters : dict, по умолчанию None

Словарь функций для преобразования значений в определенных столбцах. Ключи могут быть целыми числами или метками столбцов, значениями являются функциями, которые принимают один входной аргумент, содержимое ячейки (не столбца), и возвращают преобразованное содержимое.

Введено в версии 0.19.0.

na_values : iterable, по умолчанию None

Пользовательские значения NA

Введено в версии 0.19.0.

keep_default_na : bool, по умолчанию True

Если значения na_values указаны и keep_default_na имеет значение False, значения NaN по умолчанию переопределяются, в противном случае они добавляются к

Введено в версии 0.19.0.

Возвращаемое значение:

dfs : список DataFrames

См. также

pandas.read_csv

Примечания

Перед использованием этой функции следует прочитать замечания о библиотеках разбора HTML.

Ожидайте некоторой очистки после вызова этой функции. Например, вам может потребоваться вручную назначить имена столбцов, если имена столбцов преобразуются в NaN при передаче header=0 аргумента. Мы стараемся по возможности меньше предполагать о структуре таблицы и переносить особенности HTML, содержащегося в таблице, на пользователя.

Эта функция ищет элементы <table> и только строки <tr> и <th> и элементы <td> внутри каждого элемента <tr> или <th> в таблице. <td> обозначает «данные таблицы».

Аналогично read_csv() аргумент header применяется после применения skiprows.

Эта функция всегда возвращает список DataFrame или она завершится ошибкой, например, она не вернёт пустой список.

Примеры

См. документацию по read_html в разделе ВВОД для некоторых примеров чтения HTML-таблиц.

© 2008–2012, AQR Capital Management, LLC, Lambda Foundry, Inc. and PyData Development Team
Licensed under the 3-clause BSD License.
https://pandas.pydata.org/pandas-docs/version/0.22.0/generated/pandas.read_html.html

Spec-Zone.ru

Настройки Оффлайн Что нового Помощь О нас
Spec-Zone .ru
спецификации, руководства, описания, API