Spec-Zone.ru › pandas 0.24

pandas.read_html

pandas.read_html(io, match='.+', flavor=None, header=None, index_col=None, skiprows=None, attrs=None, parse_dates=False, tupleize_cols=None, thousands=', ', encoding=None, decimal='.', converters=None, na_values=None, keep_default_na=True, displayed_only=True) [source]

Чтение HTML-таблиц в список list объектов DataFrame.

Параметры:
io : str or file-like

URL, объект типа файла или строка, содержащая HTML. Обратите внимание, что lxml принимает только протоколы URL http, ftp и file. Если у вас есть URL, начинающийся с 'https', попробуйте удалить 's'.

match : str or compiled regular expression, optional

Множество таблиц, содержащих текст, соответствующий этому регулярному выражению или строке, будут возвращены. Если HTML не очень простой, вам, вероятно, понадобится передать здесь непустую строку. По умолчанию «.+» (соответствует любой непустой строке). Значение по умолчанию вернёт все таблицы, содержащиеся на странице. Это значение преобразуется в регулярное выражение, чтобы обеспечить согласованное поведение между Beautiful Soup и lxml.

flavor : str or None, container of strings

Двигатель разбора. ‘bs4’ и ‘html5lib’ являются синонимами, они оба существуют для обратной совместимости. По умолчанию None пытается использовать lxml для разбора, и если это не удаётся, использует bs4 + html5lib.

header : int or list-like or None, optional

Строка (или список строк для MultiIndex) для создания заголовков столбцов.

index_col : int or list-like or None, optional

Столбец (или список столбцов) для создания индекса.

skiprows : int or list-like or slice or None, optional

С нулевой базой. Количество строк, которые нужно пропустить после разбора целочисленных столбцов. Если указана последовательность целых чисел или срез, строки с индексом, указанным в этой последовательности, будут пропущены. Обратите внимание, что последовательность из одного элемента означает «пропустить n-ую строку», а целое число означает «пропустить n строк».

attrs : dict or None, optional

Это словарь атрибутов, которые можно передать, чтобы идентифицировать таблицу в HTML. Эти атрибуты не проверяются на валидность перед передачей в lxml или Beautiful Soup. Однако эти атрибуты должны быть действительными атрибутами HTML-таблиц для корректной работы. Например,

attrs = {'id': 'table'}

является допустимым словарем атрибутов, поскольку атрибут тега HTML «id» является допустимым атрибутом HTML для любого тега HTML в соответствии с этим документом.

attrs = {'asdf': 'table'}

не является допустимым словарем атрибутов, поскольку «asdf» не является допустимым атрибутом HTML, даже если это допустимый атрибут XML. Действительные атрибуты таблицы HTML 4.01 можно найти здесь. Рабочий черновик спецификации HTML 5 можно найти здесь. Он содержит последнюю информацию об атрибутах таблиц для современной сети.

parse_dates : bool, optional

См. read_csv() для получения дополнительной информации.

tupleize_cols : bool, optional

Если False пытаются разобрать несколько строк заголовков в MultiIndex, иначе возвращает исходные кортежи. По умолчанию False.

Устарело начиная с версии 0.21.0: Этот аргумент будет удалён и всегда будет преобразован в MultiIndex

thousands : str, optional

Разделитель для разбора тысяч. По умолчанию ','.

encoding : str or None, optional

Кодировка, используемая для декодирования веб-страницы. По умолчанию None. ``None`` сохраняет предыдущее поведение кодировки, которое зависит от используемой библиотеки парсера (например, библиотека парсера попытается использовать кодировку, предоставленную документом).

decimal : str, default ‘.’

Символ, распознаваемый как десятичная точка (например, используйте «,» для европейских данных).

Введено в версии 0.19.0.

converters : dict, default None

Словарь функций для преобразования значений в определённых столбцах. Ключи могут быть целыми числами или метками столбцов, значения — функциями, принимающими один аргумент — содержимое ячейки (не столбца) — и возвращающими преобразованное содержимое.

Введено в версии 0.19.0.

na_values : iterable, default None

Пользовательские значения NaN

Введено в версии 0.19.0.

keep_default_na : bool, default True

Если значения na_values указаны и keep_default_na = False, значения NaN по умолчанию переопределяются, иначе они добавляются к

Введено в версии 0.19.0.

displayed_only : bool, default True

Нужно ли парсить элементы с «display: none»

Введено в версии 0.23.0.

Возвращает:
dfs : list of DataFrames

См. также

pandas.read_csv

Примечания

Перед использованием этой функции следует прочитать примечания о библиотеках разбора HTML.

Ожидайте выполнения некоторой очистки после вызова этой функции. Например, возможно, вам придётся вручную назначить имена столбцов, если имена столбцов преобразуются в NaN при передаче аргумента header=0. Мы пытаемся предположить как можно меньше о структуре таблицы и переложить особенности HTML, содержащегося в таблице, на пользователя.

Эта функция ищет элементы <table> и только <tr> и <th> строк и <td> элементы внутри каждого <tr> или <th> элемента в таблице. <td> означает «данные таблицы». Эта функция пытается правильно обработать атрибуты colspan и rowspan. Если у функции есть аргумент <thead> , он используется для построения заголовка, в противном случае функция пытается найти заголовок в теле (путем помещения строк, содержащих только <th> элементы, в заголовок).

Введено в версии 0.21.0.

Подобно read_csv(), аргумент header применяется после применения skiprows.

Эта функция всегда возвращает список DataFrame или она терпит неудачу, например, она не возвращает пустой список.

Примеры

См. документацию read_html в разделе IO документации для некоторых примеров чтения HTML-таблиц.

© 2008–2012, AQR Capital Management, LLC, Lambda Foundry, Inc. and PyData Development Team
Licensed under the 3-clause BSD License.
https://pandas.pydata.org/pandas-docs/version/0.24.2/reference/api/pandas.read_html.html

Spec-Zone.ru

Настройки Оффлайн Что нового Помощь О нас
Spec-Zone .ru
спецификации, руководства, описания, API