pandas.Series.str.extractall
-
Series.str.extractall(pat, flags=0)[source] -
Для каждой строки-субъекта в серии извлекаются группы из всех совпадений с регулярным выражением pat. Когда каждая строка-субъект в серии имеет ровно одно совпадение, extractall(pat).xs(0, level=’match’) эквивалентно extract(pat).
Введено в версии 0.18.0.
Параметры: pat : строка
Шаблон регулярного выражения с захваченными группами
flags : int, по умолчанию 0 (нет флагов)
Флаги модуля re, например re.IGNORECASE
Возвращает: DataFrame с одной строкой для каждого совпадения и одним столбцом для каждой
группы. Его строки имеют MultiIndex с первыми уровнями, которые берутся из
серии субъектов. Последний уровень назван «match» и указывает
порядок в субъекте. Любые имена захваченных групп в регулярном
выражении pat будут использоваться в качестве имён столбцов; в противном
случае будут использоваться номера захваченных групп.
См. также
-
extract - возвращает только первое совпадение (не все совпадения)
Примеры
Шаблон с одной группой вернет DataFrame с одним столбцом. Индексы без совпадений не появятся в результате.
>>> s = Series(["a1a2", "b1", "c1"], index=["A", "B", "C"]) >>> s.str.extractall("[ab](\d)") 0 match A 0 1 1 2 B 0 1Имена захваченных групп используются в качестве имён столбцов результата.
>>> s.str.extractall("[ab](?P<digit>\d)") digit match A 0 1 1 2 B 0 1Шаблон с двумя группами вернет DataFrame с двумя столбцами.
>>> s.str.extractall("(?P<letter>[ab])(?P<digit>\d)") letter digit match A 0 a 1 1 a 2 B 0 b 1Необязательные группы, которые не совпадают, — NaN в результате.
>>> s.str.extractall("(?P<letter>[ab])?(?P<digit>\d)") letter digit match A 0 a 1 1 a 2 B 0 b 1 C 0 NaN 1 -
© 2008–2012, AQR Capital Management, LLC, Lambda Foundry, Inc. and PyData Development Team
Licensed under the 3-clause BSD License.
https://pandas.pydata.org/pandas-docs/version/0.22.0/generated/pandas.Series.str.extractall.html