pandas.Series.str.extractall
-
Series.str.extractall(pat, flags=0) -
Для каждой строки-объекта в Series извлекаются группы из всех совпадений с регулярным выражением pat. Когда у каждой строки-объекта в Series ровно одно совпадение, extractall(pat).xs(0, level=’match’) эквивалентно extract(pat).
Добавлена в версии 0.18.0.
Параметры: pat : строка
Шаблон регулярного выражения с захватывающими группами
flags : целое число, по умолчанию 0 (без флагов)
Флаги модуля re, например re.IGNORECASE
Возвращает: DataFrame с одной строкой для каждого совпадения и одним столбцом для каждой
группы. Его строки имеют MultiIndex с первыми уровнями, которые
получены из Series с исходными строками. Последний уровень
называется ‘match’ и указывает порядок в исходной строке. Любые имена
захватывающих групп в регулярном выражении pat будут использоваться в
качестве имен столбцов; в противном случае будут использованы номера
захватывающих групп.
См. также
-
extract - возвращает только первое совпадение (не все совпадения)
Примеры
Шаблон с одной группой вернёт DataFrame с одним столбцом. Индексы без совпадений не появятся в результате.
>>> s = Series(["a1a2", "b1", "c1"], index=["A", "B", "C"]) >>> s.str.extractall("[ab](\d)") 0 match A 0 1 1 2 B 0 1Имена захватывающих групп используются в качестве имён столбцов результата.
>>> s.str.extractall("[ab](?P<digit>\d)") digit match A 0 1 1 2 B 0 1Шаблон с двумя группами вернёт DataFrame с двумя столбцами.
>>> s.str.extractall("(?P<letter>[ab])(?P<digit>\d)") letter digit match A 0 a 1 1 a 2 B 0 b 1Необязательные группы, которые не совпадают, имеют значение NaN в результате.
>>> s.str.extractall("(?P<letter>[ab])?(?P<digit>\d)") letter digit match A 0 a 1 1 a 2 B 0 b 1 C 0 NaN 1 -
© 2008–2012, AQR Capital Management, LLC, Lambda Foundry, Inc. and PyData Development Team
Licensed under the 3-clause BSD License.
https://pandas.pydata.org/pandas-docs/version/0.18.1/generated/pandas.Series.str.extractall.html