Spec-Zone.ru › pandas 0.24

pandas.Series.str.extract

Series.str.extract(pat, flags=0, expand=True) [source]

Извлечение групп захвата в регулярном выражении pat в виде столбцов в DataFrame.

Для каждой строки-предмета в Series извлекаются группы из первого совпадения регулярного выражения pat.

Параметры:
pat : string

Шаблон регулярного выражения с группами захвата.

flags : int, default 0 (no flags)

Флаги из модуля re (например, re.IGNORECASE), которые изменяют соответствие регулярному выражению по параметрам, таким как регистр, пробелы и т. д. Более подробную информацию см. на странице re.

expand : bool, default True

Если True, возвращается DataFrame с одним столбцом на каждую группу захвата. Если False, возвращается Series/Index, если есть одна группа захвата, или DataFrame, если групп захвата несколько.

Новое в версии 0.18.0.

Возвращаемое значение:
DataFrame или Series или Index

DataFrame с одной строкой для каждой строки-предмета и одним столбцом для каждой группы. Любые имена групп захвата в регулярном выражении pat будут использованы в качестве имён столбцов; в противном случае будут использованы номера групп захвата. Тип данных каждого столбца результата всегда object, даже если совпадений не найдено. Если expand=False и pat содержит только одну группу захвата, то возвращается Series (если subject — Series) или Index (если subject — Index).

См. также

extractall
Возвращает все совпадения (а не только первое совпадение).

Примеры

Шаблон с двумя группами вернёт DataFrame с двумя столбцами. Несоответствия будут NaN.

>>> s = pd.Series(['a1', 'b2', 'c3'])
>>> s.str.extract(r'([ab])(\d)')
     0    1
0    a    1
1    b    2
2  NaN  NaN

Шаблон может содержать необязательные группы.

>>> s.str.extract(r'([ab])?(\d)')
     0  1
0    a  1
1    b  2
2  NaN  3

Имена групп станут именами столбцов в результате.

>>> s.str.extract(r'(?P<letter>[ab])(?P<digit>\d)')
  letter digit
0      a     1
1      b     2
2    NaN   NaN

Шаблон с одной группой вернёт DataFrame с одним столбцом, если expand=True.

>>> s.str.extract(r'[ab](\d)', expand=True)
     0
0    1
1    2
2  NaN

Шаблон с одной группой вернёт Series, если expand=False.

>>> s.str.extract(r'[ab](\d)', expand=False)
0      1
1      2
2    NaN
dtype: object

© 2008–2012, AQR Capital Management, LLC, Lambda Foundry, Inc. and PyData Development Team
Licensed under the 3-clause BSD License.
https://pandas.pydata.org/pandas-docs/version/0.24.2/reference/api/pandas.Series.str.extract.html

Spec-Zone.ru

Настройки Оффлайн Что нового Помощь О нас
Spec-Zone .ru
спецификации, руководства, описания, API