Regex
Предоставляет регулярные выражения для Elixir.
Regex основан на PCRE (Perl Compatible Regular Expressions) и построен поверх модуля Erlang’s :re. Дополнительную информацию можно найти в :re документации модуля.
Регулярные выражения в Elixir можно создать, используя сигилы ~r или ~R:
# A simple regular expression that matches foo anywhere in the string ~r/foo/ # A regular expression with case insensitive and Unicode options ~r/foo/iu
Регулярные выражения, созданные с помощью сигилов, предварительно скомпилированы и хранятся в файле .beam. Обратите внимание, что это может быть проблемой, если вы предварительно компилируете Elixir; см. раздел «Предварительная компиляция» для получения дополнительной информации.
Регулярное выражение интерпретируется как структура Regex. Поэтому, %Regex{} можно использовать при необходимости для работы с ними. Имейте в виду, что не гарантируется, что два регулярных выражения из одного источника равны, например:
~r/(?<foo>.)(?<bar>.)/ == ~r/(?<foo>.)(?<bar>.)/
может вернуть true или false в зависимости от вашей машины, порядка байтов, доступных оптимизаций и других факторов. Однако вы можете получить исходный текст скомпилированного регулярного выражения, обратившись к полю source , и затем сравнить их напрямую:
~r/(?<foo>.)(?<bar>.)/.source == ~r/(?<foo>.)(?<bar>.)/.source
Предварительная компиляция
Регулярные выражения, созданные с помощью сигилов, предварительно скомпилированы и хранятся в файлах .beam. Это может быть проблемой, если вы предварительно компилируете Elixir для выполнения в разных релизах OTP, так как релизы OTP могут обновлять подлежащий движок регулярных выражений в любое время.
По этим причинам мы всегда рекомендуем предварительно компилировать проекты Elixir с использованием версии Erlang/OTP, предназначенной для работы в рабочей среде. В случае необходимости кросс-компиляции вы можете вручную вызвать Regex.recompile/1 или Regex.recompile!/1, чтобы выполнить проверку версии во время выполнения и перекомпилировать регулярное выражение при необходимости.
Модификаторы
Доступные модификаторы при создании Regex:
-
unicode(u) - включает Unicode-специфичные шаблоны, такие как\pи изменяет модификаторы, такие как\w,\W,\sи аналогичные, чтобы они также соответствовали Unicode. Ожидается, что при сопоставлении будут переданы корректные строковые значения Unicode. -
caseless(i) - добавляет нечувствительность к регистру -
dotall(s) - заставляет точку соответствовать новым строкам, а также устанавливает новую строку на любое сочетание CRLF; установка новой строки может быть переопределена путем установки(*CR)или(*LF)или(*CRLF)или(*ANY)в соответствии с документацией по re -
multiline(m) - заставляет^и$отмечать начало и конец каждой строки; используйте\Aи\zдля соответствия концу или началу строки -
extended(x) - символы пробела игнорируются, за исключением случаев экранирования, и разрешают#для определения комментариев -
firstline(f) - принудительно заставляет неявкоориентированный шаблон соответствовать строке перед или на первой новой строке, хотя сопоставленная строка может продолжаться с новой строки -
ungreedy(U) - инвертирует «жадность» регулярного выражения (предыдущий параметрrустарел в пользуU)
Недоступные параметры:
-
anchored- недоступен, используйте^или\Aвместо него -
dollar_endonly- недоступен, используйте\zвместо него -
no_auto_capture- недоступен, используйте?:вместо него -
newline- недоступен, используйте(*CR)или(*LF)или(*CRLF)или(*ANYCRLF)или(*ANY)в начале регулярного выражения в соответствии с документацией по re
Захваты
Многие функции в этом модуле обрабатывают, что захватывать в результате совпадения с регулярным выражением, через параметр :capture. Поддерживаемые значения:
-
:all- все захваченные подмаски, включая полную совпадающую строку (это значение по умолчанию) -
:first- только первая захваченная подмаска, которая всегда является полной совпадающей частью строки; все явно захваченные подмаски отбрасываются -
:all_but_first- все, кроме первой совпадающей подмаски, то есть все явно захваченные подмаски, но не полная совпадающая часть строки -
:none- не возвращает совпадающие подмаски вообще -
:all_names- захватывает все именованные подмаски в регулярном выражении -
list(binary)- список именованных подмасок для захвата
Резюме
Типы
- t()
Функции
- compile!(source, options \\ "")
-
Компилирует регулярное выражение и генерирует исключение
Regex.CompileErrorв случае ошибок. - compile(source, options \\ "")
-
Компилирует регулярное выражение.
- escape(string)
-
Экранирует строку для буквального соответствия в регулярном выражении
- match?(regex, string)
-
Возвращает логическое значение, указывающее, было ли совпадение или нет
- named_captures(regex, string, options \\ [])
-
Возвращает заданные захваты в виде карты или
nil, если захваты не найдены - names(regex)
-
Возвращает список имён в регулярном выражении
- opts(regex)
-
Возвращает параметры регулярного выражения как строку
- re_pattern(regex)
-
Возвращает базовое регулярное выражение
re_pattern - recompile!(regex)
-
Перекомпилирует существующее регулярное выражение и генерирует исключение
Regex.CompileErrorв случае ошибок - recompile(regex)
-
Перекомпилирует существующее регулярное выражение при необходимости
- regex?(term)
-
Возвращает
true, если заданныйtermявляется регулярным выражением. В противном случае возвращаетfalse - replace(regex, string, replacement, options \\ [])
-
Принимает регулярное выражение, бинарный объект и замену, возвращает новую бинарную строку, где все совпадения заменены заменой
- run(regex, string, options \\ [])
-
Выполняет регулярное выражение для заданной строки до первого совпадения. Возвращает список со всеми захваченными подстроками или
nilв случае отсутствия совпадения - scan(regex, string, options \\ [])
-
То же, что и
run/3, но сканирует целевую строку несколько раз, собирая все совпадения с регулярным выражением - source(regex)
-
Возвращает исходный код регулярного выражения как бинарный объект
- split(regex, string, options \\ [])
-
Разделяет заданную строку на основе заданного шаблона и в заданном количестве частей
- version()
-
Возвращает версию подлежащего движка регулярных выражений
Типы
t()
t() :: %Regex{
opts: binary(),
re_pattern: term(),
re_version: term(),
source: binary()
} Функции
compile!(source, options \\ "")
compile!(binary(), binary() | [term()]) :: t()
Компилирует регулярное выражение и генерирует исключение Regex.CompileError в случае ошибок.
compile(source, options \\ "")
compile(binary(), binary() | [term()]) :: {:ok, t()} | {:error, any()} Компилирует регулярное выражение.
Заданные параметры могут быть либо бинарным объектом с символами, представляющими те же параметры регулярного выражения, которые передаются сигилу ~r, либо списком параметров, как ожидается от модуля Erlang’s :re.
Возвращает {:ok, regex} в случае успеха, {:error, reason} в противном случае.
Примеры
iex> Regex.compile("foo")
{:ok, ~r/foo/}
iex> Regex.compile("*foo")
{:error, {'nothing to repeat', 0}} escape(string)
escape(String.t()) :: String.t()
Экранирует строку для буквального соответствия в регулярном выражении.
Примеры
iex> Regex.escape(".")
"\\."
iex> Regex.escape("\\what if")
"\\\\what\\ if" match?(regex, string)
match?(t(), String.t()) :: boolean()
Возвращает логическое значение, указывающее, было ли совпадение или нет.
Примеры
iex> Regex.match?(~r/foo/, "foo") true iex> Regex.match?(~r/foo/, "bar") false
named_captures(regex, string, options \\ [])
named_captures(t(), String.t(), [term()]) :: map() | nil
Возвращает заданные захваты в виде карты или nil, если захваты не найдены.
Параметры
-
:return- устанавливается в:indexдля возвращения индекса байта и длины совпадения. По умолчанию:binary.
Примеры
iex> Regex.named_captures(~r/c(?<foo>d)/, "abcd")
%{"foo" => "d"}
iex> Regex.named_captures(~r/a(?<foo>b)c(?<bar>d)/, "abcd")
%{"bar" => "d", "foo" => "b"}
iex> Regex.named_captures(~r/a(?<foo>b)c(?<bar>d)/, "efgh")
nil names(regex)
names(t()) :: [String.t()]
Возвращает список имён в регулярном выражении.
Примеры
iex> Regex.names(~r/(?<foo>bar)/) ["foo"]
opts(regex)
opts(t()) :: String.t()
Возвращает параметры регулярного выражения как строку.
Примеры
iex> Regex.opts(~r(foo)m) "m"
re_pattern(regex)
re_pattern(t()) :: term()
Возвращает базовое re_pattern в регулярном выражении.
recompile!(regex) (since 1.4.0)
recompile!(t()) :: t()
Перекомпилирует существующее регулярное выражение и поднимает Regex.CompileError в случае ошибок.
recompile(regex) (since 1.4.0)
recompile(t()) :: t()
Перекомпилирует существующее регулярное выражение при необходимости.
Проверяет версию, сохраненную в регулярном выражении, и перекомпилирует regex в случае несовпадения версий.
regex?(term)
regex?(any()) :: boolean()
Возвращает true , если заданный term является регулярным выражением. В противном случае возвращает false.
Примеры
iex> Regex.regex?(~r/foo/) true iex> Regex.regex?(0) false
replace(regex, string, replacement, options \\ [])
replace(t(), String.t(), String.t() | (... -> String.t()), [term()]) :: String.t()
Принимает регулярное выражение, двоичную строку и замену, возвращает новую двоичную строку, где все совпадения заменены заменой.
Замена может быть строкой или функцией. Строка используется как замена для каждого совпадения, и она позволяет получить доступ к определенным группам через \N или \g{N}, где N — группа. В случае использования \0, вставляется все совпадение. Обратите внимание, что в регулярных выражениях обратная косая черта должна быть экранирована, поэтому на практике вам потребуется использовать \\N и \\g{N}.
Если замена — функция, она может иметь арность N, где каждый аргумент соответствует группе, а первый аргумент — всему совпадению. Если функция ожидает больше аргументов, чем найденных групп, оставшиеся аргументы получат "".
Параметры
-
:global- еслиfalse, заменяет только первое вхождение (по умолчаниюtrue)
Примеры
iex> Regex.replace(~r/d/, "abc", "d")
"abc"
iex> Regex.replace(~r/b/, "abc", "d")
"adc"
iex> Regex.replace(~r/b/, "abc", "[\\0]")
"a[b]c"
iex> Regex.replace(~r/a(b|d)c/, "abcadc", "[\\1]")
"[b][d]"
iex> Regex.replace(~r/\.(\d)$/, "500.5", ".\\g{1}0")
"500.50"
iex> Regex.replace(~r/a(b|d)c/, "abcadc", fn _, x -> "[#{x}]" end)
"[b][d]"
iex> Regex.replace(~r/a/, "abcadc", "A", global: false)
"Abcadc" run(regex, string, options \\ [])
run(t(), binary(), [term()]) :: nil | [binary()] | [{integer(), integer()}] Применяет регулярное выражение к данной строке до первого совпадения. Возвращает список со всеми группами или nil в случае отсутствия совпадения.
Параметры
-
:return- установите в:indexдля возврата индекса байта и длины совпадения. По умолчанию:binary. -
:capture- что захватывать в результате. Обратитесь к moduledoc дляRegex, чтобы увидеть возможные значения групп.
Примеры
iex> Regex.run(~r/c(d)/, "abcd")
["cd", "d"]
iex> Regex.run(~r/e/, "abcd")
nil
iex> Regex.run(~r/c(d)/, "abcd", return: :index)
[{2, 2}, {3, 1}] scan(regex, string, options \\ [])
scan(t(), String.t(), [term()]) :: [[String.t()]]
То же, что и run/3, но сканирует целевой объект несколько раз, собирая все совпадения регулярного выражения.
Возвращает список списков, где каждый элемент основного списка представляет совпадение, а каждый элемент вторичного списка представляет содержимое захваченных групп.
Параметры
-
:return- установите в:indexдля возврата индекса байта и длины совпадения. По умолчанию:binary. -
:capture- что захватывать в результате. Обратитесь к moduledoc дляRegex, чтобы увидеть возможные значения групп.
Примеры
iex> Regex.scan(~r/c(d|e)/, "abcd abce")
[["cd", "d"], ["ce", "e"]]
iex> Regex.scan(~r/c(?:d|e)/, "abcd abce")
[["cd"], ["ce"]]
iex> Regex.scan(~r/e/, "abcd")
[]
iex> Regex.scan(~r/\p{Sc}/u, "$, £, and €")
[["$"], ["£"], ["€"]]
iex> Regex.scan(~r/=+/, "=ü†ƒ8===", return: :index)
[[{0, 1}], [{9, 3}]] source(regex)
source(t()) :: String.t()
Возвращает исходный код регулярного выражения как двоичную строку.
Примеры
iex> Regex.source(~r(foo)) "foo"
split(regex, string, options \\ [])
split(t(), String.t(), [term()]) :: [String.t()]
Разделяет заданный целевой объект на основе заданного шаблона и на заданное количество частей.
Параметры
-
:parts- при указании разделяет строку на заданное количество частей. Если не указано,:partsпо умолчанию:infinity, что разделит строку на максимальное количество частей, возможных на основе заданного шаблона. -
:trim- еслиtrue, удаляет пустые строки ("") из результата. По умолчаниюfalse. -
:on- указывает, на какие группы следует разделить строку и в каком порядке. По умолчанию:first, что означает, что группы внутри регулярного выражения не влияют на процесс разделения. -
:include_captures- еслиtrue, включает в результат совпадения регулярного выражения. По умолчаниюfalse.
Примеры
iex> Regex.split(~r{-}, "a-b-c")
["a", "b", "c"]
iex> Regex.split(~r{-}, "a-b-c", parts: 2)
["a", "b-c"]
iex> Regex.split(~r{-}, "abc")
["abc"]
iex> Regex.split(~r{}, "abc")
["", "a", "b", "c", ""]
iex> Regex.split(~r{a(?<second>b)c}, "abc")
["", ""]
iex> Regex.split(~r{a(?<second>b)c}, "abc", on: [:second])
["a", "c"]
iex> Regex.split(~r{(x)}, "Elixir", include_captures: true)
["Eli", "x", "ir"]
iex> Regex.split(~r{a(?<second>b)c}, "abc", on: [:second], include_captures: true)
["a", "b", "c"] version() (since 1.4.0)
version() :: term()
Возвращает версию базового движка Regex.
© 2012 Plataformatec
Licensed under the Apache License, Version 2.0.
https://hexdocs.pm/elixir/1.7.4/Regex.html