Spec-Zone.ru › Elixir 1.7

Синтаксис Unicode

Elixir поддерживает Unicode на протяжении всего языка.

Управляющие идентификаторы, такие как строки ("olá") и списки символов ('olá'), поддерживают Unicode начиная с Elixir v1.0. Строки закодированы в UTF-8. Списки символов представляют собой списки кодовых точек Unicode. В таких случаях содержимое сохраняется, как написано разработчиками, без каких-либо преобразований.

Elixir также поддерживает Unicode в идентификаторах начиная с Elixir v1.5, как определено в Приложении #31 к Unicode. Цель данного документа — описать, как Elixir реализует требования, изложенные в Приложении к Unicode. Эти требования обозначаются как R1, R6 и так далее.

Для проверки версии Unicode вашей текущей установки Elixir выполните String.Unicode.version().

R1. Стандартные идентификаторы

Общее правило идентификаторов Elixir задано следующим образом:

<Identifier> := <Start> <Continue>* <Ending>?

где <Start> использует те же категории, что и спецификация, но ограничивает их формой NFC (см. R6):

символы, полученные из общей категории Unicode «заглавные буквы», «строчные буквы», «заглавные буквы», «модификаторы букв», «другие буквы», «буквенные числа», плюс Other_ID_Start, минус Pattern_Syntax и Pattern_White_Space кодовые точки

В нотации множеств: [\p{L}\p{Nl}\p{Other_ID_Start}-\p{Pattern_Syntax}-\p{Pattern_White_Space}]

и <Continue> использует те же категории, что и спецификация, но ограничивает их формой NFC (см. R6):

символы ID_Start, плюс символы, имеющие общую категорию Unicode «неразрывные знаки», «знаки объединения с пробелами», «десятичные числа», «знаки пунктуации соединения», плюс Other_ID_Continue, минус Pattern_Syntax и Pattern_White_Space кодовые точки.

В нотации множеств: [\p{ID_Start}\p{Mn}\p{Mc}\p{Nd}\p{Pc}\p{Other_ID_Continue}-\p{Pattern_Syntax}-\p{Pattern_White_Space}]

<Ending> — это дополнение, специфичное для Elixir, которое включает только кодовые точки ? (003F) и ! (0021).

Спецификация также предоставляет множество <Medial> , но Elixir не включает ни одного символа в этом множестве. Поэтому правило идентификатора было упрощено с учетом этого.

Elixir не допускает использование ZWJ или ZWNJ в идентификаторах и поэтому не реализует R1a. R1b гарантирован в целях обратной совместимости.

Атомы

Атомы в Elixir следуют правилу идентификаторов выше с последующими модификациями:

  • <Start> включает кодовую точку _ (005F)
  • <Continue> включает кодовую точку @ (0040)

Переменные

Переменные в Elixir следуют правилу идентификаторов выше с последующими модификациями:

  • <Start> включает кодовую точку _ (005F)
  • <Start> не должно включать символы Lu (заглавные буквы) и Lt (заглавные буквы)

R3. Символы пробелов и синтаксиса шаблонов

Elixir поддерживает только кодовые точки \t (0009), \n (000A), \r (000D) и \s (0020) в качестве пробелов и поэтому не соответствует требованию R3. R3 требует поддержки более широкого набора символов пробелов и синтаксиса.

R6. Отфильтрованные нормализованные идентификаторы

Идентификаторы в Elixir чувствительны к регистру.

Elixir требует, чтобы все атомы и переменные были в форме NFC. Любая другая форма приведет к соответствующему сообщению об ошибке. Однако управляемые атомы и строки могут быть в любой форме и не проверяются анализатором.

Другими словами, атом :josé может быть записан только с помощью кодовых точек 006A 006F 0073 00E9. Использование другой формы нормализации приведет к ошибке токенизатора. С другой стороны, :"josé" может быть записан как 006A 006F 0073 00E9 или 006A 006F 0073 0065 0301, так как он записан в кавычках.

Выбор требования R6 автоматически исключает требования R4, R5 и R7.

© 2012 Plataformatec
Licensed under the Apache License, Version 2.0.
https://hexdocs.pm/elixir/1.7.4/unicode-syntax.html

Spec-Zone.ru

Настройки Оффлайн Что нового Помощь О нас
Spec-Zone .ru
спецификации, руководства, описания, API