класс Encoding
Экземпляр Encoding представляет кодировку символов, используемую в Ruby. Она определена как константа в пространстве имен Encoding. У неё есть имя и, необязательно, псевдонимы:
Encoding::US_ASCII.name # => "US-ASCII" Encoding::US_ASCII.names # => ["US-ASCII", "ASCII", "ANSI_X3.4-1968", "646"]
Метод Ruby, принимающий кодировку в качестве аргумента, примет:
-
Объект Encoding.
-
Имя кодировки.
-
Псевдоним имени кодировки.
Эти варианты эквивалентны:
'foo'.encode(Encoding::US_ASCII) # Encoding object.
'foo'.encode('US-ASCII') # Encoding name.
'foo'.encode('ASCII') # Encoding alias.
Полное описание кодировок и их использования см. в документе по кодировкам.
Encoding::ASCII_8BIT — это специальная кодировка, обычно используемая для строки байтов, а не строки символов. Но, как следует из названия, её символы в диапазоне ASCII считаются символами ASCII. Это полезно, когда вы используете другие совместимые с ASCII кодировки.
Публичные методы класса
static VALUE
rb_enc_aliases(VALUE klass)
{
VALUE aliases[2];
aliases[0] = rb_hash_new();
aliases[1] = rb_ary_new();
st_foreach(global_enc_table.names, rb_enc_aliases_enc_i, (st_data_t)aliases);
return aliases[0];
} Возвращает хэш доступных псевдонимов кодировки и исходных имён кодировок.
Encoding.aliases
#=> {"BINARY"=>"ASCII-8BIT", "ASCII"=>"US-ASCII", "ANSI_X3.4-1968"=>"US-ASCII",
"SJIS"=>"Windows-31J", "eucJP"=>"EUC-JP", "CP932"=>"Windows-31J"} static VALUE
enc_compatible_p(VALUE klass, VALUE str1, VALUE str2)
{
rb_encoding *enc;
if (!enc_capable(str1)) return Qnil;
if (!enc_capable(str2)) return Qnil;
enc = rb_enc_compatible(str1, str2);
if (!enc) return Qnil;
return rb_enc_from_encoding(enc);
} Проверяет совместимость двух объектов.
Если оба объекта — строки, они совместимы, если их можно конкатенировать. Кодировка полученной строки возвращается, если они совместимы; nil, если нет.
Encoding.compatible?("\xa1".force_encoding("iso-8859-1"), "b")
#=> #<Encoding:ISO-8859-1>
Encoding.compatible?(
"\xa1".force_encoding("iso-8859-1"),
"\xa1\xa1".force_encoding("euc-jp"))
#=> nil
Если объекты не строки, их кодировки совместимы, если у них есть кодировка и:
-
Любая из кодировок совместима с US-ASCII.
-
Одна из кодировок — 7-битная кодировка.
static VALUE
get_default_external(VALUE klass)
{
return rb_enc_default_external();
} Возвращает кодировку по умолчанию для внешнего кодирования.
Кодировка по умолчанию для внешнего кодирования используется по умолчанию для строк, созданных из следующих источников:
-
Fileданные, считанные с диска -
SDBM
Хотя строки, созданные из этих источников, будут иметь эту кодировку, кодировка может быть недействительной. Убедитесь, что проверили String#valid_encoding?.
File данные, записанные на диск, будут преобразованы в кодировку по умолчанию для внешнего кодирования при записи, если default_internal не равно nil.
Кодировка по умолчанию для внешнего кодирования инициализируется опцией -E. Если опция -E не задана, она инициализируется UTF-8 в Windows и кодировкой локали в других операционных системах.
static VALUE
set_default_external(VALUE klass, VALUE encoding)
{
rb_warning("setting Encoding.default_external");
rb_enc_set_default_external(encoding);
return encoding;
} Устанавливает кодировку по умолчанию для внешнего кодирования. Не следует устанавливать Encoding::default_external в коде Ruby, так как строки, созданные до изменения значения, могут иметь другую кодировку по сравнению со строками, созданными после изменения значения. Вместо этого используйте ruby -E для запуска Ruby с правильной кодировкой по умолчанию для внешнего кодирования.
См. Encoding::default_external для получения информации о том, как используется кодировка по умолчанию для внешнего кодирования.
static VALUE
get_default_internal(VALUE klass)
{
return rb_enc_default_internal();
} Возвращает кодировку по умолчанию для внутреннего кодирования. Строки будут преобразованы в кодировку по умолчанию для внутреннего кодирования в следующих случаях, если кодировка по умолчанию для внутреннего кодирования не равна nil:
-
Fileданные, считанные с диска -
Строки, возвращаемые из
Readline -
Строки, возвращаемые из SDBM
-
Значения из
ENV -
Значения в ARGV, включая $PROGRAM_NAME
Кроме того, String#encode и String#encode! используют кодировку по умолчанию для внутреннего кодирования, если кодировка не указана.
Кодировка скрипта (__ENCODING__), а не default_internal, используется в качестве кодировки созданных строк.
Encoding::default_internal инициализируется опцией -E или nil в противном случае.
static VALUE
set_default_internal(VALUE klass, VALUE encoding)
{
rb_warning("setting Encoding.default_internal");
rb_enc_set_default_internal(encoding);
return encoding;
} Устанавливает кодировку по умолчанию для внутреннего кодирования или удаляет её, если передано значение nil. Не следует устанавливать Encoding::default_internal в коде Ruby, так как строки, созданные до изменения значения, могут иметь другую кодировку по сравнению со строками, созданными после изменения. Вместо этого используйте ruby -E для запуска Ruby с правильной кодировкой по умолчанию для внутреннего кодирования.
См. Encoding::default_internal для получения информации о том, как используется кодировка по умолчанию для внутреннего кодирования.
static VALUE
enc_find(VALUE klass, VALUE enc)
{
int idx;
if (is_obj_encoding(enc))
return enc;
idx = str_to_encindex(enc);
if (idx == UNSPECIFIED_ENCODING) return Qnil;
return rb_enc_from_encoding_index(idx);
} Поиск кодировки по заданному имени. Имя должно быть строкой.
Encoding.find("US-ASCII") #=> #<Encoding:US-ASCII>
Принимаемые этим методом имена — имена кодировок и псевдонимы, включая следующие специальные псевдонимы:
- “external”
-
кодировка по умолчанию для внешнего кодирования
- “internal”
-
кодировка по умолчанию для внутреннего кодирования
- “locale”
-
кодировка локали
- “filesystem”
-
кодировка файловой системы
Возникает ошибка ArgumentError, если нет кодировки с именем name. Только Encoding.find("internal") возвращает nil, когда нет кодировки с именем “internal”, другими словами, когда у Ruby нет кодировки по умолчанию для внутреннего кодирования.
static VALUE
enc_list(VALUE klass)
{
VALUE ary = rb_ary_new2(0);
rb_ary_replace(ary, rb_encoding_list);
return ary;
} Возвращает список загруженных кодировок.
Encoding.list
#=> [#<Encoding:ASCII-8BIT>, #<Encoding:UTF-8>,
#<Encoding:ISO-2022-JP (dummy)>]
Encoding.find("US-ASCII")
#=> #<Encoding:US-ASCII>
Encoding.list
#=> [#<Encoding:ASCII-8BIT>, #<Encoding:UTF-8>,
#<Encoding:US-ASCII>, #<Encoding:ISO-2022-JP (dummy)>]
VALUE
rb_locale_charmap(VALUE klass)
{
#if NO_LOCALE_CHARMAP
return rb_usascii_str_new_cstr("US-ASCII");
#else
return locale_charmap(rb_usascii_str_new_cstr);
#endif
} Возвращает имя набора символов локали. Возвращает nil, если нет соответствующей информации.
Debian GNU/Linux
LANG=C
Encoding.locale_charmap #=> "ANSI_X3.4-1968"
LANG=ja_JP.EUC-JP
Encoding.locale_charmap #=> "EUC-JP"
SunOS 5
LANG=C
Encoding.locale_charmap #=> "646"
LANG=ja
Encoding.locale_charmap #=> "eucJP"
Результат сильно зависит от платформы. Поэтому Encoding.find(Encoding.locale_charmap) может вызвать ошибку. Если вам нужен какой-либо объект кодировки даже для неизвестной локали, можно использовать Encoding.find(“locale”).
static VALUE
rb_enc_name_list(VALUE klass)
{
VALUE ary = rb_ary_new2(global_enc_table.names->num_entries);
st_foreach(global_enc_table.names, rb_enc_name_list_i, (st_data_t)ary);
return ary;
} Возвращает список доступных имён кодировок.
Encoding.name_list
#=> ["US-ASCII", "ASCII-8BIT", "UTF-8",
"ISO-8859-1", "Shift_JIS", "EUC-JP",
"Windows-31J",
"BINARY", "CP932", "eucJP"] Общедоступные методы экземпляров
static VALUE
enc_ascii_compatible_p(VALUE enc)
{
return RBOOL(rb_enc_asciicompat(must_encoding(enc)));
} Возвращает значение, указывающее, является ли кодировка совместимой с ASCII.
Encoding::UTF_8.ascii_compatible? #=> true Encoding::UTF_16BE.ascii_compatible? #=> false
static VALUE
enc_dummy_p(VALUE enc)
{
return RBOOL(ENC_DUMMY_P(must_encoding(enc)));
} Возвращает true для фиктивных кодировок. Фиктивная кодировка — это кодировка, для которой обработка символов не реализована должным образом. Она используется для состоятельных кодировок.
Encoding::ISO_2022_JP.dummy? #=> true Encoding::UTF_8.dummy? #=> false
static VALUE
enc_inspect(VALUE self)
{
rb_encoding *enc;
if (!is_data_encoding(self)) {
not_encoding(self);
}
if (!(enc = DATA_PTR(self)) || rb_enc_from_index(rb_enc_to_index(enc)) != enc) {
rb_raise(rb_eTypeError, "broken Encoding");
}
return rb_enc_sprintf(rb_usascii_encoding(),
"#<%"PRIsVALUE":%s%s%s>", rb_obj_class(self),
rb_enc_name(enc),
(ENC_DUMMY_P(enc) ? " (dummy)" : ""),
rb_enc_autoload_p(enc) ? " (autoload)" : "");
} Возвращает строку, представляющую кодировку для программистов.
Encoding::UTF_8.inspect #=> "#<Encoding:UTF-8>" Encoding::ISO_2022_JP.inspect #=> "#<Encoding:ISO-2022-JP (dummy)>"
static VALUE
enc_names(VALUE self)
{
VALUE args[2];
args[0] = (VALUE)rb_to_encoding_index(self);
args[1] = rb_ary_new2(0);
st_foreach(global_enc_table.names, enc_names_i, (st_data_t)args);
return args[1];
} Возвращает список имен и псевдонимов кодировки.
Encoding::WINDOWS_31J.names #=> ["Windows-31J", "CP932", "csWindows31J", "SJIS", "PCK"]
static VALUE
enc_replicate_m(VALUE encoding, VALUE name)
{
int idx;
rb_warn_deprecated_to_remove("3.3", "Encoding#replicate", "the original encoding");
idx = rb_enc_replicate(name_for_encoding(&name), rb_to_encoding(encoding));
RB_GC_GUARD(name);
return rb_enc_from_encoding_index(idx);
} Возвращает дублированную кодировку enc с именем name. Новая кодировка должна иметь ту же структуру байтов, что и enc. Если name используется другой кодировкой, возникает исключение ArgumentError.
static VALUE
enc_name(VALUE self)
{
return rb_fstring_cstr(rb_enc_name((rb_encoding*)DATA_PTR(self)));
} Возвращает имя кодировки.
Encoding::UTF_8.name #=> "UTF-8"
Ruby Core © 1993–2022 Yukihiro Matsumoto
Licensed under the Ruby License.
Ruby Standard Library © contributors
Licensed under their own licenses.