Spec-Zone.ru › C++

std::mbrtowc

Определено в заголовке <cwchar>
std::size_t mbrtowc( wchar_t* pwc,
                     const char* s,
                     std::size_t n,
                     std::mbstate_t* ps );

Преобразует узкий многобайтовый символ в символ широкой кодировки.

Если s не является нулевым указателем, проверяет не более n байтов строки многобайтового символа, начиная с байта, на который указывает s, чтобы определить количество байтов, необходимых для завершения следующего многобайтового символа (включая любые последовательности смены состояния). Если функция определяет, что следующий многобайтовый символ в s завершён и корректен, преобразует его в соответствующий символ широкой кодировки и сохраняет его в *pwc (если pwc не является нулевым указателем).

Если s является нулевым указателем, значения n и pwc игнорируются, и вызов эквивалентен std::mbrtowc(nullptr, "", 1, ps).

Если полученный символ широкой кодировки — нулевой символ, состояние преобразования, хранящееся в *ps , — начальное состояние смены кода.

Параметры

pwc - указатель на место, куда будет записан полученный символ широкой кодировки
s - указатель на строку многобайтового символа, используемую в качестве входных данных
n - ограничение на количество байтов в s, которые могут быть проверены
ps - указатель на состояние преобразования, используемое при интерпретации многобайтовой строки

Возвращаемое значение

Первое из следующего, что применяется:

  • ​0​ если символ, преобразованный из s (и сохранённый в pwc , если он не нулевой), был нулевым символом.
  • количество байтов [1...n] многобайтового символа, успешно преобразованного из s.
  • static_cast<std::size_t>(-2) если следующие n байта составляют незавершенный, но до сих пор корректный многобайтовый символ. В *pwc ничего не записывается.
  • static_cast<std::size_t>(-1) если произошла ошибка кодирования. В *pwc ничего не записывается, значение EILSEQ сохраняется в errno, а значение *ps остаётся неопределённым.

Пример

#include <clocale>
#include <cstring>
#include <cwchar>
#include <iostream>
 
void print_mb(const char* ptr)
{
    std::mbstate_t state = std::mbstate_t(); // initial state
    const char* end = ptr + std::strlen(ptr);
    int len;
    wchar_t wc;
    while ((len = std::mbrtowc(&wc, ptr, end-ptr, &state)) > 0)
    {
        std::wcout << "Next " << len << " bytes are the character " << wc << '\n';
        ptr += len;
    }
}
 
int main()
{
    std::setlocale(LC_ALL, "en_US.utf8");
    // UTF-8 narrow multibyte encoding
    const char* str = "z\u00df\u6c34\U0001d10b"; // or u8"zß水𝄋"
                      // or "\x7a\xc3\x9f\xe6\xb0\xb4\xf0\x9d\x84\x8b";
    print_mb(str);
}

Вывод:

Next 1 bytes are the character z
Next 2 bytes are the character ß
Next 3 bytes are the character 水
Next 4 bytes are the character 𝄋

См. также

mbtowc
преобразует следующий многобайтовый символ в символ широкой кодировки
(функция)
wcrtomb
преобразует символ широкой кодировки в его многобайтовое представление, учитывая состояние
(функция)
do_in
[virtual]
преобразует строку из ExternT в InternT, например, при чтении из файла
(виртуальная защищённая функция-член std::codecvt<InternT,ExternT,StateT>)
Документация C для mbrtowc

© cppreference.com
Licensed under the Creative Commons Attribution-ShareAlike Unported License v3.0.
https://en.cppreference.com/w/cpp/string/multibyte/mbrtowc

Spec-Zone.ru

Настройки Оффлайн Что нового Помощь О нас
Spec-Zone .ru
спецификации, руководства, описания, API