Spec-Zone.ru › Python 3.9

codecs — Реестр кодеков и базовые классы

Исходный код: Lib/codecs.py

Этот модуль определяет базовые классы для стандартных кодеков Python (кодировщиков и декодировщиков) и предоставляет доступ к внутреннему реестру кодеков Python, который управляет процессом поиска кодеков и обработки ошибок. Большинство стандартных кодеков являются кодировками текста, которые кодируют текст в байты (и декодируют байты в текст), но также существуют кодеки, кодирующие текст в текст и байты в байты. Пользовательские кодеки могут кодировать и декодировать между произвольными типами, но некоторые функции модуля ограничены для использования только с кодировками текста или с кодеками, кодирующими в bytes.

Модуль определяет следующие функции для кодирования и декодирования с использованием любого кодека:

codecs.encode(obj, encoding='utf-8', errors='strict')

Кодирует obj с помощью зарегистрированного кодека для encoding.

Errors может быть задано для установки желаемой схемы обработки ошибок. По умолчанию используется обработчик ошибок 'strict', что означает, что ошибки кодирования вызывают ValueError (или более специализированный подкласс кодека, такой как UnicodeEncodeError). Дополнительную информацию об обработке ошибок кодеков см. в разделе Базовые классы кодеков.

codecs.decode(obj, encoding='utf-8', errors='strict')

Декодирует obj с помощью зарегистрированного кодека для encoding.

Errors может быть задано для установки желаемой схемы обработки ошибок. По умолчанию используется обработчик ошибок 'strict' , что означает, что ошибки декодирования вызывают ValueError (или более специализированный подкласс кодека, такой как UnicodeDecodeError). Дополнительную информацию об обработке ошибок кодеков см. в разделе Базовые классы кодеков.

Полные сведения о каждом кодеке также можно получить напрямую:

codecs.lookup(encoding)

Ищет информацию о кодеке в реестре кодеков Python и возвращает объект CodecInfo, как определено ниже.

Кодировки сначала ищутся в кэше реестра. Если не найдены, сканируется список зарегистрированных функций поиска. Если объект CodecInfo не найден, генерируется исключение LookupError. В противном случае объект CodecInfo сохраняется в кэше и возвращается вызывающей стороне.

class codecs.CodecInfo(encode, decode, streamreader=None, streamwriter=None, incrementalencoder=None, incrementaldecoder=None, name=None)

Подробности кодека при поиске в реестре кодеков. Аргументы конструктора хранятся в атрибутах с одинаковыми именами:

name

Имя кодировки.

encode
decode

Функции статического кодирования и декодирования. Они должны быть функциями или методами, которые имеют тот же интерфейс, что и методы encode() и decode() экземпляров Codec (см. Интерфейс кодека). Ожидается, что функции или методы будут работать в бессостоятельном режиме.

incrementalencoder
incrementaldecoder

Классы или фабричные функции для инкрементального кодировщика и декодировщика. Они должны предоставлять интерфейс, определенный базовыми классами IncrementalEncoder и IncrementalDecoder соответственно. Инкрементальные кодеки могут сохранять состояние.

streamwriter
streamreader

Классы или фабричные функции для потокового записи и чтения. Они должны предоставлять интерфейс, определенный базовыми классами StreamWriter и StreamReader соответственно. Потоковые кодеки могут сохранять состояние.

Для упрощения доступа к различным компонентам кодека модуль предоставляет следующие дополнительные функции, которые используют lookup() для поиска кодека:

codecs.getencoder(encoding)

Ищет кодек для заданной кодировки и возвращает функцию кодирования.

Вызывает исключение LookupError в случае, если кодировка не найдена.

codecs.getdecoder(encoding)

Ищет кодек для заданной кодировки и возвращает функцию декодирования.

Вызывает исключение LookupError в случае, если кодировка не найдена.

codecs.getincrementalencoder(encoding)

Ищет кодек для заданной кодировки и возвращает класс или фабричную функцию для инкрементального кодировщика.

Вызывает исключение LookupError в случае, если кодировка не найдена или кодек не поддерживает инкрементального кодировщика.

codecs.getincrementaldecoder(encoding)

Ищет кодек для заданной кодировки и возвращает класс или фабричную функцию для инкрементального декодировщика.

Вызывает исключение LookupError в случае, если кодировка не найдена или кодек не поддерживает инкрементального декодировщика.

codecs.getreader(encoding)

Ищет кодек для заданной кодировки и возвращает класс или фабричную функцию StreamReader.

Вызывает исключение LookupError в случае, если кодировка не найдена.

codecs.getwriter(encoding)

Ищет кодек для заданной кодировки и возвращает класс или фабричную функцию StreamWriter.

Вызывает исключение LookupError в случае, если кодировка не найдена.

Пользовательские кодеки становятся доступными путем регистрации подходящей функции поиска кодека:

codecs.register(search_function)

Регистрирует функцию поиска кодека. Функции поиска принимают один аргумент — имя кодировки в нижнем регистре, в котором тире и пробелы заменены на подчеркивания, и возвращают объект CodecInfo. Если функция поиска не может найти заданную кодировку, она должна вернуть None.

Изменено в версии 3.9: Тире и пробелы заменяются на подчеркивания.

Примечание

Регистрация функций поиска в настоящее время необратима, что может привести к проблемам в некоторых случаях, таких как тестирование или перезагрузка модулей.

В то время как встроенная функция open() и связанный с ней модуль io являются рекомендуемым подходом для работы с закодированными текстовыми файлами, этот модуль предоставляет дополнительные вспомогательные функции и классы, которые позволяют использовать более широкий спектр кодеков при работе с бинарными файлами:

codecs.open(filename, mode='r', encoding=None, errors='strict', buffering=-1)

Открывает закодированный файл с указанным режимом и возвращает экземпляр StreamReaderWriter, обеспечивая прозрачное кодирование/декодирование. По умолчанию используется режим файла 'r', что означает открытие файла для чтения.

Примечание

Подлежащие кодированию файлы всегда открываются в двоичном режиме. Автоматического преобразования '\n' при чтении и записи не происходит. Аргумент mode может быть любым двоичным режимом, допустимым для встроенной функции open(); 'b' добавляется автоматически.

encoding указывает кодировку, которая должна использоваться для файла. Допускается любая кодировка, которая кодирует и декодирует в байты, и типы данных, поддерживаемые методами файла, зависят от используемого кодека.

errors можно задать для определения обработки ошибок. По умолчанию используется 'strict', что приводит к возбуждению исключения ValueError в случае возникновения ошибки кодирования.

buffering имеет то же значение, что и для встроенной функции open(). По умолчанию используется значение -1, что означает использование размера буфера по умолчанию.

codecs.EncodedFile(file, data_encoding, file_encoding=None, errors='strict')

Возвращает экземпляр StreamRecoder, обернутую версию file, которая обеспечивает прозрачное преобразование кодировок. Исходный файл закрывается при закрытии обернутой версии.

Данные, записываемые в обернутый файл, декодируются в соответствии с заданной data_encoding и затем записываются в исходный файл в виде байтов с использованием file_encoding. Байты, считываемые из исходного файла, декодируются в соответствии с file_encoding, а результат кодируется с использованием data_encoding.

Если file_encoding не указан, он по умолчанию равен data_encoding.

errors может быть указан для определения обработки ошибок. По умолчанию значение 'strict', что приводит к поднятию ValueError в случае возникновения ошибки кодирования.

codecs.iterencode(iterator, encoding, errors='strict', **kwargs)

Использует инкрементальный кодер для итерационного кодирования входных данных, предоставляемых iterator. Эта функция является генератором. Аргумент errors (а также любые другие ключевые аргументы) передаются инкрементальному кодеру.

Эта функция требует, чтобы кодек принимал объекты текста str для кодирования. Поэтому она не поддерживает кодеры байт-в-байты, такие как base64_codec.

codecs.iterdecode(iterator, encoding, errors='strict', **kwargs)

Использует инкрементальный декодер для итерационного декодирования входных данных, предоставляемых iterator. Эта функция является генератором. Аргумент errors (а также любые другие ключевые аргументы) передаются инкрементальному декодеру.

Эта функция требует, чтобы кодек принимал объекты bytes для декодирования. Поэтому она не поддерживает кодировщики текст-в-текст, такие как rot_13, хотя rot_13 может быть использован эквивалентно с iterencode().

Модуль также предоставляет следующие константы, которые полезны для чтения и записи в платформозависимые файлы:

codecs.BOM
codecs.BOM_BE
codecs.BOM_LE
codecs.BOM_UTF8
codecs.BOM_UTF16
codecs.BOM_UTF16_BE
codecs.BOM_UTF16_LE
codecs.BOM_UTF32
codecs.BOM_UTF32_BE
codecs.BOM_UTF32_LE

Эти константы определяют различные последовательности байтов, являющиеся метками порядка байтов Юникода (BOM) для нескольких кодировок. Они используются в потоках данных UTF-16 и UTF-32 для указания используемого порядка байтов, а в UTF-8 — как сигнатура Юникода. BOM_UTF16 является либо BOM_UTF16_BE, либо BOM_UTF16_LE в зависимости от родного порядка байтов платформы, BOM — псевдоним для BOM_UTF16, BOM_LE для BOM_UTF16_LE и BOM_BE для BOM_UTF16_BE. Остальные представляют BOM в кодировках UTF-8 и UTF-32.

Базовые классы кодеков

Модуль codecs определяет набор базовых классов, которые определяют интерфейсы для работы с объектами кодеков и могут также использоваться в качестве основы для реализации пользовательских кодеков.

Каждый кодек должен определить четыре интерфейса, чтобы его можно было использовать как кодек в Python: бессостояние кодировщик, бессостояние декодировщик, потоковый читатель и потоковый писатель. Потоковые читатели и писатели обычно повторно используют бессостояние кодировщик/декодировщик для реализации протоколов файлов. Авторы кодеков также должны определить, как кодек будет обрабатывать ошибки кодирования и декодирования.

Обработчики ошибок

Для упрощения и стандартизации обработки ошибок кодеки могут реализовывать различные схемы обработки ошибок, принимая строковый аргумент errors:

>>> 'German ß, ♬'.encode(encoding='ascii', errors='backslashreplace')
b'German \\xdf, \\u266c'
>>> 'German ß, ♬'.encode(encoding='ascii', errors='xmlcharrefreplace')
b'German ß, ♬'

Следующие обработчики ошибок могут использоваться со всеми кодеками Python Стандартные кодировки:

Значение

Значение

'strict'

Вызвать UnicodeError (или подкласс), это значение по умолчанию. Реализовано в strict_errors().

'ignore'

Пропустить некорректные данные и продолжить без дальнейших уведомлений. Реализовано в ignore_errors().

'replace'

Заменить на маркер замены. При кодировании использовать ? (символ ASCII). При декодировании использовать � (U+FFFD, официальный символ ЗАМЕНЫ). Реализовано в replace_errors().

'backslashreplace'

Заменить на обратные косые последовательности escape. При кодировании использовать шестнадцатеричную форму кода Unicode с форматами \xhh \uxxxx \Uxxxxxxxx. При декодировании использовать шестнадцатеричную форму значения байта с форматом \xhh. Реализовано в backslashreplace_errors().

'surrogateescape'

При декодировании заменить байт отдельным суррогатным кодом, от U+DC80 до U+DCFF. Этот код будет затем возвращен в тот же байт, когда используется обработчик ошибок 'surrogateescape' при кодировании данных. (См. PEP 383 для получения дополнительной информации.)

Следующие обработчики ошибок применимы только к кодированию (в рамках кодирования текста):

Значение

Значение

'xmlcharrefreplace'

Заменить на числовое справочное значение XML/HTML, которое представляет собой десятичную форму кода Unicode с форматом &#num; Реализовано в xmlcharrefreplace_errors().

'namereplace'

Заменить на \N{...} escape последовательности, то, что появляется в фигурных скобках — это свойство Name из Unicode Character Database. Реализовано в namereplace_errors().

Кроме того, следующий обработчик ошибок специфичен для данных кодеков:

Значение

Кодеки

Значение

'surrogatepass'

utf-8, utf-16, utf-32, utf-16-be, utf-16-le, utf-32-be, utf-32-le

Разрешить кодирование и декодирование суррогатного кода (U+D800 - U+DFFF) как обычного кода. В противном случае эти кодеки рассматривают наличие суррогатного кода в str как ошибку.

Новое в версии 3.1: Обработчики ошибок 'surrogateescape' и 'surrogatepass'.

Изменено в версии 3.4: Обработчик ошибок 'surrogatepass' теперь работает с кодеками utf-16* и utf-32*.

Новое в версии 3.5: Обработчик ошибок 'namereplace'.

Изменено в версии 3.5: Обработчик ошибок 'backslashreplace' теперь работает с декодированием и трансляцией.

Набор разрешенных значений может быть расширен путем регистрации нового обработчика ошибок с именем:

codecs.register_error(name, error_handler)

Зарегистрировать функцию обработки ошибок error_handler под именем name. Аргумент error_handler будет вызван во время кодирования и декодирования в случае ошибки, когда name указан в параметре errors.

При кодировании error_handler будет вызван с экземпляром UnicodeEncodeError, содержащим информацию о местоположении ошибки. Обработчик ошибок должен либо вызвать эту или другую ошибку, либо вернуть кортеж с заменой для некодируемой части входных данных и позиции, с которой должно продолжаться кодирование. Замена может быть либо str, либо bytes. Если замена — байты, кодировщик просто скопирует их в буфер вывода. Если замена — строка, кодировщик закодирует замену. Кодирование продолжается по исходным входным данным с указанной позиции. Отрицательные значения позиций будут рассматриваться как относительные к концу строки входных данных. Если результирующая позиция выходит за пределы, будет вызвано исключение IndexError.

Декодирование и перевод работают аналогично, за исключением того, что будет передан UnicodeDecodeError или UnicodeTranslateError и замена из обработчика ошибок будет помещена непосредственно в выходные данные.

Ранее зарегистрированные обработчики ошибок (включая стандартные обработчики ошибок) могут быть найдены по имени:

codecs.lookup_error(name)

Возвращает обработчик ошибок, ранее зарегистрированный под именем name.

Вызывает LookupError в случае, если обработчик не найден.

Следующие стандартные обработчики ошибок также доступны как функции на уровне модуля:

codecs.strict_errors(exception)

Реализует обработку ошибок 'strict'.

Каждая ошибка кодирования или декодирования вызывает UnicodeError.

codecs.ignore_errors(exception)

Реализует обработку ошибок 'ignore'.

Некорректные данные игнорируются; кодирование или декодирование продолжаются без дальнейших уведомлений.

codecs.replace_errors(exception)

Реализует обработку ошибок 'replace'.

Заменяет ? (символ ASCII) на ошибки кодирования или � (U+FFFD, официальный символ ЗАМЕНЫ) на ошибки декодирования.

codecs.backslashreplace_errors(exception)

Реализует обработку ошибок 'backslashreplace'.

Некорректные данные заменяются обратной косой последовательностью escape. При кодировании используется шестнадцатеричная форма кода Unicode с форматами \xhh \uxxxx \Uxxxxxxxx. При декодировании используется шестнадцатеричная форма значения байта с форматом \xhh.

Изменено в версии 3.5: Работает с декодированием и переводом.

codecs.xmlcharrefreplace_errors(exception)

Реализует обработку ошибок 'xmlcharrefreplace' (только для кодирования в рамках кодирования текста).

Некодируемый символ заменяется соответствующим числовым справочным значением XML/HTML, которое представляет собой десятичную форму кода Unicode с форматом &#num;.

codecs.namereplace_errors(exception)

Реализует обработку ошибок 'namereplace' (только для кодирования в рамках кодирования текста).

Некодируемый символ заменяется \N{...} escape последовательностью. Набор символов, которые появляются в фигурных скобках, — это свойство Name из Unicode Character Database. Например, немецкая строчная буква 'ß' будет преобразована в последовательность байтов \N{LATIN SMALL LETTER SHARP S}.

Новое в версии 3.5.

Бессостоятельные кодирование и декодирование

Базовый Codec класс определяет эти методы, которые также определяют интерфейсы функций бессостоятельного кодировщика и декодировщика:

Codec.encode(input, errors='strict')

Кодирует объект input и возвращает кортеж (объект вывода, длина потреблённого). Например, кодирование текста преобразует строковый объект в байтовый объект с использованием кодировки набора символов (например, cp1252 или iso-8859-1).

Аргумент errors определяет обработку ошибок. По умолчанию используется обработка 'strict'.

Метод не должен хранить состояние в экземпляре Codec. Используйте StreamWriter для кодеков, которым необходимо хранить состояние для повышения эффективности кодирования.

Кодировщик должен уметь обрабатывать входной объект нулевой длины и возвращать пустой объект соответствующего типа объекта вывода.

Codec.decode(input, errors='strict')

Декодирует объект input и возвращает кортеж (объект вывода, длина потреблённого). Например, для кодирования текста, декодирование преобразует байтовый объект, закодированный с использованием определённой кодировки набора символов, в строковый объект.

Для текстовых кодировок и кодеков байт-в-байты, input должен быть байтовым объектом или объектом, предоставляющим интерфейс для чтения буфера — например, объекты буфера и файлы с отображением памяти.

Аргумент errors определяет обработку ошибок. По умолчанию используется обработка 'strict'.

Метод не должен хранить состояние в экземпляре Codec. Используйте StreamReader для кодеков, которым необходимо хранить состояние для повышения эффективности декодирования.

Декодировщик должен уметь обрабатывать входной объект нулевой длины и возвращать пустой объект соответствующего типа объекта вывода.

Инкрементальное кодирование и декодирование

Классы IncrementalEncoder и IncrementalDecoder предоставляют базовый интерфейс для инкрементального кодирования и декодирования. Кодирование/декодирование входных данных не выполняется с помощью одного вызова функции бессостоятельного кодировщика/декодировщика, а с помощью нескольких вызовов метода encode()/decode() инкрементального кодировщика/декодировщика. Инкрементальный кодировщик/декодировщик отслеживает процесс кодирования/декодирования во время вызовов методов.

Объединённый вывод вызовов методов encode()/decode() такой же, как если бы все отдельные входные данные были объединены в один и этот объединённый вход был закодирован/декодирован бессостоятельным кодировщиком/декодировщиком.

Объекты IncrementalEncoder

Класс IncrementalEncoder используется для кодирования входных данных поэтапно. Он определяет следующие методы, которые каждый инкрементальный кодировщик должен определить, чтобы быть совместимым с реестром кодеков Python.

class codecs.IncrementalEncoder(errors='strict')

Конструктор для экземпляра IncrementalEncoder.

Все инкрементальные кодировщики должны предоставлять этот конструкторский интерфейс. Они могут добавлять дополнительные ключевые аргументы, но только те, которые определены здесь, используются реестром кодеков Python.

Класс IncrementalEncoder может реализовывать различные схемы обработки ошибок, предоставляя ключевой аргумент errors. См. Обработчики ошибок для возможных значений.

Аргумент errors будет присвоен атрибуту с тем же именем. Присвоение этому атрибуту позволяет переключаться между различными стратегиями обработки ошибок во время работы объекта IncrementalEncoder.

encode(object, final=False)

Кодирует object (учитывая текущее состояние кодировщика) и возвращает результат кодирования. Если это последний вызов encode(), final должно быть true (по умолчанию false).

reset()

Сбросить кодировщик до начального состояния. Вывод отбрасывается: вызовите .encode(object, final=True), передав пустую строку байтов или текст, если необходимо, для сброса кодировщика и получения вывода.

getstate()

Возвращает текущее состояние кодировщика, которое должно быть целым числом. Реализация должна гарантировать, что 0 является наиболее распространённым состоянием. (Состояния, более сложные, чем целые числа, могут быть преобразованы в целое число путём маршалинга/сериализации состояния и кодирования байтов полученной строки в целое число.)

setstate(state)

Установить состояние кодировщика в state. state должно быть состоянием кодировщика, возвращённым методом getstate().

Объекты IncrementalDecoder

Класс IncrementalDecoder используется для декодирования входных данных поэтапно. Он определяет следующие методы, которые каждый инкрементальный декодировщик должен определить, чтобы быть совместимым с реестром кодеков Python.

class codecs.IncrementalDecoder(errors='strict')

Конструктор для экземпляра IncrementalDecoder.

Все инкрементальные декодировщики должны предоставлять этот конструкторский интерфейс. Они могут добавлять дополнительные ключевые аргументы, но только те, которые определены здесь, используются реестром кодеков Python.

Класс IncrementalDecoder может реализовывать различные схемы обработки ошибок, предоставляя ключевой аргумент errors. См. Обработчики ошибок для возможных значений.

Аргумент errors будет присвоен атрибуту с тем же именем. Присвоение этому атрибуту позволяет переключаться между различными стратегиями обработки ошибок во время работы объекта IncrementalDecoder.

decode(object, final=False)

Декодирует object (учитывая текущее состояние декодировщика) и возвращает результат декодирования. Если это последний вызов decode(), final должно быть true (по умолчанию false). Если final true, декодировщик должен полностью декодировать входные данные и очистить все буферы. Если это невозможно (например, из-за неполных байтовых последовательностей в конце входных данных), он должен инициировать обработку ошибок, как и в бессостоятельном случае (что может вызвать исключение).

reset()

Сбросить декодировщик до начального состояния.

getstate()

Возвращает текущее состояние декодировщика. Это должен быть кортеж из двух элементов: буфер с необработанными входными данными и целое число (дополнительная информация о состоянии). (Реализация должна гарантировать, что 0 является наиболее распространённой дополнительной информацией о состоянии.) Если эта дополнительная информация о состоянии равна 0, должен быть возможен возврат декодировщика к состоянию без буферизованных входных данных и 0 в качестве дополнительной информации о состоянии, так что подача ранее буферизованных входных данных в декодировщик возвращает его в предыдущее состояние без генерации вывода. (Дополнительная информация о состоянии, более сложная, чем целые числа, может быть преобразована в целое число путём маршалинга/сериализации информации и кодирования байтов полученной строки в целое число.)

setstate(state)

Установить состояние декодировщика в state. state должен быть состоянием декодировщика, возвращённым методом getstate().

Кодирование и декодирование потоков

Классы StreamWriter и StreamReader предоставляют общие рабочие интерфейсы, которые можно использовать для очень лёгкой реализации новых подмодулей кодирования. См. encodings.utf_8 для примера того, как это сделать.

Объекты StreamWriter

Класс StreamWriter является подклассом Codec и определяет следующие методы, которые каждый объект записи потока должен определить для совместимости с реестром кодеков Python.

class codecs.StreamWriter(stream, errors='strict')

Конструктор экземпляра StreamWriter.

Все объекты записи потока должны предоставить этот интерфейс конструктора. Они могут добавлять дополнительные ключевые аргументы, но только определённые здесь используются реестром кодеков Python.

Аргумент stream должен быть объектом, подобным файлу, открытым для записи текстовых или двоичных данных, соответствующим конкретному кодеку.

Объект StreamWriter может реализовать различные схемы обработки ошибок, предоставив ключевой аргумент errors. См. Обработчики ошибок для стандартных обработчиков ошибок, которые может поддерживать кодек базового потока.

Аргумент errors будет назначен атрибуту с таким же именем. Назначение этому атрибуту позволяет переключаться между различными стратегиями обработки ошибок во время работы объекта StreamWriter.

write(object)

Записывает закодированное содержимое объекта в поток.

writelines(list)

Записывает конкатенированную итерируемую последовательность строк в поток (возможно, повторно используя метод write()). Бесконечные или очень большие итерируемые последовательности не поддерживаются. Стандартные кодеки байты-в-байты не поддерживают этот метод.

reset()

Сбрасывает буферы кодека, используемые для хранения внутреннего состояния.

Вызов этого метода должен гарантировать, что данные на выходе находятся в чистом состоянии, которое позволяет добавлять новые свежие данные без необходимости повторного сканирования всего потока для восстановления состояния.

Помимо вышеперечисленных методов, StreamWriter также должен наследоваться от всех других методов и атрибутов из базового потока.

Объекты StreamReader

Класс StreamReader является подклассом Codec и определяет следующие методы, которые каждый объект чтения потока должен определить для совместимости с реестром кодеков Python.

class codecs.StreamReader(stream, errors='strict')

Конструктор экземпляра StreamReader.

Все объекты чтения потока должны предоставить этот интерфейс конструктора. Они могут добавлять дополнительные ключевые аргументы, но только определённые здесь используются реестром кодеков Python.

Аргумент stream должен быть объектом, подобным файлу, открытым для чтения текстовых или двоичных данных, соответствующим конкретному кодеку.

Объект StreamReader может реализовать различные схемы обработки ошибок, предоставив ключевой аргумент errors. См. Обработчики ошибок для стандартных обработчиков ошибок, которые может поддерживать кодек базового потока.

Аргумент errors будет назначен атрибуту с таким же именем. Назначение этому атрибуту позволяет переключаться между различными стратегиями обработки ошибок во время работы объекта StreamReader объекта.

Множество разрешённых значений для аргумента errors может быть расширено с помощью register_error().

read(size=-1, chars=-1, firstline=False)

Декодирует данные из потока и возвращает результирующий объект.

Аргумент chars указывает количество декодированных кодовых точек или байтов для возврата. Метод read() никогда не вернёт больше данных, чем запрошено, но может вернуть меньше, если недостаточно доступно.

Аргумент size указывает приблизительное максимальное количество закодированных байтов или кодовых точек для чтения при декодировании. Декодер может изменить это значение по мере необходимости. Значение по умолчанию -1 означает чтение и декодирование максимально возможно. Этот параметр предназначен для предотвращения декодирования огромных файлов за один шаг.

Флаг firstline указывает, что достаточно вернуть только первую строку, если есть ошибки декодирования в последующих строках.

Метод должен использовать стратегию жадного чтения, означающую, что он должен прочитать столько данных, сколько разрешено в определении кодирования и заданном размере, например, если необязательные окончания кодирования или маркеры состояния доступны в потоке, они также должны быть прочитаны.

readline(size=None, keepends=True)

Считывает одну строку из входного потока и возвращает декодированные данные.

size, если задано, передаётся как аргумент size методу read() потока.

Если keepends ложно, окончания строк будут удалены из возвращаемых строк.

readlines(sizehint=None, keepends=True)

Считывает все доступные строки из входного потока и возвращает их как список строк.

Окончания строк реализуются с помощью метода кодека decode() и включаются в записи списка, если keepends истинно.

sizehint, если задано, передаётся в качестве аргумента size методу read() потока.

reset()

Сбрасывает буферы кодека, используемые для хранения внутреннего состояния.

Обратите внимание, что никакого перемещения потока не должно происходить. Этот метод в первую очередь предназначен для восстановления после ошибок декодирования.

Помимо вышеперечисленных методов, StreamReader также должен наследоваться от всех других методов и атрибутов из базового потока.

Объекты StreamReaderWriter

Класс StreamReaderWriter — это удобный класс, позволяющий оборачивать потоки, которые работают как в режиме чтения, так и в режиме записи.

Конструкция такова, что можно использовать функции-фабрики, возвращаемые функцией lookup(), для построения экземпляра.

class codecs.StreamReaderWriter(stream, Reader, Writer, errors='strict')

Создаёт экземпляр StreamReaderWriter. stream должен быть объектом, подобным файлу. Reader и Writer должны быть функциями-фабриками или классами, предоставляющими интерфейс StreamReader и StreamWriter соответственно. Обработка ошибок выполняется так же, как определено для объектов чтения и записи потоков.

Экземпляры StreamReaderWriter определяют объединённый интерфейс классов StreamReader и StreamWriter. Они наследуют все остальные методы и атрибуты из базового потока.

Объекты StreamRecoder

Класс StreamRecoder преобразует данные из одного кодирования в другое, что иногда бывает полезно при работе с различными кодировками.

Проектирование выполнено таким образом, что можно использовать фабричные функции, возвращаемые функцией lookup(), для создания экземпляра.

class codecs.StreamRecoder(stream, encode, decode, Reader, Writer, errors='strict')

Создаёт экземпляр StreamRecoder, который реализует двустороннее преобразование: encode и decode работают на переднем плане — данные, видимые кодом, вызывающим read() и write(), в то время как Reader и Writer работают на заднем плане — данные в stream.

Вы можете использовать эти объекты для прозрачной транскодировки, например, из Latin-1 в UTF-8 и обратно.

Аргумент stream должен быть объектом, подобным файлу.

Аргументы encode и decode должны соответствовать интерфейсу Codec . Reader и Writer должны быть фабричными функциями или классами, предоставляющими объекты интерфейса StreamReader и StreamWriter соответственно.

Обработка ошибок выполняется так же, как и для читателей и писателей потоков.

Экземпляры StreamRecoder определяют объединённые интерфейсы классов StreamReader и StreamWriter. Они наследуют все остальные методы и атрибуты от базового потока.

Обзор кодировок и Unicode

Строки хранятся внутри как последовательности кодовых точек в диапазоне U+0000–U+10FFFF. (См. PEP 393 для получения дополнительных сведений об реализации.) После того, как объект строки используется вне процессора и памяти, возникает проблема с порядком байтов и способом хранения этих массивов в виде байтов. Как и в других кодировках, сериализация строки в последовательность байтов известна как кодирование, а восстановление строки из последовательности байтов — как декодирование. Существует множество различных кодировок текста, которые коллективно называются кодировками текста.

Простейшая кодировка текста (называемая 'latin-1' или 'iso-8859-1') сопоставляет кодовые точки 0–255 с байтами 0x0–0xff, что означает, что объект строки, содержащий кодовые точки выше U+00FF, не может быть закодирован с помощью этой кодировки. При попытке сделать это будет поднято исключение UnicodeEncodeError, которое будет выглядеть следующим образом (хотя детали сообщения об ошибке могут отличаться): UnicodeEncodeError: 'latin-1' codec can't encode character '\u1234' in position 3: ordinal not in range(256).

Есть ещё одна группа кодировок (так называемые кодировки charmap), которые выбирают другое подмножество всех кодовых точек Unicode и способ сопоставления этих кодовых точек с байтами 0x0–0xff. Чтобы увидеть, как это делается, просто откройте, например, encodings/cp1252.py (кодировка, используемая в основном в Windows). Существует строковая константа с 256 символами, которая показывает, какой символ сопоставлен с каким значением байта.

Все эти кодировки могут кодировать только 256 из 1114112 кодовых точек, определённых в Unicode. Простой и прямой способ хранения каждой кодовой точки Unicode — это хранение каждой кодовой точки в виде четырёх последовательных байтов. Есть две возможности: хранить байты в формате big endian или little endian. Эти две кодировки называются UTF-32-BE и UTF-32-LE соответственно. Их недостаток заключается в том, что, например, при использовании UTF-32-BE на машине с little endian, необходимо будет каждый раз переставлять байты при кодировании и декодировании. UTF-32 избегает этой проблемы: байты всегда будут в естественном порядке байтов. Однако, если эти байты читаются процессором с другим порядком байтов, байты необходимо будет переставить.

Для определения порядка байтов в последовательности байтов UTF-16 или UTF-32 используется так называемый BOM («Byte Order Mark»). Это символ Unicode U+FEFF. Этот символ можно добавить к каждой последовательности байтов UTF-16 или UTF-32. Переставленная версия этого символа (0xFFFE) является недопустимым символом, который может не появляться в тексте Unicode. Поэтому, когда первый символ в последовательности байтов UTF-16 или UTF-32 оказывается U+FFFE, байты необходимо переставить при декодировании.

К сожалению, символ U+FEFF выполнял ещё одну функцию, как ZERO WIDTH NO-BREAK SPACE: символ, у которого нет ширины и который не позволяет разделять слова. Например, он может использоваться для предоставления подсказок алгоритму формирования лигатур. С Unicode 4.0 использование U+FEFF в качестве ZERO WIDTH NO-BREAK SPACE устарело (с U+2060 (WORD JOINER) принявшей на себя эту роль). Тем не менее, программное обеспечение Unicode по-прежнему должно уметь обрабатывать U+FEFF в обеих ролях: как BOM, это устройство для определения расположения байтов в хранилище, которое исчезает после декодирования последовательности байтов в строку; как ZERO WIDTH NO-BREAK SPACE, это обычный символ, который будет декодирован как любой другой.

Есть ещё одна кодировка, способная кодировать весь диапазон символов Unicode: UTF-8. UTF-8 — это 8-битовая кодировка, поэтому проблем с порядком байтов в UTF-8 нет. Каждый байт в последовательности байтов UTF-8 состоит из двух частей: маркерных бит (самые старшие биты) и полезных бит. Маркерные биты — это последовательность от нуля до четырёх 1 бит, за которыми следует 0 бит. Символы Unicode кодируются таким образом (x — это полезные биты, которые при объединении образуют символ Unicode):

Диапазон

Кодирование

U-00000000 … U-0000007F

0xxxxxxx

U-00000080 … U-000007FF

110xxxxx 10xxxxxx

U-00000800 … U-0000FFFF

1110xxxx 10xxxxxx 10xxxxxx

U-00010000 … U-0010FFFF

11110xxx 10xxxxxx 10xxxxxx 10xxxxxx

Самый младший бит символа Unicode — это самый правый бит x.

Поскольку UTF-8 — это 8-битовая кодировка, BOM не требуется, и любой U+FEFF символ в декодированной строке (даже если это первый символ) обрабатывается как ZERO WIDTH NO-BREAK SPACE.

Без внешней информации невозможно надёжно определить, какая кодировка была использована для кодирования строки. Каждая кодировка charmap может декодировать любую случайную последовательность байтов. Однако это невозможно с UTF-8, так как последовательности байтов UTF-8 имеют структуру, которая не допускает произвольных последовательностей байтов. Чтобы повысить надёжность определения кодировки UTF-8, Microsoft разработала вариант UTF-8 (который Python называет "utf-8-sig"), используемый в программе Notepad: перед записью любого символа Unicode в файл записывается закодированная в UTF-8 BOM (которая выглядит как последовательность байтов: 0xef, 0xbb, 0xbf). Поскольку маловероятно, что любой файл, закодированный в charmap, начнётся с этих значений байтов (которые, например, сопоставлялись бы

в iso-8859-1), это повышает вероятность правильного угадывания кодировки utf-8-sig по последовательности байтов. Поэтому здесь BOM используется не для определения порядка байтов, используемого для генерации последовательности байтов, а как подпись, которая помогает в угадывании кодировки. При кодировании кодировка utf-8-sig запишет 0xef, 0xbb, 0xbf в качестве первых трёх байтов в файл. При декодировании utf-8-sig пропустит эти три байта, если они появятся в первых трёх байтах файла. В UTF-8 использование BOM не рекомендуется и его следует, как правило, избегать.

Стандартные кодировки

Python предоставляет ряд встроенных кодировок, реализованных либо как функции на C, либо с помощью словарей в качестве таблиц сопоставлений. В следующей таблице перечислены кодировки по имени, вместе с некоторыми общими псевдонимами и языками, для которых кодировка, скорее всего, используется. Ни список псевдонимов, ни список языков не претендуют на полноту. Обратите внимание, что альтернативы написания, отличающиеся только регистром или использованием дефиса вместо нижнего подчёркивания, также являются допустимыми псевдонимами; следовательно, например, 'utf-8' является допустимым псевдонимом для кодировки 'utf_8'.

Подробность реализации CPython: Некоторые распространённые кодировки могут обходить механизм поиска кодировок для повышения производительности. Эти возможности оптимизации распознаются CPython только для ограниченного набора (регистронезависимых) псевдонимов: utf-8, utf8, latin-1, latin1, iso-8859-1, iso8859-1, mbcs (только Windows), ascii, us-ascii, utf-16, utf16, utf-32, utf32 и те же с использованием нижнего подчёркивания вместо дефисов. Использование альтернативных псевдонимов для этих кодировок может привести к замедлению выполнения.

Изменено в версии 3.6: Возможность оптимизации распознана для us-ascii.

Многие наборы символов поддерживают одни и те же языки. Они различаются отдельными символами (например, поддерживается ли символ EURO SIGN или нет) и назначением символов кодовым позициям. В частности, для европейских языков обычно существуют следующие варианты:

  • набор символов ISO 8859
  • страница кодирования Microsoft Windows, обычно производная от набора символов 8859, но заменяющая управляющие символы дополнительными графическими символами
  • страница кодирования IBM EBCDIC
  • страница кодирования IBM PC, совместимая с ASCII

Кодек

Псевдонимы

Языки

ascii

646, us-ascii

Английский

big5

big5-tw, csbig5

Традиционный китайский

big5hkscs

big5-hkscs, hkscs

Традиционный китайский

cp037

IBM037, IBM039

Английский

cp273

273, IBM273, csIBM273

Немецкий

Добавлено в версии 3.4.

cp424

EBCDIC-CP-HE, IBM424

Иврит

cp437

437, IBM437

Английский

cp500

EBCDIC-CP-BE, EBCDIC-CP-CH, IBM500

Западная Европа

cp720

Арабский

cp737

Греческий

cp775

IBM775

Балтийские языки

cp850

850, IBM850

Западная Европа

cp852

852, IBM852

Центральная и Восточная Европа

cp855

855, IBM855

Болгарский, Белорусский, Македонский, Русский, Сербский

cp856

Иврит

cp857

857, IBM857

Турецкий

cp858

858, IBM858

Западная Европа

cp860

860, IBM860

Португальский

cp861

861, CP-IS, IBM861

Исландский

cp862

862, IBM862

Иврит

cp863

863, IBM863

Канадский

cp864

IBM864

Арабский

cp865

865, IBM865

Датский, Норвежский

cp866

866, IBM866

Русский

cp869

869, CP-GR, IBM869

Греческий

cp874

Тайский

cp875

Греческий

cp932

932, ms932, mskanji, ms-kanji

Японский

cp949

949, ms949, uhc

Корейский

cp950

950, ms950

Традиционный китайский

cp1006

Урду

cp1026

ibm1026

Турецкий

cp1125

1125, ibm1125, cp866u, ruscii

Украинский

Добавлено в версии 3.4.

cp1140

ibm1140

Западная Европа

cp1250

windows-1250

Центральная и Восточная Европа

cp1251

windows-1251

Болгарский, Белорусский, Македонский, Русский, Сербский

cp1252

windows-1252

Западная Европа

cp1253

windows-1253

Греческий

cp1254

windows-1254

Турецкий

cp1255

windows-1255

Иврит

cp1256

windows-1256

Арабский

cp1257

windows-1257

Балтийские языки

cp1258

windows-1258

Вьетнамский

euc_jp

eucjp, ujis, u-jis

Японский

euc_jis_2004

jisx0213, eucjis2004

Японский

euc_jisx0213

eucjisx0213

Японский

euc_kr

euckr, korean, ksc5601, ks_c-5601, ks_c-5601-1987, ksx1001, ks_x-1001

Корейский

gb2312

chinese, csiso58gb231280, euc-cn, euccn, eucgb2312-cn, gb2312-1980, gb2312-80, iso-ir-58

Упрощенный китайский

gbk

936, cp936, ms936

Объединённый китайский

gb18030

gb18030-2000

Объединённый китайский

hz

hzgb, hz-gb, hz-gb-2312

Упрощенный китайский

iso2022_jp

csiso2022jp, iso2022jp, iso-2022-jp

Японский

iso2022_jp_1

iso2022jp-1, iso-2022-jp-1

Японский

iso2022_jp_2

iso2022jp-2, iso-2022-jp-2

Японский, Корейский, Упрощенный китайский, Западная Европа, Греческий

iso2022_jp_2004

iso2022jp-2004, iso-2022-jp-2004

Японский

iso2022_jp_3

iso2022jp-3, iso-2022-jp-3

Японский

iso2022_jp_ext

iso2022jp-ext, iso-2022-jp-ext

Японский

iso2022_kr

csiso2022kr, iso2022kr, iso-2022-kr

Корейский

latin_1

iso-8859-1, iso8859-1, 8859, cp819, latin, latin1, L1

Западная Европа

iso8859_2

iso-8859-2, latin2, L2

Центральная и Восточная Европа

iso8859_3

iso-8859-3, latin3, L3

Эсперанто, Мальтийский

iso8859_4

iso-8859-4, latin4, L4

Балтийские языки

iso8859_5

iso-8859-5, cyrillic

Болгарский, Белорусский, Македонский, Русский, Сербский

iso8859_6

iso-8859-6, arabic

Арабский

iso8859_7

iso-8859-7, greek, greek8

Греческий

iso8859_8

iso-8859-8, hebrew

Иврит

iso8859_9

iso-8859-9, latin5, L5

Турецкий

iso8859_10

iso-8859-10, latin6, L6

Языки Северной Европы

iso8859_11

iso-8859-11, thai

Тайские языки

iso8859_13

iso-8859-13, latin7, L7

Балтийские языки

iso8859_14

iso-8859-14, latin8, L8

Кельтские языки

iso8859_15

iso-8859-15, latin9, L9

Западная Европа

iso8859_16

iso-8859-16, latin10, L10

Юго-Восточная Европа

johab

cp1361, ms1361

Корейский

koi8_r

Русский

koi8_t

Таджикский

Добавлено в версии 3.5.

koi8_u

Украинский

kz1048

kz_1048, strk1048_2002, rk1048

Казахский

Добавлено в версии 3.5.

mac_cyrillic

maccyrillic

Болгарский, Белорусский, Македонский, Русский, Сербский

mac_greek

macgreek

Греческий

mac_iceland

maciceland

Исландский

mac_latin2

maclatin2, maccentraleurope, mac_centeuro

Центральная и Восточная Европа

mac_roman

macroman, macintosh

Западная Европа

mac_turkish

macturkish

Турецкий

ptcp154

csptcp154, pt154, cp154, cyrillic-asian

Казахский

shift_jis

csshiftjis, shiftjis, sjis, s_jis

Японский

shift_jis_2004

shiftjis2004, sjis_2004, sjis2004

Японский

shift_jisx0213

shiftjisx0213, sjisx0213, s_jisx0213

Японский

utf_32

U32, utf32

все языки

utf_32_be

UTF-32BE

все языки

utf_32_le

UTF-32LE

все языки

utf_16

U16, utf16

все языки

utf_16_be

UTF-16BE

все языки

utf_16_le

UTF-16LE

все языки

utf_7

U7, unicode-1-1-utf-7

все языки

utf_8

U8, UTF, utf8, cp65001

все языки

utf_8_sig

все языки

Изменено в версии 3.4: Кодировщики utf-16* и utf-32* больше не допускают кодирования точек кода суррогатных знаков (U+D800–U+DFFF). Декoдировщики utf-32* больше не декодируют последовательности байтов, соответствующие точкам кода суррогатных знаков.

Изменено в версии 3.8: cp65001 теперь является псевдонимом для utf_8.

Python-специфические кодировки

Несколько предопределенных кодеков специфичны для Python, поэтому их имена кодеков не имеют значения за пределами Python. Эти кодеки перечислены в таблицах ниже в зависимости от ожидаемых типов входных и выходных данных (обратите внимание, что, хотя кодировки текста являются наиболее распространенным случаем использования кодеков, базовое кодековое инфраструктура поддерживает произвольные преобразования данных, а не только кодировки текста). Для асимметричных кодеков указанное значение описывает направление кодирования.

Кодировки текста

Следующие кодеки обеспечивают кодирование str в bytes и декодирование объектов типа bytes в str, аналогично кодировкам текста Unicode.

Кодек

Псевдонимы

Значение

idna

Реализация RFC 3490, см. также encodings.idna. Поддерживается только errors='strict'.

mbcs

ansi, dbcs

Только для Windows: кодирует операнд в соответствии с кодовой страницей ANSI (CP_ACP).

oem

Только для Windows: кодирует операнд в соответствии с кодовой страницей OEM (CP_OEMCP).

Добавлена в версии 3.6.

palmos

Кодировка PalmOS 3.5.

punycode

Реализация RFC 3492. Не поддерживаются состоявочные кодеки.

raw_unicode_escape

Кодировка Latin-1 с \uXXXX и \UXXXXXXXX для других кодовых точек. Существующие обратные слэши не экранируются никоим образом. Используется в протоколе Python pickle.

undefined

Вызывает исключение для всех преобразований, даже для пустых строк. Обработчик ошибок игнорируется.

unicode_escape

Кодировка, подходящая в качестве содержимого литерала Unicode в коде Python, закодированном в ASCII, за исключением того, что кавычки не экранируются. Декодируется из кода Latin-1. Обратите внимание, что код Python по умолчанию использует UTF-8.

Изменено в версии 3.8: Кодек «unicode_internal» удален.

Бинарные преобразования

Следующие кодеки обеспечивают бинарные преобразования: соответствия объектов типа bytes с bytes. Они не поддерживаются bytes.decode() (который производит только str вывод).

Кодек

Псевдонимы

Значение

Кодировщик/декодер

base64_codec 1

base64, base_64

Преобразует операнд в многострочный MIME base64 (результат всегда включает в себя заключительный '\n').

Изменено в версии 3.4: принимает любой объект типа bytes в качестве входных данных для кодирования и декодирования

base64.encodebytes() / base64.decodebytes()

bz2_codec

bz2

Сжимает операнд с помощью bz2.

bz2.compress() / bz2.decompress()

hex_codec

hex

Преобразует операнд в шестнадцатеричное представление с двумя цифрами на байт.

binascii.b2a_hex() / binascii.a2b_hex()

quopri_codec

quopri, quotedprintable, quoted_printable

Преобразует операнд в MIME quoted printable.

quopri.encode() с quotetabs=True / quopri.decode()

uu_codec

uu

Преобразует операнд с помощью uuencode.

uu.encode() / uu.decode()

zlib_codec

zip, zlib

Сжимает операнд с помощью gzip.

zlib.compress() / zlib.decompress()

1

В дополнение к объектам типа bytes, 'base64_codec' также принимает ASCII-только экземпляры str для декодирования

Добавлена в версии 3.2: Восстановление бинарных преобразований.

Изменено в версии 3.4: Восстановлены псевдонимы для бинарных преобразований.

Текстовые преобразования

Следующий кодек обеспечивает текстовое преобразование: отображение str на str. Он не поддерживается str.encode() (который производит только bytes вывод).

Кодек

Псевдонимы

Значение

rot_13

rot13

Возвращает шифрование Цезаря операнда.

Добавлена в версии 3.2: Восстановление текстового преобразования.

Изменено в версии 3.4: Восстановлен псевдоним.

encodings.idna — Международные доменные имена в приложениях

Этот модуль реализует RFC 3490 (Международные доменные имена в приложениях) и RFC 3492 (Nameprep: Профиль Stringprep для международных доменных имён (IDN)). Он основан на кодировке punycode и stringprep.

Если вам необходим стандарт IDNA 2008 из RFC 5891 и RFC 5895, используйте сторонний модуль idna.

Эти RFC вместе определяют протокол для поддержки символов, отличных от ASCII, в доменных именах. Доменное имя, содержащее символы, отличные от ASCII (например, www.Alliancefrançaise.nu), преобразуется в совместимое с ASCII кодирование (ACE, например www.xn--alliancefranaise-npb.nu). Форма ACE доменного имени затем используется во всех местах, где произвольные символы не допускаются протоколом, таких как запросы DNS, поля HTTP Host и т. д. Это преобразование выполняется в приложении; по возможности, незаметно для пользователя: Приложение должно прозрачно преобразовывать метки доменных имён Unicode в IDNA в сети и преобразовывать метки ACE обратно в Unicode перед представлением их пользователю.

Python поддерживает это преобразование несколькими способами: кодек idna выполняет преобразование между Unicode и ACE, разделяя входную строку на метки на основе разделителей, определенных в разделе 3.1 RFC 3490 и преобразуя каждую метку в ACE, как требуется, и наоборот, разделяя входную строку байтов на метки на основе разделителя . и преобразуя любые найденные метки ACE в Unicode. Кроме того, модуль socket прозрачно преобразует имена хостов Unicode в ACE, так что приложениям не нужно беспокоиться о преобразовании имён хостов, когда они передают их модулю сокетов. Кроме того, модули, которые имеют имена хостов в качестве параметров функций, такие как http.client и ftplib, принимают имена хостов Unicode (http.client затем также прозрачно отправляет имя хоста IDNA в поле Host, если оно вообще отправляется).

При получении имён хостов из сети (например, в обратном поиске имён) автоматическое преобразование в Unicode не выполняется: приложения, желающие представить такие имена хостов пользователю, должны декодировать их в Unicode.

Модуль encodings.idna также реализует процедуру nameprep, которая выполняет определённые нормализации имён хостов для достижения регистронезависимости международных доменных имён и объединения похожих символов. Функции nameprep можно использовать напрямую, если это необходимо.

encodings.idna.nameprep(label)

Возвращает преобразованную версию label. Реализация в настоящее время предполагает строки запросов, поэтому AllowUnassigned равно true.

encodings.idna.ToASCII(label)

Преобразует метку в ASCII в соответствии с RFC 3490. UseSTD3ASCIIRules предполагается false.

encodings.idna.ToUnicode(label)

Преобразует метку в Unicode в соответствии с RFC 3490.

encodings.mbcs — Кодировка ANSI Windows

Этот модуль реализует кодировку ANSI (CP_ACP).

Доступность: Только Windows.

Изменено в версии 3.3: Поддержка любого обработчика ошибок.

Изменено в версии 3.2: До версии 3.2 аргумент errors игнорировался; 'replace' всегда использовался для кодирования, а 'ignore' для декодирования.

encodings.utf_8_sig — Кодек UTF-8 с сигнатурой BOM

Этот модуль реализует вариант кодека UTF-8. При кодировании в UTF-8 закодированная BOM UTF-8 будет добавлена в начало. Для состоятельного кодировщика это делается только один раз (при первом записи в поток байтов). При декодировании необязательная закодированная BOM UTF-8 в начале данных будет пропущена.

© 2001–2022 Python Software Foundation
Licensed under the PSF License.
https://docs.python.org/3.9/library/codecs.html

Spec-Zone.ru

Настройки Оффлайн Что нового Помощь О нас
Spec-Zone .ru
спецификации, руководства, описания, API