Spec-Zone.ru › TensorFlow 2.9

tf.raw_ops.UnicodeDecodeWithOffsets

Декодирует каждую строку в input в последовательность кодовых точек Юникода.

Просмотр псевдонимов

Псевдонимы для миграции

См. Руководство по миграции для получения дополнительной информации.

tf.compat.v1.raw_ops.UnicodeDecodeWithOffsets

tf.raw_ops.UnicodeDecodeWithOffsets(
    input,
    input_encoding,
    errors='replace',
    replacement_char=65533,
    replace_control_characters=False,
    Tsplits=tf.dtypes.int64,
    name=None
)

Кодовые точки символов для всех строк возвращаются с использованием одного вектора char_values, где строки расширяются до символов в порядке строк.

Аналогично, начальные байтовые смещения символов возвращаются с использованием одного вектора char_to_byte_starts, где строки расширяются в порядке строк.

Тензор row_splits указывает, где начинаются и заканчиваются кодовые точки и начальные смещения для каждой входной строки внутри тензоров char_values и char_to_byte_starts. В частности, значения для i-й строки (в порядке строк) хранятся в срезе [row_splits[i]:row_splits[i+1]]. Таким образом:

  • char_values[row_splits[i]+j] — это кодовая точка Юникода для j-го символа в i-й строке (в порядке строк).
  • char_to_bytes_starts[row_splits[i]+j] — это начальное байтовое смещение для j-го символа в i-й строке (в порядке строк).
  • row_splits[i+1] - row_splits[i] — это количество символов в i-й строке (в порядке строк).
Аргументы
input A Tensor типа string. Текст для декодирования. Может иметь любую форму. Обратите внимание, что вывод сжат в вектор значений символов.
input_encoding A string. Кодировка текста входных строк. Это любая из кодировок, поддерживаемых алгоритмическими преобразователями ICU ucnv. Примеры: "UTF-16", "US ASCII", "UTF-8".
errors Необязательный string из: "strict", "replace", "ignore". По умолчанию "replace". Политика обработки ошибок, когда в вводе обнаружено некорректное форматирование. Значение 'strict' приведет к тому, что операция выдаст ошибку InvalidArgument при любом некорректном форматировании ввода. Значение 'replace' (по умолчанию) приведет к тому, что операция заменит любое некорректное форматирование ввода кодовой точкой replacement_char. Значение 'ignore' приведет к тому, что операция пропустит любое некорректное форматирование ввода и не создаст соответствующий символ вывода.
replacement_char Необязательная int. По умолчанию 65533. Кодовая точка символа замены, которая должна использоваться вместо любого некорректного форматирования ввода, когда errors='replace'. Может использоваться любая допустимая кодовая точка Юникода. Значение по умолчанию — символ замены по умолчанию для Юникода — 0xFFFD или U+65533.)
replace_control_characters Необязательный bool. По умолчанию False. Следует ли заменять управляющие символы C0 (00-1F) на replacement_char. По умолчанию ложь.
Tsplits Необязательный tf.DType из: tf.int32, tf.int64. По умолчанию tf.int64.
name Имя операции (необязательно).
Возвращаемое значение
Кортеж из объектов Tensor (row_splits, char_values, char_to_byte_starts).
row_splits A Tensor типа Tsplits.
char_values A Tensor типа int32.
char_to_byte_starts A Tensor типа int64.

© 2022 The TensorFlow Authors. All rights reserved.
Licensed under the Creative Commons Attribution License 4.0.
Code samples licensed under the Apache 2.0 License.
https://www.tensorflow.org/versions/r2.9/api_docs/python/tf/raw_ops/UnicodeDecodeWithOffsets

Spec-Zone.ru

Настройки Оффлайн Что нового Помощь О нас
Spec-Zone .ru
спецификации, руководства, описания, API