tf.raw_ops.UnicodeDecodeWithOffsets
Декодирует каждую строку в input в последовательность кодовых точек Юникода.
tf.raw_ops.UnicodeDecodeWithOffsets(
input, input_encoding, errors='replace', replacement_char=65533,
replace_control_characters=False, Tsplits=tf.dtypes.int64, name=None
)
Кодовые точки символов для всех строк возвращаются с использованием одного вектора char_values, с расширением строк до символов в порядке следования строк. Аналогично, начальные байтовые смещения символов возвращаются с использованием одного вектора char_to_byte_starts, со строками, расширенными в порядке следования строк.
Тензор row_splits указывает, где начинаются и заканчиваются кодовые точки и начальные смещения для каждой входной строки в тензорах char_values и char_to_byte_starts. В частности, значения для i-й строки (в порядке следования строк) хранятся в срезе [row_splits[i]:row_splits[i+1]]. Таким образом:
-
char_values[row_splits[i]+j]— это кодовая точка символаj-го символа вi-й строке (в порядке следования строк). -
char_to_bytes_starts[row_splits[i]+j]— это начальное байтовое смещениеj-го символа вi-й строке (в порядке следования строк). -
row_splits[i+1] - row_splits[i]— это количество символов вi-й строке (в порядке следования строк).
| Аргументы | |
|---|---|
input | Tensor типа string. Текст, подлежащий декодированию. Может иметь любую форму. Обратите внимание, что вывод сжат в вектор значений символов. |
input_encoding | string. Кодировка текста входных строк. Это любая из кодировок, поддерживаемых алгоритмическими преобразователями ICU ucnv. Примеры: "UTF-16", "US ASCII", "UTF-8". |
errors | Необязательный string из: "strict", "replace", "ignore". По умолчанию "replace". Политика обработки ошибок, когда в вводе обнаружен неверный формат. Значение «strict» приведет к тому, что операция выдаст ошибку InvalidArgument при любом неверном формате ввода. Значение «replace» (по умолчанию) приведет к тому, что операция заменит любой неверный формат ввода кодовой точкой replacement_char. Значение «ignore» приведет к тому, что операция пропустит любой неверный формат ввода и не произведёт соответствующий выходной символ. |
replacement_char | Необязательный int. По умолчанию 65533. Кодовая точка символа-заменителя, используемая вместо любого неверного форматирования ввода при errors='replace'. Можно использовать любую допустимую кодовую точку Юникода. Значение по умолчанию — стандартная замена Юникода — 0xFFFD или U+65533.) |
replace_control_characters | Необязательный bool. По умолчанию False. Нужно ли заменять управляющие символы C0 (00-1F) на replacement_char. По умолчанию false. |
Tsplits | Необязательный tf.DType из: tf.int32, tf.int64. По умолчанию tf.int64. |
name | Имя операции (необязательно). |
| Возвращаемое значение | |
|---|---|
Кортеж объектов Tensor (row_splits, char_values, char_to_byte_starts). | |
row_splits | Tensor типа Tsplits. |
char_values | Tensor типа int32. |
char_to_byte_starts | Tensor типа int64. |
© 2020 The TensorFlow Authors. All rights reserved.
Licensed under the Creative Commons Attribution License 3.0.
Code samples licensed under the Apache 2.0 License.
https://www.tensorflow.org/versions/r2.3/api_docs/python/tf/raw_ops/UnicodeDecodeWithOffsets