6.12 Половинная точность с плавающей запятой
На целевых устройствах ARM компилятор GCC поддерживает половинную точность (16-битные) числа с плавающей запятой через тип __fp16. Для использования этого типа необходимо явно включить его с помощью параметра командной строки -mfp16-format.
ARM поддерживает два несовместимых представления для значений с плавающей запятой половинной точности. Необходимо выбрать одно из представлений и использовать его последовательно в вашей программе.
Указание -mfp16-format=ieee выбирает формат IEEE 754-2008. Этот формат может представлять нормализованные значения в диапазоне от 2^-14 до 65504. Точность мантиссы составляет 11 бит, что приблизительно соответствует 3 десятичным знакам.
Указание -mfp16-format=alternative выбирает альтернативный формат ARM. Это представление похоже на формат IEEE, но не поддерживает бесконечности или NaN. Вместо этого диапазон показателей расширен, так что этот формат может представлять нормализованные значения в диапазоне от 2^-14 до 131008.
Тип __fp16 является только форматом хранения. Для целей арифметических и других операций значения __fp16 в выражениях C или C++ автоматически повышаются до float. Кроме того, вы не можете объявить функцию со значением возврата или параметрами типа __fp16.
Обратите внимание, что преобразования из double в __fp16 включают промежуточное преобразование в float. Из-за округления это иногда может привести к другому результату, чем прямое преобразование.
ARM предоставляет аппаратную поддержку преобразований между __fp16 и float значениями как расширение для VFP и NEON (Advanced SIMD). GCC генерирует код, использующий эти аппаратные инструкции, если вы компилируете с параметрами для выбора FPU, который их предоставляет; например, -mfpu=neon-fp16 -mfloat-abi=softfp, в дополнение к параметру -mfp16-format для выбора формата половинной точности.
Поддержка типа данных __fp16 на уровне языка независима от того, генерирует ли GCC код, использующий аппаратные инструкции для работы с плавающей запятой. В тех случаях, когда аппаратная поддержка не указана, GCC реализует преобразования между __fp16 и float значениями как вызовы библиотеки.
© Free Software Foundation
Licensed under the GNU Free Documentation License, Version 1.3.
https://gcc.gnu.org/onlinedocs/gcc-4.9.4/gcc/Half-Precision.html