Выполняет редукцию к одному GPU по краям некоторой иерархии и транслирует обратно на каждый GPU по тому же пути. Перед выполнением all-reduce тензоры будут переупакованы или агрегированы для повышения эффективности межсетевого транспорта.
Это редукция, созданная для Nvidia DGX-1, которая предполагает, что GPU подключены так же, как и на машине DGX-1. Если у вас есть другие межсетевые соединения GPU, вероятно, это будет медленнее, чем tf.distribute.ReductionToOneDevice.
Аргументы
num_packs
значения будут упакованы в этом количестве разделов. num_packs должно быть больше или равно 0. Когда оно равно нулю, никакой упаковки не выполняется.