Это количество шагов обучения, выполняемых в системе TPU, прежде чем возвращение на процессорный хост для каждого Session.run. Это означает, что глобальный шаг увеличивается iterations_per_loop раз в одной Session.run. Рекомендуется устанавливать его как количество глобальных шагов для следующей точки сохранения. Обратите внимание, что при оценке не используйте это значение, вместо этого мы выполняем полную оценку steps на TPU для одного Session.run. [Экспериментально]: iterations_per_loop может быть указан как временной интервал. Чтобы указать N секунд в одном Session.run, можно указать его как Ns и заменить N на желаемое количество секунд. В качестве альтернативы, единица измерения времени также может быть указана в минутах или часах, например, 3600s или 60m или 1h .
num_shards
(Устаревшее, игнорируется TPUEstimator). Количество реплик модели в системе. В случае отсутствия параллелизма моделей это число равно общему количеству ядер TPU. При параллелизме моделей общее количество ядер TPU равно num_cores_per_replica * num_shards.
num_cores_per_replica
По умолчанию None, что отключает параллелизм моделей. Целое число, описывающее количество ядер TPU на одну реплику модели. Это необходимо для параллелизма моделей, который позволяет разделить модель на несколько ядер. В настоящее время num_cores_per_replica должен быть 1, 2, 4 или 8.
per_host_input_for_training
Если True, для PER_HOST_V1, input_fn вызывается один раз на каждом хосте, и количество хостов должно быть меньше или равно количеству реплик. Для PER_HOST_V2 input_fn вызывается один раз для каждого хоста (если количество хостов меньше количества реплик) или реплики (если количество реплик меньше количества хостов). С конфигурацией входной линии на ядро она вызывается один раз для каждого ядра. С глобальным размером пакета train_batch_size в конструкторе TPUEstimator, размер пакета для каждого фрагмента составляет train_batch_size // # хостов в True или PER_HOST_V1 режиме. В режиме PER_HOST_V2 это train_batch_size // # ядер. В режиме BROADCASTinput_fn вызывается только один раз на хосте 0, а тензоры транслируются во все остальные реплики. Размер пакета равен train_batch_size. С конфигурацией входной линии на ядро размер пакета фрагмента также составляет train_batch_size // # ядер. Примечание: per_host_input_for_training==PER_SHARD_V1 поддерживает только режим.TRAIN.
tpu_job_name
Название задания TPU. Обычно это имя автоматически определяется в TPUEstimator, однако при использовании распространения ClusterSpec в более сложных конфигурациях кластеров вам может потребоваться указать имя задания как строку.
initial_infeed_sleep_secs
Количество секунд, которое поток infeed должен ждать перед добавлением в очередь первой порции. Это помогает избежать таймаутов для моделей, которые требуют длительного времени компиляции.
input_partition_dims
Вложенный список для описания размеров разбиения для всех тензоров из input_fn(). Структура input_partition_dims должна соответствовать структуре features и labels из input_fn(). Общее количество разделов должно совпадать с num_cores_per_replica. Например, если input_fn() возвращает два тензора: изображения с формой [N, H, W, C] и метки [N]. input_partition_dims = [[1, 2, 2, 1], None] разделит изображения на 4 части и передаст их в 4 ядра TPU. Тензор меток непосредственно транслируется во все ядра TPU, так как размер разбиения равен None. Текущие ограничения: эта функция поддерживается только с режимом ввода PER_HOST_V2.
eval_training_input_configuration
Если SLICED, input_fn вызывается только один раз на хосте 0, а тензоры транслируются во все остальные реплики. В отличие от per_host_input_for_training=BROADCAST, каждая реплика получит только часть данных, а не полную копию. Если PER_HOST_V1, поведение определяется per_host_input_for_training.
experimental_host_call_every_n_steps
В цикле обучения этот аргумент задаёт частоту выполнения вызовов хоста во время обучения. Вызовы хоста будут выполняться каждые n шагов в цикле обучения, где n — значение этого аргумента.
Возбуждает
ValueError
Если num_cores_per_replica не равно 1, 2, 4, 8, ..., 128.