tf.experimental.dtensor.initialize_accelerator_system
Инициализирует ускорители и коммуникационные сети для DTensor.
tf.experimental.dtensor.initialize_accelerator_system(
device_type: Optional[str] = None,
enable_coordination_service: Optional[bool] = True,
num_logical_cpu_devices: Optional[int] = None,
experimental_reset_context: Optional[bool] = False,
experimental_enable_megcore: Optional[bool] = False
) -> str
DTensor настраивает TensorFlow для работы в локальном режиме или в режиме с несколькими клиентами.
- В локальном режиме сетка может использовать только устройства, подключенные к текущему процессу.
- В режиме с несколькими клиентами сетка может охватывать устройства от нескольких клиентов.
Если DTENSOR_JOBS не пусто, DTensor настраивает TensorFlow для работы в режиме с несколькими клиентами, используя распределенную среду выполнения. В режиме с несколькими клиентами устройства на разных клиентах могут обмениваться данными друг с другом.
Следующие переменные среды контролируют поведение этой функции.
-
DTENSOR_JOBS: строка, запятая-разделенный список. Каждый элемент списка имеет формат{hostname}:{port}. Если пустая, DTensor работает в локальном режиме. Примеры допустимых значенийDTENSOR_JOBS:- 4 клиента на localhost:
localhost:10000,localhost:10001,localhost:10002,localhost:10003 - 2 клиента на host1, 2 клиента на host2
host1:10000,host1:10001,host2:10000,host2:10003Если имена хостов — адреса BNS, элементы должны быть отсортированы в алфавитном порядке.
- 4 клиента на localhost:
-
DTENSOR_CLIENT_ID: целое число, от0доnum_clients - 1, для идентификации идентификатора клиента текущего процесса. Значение по умолчанию —0. -
DTENSOR_JOB_NAME: строка, строка для имени задания TensorFlow. Имя задания управляет разделом имени задания в TensorFlow DeviceSpecs, например,job:workerв/job:worker/replica:0/task:0/device:TPU:0, когда имя задания —worker. Значение по умолчанию —localhostв локальном режиме иworkerв режиме с несколькими клиентами. Все клиенты DTensor в одном кластере с несколькими клиентами используют одно и то же имя задания. -
DTENSOR_USE_PARALLEL_EXECUTOR: строка со значениемpw, чтобы указать, что бэкенд — Pathways, а в противном случае — TensorFlow.
| Аргументы | |
|---|---|
device_type | Тип используемого ускорителя, может быть CPU, GPU или TPU. Если None, используется tf.experimental.dtensor.preferred_device_type(). |
enable_coordination_service | Если true, включить службу распределенного управления, чтобы убедиться, что рабочие знают устройства друг друга, когда клиентов больше одного. |
num_logical_cpu_devices | количество логических ЦП-устройств на клиент DTensor. По умолчанию — текущее количество логических ЦП (dtensor.num_local_devices("CPU")), когда device_type — CPU, иначе автоматически настраивается для соответствия количеству локальных GPU/TPU-устройств. |
experimental_reset_context | Сбросить контекст TensorFlow. Поведение существующих объектов TensorFlow (например, тензоров) не определено. Установите это значение в True в качестве аварийного выхода, если нет четкого способа переписать свой код, чтобы вызвать initialize_accelerator_system() перед вызовом API TensorFlow, который инициализирует контекст. |
experimental_enable_megcore | Дополнительно включить megcore в бэкенде. |
| Возвращаемые значения | |
|---|---|
device_type | тип инициализированного ускорителя. |
© 2022 The TensorFlow Authors. All rights reserved.
Licensed under the Creative Commons Attribution License 4.0.
Code samples licensed under the Apache 2.0 License.
https://www.tensorflow.org/api_docs/python/tf/experimental/dtensor/initialize_accelerator_system