tf.compat.v1.train.replica_device_setter
Возвращает функцию, которая используется при построении графа для реплик.
tf.compat.v1.train.replica_device_setter(
ps_tasks=0,
ps_device='/job:ps',
worker_device='/job:worker',
merge_devices=True,
cluster=None,
ps_ops=None,
ps_strategy=None
)
Функции устройств используются в операторе with tf.device(device_function):, чтобы автоматически назначать устройства объектам Operation при их создании. Ограничения устройств добавляются из самого внутреннего контекста, работая наружу. Поведение слияния добавляет ограничения к полям, которые ещё не установлены более внутренним контекстом. В настоящее время полями являются (job, task, cpu/gpu).
Если cluster равно None, и ps_tasks равно 0, возвращаемая функция является функцией без действий. В противном случае, значение ps_tasks выводится из cluster.
По умолчанию, только операции переменных размещаются на задачах ps, и стратегия размещения выполняется по круговому циклу по всем задачам ps. Можно использовать пользовательскую функцию ps_strategy для более интеллектуального размещения, например, tf.contrib.training.GreedyLoadBalancingStrategy.
Например,
# To build a cluster with two ps jobs on hosts ps0 and ps1, and 3 worker
# jobs on hosts worker0, worker1 and worker2.
cluster_spec = {
"ps": ["ps0:2222", "ps1:2222"],
"worker": ["worker0:2222", "worker1:2222", "worker2:2222"]}
with
tf.compat.v1.device(tf.compat.v1.train.replica_device_setter(cluster=cluster_spec)):
# Build your graph
v1 = tf.Variable(...) # assigned to /job:ps/task:0
v2 = tf.Variable(...) # assigned to /job:ps/task:1
v3 = tf.Variable(...) # assigned to /job:ps/task:0
# Run compute
| Аргументы | |
|---|---|
ps_tasks | Количество задач в задаче ps. Игнорируется, если предоставлено cluster. |
ps_device | Строка. Устройство задачи ps. Если пустая, задача ps не используется. По умолчанию равно ps. |
worker_device | Строка. Устройство задачи worker. Если пустая, задача worker не используется. |
merge_devices | Логическое значение. Если True, сливает или устанавливает устройство только в том случае, если ограничение устройства полностью не установлено. Объединяет спецификацию устройства, а не перезаписывает её. |
cluster | Протокол ClusterDef или ClusterSpec. |
ps_ops | Список строк, представляющих типы Operation, которые должны быть размещены на устройствах ps. Если None, по умолчанию равно STANDARD_PS_OPS. |
ps_strategy | Функция, вызываемая для каждой задачи ps Operation (т.е. соответствующей ps_ops), которая принимает устройство и возвращает индекс задачи ps для использования. Если None, по умолчанию используется стратегия циклического обхода по всем устройствам ps. |
| Возвращает | |
|---|---|
Функция, которая передаётся в tf.device(). |
| Возможные исключения | |
|---|---|
Тип ошибки TypeError, если cluster не является словарем или протоколом ClusterDef, или если ps_strategy предоставлен, но не является вызываемой функцией. |
© 2022 The TensorFlow Authors. All rights reserved.
Licensed under the Creative Commons Attribution License 4.0.
Code samples licensed under the Apache 2.0 License.
https://www.tensorflow.org/api_docs/python/tf/compat/v1/train/replica_device_setter