tf.distribute.cluster_resolver.TFConfigClusterResolver
| Просмотреть исходный код на GitHub |
Реализация ClusterResolver, которая считывает переменную среды TF_CONFIG.
Наследуется от: ClusterResolver
tf.distribute.cluster_resolver.TFConfigClusterResolver(
task_type=None, task_id=None, rpc_layer=None, environment=None
)
Это реализация разрешителей кластера при использовании TF_CONFIG для установки информации о кластере. Спецификация кластера будет инициализирована из переменной среды TF_CONFIG.
Пример установки TF_CONFIG:
os.environ['TF_CONFIG'] = json.dumps({
'cluster': {
'worker': ["localhost:12345", "localhost:23456"]
},
'task': {'type': 'worker', 'index': 0}
})
Однако, иногда среда выполнения контейнера устанавливает TF_CONFIG за вас. В этом случае вы можете просто создать экземпляр без передачи каких-либо аргументов. Вы можете найти пример, позволяющий Kuburnetes установить TF_CONFIG за вас: https://github.com/tensorflow/ecosystem/tree/master/kubernetes. Затем вы можете использовать его с tf.distribute.Strategy как:
# `TFConfigClusterResolver` is already the default one in the following
# strategy.
strategy = tf.distribute.experimental.MultiWorkerMirroredStrategy(
cluster_resolver=TFConfigClusterResolver())
| Аргументы | |
|---|---|
task_type | (Строка, необязательно) Переопределяет тип задачи, указанный в переменной среды TF_CONFIG. |
task_id | (Целое число, необязательно) Переопределяет индекс задачи, указанный в переменной среды TF_CONFIG. |
rpc_layer | (Строка, необязательно) Переопределяет слой rpc, используемый TensorFlow. |
environment | (Строка, необязательно) Переопределяет среду, в которой работает TensorFlow. |
| Атрибуты | |
|---|---|
environment | Возвращает текущую среду, в которой работает TensorFlow. Возможны два значения возврата: «google» (когда TensorFlow работает во внутренней среде Google) или пустая строка (когда TensorFlow работает где-то еще). Если вы реализуете ClusterResolver, который работает как в среде Google, так и в открытом источнике (например, TPU ClusterResolver или аналогичный), вам нужно будет вернуть соответствующую строку в зависимости от среды, которую вам нужно будет определить. В противном случае, если вы реализуете ClusterResolver, который будет работать только с открытым исходным кодом TensorFlow, вам не нужно реализовывать этот атрибут. |
rpc_layer | |
task_id | Возвращает идентификатор задачи, который указывает этот ClusterResolver. В среде распределенного TensorFlow каждая работа может иметь применимый идентификатор задачи, который является индексом экземпляра внутри его типа задачи. Это полезно, когда пользователю необходимо выполнить определенный код в соответствии с индексом задачи. Например, cluster_spec = tf.train.ClusterSpec({
"ps": ["localhost:2222", "localhost:2223"],
"worker": ["localhost:2224", "localhost:2225", "localhost:2226"]
})
# SimpleClusterResolver is used here for illustration; other cluster
# resolvers may be used for other source of task type/id.
simple_resolver = SimpleClusterResolver(cluster_spec, task_type="worker",
task_id=0)
...
if cluster_resolver.task_type == 'worker' and cluster_resolver.task_id == 0:
# Perform something that's only applicable on 'worker' type, id 0. This
# block will run on this particular instance since we've specified this
# task to be a 'worker', id 0 in above cluster resolver.
else:
# Perform something that's only applicable on other ids. This block will
# not run on this particular instance.
Возвращает Для получения дополнительной информации см. документацию класса |
task_type | Возвращает тип задачи, который указывает этот ClusterResolver. В среде распределенного TensorFlow каждая работа может иметь соответствующий тип задачи. Действительные типы задач в TensorFlow включают «chief» — рабочий узел, которому поручена большая ответственность, «worker» — обычный рабочий узел для обучения/оценки, «ps» — сервер параметров или «evaluator» — инструмент оценки, оценивающий контрольные точки по метрикам. См. Конфигурация многоузлового обучения для получения дополнительной информации о типах задач «chief» и «worker», которые чаще всего используются. Доступ к такой информации полезен, когда пользователю необходимо выполнить определенный код в соответствии с типами задач. Например, cluster_spec = tf.train.ClusterSpec({
"ps": ["localhost:2222", "localhost:2223"],
"worker": ["localhost:2224", "localhost:2225", "localhost:2226"]
})
# SimpleClusterResolver is used here for illustration; other cluster
# resolvers may be used for other source of task type/id.
simple_resolver = SimpleClusterResolver(cluster_spec, task_type="worker",
task_id=1)
...
if cluster_resolver.task_type == 'worker':
# Perform something that's only applicable on workers. This block
# will run on this particular instance since we've specified this task to
# be a worker in above cluster resolver.
elif cluster_resolver.task_type == 'ps':
# Perform something that's only applicable on parameter servers. This
# block will not run on this particular instance.
Возвращает Для получения дополнительной информации см. документацию класса |
Методы
cluster_spec
cluster_spec()
Возвращает ClusterSpec на основе переменной среды TF_CONFIG.
| Возвращает | |
|---|---|
| ClusterSpec с информацией из переменной среды TF_CONFIG. |
master
master(
task_type=None, task_id=None, rpc_layer=None
)
Возвращает адрес мастера для использования при создании сеанса TensorFlow.
Примечание: это полезно только для TensorFlow 1.x.
| Аргументы | |
|---|---|
task_type | (Строка, необязательно) Переопределяет и устанавливает тип задачи master. |
task_id | (Целое число, необязательно) Переопределяет и устанавливает идентификатор задачи master. |
rpc_layer | (Строка, необязательно) Переопределяет и устанавливает протокол, по которому узлы TensorFlow общаются друг с другом. |
| Возвращает | |
|---|---|
| Адрес мастера. |
| Возможные исключения | |
|---|---|
RuntimeError | Если тип_задачи или id_задачи не указаны, и переменная среды TF_CONFIG не содержит секцию задачи. |
num_accelerators
num_accelerators(
task_type=None, task_id=None, config_proto=None
)
Возвращает количество ускорителей на рабочий узел.
Возвращает количество ядер ускорителей (например, GPU и TPU) на рабочий узел.
Мы также разрешаем вызывающим сторонам указывать тип_задачи и id_задачи, чтобы нацелиться на определённую задачу TensorFlow для запроса количества ускорителей. Это необходимо для поддержки гетерогенных сред, где количество ядер ускорителей на хосте различается.
| Аргументы | |
|---|---|
task_type | (Необязательно) Тип задачи TensorFlow машины, которую мы хотим запросить. |
task_id | (Необязательно) Индекс задачи TensorFlow машины, которую мы хотим запросить. |
config_proto | (Необязательно) Конфигурация для запуска нового сеанса, чтобы запросить количество ядер ускорителей. |
| Возвращает | |
|---|---|
| Словарь типов ускорителей и количества ядер. |
© 2022 The TensorFlow Authors. All rights reserved.
Licensed under the Creative Commons Attribution License 4.0.
Code samples licensed under the Apache 2.0 License.
https://www.tensorflow.org/versions/r2.9/api_docs/python/tf/distribute/cluster_resolver/TFConfigClusterResolver