tf.distribute.cluster_resolver.KubernetesClusterResolver
| Посмотреть исходный код на GitHub |
ClusterResolver для Kubernetes.
Наследуется от: ClusterResolver
tf.distribute.cluster_resolver.KubernetesClusterResolver(
job_to_label_mapping=None,
tf_server_port=8470,
rpc_layer='grpc',
override_client=None
)
Это реализация резолверов кластеров для Kubernetes. При заданном пространстве имен Kubernetes и селекторе меток для контейнеров мы получим IP-адреса контейнеров всех работающих контейнеров, соответствующих селектору, и вернём ClusterSpec на основе этой информации.
Примечание: он не может получитьtask_type,task_idилиrpc_layer. Для использования с некоторыми стратегиями распределения, такими какtf.distribute.experimental.MultiWorkerMirroredStrategy, вам нужно указатьtask_typeиtask_idпутём установки этих атрибутов.
Пример использования с tf.distribute.Strategy:
# On worker 0
cluster_resolver = KubernetesClusterResolver(
{"worker": ["job-name=worker-cluster-a", "job-name=worker-cluster-b"]})
cluster_resolver.task_type = "worker"
cluster_resolver.task_id = 0
strategy = tf.distribute.experimental.MultiWorkerMirroredStrategy(
cluster_resolver=cluster_resolver)
# On worker 1
cluster_resolver = KubernetesClusterResolver(
{"worker": ["job-name=worker-cluster-a", "job-name=worker-cluster-b"]})
cluster_resolver.task_type = "worker"
cluster_resolver.task_id = 1
strategy = tf.distribute.experimental.MultiWorkerMirroredStrategy(
cluster_resolver=cluster_resolver)
| Аргументы | |
|---|---|
job_to_label_mapping |
Словарь, сопоставляющий задания TensorFlow с селекторами меток. Это позволяет пользователям указывать несколько заданий TensorFlow в одном резолвере кластера, и каждое задание может иметь контейнеры, принадлежащие различным селекторам меток. Например, пример сопоставления может быть {'worker': ['job-name=worker-cluster-a', 'job-name=worker-cluster-b'],
'ps': ['job-name=ps-1', 'job-name=ps-2']}
|
tf_server_port |
Порт, на котором слушает сервер TensorFlow. |
rpc_layer |
(Необязательно) Слой RPC, который TensorFlow должен использовать для связи между задачами в Kubernetes. По умолчанию 'grpc'. |
override_client |
Клиент Kubernetes (обычно автоматически извлекается с помощью from kubernetes import client as k8sclient). Если вы передаёте его, вы несёте ответственность за ручное установление учетных данных Kubernetes. |
| Исключения | |
|---|---|
ImportError |
Если клиент Kubernetes Python не установлен и нет override_client. |
RuntimeError |
Если autoresolve_task не является булевым значением или вызываемой функцией. |
| Атрибуты | |
|---|---|
environment |
Возвращает текущую среду, в которой выполняется TensorFlow. Возможны два значения возврата: "google" (если TensorFlow выполняется во внутренней среде Google) или пустая строка (если TensorFlow выполняется где-то ещё). Если вы реализуете ClusterResolver, который работает как в среде Google, так и в открытом источнике (например, TPU ClusterResolver или аналогичный), вам придётся вернуть соответствующую строку, в зависимости от среды, которую вам нужно определить. В противном случае, если вы реализуете ClusterResolver, который будет работать только с открытым TensorFlow, вам не нужно реализовывать этот свойство. |
task_id |
Возвращает идентификатор задачи, который указывает этот ClusterResolver. В распределённой среде TensorFlow каждое задание может иметь соответствующий идентификатор задачи, который является индексом экземпляра в рамках его типа задачи. Это полезно, когда пользователю нужно выполнить определённый код в соответствии с индексом задачи. Например, cluster_spec = tf.train.ClusterSpec({
"ps": ["localhost:2222", "localhost:2223"],
"worker": ["localhost:2224", "localhost:2225", "localhost:2226"]
})
# SimpleClusterResolver is used here for illustration; other cluster
# resolvers may be used for other source of task type/id.
simple_resolver = SimpleClusterResolver(cluster_spec, task_type="worker",
task_id=0)
...
if cluster_resolver.task_type == 'worker' and cluster_resolver.task_id == 0:
# Perform something that's only applicable on 'worker' type, id 0. This
# block will run on this particular instance since we've specified this
# task to be a 'worker', id 0 in above cluster resolver.
else:
# Perform something that's only applicable on other ids. This block will
# not run on this particular instance.
Возвращает Для получения более подробной информации, см. строку документации класса |
task_type |
Возвращает тип задачи, который указывает этот ClusterResolver. В распределённой среде TensorFlow каждое задание может иметь соответствующий тип задачи. Действительные типы задач в TensorFlow включают 'chief': рабочий элемент, которому назначена большая ответственность, 'worker': обычный рабочий элемент для обучения/оценки, 'ps': сервер параметров или 'evaluator': оценщик, который оценивает контрольные точки по метрикам. См. Многоузловую конфигурацию для получения более подробной информации о типах задач 'chief' и 'worker', которые наиболее часто используются. Доступ к такой информации полезен, когда пользователь хочет выполнить определенный код в зависимости от типа задачи. Например, cluster_spec = tf.train.ClusterSpec({
"ps": ["localhost:2222", "localhost:2223"],
"worker": ["localhost:2224", "localhost:2225", "localhost:2226"]
})
# SimpleClusterResolver is used here for illustration; other cluster
# resolvers may be used for other source of task type/id.
simple_resolver = SimpleClusterResolver(cluster_spec, task_type="worker",
task_id=1)
...
if cluster_resolver.task_type == 'worker':
# Perform something that's only applicable on workers. This block
# will run on this particular instance since we've specified this task to
# be a worker in above cluster resolver.
elif cluster_resolver.task_type == 'ps':
# Perform something that's only applicable on parameter servers. This
# block will not run on this particular instance.
Возвращает Для получения дополнительной информации, см. документацию класса |
Методы
cluster_spec
cluster_spec()
Возвращает объект ClusterSpec на основе последней информации из Kubernetes.
Мы извлекаем информацию с Kubernetes-мастера каждый раз, когда этот метод вызывается.
| Возвращает | |
|---|---|
| Объект ClusterSpec, содержащий информацию о хостах, возвращаемую из Kubernetes. |
| Исключения | |
|---|---|
RuntimeError |
Если какой-либо из контейнеров, возвращаемых мастером, не находится в фазе Running. |
master
master(
task_type=None, task_id=None, rpc_layer=None
)
Возвращает адрес мастера для использования при создании сессии.
Вы должны установить свойства task_type и task_id объекта перед вызовом этой функции или передать параметры task_type и task_id при использовании этой функции. Если вы делаете и то, и другое, параметры функции переопределяют свойства объекта.
Примечание: это полезно только для TensorFlow 1.x.
| Аргументы | |
|---|---|
task_type |
(Необязательно) Тип задания TensorFlow мастера. |
task_id |
(Необязательно) Индекс задания TensorFlow мастера. |
rpc_layer |
(Необязательно) Протокол RPC для данного кластера. |
| Возвращает | |
|---|---|
| Имя или URL мастера сессии. |
num_accelerators
num_accelerators(
task_type=None, task_id=None, config_proto=None
)
Возвращает количество ускорителей на ядро рабочего узла.
Это возвращает количество ускорителей (таких как GPU и TPU) на ядро рабочего узла.
В качестве опции мы позволяем вызывающим сторонам указать task_type и task_id, если они хотят нацелить запрос на определённое задание TensorFlow для запроса количества ускорителей. Это поддерживает разнородные среды, где количество ускорителей на узле отличается.
| Аргументы | |
|---|---|
task_type |
(Необязательно) Тип задания TensorFlow узла, который мы хотим запросить. |
task_id |
(Необязательно) Индекс задания TensorFlow узла, который мы хотим запросить. |
config_proto |
(Необязательно) Настройка для запуска новой сессии, чтобы запросить количество ускорителей. |
| Возвращает | |
|---|---|
| Словарь типов ускорителей и количества ядер. |
© 2022 The TensorFlow Authors. All rights reserved.
Licensed under the Creative Commons Attribution License 4.0.
Code samples licensed under the Apache 2.0 License.
https://www.tensorflow.org/versions/r2.9/api_docs/python/tf/distribute/cluster_resolver/KubernetesClusterResolver