Spec-Zone.ru › TensorFlow

tf.distribute.cluster_resolver.KubernetesClusterResolver

Решатель кластеров для Kubernetes.

Наследуется от: ClusterResolver

Просмотр псевдонимов

Псевдонимы совместимости для миграции

См. Руководство по миграции для получения дополнительных сведений.

tf.compat.v1.distribute.cluster_resolver.KubernetesClusterResolver

tf.distribute.cluster_resolver.KubernetesClusterResolver(
    job_to_label_mapping=None,
    tf_server_port=8470,
    rpc_layer='grpc',
    override_client=None
)

Это реализация решателей кластеров для Kubernetes. Получив пространство имён Kubernetes и селектор меток для подкастов, мы получим IP-адреса подкастов всех запущенных подкастов, соответствующих селектору, и вернём ClusterSpec на основе этой информации.

Примечание: он не может получить task_type, task_id или rpc_layer. Чтобы использовать его с некоторыми стратегиями распределения, такими как tf.distribute.experimental.MultiWorkerMirroredStrategy, вам необходимо указать task_type и task_id, задав эти атрибуты.

Пример использования с tf.distribute.Strategy:

# On worker 0
cluster_resolver = KubernetesClusterResolver(
    {"worker": ["job-name=worker-cluster-a", "job-name=worker-cluster-b"]})
cluster_resolver.task_type = "worker"
cluster_resolver.task_id = 0
strategy = tf.distribute.experimental.MultiWorkerMirroredStrategy(
    cluster_resolver=cluster_resolver)

# On worker 1
cluster_resolver = KubernetesClusterResolver(
    {"worker": ["job-name=worker-cluster-a", "job-name=worker-cluster-b"]})
cluster_resolver.task_type = "worker"
cluster_resolver.task_id = 1
strategy = tf.distribute.experimental.MultiWorkerMirroredStrategy(
    cluster_resolver=cluster_resolver)
Аргументы
job_to_label_mapping Сопоставление задач TensorFlow с селекторами меток. Это позволяет пользователям указывать много задач TensorFlow в одном решателе кластера, и каждая задача может иметь подкасты, принадлежащие разным селекторам меток. Например, примерный набор сопоставлений может быть
{'worker': ['job-name=worker-cluster-a', 'job-name=worker-cluster-b'],
 'ps': ['job-name=ps-1', 'job-name=ps-2']}
tf_server_port Порт, на котором сервер TensorFlow прослушивает соединения.
rpc_layer (Необязательно) Слой RPC, который TensorFlow должен использовать для взаимодействия между задачами в Kubernetes. По умолчанию 'grpc'.
override_client Клиент Kubernetes (обычно автоматически извлекается с помощью from kubernetes import client as k8sclient). Если вы передаёте его, вы сами отвечаете за ручную установку учетных данных Kubernetes.
Исключения
ImportError Если клиент Python Kubernetes не установлен и нет override_client.
RuntimeError Если autoresolve_task не является булевым значением или вызываемой функцией.
Атрибуты
environment Возвращает текущую среду, в которой выполняется TensorFlow.

Возможны два значения возврата: "google" (когда TensorFlow выполняется во внутренней среде Google) или пустая строка (когда TensorFlow выполняется где-то ещё).

Если вы реализуете решатель кластера, который работает как в среде Google, так и в открытом исходном коде (например, решатель кластера TPU или аналогичный), вам нужно будет вернуть соответствующую строку в зависимости от среды, которую необходимо обнаружить.

В противном случае, если вы реализуете решатель кластера, который будет работать только с открытым исходным кодом TensorFlow, вам не нужно реализовывать этот метод.

task_id Возвращает идентификатор задачи, который указывает этот ClusterResolver.

В среде распределённого TensorFlow каждая задача может иметь применимый идентификатор задачи, который является индексом экземпляра внутри его типа задачи. Это полезно, когда пользователю нужно выполнить определённый код в соответствии с индексом задачи. Например,

cluster_spec = tf.train.ClusterSpec({
    "ps": ["localhost:2222", "localhost:2223"],
    "worker": ["localhost:2224", "localhost:2225", "localhost:2226"]
})

# SimpleClusterResolver is used here for illustration; other cluster
# resolvers may be used for other source of task type/id.
simple_resolver = SimpleClusterResolver(cluster_spec, task_type="worker",
                                        task_id=0)

...

if cluster_resolver.task_type == 'worker' and cluster_resolver.task_id == 0:
  # Perform something that's only applicable on 'worker' type, id 0. This
  # block will run on this particular instance since we've specified this
  # task to be a 'worker', id 0 in above cluster resolver.
else:
  # Perform something that's only applicable on other ids. This block will
  # not run on this particular instance.

Возвращает None, если такая информация недоступна или неприменима в текущей распределённой среде, например, при обучении с помощью tf.distribute.cluster_resolver.TPUClusterResolver.

Для получения дополнительной информации, пожалуйста, обратитесь к документированию класса tf.distribute.cluster_resolver.ClusterResolver.

task_type Возвращает тип задачи, который указывает этот ClusterResolver.

В распределённой среде TensorFlow каждая задача может иметь применимый тип задачи. Действительные типы задач в TensorFlow включают 'chief' (задача с большей ответственностью), 'worker' (обычная задача для обучения/оценки), 'ps' (сервер параметров) или 'evaluator' (оцениватель, который оценивает контрольные точки по метрикам).

См. Многозадачную конфигурацию для получения дополнительной информации о типах задач 'chief' и 'worker', которые наиболее часто используются.

Доступ к такой информации полезен, когда пользователь хочет выполнить определённый код в соответствии с типами задач. Например,

cluster_spec = tf.train.ClusterSpec({
    "ps": ["localhost:2222", "localhost:2223"],
    "worker": ["localhost:2224", "localhost:2225", "localhost:2226"]
})

# SimpleClusterResolver is used here for illustration; other cluster
# resolvers may be used for other source of task type/id.
simple_resolver = SimpleClusterResolver(cluster_spec, task_type="worker",
                                        task_id=1)

...

if cluster_resolver.task_type == 'worker':
  # Perform something that's only applicable on workers. This block
  # will run on this particular instance since we've specified this task to
  # be a worker in above cluster resolver.
elif cluster_resolver.task_type == 'ps':
  # Perform something that's only applicable on parameter servers. This
  # block will not run on this particular instance.

Возвращает None, если такая информация недоступна или неприменима в текущей распределённой среде, например, при обучении с помощью tf.distribute.experimental.TPUStrategy.

Для получения дополнительной информации, пожалуйста, обратитесь к документированию класса tf.distribute.cluster_resolver.ClusterResolver.

Методы

cluster_spec

Просмотреть исходный код

cluster_spec()

Возвращает объект ClusterSpec на основе последней информации из Kubernetes.

Мы извлекаем информацию с мастера Kubernetes каждый раз, когда вызывается этот метод.

Возвращаемое значение
Объект ClusterSpec, содержащий информацию о хосте, возвращённую из Kubernetes.
Исключения
RuntimeError Если любой из подкастов, возвращённых мастером, не находится в фазе Running.

master

Просмотреть исходный код

master(
    task_type=None, task_id=None, rpc_layer=None
)

Возвращает адрес мастера, который следует использовать при создании сессии.

Вы должны установить свойства объекта task_type и task_id перед вызовом этой функции или передать параметры task_type и task_id при использовании этой функции. Если вы делаете оба, параметры функции переопределят свойства объекта.

Примечание: это полезно только для TensorFlow 1.x.
Аргументы
task_type (Необязательно) Тип задачи TensorFlow мастера.
task_id (Необязательно) Индекс задачи TensorFlow мастера.
rpc_layer (Необязательно) Протокол RPC для данного кластера.
Возвращаемое значение
Имя или URL мастера сессии.

num_accelerators

Просмотреть исходный код

num_accelerators(
    task_type=None, task_id=None, config_proto=None
)

Возвращает количество ускорительных ядер на рабочем узле.

Это возвращает количество ускорительных ядер (таких как GPU и TPU) на рабочем узле.

По желанию, мы позволяем вызывающим сторонам указывать task_type и task_id, чтобы они могли нацеливаться на конкретную задачу TensorFlow для запроса количества ускорительных ядер. Это для поддержки разнородных сред, где количество ускорительных ядер на хост отличается.

Аргументы
task_type (Необязательно) Тип задачи TensorFlow машины, которую мы хотим запросить.
task_id (Необязательно) Индекс задачи TensorFlow машины, которую мы хотим запросить.
config_proto (Необязательно) Конфигурация для запуска новой сессии, чтобы запросить количество ускорительных ядер.
Возвращаемое значение
Карта типов ускорителей к количеству ядер.

© 2022 The TensorFlow Authors. All rights reserved.
Licensed under the Creative Commons Attribution License 4.0.
Code samples licensed under the Apache 2.0 License.
https://www.tensorflow.org/api_docs/python/tf/distribute/cluster_resolver/KubernetesClusterResolver

Spec-Zone.ru

Настройки Оффлайн Что нового Помощь О нас
Spec-Zone .ru
спецификации, руководства, описания, API