Spec-Zone.ru › TensorFlow 2.9

tf.distribute.cluster_resolver.ClusterResolver

Просмотреть исходный код на GitHub

Абстрактный класс для всех реализаций ClusterResolvers.

Просмотр псевдонимов

Псевдонимы для миграции

См. Руководство по миграции для получения дополнительных сведений.

tf.compat.v1.distribute.cluster_resolver.ClusterResolver

Это определяет каркас для всех реализаций ClusterResolvers. ClusterResolvers — это способ, которым TensorFlow взаимодействует с различными системами управления кластерами (например, GCE, AWS и т. д.) и предоставляет TensorFlow необходимую информацию для настройки распределенного обучения.

Позволяя TensorFlow взаимодействовать с этими системами, мы сможем автоматически обнаруживать и разрешать IP-адреса для различных рабочих узлов TensorFlow. В конечном итоге это позволит нам автоматически восстанавливаться после сбоев на базовом уровне и масштабировать кластеры рабочих узлов TensorFlow вверх и вниз.

Примечание для разработчиков подкласса tf.distribute.cluster_resolver.ClusterResolver: Кроме этих абстрактных методов, когда атрибуты task_type, task_id и rpc_layer применимы, вы также должны реализовать их либо как свойства с геттерами или сеттерами, либо напрямую установить атрибуты self._task_type, self._task_id, или self._rpc_layer для использования геттеров и сеттеров базового класса. См. tf.distribute.clusterresolver.SimpleClusterResolver.init_ для примера.

В общем случае стратегии tf.distribute с несколькими клиентами, такие как tf.distribute.experimental.MultiWorkerMirroredStrategy, требуют, чтобы свойства task_type и task_id были доступны в ClusterResolver стратегии. С другой стороны, эти концепции не применимы в стратегиях с одним клиентом, таких как tf.distribute.experimental.TPUStrategy, поскольку ожидается, что программа будет выполняться только на одном узле, поэтому не должно быть необходимости в ветвлении кода в зависимости от типа и идентификатора задачи.

  • task_type — это имя текущей именованной задачи сервера (например, 'worker', 'ps' в задаче распределённого параметрического обучения).
  • task_id — это порядковый индекс сервера в рамках типа задачи.
  • rpc_layer — это протокол, используемый TensorFlow для связи с другими серверами TensorFlow в распределённой среде.
Атрибуты
environment Возвращает текущую среду, в которой выполняется TensorFlow.

Возможны два значения возврата: "google" (когда TensorFlow выполняется во внутренней среде Google) или пустая строка (когда TensorFlow выполняется в другом месте).

Если вы реализуете ClusterResolver, который работает как в среде Google, так и в открытых исходных кодах (например, ClusterResolver для TPU или аналогичный), вам необходимо вернуть соответствующую строку в зависимости от среды, которую вам нужно будет определить.

В противном случае, если вы реализуете ClusterResolver, который будет работать только с открытым TensorFlow, вам не нужно реализовывать это свойство.

task_id Возвращает идентификатор задачи, который указывает данный ClusterResolver.

В распределённой среде TensorFlow каждая задача может иметь соответствующий идентификатор задачи, который представляет собой индекс экземпляра в рамках его типа задачи. Это полезно, когда пользователю необходимо выполнить определённый код в соответствии с индексом задачи. Например,

cluster_spec = tf.train.ClusterSpec({
    "ps": ["localhost:2222", "localhost:2223"],
    "worker": ["localhost:2224", "localhost:2225", "localhost:2226"]
})

# SimpleClusterResolver is used here for illustration; other cluster
# resolvers may be used for other source of task type/id.
simple_resolver = SimpleClusterResolver(cluster_spec, task_type="worker",
                                        task_id=0)

...

if cluster_resolver.task_type == 'worker' and cluster_resolver.task_id == 0:
  # Perform something that's only applicable on 'worker' type, id 0. This
  # block will run on this particular instance since we've specified this
  # task to be a 'worker', id 0 in above cluster resolver.
else:
  # Perform something that's only applicable on other ids. This block will
  # not run on this particular instance.

Возвращает None, если такая информация недоступна или не применима в текущей распределённой среде, например, при обучении с помощью tf.distribute.cluster_resolver.TPUClusterResolver.

Для получения дополнительной информации см. документацию класса tf.distribute.cluster_resolver.ClusterResolver.

task_type Возвращает тип задачи, который указывает данный ClusterResolver.

В распределённой среде TensorFlow каждая задача может иметь соответствующий тип задачи. Действительные типы задач в TensorFlow включают 'chief': рабочий узел, которому поручено больше ответственности, 'worker': обычный рабочий узел для обучения/оценки, 'ps': сервер параметров или 'evaluator': оценщик, который оценивает контрольные точки для метрик.

См. Многоузловое конфигурирование для получения дополнительной информации о типах задач 'chief' и 'worker', которые наиболее часто используются.

Доступ к такой информации полезен, когда пользователю необходимо выполнить определённый код в соответствии с типами задач. Например,

cluster_spec = tf.train.ClusterSpec({
    "ps": ["localhost:2222", "localhost:2223"],
    "worker": ["localhost:2224", "localhost:2225", "localhost:2226"]
})

# SimpleClusterResolver is used here for illustration; other cluster
# resolvers may be used for other source of task type/id.
simple_resolver = SimpleClusterResolver(cluster_spec, task_type="worker",
                                        task_id=1)

...

if cluster_resolver.task_type == 'worker':
  # Perform something that's only applicable on workers. This block
  # will run on this particular instance since we've specified this task to
  # be a worker in above cluster resolver.
elif cluster_resolver.task_type == 'ps':
  # Perform something that's only applicable on parameter servers. This
  # block will not run on this particular instance.

Возвращает None, если такая информация недоступна или неприменима в текущей распределённой среде, например, при обучении с помощью tf.distribute.experimental.TPUStrategy.

Для получения дополнительной информации см. документацию класса tf.distribute.cluster_resolver.ClusterResolver.

Методы

cluster_spec

Просмотреть исходный код

@abc.abstractmethod
cluster_spec()

Получает текущее состояние кластера и возвращает tf.train.ClusterSpec.

Возвращает
tf.train.ClusterSpec, представляющий состояние кластера на момент вызова этой функции.

Разработчики этой функции должны позаботиться о том, чтобы возвращаемый ClusterSpec был актуальным на момент вызова этой функции. Обычно это означает получение информации из базовой системы управления кластером каждый раз при вызове этой функции и построение cluster_spec, а не попытку кэширования чего-либо.

master

Просмотреть исходный код

@abc.abstractmethod
master(
    task_type=None, task_id=None, rpc_layer=None
)

Получает имя или URL сессионного мастер-узла.

Примечание: это полезно только для TensorFlow 1.x.
Аргументы
task_type (Необязательно) Тип задачи TensorFlow мастер-узла.
task_id (Необязательно) Индекс задачи TensorFlow мастер-узла.
rpc_layer (Необязательно) Протокол RPC для данного кластера.
Возвращает
Имя или URL сессионного мастер-узла.

Разработчики этой функции должны позаботиться о том, чтобы возвращаемый мастер-узел был актуальным на момент вызова этой функции. Обычно это означает получение мастер-узла каждый раз при вызове этой функции.

num_accelerators

Просмотреть исходный код

num_accelerators(
    task_type=None, task_id=None, config_proto=None
)

Возвращает количество ускорительных ядер на рабочий узел.

Возвращает количество ускорительных ядер (например, GPU и TPU) на рабочий узел.

По желанию, мы позволяем вызывающим сторонам указывать task_type и task_id, если они хотят нацелить запрос на конкретную задачу TensorFlow для получения количества ускорительных ядер. Это предназначено для поддержки гетерогенных сред, где количество ускорительных ядер на хост отличается.

Аргументы
task_type (Необязательно) Тип задачи TensorFlow машины, которую мы хотим запросить.
task_id (Необязательно) Индекс задачи TensorFlow машины, которую мы хотим запросить.
config_proto (Необязательно) Настройка для запуска новой сессии, чтобы запросить количество ускорительных ядер.
Возвращает
Карта типов ускорителей к количеству ядер.

© 2022 The TensorFlow Authors. All rights reserved.
Licensed under the Creative Commons Attribution License 4.0.
Code samples licensed under the Apache 2.0 License.
https://www.tensorflow.org/versions/r2.9/api_docs/python/tf/distribute/cluster_resolver/ClusterResolver

Spec-Zone.ru

Настройки Оффлайн Что нового Помощь О нас
Spec-Zone .ru
спецификации, руководства, описания, API