tf.distribute.cluster_resolver.ClusterResolver
| Просмотр исходного кода на GitHub |
Абстрактный класс для всех реализаций ClusterResolvers.
Это определяет каркас для всех реализаций ClusterResolvers. ClusterResolvers — это способ для TensorFlow общаться с различными системами управления кластерами (например, GCE, AWS и т. д.) и предоставлять TensorFlow необходимую информацию для настройки распределённого обучения.
Позволяя TensorFlow взаимодействовать с этими системами, мы сможем автоматически обнаруживать и разрешать IP-адреса для различных рабочих узлов TensorFlow. Это в конечном итоге позволит нам автоматически восстанавливаться после сбоев на машинах нижележащего уровня и масштабировать кластеры рабочих узлов TensorFlow вверх и вниз.
Примечание для разработчиков подкласса tf.distribute.cluster_resolver.ClusterResolver: В дополнение к этим абстрактным методам, когда атрибуты task_type, task_id и rpc_layer применимы, вы также должны реализовать их либо как свойства с геттерами или сеттерами, либо напрямую установить атрибуты self._task_type, self._task_id, или self._rpc_layer, чтобы использовались геттеры и сеттеры базового класса. См. tf.distribute.clusterresolver.SimpleClusterResolver.init_ для примера.
В общем случае стратегии tf.distribute с несколькими клиентами, такие как tf.distribute.experimental.MultiWorkerMirroredStrategy, требуют, чтобы свойства task_type и task_id были доступны в ClusterResolver , которые они используют. С другой стороны, эти понятия не применяются в стратегиях с одним клиентом, таких как tf.distribute.experimental.TPUStrategy, поскольку ожидается, что программа будет запущена только на одном задании, поэтому не должно быть необходимости в наличии ветвлений кода в зависимости от типа задания и идентификатора задания.
- task_type — это имя текущей именованной работы сервера (например, 'worker', 'ps' в задании распределённого параметрического обучения).
- task_id — это порядковый индекс сервера в рамках типа задания.
- rpc_layer — это протокол, используемый TensorFlow для общения с другими серверами TensorFlow в распределённой среде.
| Атрибуты | |
|---|---|
environment | Возвращает текущую среду, в которой выполняется TensorFlow. Возможны два возвращаемых значения: "google" (если TensorFlow выполняется во внутренней среде Google) или пустая строка (если TensorFlow выполняется в другом месте). Если вы реализуете ClusterResolver, который работает как в среде Google, так и в открытом мире (например, TPU ClusterResolver или аналогичный), вам нужно будет вернуть соответствующую строку в зависимости от среды, которую вам нужно будет определить. В противном случае, если вы реализуете ClusterResolver, который будет работать только в открытом TensorFlow, вам не нужно реализовывать это свойство. |
task_id | Возвращает идентификатор задачи, который этот ClusterResolver указывает. В распределённой среде TensorFlow каждая работа может иметь применимый идентификатор задачи, который является индексом экземпляра в рамках его типа задачи. Это полезно, когда пользователю нужно запустить определённый код в зависимости от индекса задачи. Например, cluster_spec = tf.train.ClusterSpec({
"ps": ["localhost:2222", "localhost:2223"],
"worker": ["localhost:2224", "localhost:2225", "localhost:2226"]
})
# SimpleClusterResolver is used here for illustration; other cluster
# resolvers may be used for other source of task type/id.
simple_resolver = SimpleClusterResolver(cluster_spec, task_type="worker",
task_id=0)
...
if cluster_resolver.task_type == 'worker' and cluster_resolver.task_id == 0:
# Perform something that's only applicable on 'worker' type, id 0. This
# block will run on this particular instance since we've specified this
# task to be a 'worker', id 0 in above cluster resolver.
else:
# Perform something that's only applicable on other ids. This block will
# not run on this particular instance.
Возвращает Для получения дополнительной информации см. документацию к классу |
task_type | Возвращает тип задачи, который этот ClusterResolver указывает. В распределённой среде TensorFlow каждая работа может иметь применимый тип задачи. Действительные типы задач в TensorFlow включают 'chief': рабочий узел, которому делегированы дополнительные задачи, 'worker': обычный рабочий узел для обучения/оценки, 'ps': сервер параметров или 'evaluator': оценочный узел, который оценивает контрольные точки по метрикам. См. Конфигурация многорабочего узла для получения дополнительной информации о типах задач 'chief' и 'worker', которые наиболее часто используются. Доступ к такой информации полезен, когда пользователю нужно запустить определённый код в зависимости от типа задачи. Например, cluster_spec = tf.train.ClusterSpec({
"ps": ["localhost:2222", "localhost:2223"],
"worker": ["localhost:2224", "localhost:2225", "localhost:2226"]
})
# SimpleClusterResolver is used here for illustration; other cluster
# resolvers may be used for other source of task type/id.
simple_resolver = SimpleClusterResolver(cluster_spec, task_type="worker",
task_id=1)
...
if cluster_resolver.task_type == 'worker':
# Perform something that's only applicable on workers. This block
# will run on this particular instance since we've specified this task to
# be a worker in above cluster resolver.
elif cluster_resolver.task_type == 'ps':
# Perform something that's only applicable on parameter servers. This
# block will not run on this particular instance.
Возвращает Для получения дополнительной информации см. документацию к классу |
Методы
cluster_spec
@abc.abstractmethod cluster_spec()
Получение текущего состояния кластера и возврат tf.train.ClusterSpec.
| Возвращает | |
|---|---|
tf.train.ClusterSpec, представляющий состояние кластера на момент вызова этой функции. |
Разработчики этой функции должны позаботиться о том, чтобы возвращаемый ClusterSpec был актуальным на момент вызова этой функции. Это обычно означает получение информации из подлежащей системы управления кластером каждый раз при вызове этой функции и построение cluster_spec, а не попытку кэширования чего-либо.
master
@abc.abstractmethod
master(
task_type=None, task_id=None, rpc_layer=None
)
Возвращает имя или URL сессии главного узла.
Примечание: это полезно только для TensorFlow 1.x.
| Аргументы | |
|---|---|
task_type | (Необязательно) Тип задачи TensorFlow главного узла. |
task_id | (Необязательно) Индекс задачи TensorFlow главного узла. |
rpc_layer | (Необязательно) Протокол RPC для данного кластера. |
| Возвращает | |
|---|---|
| Имя или URL сессии главного узла. |
Разработчики этой функции должны позаботиться о том, чтобы возвращаемый главный узел был актуальным на момент вызова этой функции. Это обычно означает получение главного узла каждый раз при вызове этой функции.
num_accelerators
num_accelerators(
task_type=None, task_id=None, config_proto=None
)
Возвращает количество ускорителей на рабочий узел.
Это возвращает количество ускорителей (например, GPU и TPU) на рабочий узел.
По желанию, мы допускаем, чтобы вызывающие стороны указывали task_type и task_id, если они хотят нацелить запрос количества ускорителей на определённую задачу TensorFlow. Это позволяет поддерживать гетерогенные среды, где количество ускорителей на хост отличается.
| Аргументы | |
|---|---|
task_type | (Необязательно) Тип задачи TensorFlow машины, которую мы хотим запросить. |
task_id | (Необязательно) Индекс задачи TensorFlow машины, которую мы хотим запросить. |
config_proto | (Необязательно) Конфигурация для запуска новой сессии, чтобы запросить количество ускорителей. |
| Возвращает | |
|---|---|
| Карта типов ускорителей к количеству ядер. |
© 2020 The TensorFlow Authors. All rights reserved.
Licensed under the Creative Commons Attribution License 3.0.
Code samples licensed under the Apache 2.0 License.
https://www.tensorflow.org/versions/r2.4/api_docs/python/tf/distribute/cluster_resolver/ClusterResolver