tf.distribute.cluster_resolver.GCEClusterResolver
| Просмотреть исходный код на GitHub |
ClusterResolver для Google Compute Engine.
Наследуется от: ClusterResolver
tf.distribute.cluster_resolver.GCEClusterResolver(
project,
zone,
instance_group,
port,
task_type='worker',
task_id=0,
rpc_layer='grpc',
credentials='default',
service=None
)
Это реализация решателей кластеров для платформы группы экземпляров Google Compute Engine. Указав проект, зону и группу экземпляров, это позволит получить IP-адреса всех экземпляров в группе экземпляров и вернуть объект ClusterResolver, подходящий для использования в распределённом TensorFlow.
Примечание: данный решатель кластеров не может получитьtask_type,task_idилиrpc_layer. Чтобы использовать его с некоторыми стратегиями распределения, такими какtf.distribute.experimental.MultiWorkerMirroredStrategy, необходимо указатьtask_typeиtask_idв конструкторе.
Пример использования с tf.distribute.Strategy:
# On worker 0
cluster_resolver = GCEClusterResolver("my-project", "us-west1",
"my-instance-group",
task_type="worker", task_id=0)
strategy = tf.distribute.experimental.MultiWorkerMirroredStrategy(
cluster_resolver=cluster_resolver)
# On worker 1
cluster_resolver = GCEClusterResolver("my-project", "us-west1",
"my-instance-group",
task_type="worker", task_id=1)
strategy = tf.distribute.experimental.MultiWorkerMirroredStrategy(
cluster_resolver=cluster_resolver)
| Аргументы | |
|---|---|
project | Название проекта GCE. |
zone | Зона группы экземпляров GCE. |
instance_group | Название группы экземпляров GCE. |
port | Порт прослушивания сервера TensorFlow (по умолчанию: 8470) |
task_type | Название задания TensorFlow, которому принадлежит данная группа экземпляров VM в GCE. |
task_id | Индекс задачи для данной конкретной VM в группе экземпляров GCE. В частности, каждому экземпляру должна быть вручную назначена уникальный порядковый индекс в группе экземпляров, чтобы их можно было различать. |
rpc_layer | Слой RPC, который TensorFlow должен использовать для взаимодействия между экземплярами. |
credentials | Удостоверения GCE. Если ничего не указано, по умолчанию используется GoogleCredentials.get_application_default(). |
service | Объект API GCE, возвращаемый функцией googleapiclient.discovery. (По умолчанию: discovery.build('compute', 'v1')). Если вы указываете пользовательский объект службы, параметр credentials будет проигнорирован. |
| Исключения | |
|---|---|
ImportError | Если googleapiclient не установлен. |
| Атрибуты | |
|---|---|
environment | Возвращает текущую среду, в которой выполняется TensorFlow. Возможны два значения возврата: «google» (если TensorFlow выполняется во внутренней среде Google) или пустая строка (если TensorFlow выполняется в другом месте). Если вы реализуете ClusterResolver, который работает как в среде Google, так и в открытом исходном коде (например, TPU ClusterResolver или аналогичный), вам нужно будет вернуть соответствующую строку в зависимости от среды, которую вам нужно будет определить. В противном случае, если вы реализуете ClusterResolver, который будет работать только в открытом исходном коде TensorFlow, вам не нужно реализовывать этот свойство. |
rpc_layer | |
task_id | Возвращает идентификатор задачи, который указывает данный ClusterResolver. В распределенной среде TensorFlow каждое задание может иметь соответствующий идентификатор задачи, который является индексом экземпляра в его типе задачи. Это полезно, когда пользователю необходимо выполнить определенный код в соответствии с индексом задачи. Например, cluster_spec = tf.train.ClusterSpec({
"ps": ["localhost:2222", "localhost:2223"],
"worker": ["localhost:2224", "localhost:2225", "localhost:2226"]
})
# SimpleClusterResolver is used here for illustration; other cluster
# resolvers may be used for other source of task type/id.
simple_resolver = SimpleClusterResolver(cluster_spec, task_type="worker",
task_id=0)
...
if cluster_resolver.task_type == 'worker' and cluster_resolver.task_id == 0:
# Perform something that's only applicable on 'worker' type, id 0. This
# block will run on this particular instance since we've specified this
# task to be a 'worker', id 0 in above cluster resolver.
else:
# Perform something that's only applicable on other ids. This block will
# not run on this particular instance.
Возвращает Для получения дополнительной информации см. документацию класса |
task_type | Возвращает тип задачи, который указывает данный ClusterResolver. В распределённой среде TensorFlow каждое задание может иметь соответствующий тип задачи. Действительные типы задач в TensorFlow включают «chief» (рабочий процесс, имеющий больше ответственности), «worker» (обычный рабочий процесс для обучения/оценки), «ps» (сервер параметров) или «evaluator» (оценивающий контрольные точки для метрик). См. Многоузловую конфигурацию для получения дополнительной информации о типах задач «chief» и «worker», которые чаще всего используются. Доступ к такой информации полезен, когда пользователь хочет выполнить определённый код в соответствии с типом задачи. Например, cluster_spec = tf.train.ClusterSpec({
"ps": ["localhost:2222", "localhost:2223"],
"worker": ["localhost:2224", "localhost:2225", "localhost:2226"]
})
# SimpleClusterResolver is used here for illustration; other cluster
# resolvers may be used for other source of task type/id.
simple_resolver = SimpleClusterResolver(cluster_spec, task_type="worker",
task_id=1)
...
if cluster_resolver.task_type == 'worker':
# Perform something that's only applicable on workers. This block
# will run on this particular instance since we've specified this task to
# be a worker in above cluster resolver.
elif cluster_resolver.task_type == 'ps':
# Perform something that's only applicable on parameter servers. This
# block will not run on this particular instance.
Возвращает Для получения дополнительной информации см. документацию класса |
Методы
cluster_spec
cluster_spec()
Возвращает объект ClusterSpec на основе последней информации о группе экземпляров.
Это возвращает объект ClusterSpec для использования на основе информации из указанной группы экземпляров. Мы будем получать информацию из API GCE каждый раз, когда этот метод вызывается.
| Возвращаемое значение | |
|---|---|
| Объект ClusterSpec, содержащий информацию о хостах, полученную из GCE. |
master
master(
task_type=None, task_id=None, rpc_layer=None
)
Возвращает имя или URL сессионного мастера.
Примечание: это полезно только для TensorFlow 1.x.
| Аргументы | |
|---|---|
task_type | (Необязательно) Тип задачи TensorFlow мастера. |
task_id | (Необязательно) Индекс задачи TensorFlow мастера. |
rpc_layer | (Необязательно) Протокол RPC для данного кластера. |
| Возвращаемое значение | |
|---|---|
| Имя или URL сессионного мастера. |
Реализаторы этой функции должны позаботиться о том, чтобы возвращаемый мастер был актуальным на момент вызова этой функции. Это обычно означает получение мастера каждый раз при вызове этой функции.
num_accelerators
num_accelerators(
task_type=None, task_id=None, config_proto=None
)
Возвращает количество ускорительных ядер на рабочий процесс.
Это возвращает количество ускорительных ядер (таких как GPU и TPU) на рабочий процесс.
Мы также позволяем вызывающим сторонам указать task_type и task_id, если они хотят нацелиться на определенную задачу TensorFlow для запроса количества ускорителей. Это для поддержки гетерогенных сред, где количество ускорительных ядер на хост различно.
| Аргументы | |
|---|---|
task_type | (Необязательно) Тип задачи TensorFlow машины, которую мы хотим запросить. |
task_id | (Необязательно) Индекс задачи TensorFlow машины, которую мы хотим запросить. |
config_proto | (Необязательно) Конфигурация для запуска новой сессии для запроса количества ускорительных ядер. |
| Возвращаемое значение | |
|---|---|
| Словарь типов ускорителей и количества ядер. |
© 2022 The TensorFlow Authors. All rights reserved.
Licensed under the Creative Commons Attribution License 4.0.
Code samples licensed under the Apache 2.0 License.
https://www.tensorflow.org/versions/r2.9/api_docs/python/tf/distribute/cluster_resolver/GCEClusterResolver