Обнаружение неполадок в кластере
Избранный мастер периодически проверяет каждый узел в кластере, чтобы убедиться, что они по-прежнему подключены и работоспособны. Каждый узел в кластере также периодически проверяет работоспособность избранного мастера. Эти проверки известны соответственно как проверки ведомых узлов и проверки лидера.
Elasticsearch позволяет этим проверкам периодически завершаться неудачно или с временным выходом из строя без каких-либо действий. Узел считается неисправным только после того, как определенное количество проверок подряд завершилось неудачно. Вы можете контролировать поведение обнаружения неполадок с помощью cluster.fault_detection.* настроек.
Однако, если избранный мастер обнаруживает, что узел отключился, эта ситуация рассматривается как немедленная ошибка. Мастер игнорирует значения времени ожидания и повторных попыток и пытается удалить узел из кластера. Аналогично, если узел обнаруживает, что избранный мастер отключился, эта ситуация рассматривается как немедленная ошибка. Узел игнорирует настройки времени ожидания и повторных попыток и перезапускает свой этап обнаружения, чтобы попытаться найти или выбрать нового мастера.
Кроме того, каждый узел периодически проверяет, что его путь данных работает корректно, записывая небольшой файл на диск, а затем удаляя его. Если узел обнаруживает, что его путь данных неисправен, он удаляется из кластера до тех пор, пока путь данных не восстановится. Вы можете контролировать это поведение с помощью monitor.fs.health настроек.
Избранный мастер также будет удалять узлы из кластера, если узлы не могут применить обновленное состояние кластера в разумное время. Время ожидания по умолчанию составляет 2 минуты с начала обновления состояния кластера. Для более подробного описания см. Опубликование состояния кластера.
Устранение неполадок в нестабильном кластере
См. Устранение неполадок в нестабильном кластере.
Диагностика disconnected узлов
См. Диагностику disconnected узлов.
Диагностика lagging узлов
См. Диагностику lagging узлов.
Диагностика follower check retry count exceeded узлов
См. Диагностику follower check retry count exceeded узлов.
Диагностика ShardLockObtainFailedException ошибок
См. Диагностику ShardLockObtainFailedException ошибок.
Диагностика других сетевых отключений
© 2023-2025 Elasticsearch
As of September 2024, Elasticsearch is available under a choice of three licenses: the Server Side Public License (SSPL), the Elastic License, or the AGPLv3 (OSI approved).
Elasticsearch and the Elasticsearch logo are trademarks of Elasticsearch B.V., registered in the U.S. and in other countries.
https://www.elastic.co/guide/en/elasticsearch/reference/8.17/cluster-fault-detection.html