[ aws . neptunedata ]
start-loader-job
Описание
Запускает задачу массового загрузчика Neptune для загрузки данных из корзины Amazon S3 в экземпляр базы данных Neptune. См. Использование массового загрузчика Amazon Neptune для загрузки данных.
При вызове этой операции в кластере Neptune, в котором включена аутентификация IAM, пользователь или роль IAM, выполняющие запрос, должны иметь прикрепленную политику, которая разрешает действие IAM neptune-db:StartLoaderJob в этом кластере.
См. также: Документацию API AWS
Синтаксис
start-loader-job
--source <value>
--format <value>
--s3-bucket-region <value>
--iam-role-arn <value>
[--mode <value>]
[--fail-on-error | --no-fail-on-error]
[--parallelism <value>]
[--parser-configuration <value>]
[--update-single-cardinality-properties | --no-update-single-cardinality-properties]
[--queue-request | --no-queue-request]
[--dependencies <value>]
[--user-provided-edge-ids | --no-user-provided-edge-ids]
[--cli-input-json | --cli-input-yaml]
[--generate-cli-skeleton <value>]
[--debug]
[--endpoint-url <value>]
[--no-verify-ssl]
[--no-paginate]
[--output <value>]
[--query <value>]
[--profile <value>]
[--region <value>]
[--version <value>]
[--color <value>]
[--no-sign-request]
[--ca-bundle <value>]
[--cli-read-timeout <value>]
[--cli-connect-timeout <value>]
[--cli-binary-format <value>]
[--no-cli-pager]
[--cli-auto-prompt]
[--no-cli-auto-prompt]
Параметры
--source (строка)
Параметр source принимает URI S3, который идентифицирует один файл, несколько файлов, папку или несколько папок. Neptune загружает все файлы данных в любой указанной папке.
URI может быть в одном из следующих форматов.
s3://(bucket_name)/(object-key-name)https://s3.amazonaws.com/(bucket_name)/(object-key-name)https://s3.us-east-1.amazonaws.com/(bucket_name)/(object-key-name)
Элемент object-key-name URI эквивалентен параметру префикса в вызове API S3 ListObjects. Он идентифицирует все объекты в указанной корзине S3, имена которых начинаются с этого префикса. Это может быть один файл или папка, или несколько файлов и/или папок.
Указанная папка или папки могут содержать несколько файлов вершин и несколько файлов рёбер.
--format (строка)
Формат данных. Дополнительную информацию о форматах данных для команды Neptune Loader см. в Load Data Formats.
-
**
csv** для формата данных Gremlin CSV. -
**
opencypher** для формата данных openCypher CSV. -
**
ntriples** для формата данных RDF N-Triples. -
**
nquads** для формата данных RDF N-Quads. -
**
rdfxml** для формата данных RDF RDFXML. -
**
turtle** для формата данных RDF Turtle.
Возможные значения:
csvopencypherntriplesnquadsrdfxmlturtle
--s3-bucket-region (строка)
Регион Amazon корзины S3. Он должен соответствовать региону Amazon кластера баз данных.
Возможные значения:
us-east-1us-east-2us-west-1us-west-2ca-central-1sa-east-1eu-north-1eu-west-1eu-west-2eu-west-3eu-central-1me-south-1af-south-1ap-east-1ap-northeast-1ap-northeast-2ap-southeast-1ap-southeast-2ap-south-1cn-north-1cn-northwest-1us-gov-west-1us-gov-east-1
--iam-role-arn (строка)
--mode (строка)
Режим работы задачи загрузки.
Допустимые значения : RESUME , NEW , AUTO .
Значение по умолчанию : AUTO .
-
RESUME– В режиме RESUME загрузчик ищет предыдущую загрузку из этого источника и, если находит, возобновляет эту задачу загрузки. Если предыдущая задача загрузки не найдена, загрузчик останавливается. Загрузчик избегает повторной загрузки файлов, которые были успешно загружены в предыдущей задаче. Он пытается обработать только файлы, которые завершились ошибкой. Если вы удалили ранее загруженные данные из кластера Neptune, эти данные не перезагружаются в этом режиме. Если предыдущая задача загрузки успешно загрузила все файлы из того же источника, ничего не перезагружается, и загрузчик возвращает успешное завершение. -
NEW– В режиме NEW загрузчик создаёт новый запрос на загрузку независимо от предыдущих загрузок. Вы можете использовать этот режим для перезагрузки всех данных из источника после удаления ранее загруженных данных из кластера Neptune или для загрузки новых данных, доступных в том же источнике. -
AUTO– В режиме AUTO загрузчик ищет предыдущую задачу загрузки из того же источника и, если находит, возобновляет эту задачу, как и в режимеRESUME. Если загрузчик не находит предыдущую задачу загрузки из того же источника, он загружает все данные из источника, как и в режимеNEW.
Возможные значения:
RESUMENEWAUTO
--fail-on-error | --no-fail-on-error (булево)
** failOnError ** – Флаг для полной остановки при ошибке.
Допустимые значения : "TRUE" , "FALSE" .
Значение по умолчанию : "TRUE" .
Когда этот параметр установлен в "FALSE", загрузчик пытается загрузить все данные в указанном месте, пропуская любые записи с ошибками.
Когда этот параметр установлен в "TRUE", загрузчик останавливается сразу же после обнаружения ошибки. Загруженные до этого момента данные сохраняются.
--parallelism (строка)
Необязательный параметр parallelism можно установить для уменьшения числа потоков, используемых процессом массовой загрузки.
-
LOW– Количество потоков равно количеству доступных vCPU, делённому на 8. -
MEDIUM– Количество потоков равно количеству доступных vCPU, делённому на 2. -
HIGH– Количество потоков равно количеству доступных vCPU. -
OVERSUBSCRIBE– Количество потоков равно количеству доступных vCPU, умноженному на 2. Если используется это значение, массовый загрузчик использует все доступные ресурсы. Однако это не означает, что настройкаOVERSUBSCRIBEприводит к 100% загрузке ЦП. Поскольку операция загрузки ограничена вводом-выводом, максимальная загрузка ЦП может составить 60-70%.
HIGH
Настройка parallelism иногда приводит к тупику между потоками при загрузке данных openCypher. Когда это происходит, Neptune возвращает ошибку LOAD_DATA_DEADLOCK. Обычно проблему можно исправить, установив parallelism на меньшее значение и повторив команду загрузки.
Возможные значения:
LOWMEDIUMHIGHOVERSUBSCRIBE
--parser-configuration (карта)
parserConfiguration ** – Необязательный объект с дополнительными значениями конфигурации парсера. Каждый из дочерних параметров также необязателен:-
**
namedGraphUri** – Граф по умолчанию для всех форматов RDF, когда не указан ни один граф (для форматов, не являющихся квадровыми, и записей NQUAD без графа). Значение по умолчанию –https://aws.amazon.com/neptune/vocab/v01/DefaultNamedGraph. -
**
baseUri** – Базовый URI для форматов RDF/XML и Turtle. Значение по умолчанию –https://aws.amazon.com/neptune/default. -
**
allowEmptyStrings** – Пользователям Gremlin необходимо иметь возможность передавать значения пустых строк («») в качестве свойств узлов и рёбер при загрузке данных CSV. ЕслиallowEmptyStringsустановлено вfalse(значение по умолчанию), такие пустые строки обрабатываются как null и не загружаются. ЕслиallowEmptyStringsустановлено вtrue, загрузчик обрабатывает пустые строки как действительные значения свойств и загружает их соответствующим образом.
ключ -> (строка)
значение -> (строка)
Краткая запись:
KeyName1=string,KeyName2=string
Синтаксис JSON:
{"string": "string"
...}
--update-single-cardinality-properties | --no-update-single-cardinality-properties (булево)
updateSingleCardinalityProperties – необязательный параметр, который управляет тем, как массовый загрузчик обрабатывает новое значение для свойств вершин или рёбер с единственной кратностью. Это не поддерживается при загрузке данных openCypher.
Допустимые значения : "TRUE" , "FALSE" .
Значение по умолчанию : "FALSE" .
По умолчанию или когда updateSingleCardinalityProperties явно установлено в "FALSE", загрузчик обрабатывает новое значение как ошибку, поскольку оно нарушает единственную кратность.
Когда updateSingleCardinalityProperties установлено в "TRUE", массовый загрузчик, с другой стороны, заменяет существующее значение новым. Если в загружаемых файлах источника предоставлено несколько значений свойств рёбер или свойств вершин с единственной кратностью, конечное значение после массовой загрузки может быть любым из этих новых значений. Загрузчик гарантирует только, что существующее значение было заменено одним из новых.
--queue-request | --no-queue-request (булево)
Это необязательный флаг-параметр, который указывает, может ли запрос на загрузку быть помещён в очередь или нет.
Вам не нужно ждать завершения одной задачи загрузки, прежде чем запускать следующую, потому что Neptune может поместить в очередь до 64 задач одновременно, при условии, что все параметры queueRequest установлены в "TRUE". Порядок задач в очереди будет первым вошёл – первым вышел (FIFO).
Если параметр queueRequest опущен или установлен в "FALSE", запрос на загрузку завершится неудачей, если уже выполняется другая задача загрузки.
Допустимые значения : "TRUE" , "FALSE" .
Значение по умолчанию : "FALSE" .
--dependencies (список)
Это необязательный параметр, который может сделать запрос на загрузку в очереди зависимым от успешного завершения одного или нескольких предыдущих задач в очереди.
Neptune может поставить в очередь до 64 запросов на загрузку одновременно, если их параметры queueRequest установлены в значение "TRUE". Параметр dependencies позволяет сделать выполнение такого запроса в очереди зависимым от успешного завершения одного или нескольких указанных предыдущих запросов в очереди.
Например, если загрузка Job-A и Job-B независимы друг от друга, но загрузка Job-C нуждается в завершении Job-A и Job-B перед началом, выполните следующие действия:
- Отправьте
load-job-Aиload-job-Bпо одному, в любом порядке, и сохраните их идентификаторы загрузки. - Отправьте
load-job-Cс идентификаторами загрузки двух задач в полеdependencies:
Благодаря параметру dependencies, массовый загрузчик не начнёт Job-C, пока Job-A и Job-B не завершатся успешно. Если один из них завершится неудачно, задача Job-C не будет выполнена, и её статус будет установлен в значение LOAD_FAILED_BECAUSE_DEPENDENCY_NOT_SATISFIED.
Вы можете настроить несколько уровней зависимости таким образом, чтобы неудача одной задачи привела к отмене всех запросов, напрямую или косвенно зависящих от неё.
(строка)
Синтаксис:
"string" "string" ...
--user-provided-edge-ids | --no-user-provided-edge-ids (булево)
Этот параметр необходим только при загрузке данных openCypher, содержащих идентификаторы отношений. Он должен быть включён и установлен в значение True, когда идентификаторы отношений openCypher явно указаны в данных загрузки (рекомендуется).
Когда --no-user-provided-edge-ids отсутствует или установлен в значение True, столбец :ID должен быть присутствовать в каждом файле отношений в загрузке.
Когда userProvidedEdgeIds присутствует и установлен в значение False, файлы отношений в загрузке не должны содержать столбец :ID. Вместо этого загрузчик Neptune автоматически генерирует идентификатор для каждого отношения.
Полезно явно указывать идентификаторы отношений, чтобы загрузчик мог возобновить загрузку после исправления ошибок в данных CSV, без необходимости повторной загрузки уже загруженных отношений. Если идентификаторы отношений не были явно назначены, загрузчик не может возобновить прерванную загрузку, если какой-либо файл отношений потребовал исправления, и вместо этого должен перегрузить все отношения.
--cli-input-json | --cli-input-yaml (строка) Считывает аргументы из предоставленной строки JSON. Строка JSON следует формату, предоставленному --generate-cli-skeleton. Если другие аргументы предоставлены в командной строке, эти значения перепишут значения, предоставленные JSON. Невозможно передавать произвольные двоичные значения с помощью предоставленного JSON-значения, поскольку строка будет воспринята буквально. Это может не быть указано вместе с --cli-input-yaml.
--generate-cli-skeleton (строка) Выводит JSON-скелет в стандартный вывод без отправки запроса API. Если предоставлено значение без значения или со значением input, выводит пример входного JSON, который можно использовать в качестве аргумента для --cli-input-json. Аналогично, если предоставлено значение yaml-input, будет выведен пример входного YAML, который можно использовать с --cli-input-yaml. Если предоставлено значение output, он проверит входные данные команд и вернёт пример выходного JSON для этой команды. Сгенерированный JSON-скелет нестабилен между версиями AWS CLI, и нет гарантий обратной совместимости в сгенерированном JSON-скелете.
Глобальные параметры
--debug (булево)
Включает отладку логирования.
--endpoint-url (строка)
Переопределяет URL по умолчанию команды заданным URL.
--no-verify-ssl (булево)
По умолчанию AWS CLI использует SSL при взаимодействии с AWS-сервисами. Для каждого SSL-соединения AWS CLI проверит SSL-сертификаты. Этот параметр переопределяет поведение проверки SSL-сертификатов по умолчанию.
--no-paginate (булево)
Отключает автоматическую постраничную навигацию. Если автоматическая постраничная навигация отключена, AWS CLI выполнит только один вызов для первой страницы результатов.
--output (строка)
Стиль форматирования для вывода команды.
- json
- текст
- таблица
- yaml
- yaml-поток
--query (строка)
Запрос JMESPath для фильтрации данных ответа.
--profile (строка)
Использование определённого профиля из файла учетных данных.
--region (строка)
Регион для использования. Переопределяет параметры конфигурации/среды.
--version (строка)
Отображение версии этого инструмента.
--color (строка)
Включение/выключение цветного вывода.
- включено
- выключено
- автоматически
--no-sign-request (булево)
Не подписывать запросы. Учетные данные не будут загружены, если этот аргумент предоставлен.
--ca-bundle (строка)
Обработанный пакет сертификатов CA для проверки SSL-сертификатов. Переопределяет параметры конфигурации/среды.
--cli-read-timeout (целое число)
Максимальное время чтения сокета в секундах. Если значение установлено в 0, чтение сокета будет блокирующим и без таймаута. Значение по умолчанию — 60 секунд.
--cli-connect-timeout (целое число)
Максимальное время подключения сокета в секундах. Если значение установлено в 0, подключение сокета будет блокирующим и без таймаута. Значение по умолчанию — 60 секунд.
--cli-binary-format (строка)
Стиль форматирования, используемый для двоичных блоков. Формат по умолчанию — base64. Формат base64 ожидает, что двоичные блоки будут предоставлены как строка, закодированная в base64. Формат raw-in-base64-out сохраняет совместимость с поведением AWS CLI V1, и двоичные значения должны передаваться буквально. При предоставлении содержимого из файла, соответствующего двоичному блоку, fileb:// всегда будет обрабатываться как двоичное и использовать содержимое файла непосредственно, независимо от настроек cli-binary-format. При использовании file:// содержимое файла должно быть должным образом отформатировано для настроенного cli-binary-format.
- base64
- raw-in-base64-out
--no-cli-pager (булево)
Отключение постраничной навигации CLI для вывода.
--cli-auto-prompt (булево)
Автоматически запрашивать параметры входных данных CLI.
--no-cli-auto-prompt (булево)
Отключить автоматическое запроса параметров ввода CLI.
Вывод
status -> (строка)
payload -> (карта)
Содержит пару имя-значение loadId, которая предоставляет идентификатор операции загрузки.
ключ -> (строка)
значение -> (строка)
© Copyright 2025, Amazon Web Services. Created using Sphinx.