[ aws . transcribe ]
start-medical-transcription-job
Описание
Транскрибирует аудио из медицинского диктования или разговора и применяет любые дополнительные параметры запроса, которые вы хотите включить в свой запрос.
Помимо многих стандартных функций транскрипции, Amazon Transcribe Medical предоставляет вам богатый медицинский словарь и, по желанию, идентификацию содержимого, добавляющую метки к персональной медицинской информации (PHI). Чтобы узнать больше об этих функциях, обратитесь к разделу Как работает Amazon Transcribe Medical.
Чтобы выполнить запрос, вы сначала должны загрузить свой медиафайл в ведро Amazon S3; затем вы можете указать расположение файла Amazon S3 с помощью параметра.
Вы должны включить следующие параметры в свой запрос:
-
region: Регион Amazon Web Services, в котором вы отправляете запрос. Для получения списка регионов Amazon Web Services, поддерживаемых Amazon Transcribe, обратитесь к разделам о конечных точках и квотах Amazon Transcribe. -
MedicalTranscriptionJobName: Пользовательское имя, которое вы создаёте для вашей задачи транскрипции и которое уникально в пределах вашей учетной записи Amazon Web Services. -
Media(MediaFileUri): Расположение вашего медиафайла в Amazon S3. -
LanguageCode: Должно бытьen-US. -
OutputBucketName: Ведро Amazon S3, в котором вы хотите сохранить транскрипт. Если вы хотите сохранить свой вывод в подпапке этого ведра, вы также должны включитьOutputKey. -
Specialty: Должно бытьPRIMARYCARE. -
Type: Выберите, является ли ваше аудио разговором или диктованием.
См. также: Документация API AWS
Синтаксис
start-medical-transcription-job
--medical-transcription-job-name <value>
--language-code <value>
[--media-sample-rate-hertz <value>]
[--media-format <value>]
--media <value>
--output-bucket-name <value>
[--output-key <value>]
[--output-encryption-kms-key-id <value>]
[--kms-encryption-context <value>]
[--settings <value>]
[--content-identification-type <value>]
--specialty <value>
--type <value>
[--tags <value>]
[--cli-input-json | --cli-input-yaml]
[--generate-cli-skeleton <value>]
[--debug]
[--endpoint-url <value>]
[--no-verify-ssl]
[--no-paginate]
[--output <value>]
[--query <value>]
[--profile <value>]
[--region <value>]
[--version <value>]
[--color <value>]
[--no-sign-request]
[--ca-bundle <value>]
[--cli-read-timeout <value>]
[--cli-connect-timeout <value>]
[--cli-binary-format <value>]
[--no-cli-pager]
[--cli-auto-prompt]
[--no-cli-auto-prompt]
Параметры
--medical-transcription-job-name (строка)
Уникальное имя, выбранное вами, для вашей задачи медицинской транскрипции. Указанное имя также используется в качестве имени файла-результата транскрипции по умолчанию. Если вы хотите указать другое имя для файла-результата транскрипции, используйте параметр OutputKey.
Это имя чувствительно к регистру, не может содержать пробелы и должно быть уникальным в рамках учетной записи Amazon Web Services. Если вы попытаетесь создать новую задачу с тем же именем, что и существующая задача, вы получите ошибку ConflictException.
--language-code (строка)
Код языка, представляющий язык, на котором произнесено содержимое входного медиафайла. Для задач медицинской транскрипции допустимо только значение US English (en-US ). Любое другое значение, введённое для кода языка, приведёт к ошибке BadRequestException.
Возможные значения:
af-ZAar-AEar-SAda-DKde-CHde-DEen-ABen-AUen-GBen-IEen-INen-USen-WLes-ESes-USfa-IRfr-CAfr-FRhe-ILhi-INid-IDit-ITja-JPko-KRms-MYnl-NLpt-BRpt-PTru-RUta-INte-INtr-TRzh-CNzh-TWth-THen-ZAen-NZvi-VNsv-SEab-GEast-ESaz-AZba-RUbe-BYbg-BGbn-INbs-BAca-ESckb-IQckb-IRcs-CZcy-WLel-GRet-ETeu-ESfi-FIgl-ESgu-INha-NGhr-HRhu-HUhy-AMis-ISka-GEkab-DZkk-KZkn-INky-KGlg-INlt-LTlv-LVmhr-RUmi-NZmk-MKml-INmn-MNmr-INmt-MTno-NOor-INpa-INpl-PLps-AFro-ROrw-RWsi-LKsk-SKsl-SIso-SOsr-RSsu-IDsw-BIsw-KEsw-RWsw-TZsw-UGtl-PHtt-RUug-CNuk-UAuz-UZwo-SNzh-HKzu-ZA
--media-sample-rate-hertz (целое число)
Частота дискретизации аудиодорожки в входном медиафайле в герцах.
Если вы не укажете частоту дискретизации медиа, Amazon Transcribe Medical определит её для вас. Если вы укажете частоту дискретизации, она должна соответствовать частоте, обнаруженной Amazon Transcribe Medical; если между указанным вами значением и обнаруженным значением есть несоответствие, ваша задача завершится неудачей. Поэтому в большинстве случаев рекомендуется опустить MediaSampleRateHertz и позволить Amazon Transcribe Medical определить частоту дискретизации.
--media-format (строка)
Укажите формат входного медиафайла.
Возможные значения:
mp3mp4wavflacoggamrwebmm4a
--media (структура)
Описывает расположение медиафайла в Amazon S3, которое вы хотите использовать в своём запросе.
Дополнительную информацию о поддерживаемых форматах медиафайлов см. в параметре MediaFormat или в разделе Форматы медиафайлов в руководстве разработчика Amazon S3.
MediaFileUri -> (строка)
Расположение медиафайла в Amazon S3, который вы хотите транскрибировать. Например:
s3://DOC-EXAMPLE-BUCKET/my-media-file.flacs3://DOC-EXAMPLE-BUCKET/media-files/my-media-file.flac
Обратите внимание, что ведро Amazon S3, содержащее входной медиафайл, должно находиться в той же области Amazon Web Services, где вы отправляете запрос на транскрипцию.
RedactedMediaFileUri -> (строка)
Расположение медиафайла в Amazon S3, который вы хотите замаскировать. Например:
s3://DOC-EXAMPLE-BUCKET/my-media-file.flacs3://DOC-EXAMPLE-BUCKET/media-files/my-media-file.flac
Обратите внимание, что ведро Amazon S3, содержащее входной медиафайл, должно находиться в той же области Amazon Web Services, где вы отправляете запрос на транскрипцию.
Предупреждение
RedactedMediaFileUri создаёт замаскированный аудиофайл в дополнение к замаскированному транскрипту. Поддерживается только для запросов транскрипции Call Analytics (StartCallAnalyticsJob ).Сокращённый синтаксис:
MediaFileUri=string,RedactedMediaFileUri=string
Синтаксис JSON:
{
"MediaFileUri": "string",
"RedactedMediaFileUri": "string"
}
--output-bucket-name (строка)
Имя ведра Amazon S3, в котором вы хотите хранить результат медицинской транскрипции. Не включайте префикс S3:// указанного ведра.
Если вы хотите сохранить результат в подкаталоге этого ведра, укажите его с помощью параметра OutputKey; OutputBucketName принимает только имя ведра.
Например, если вы хотите сохранить результат в S3://DOC-EXAMPLE-BUCKET , задайте OutputBucketName на DOC-EXAMPLE-BUCKET . Однако, если вы хотите сохранить результат в S3://DOC-EXAMPLE-BUCKET/test-files/ , задайте OutputBucketName на DOC-EXAMPLE-BUCKET и OutputKey на test-files/.
Обратите внимание, что у Amazon Transcribe должны быть права на использование указанного расположения. Вы можете изменить разрешения Amazon S3 с помощью консоли управления Amazon Web Services. См. также Требуемые разрешения для ролей IAM.
--output-key (строка)
Используется в сочетании с OutputBucketName для указания расположения результата транскрипции и, при необходимости, уникального имени для файла результата. Имя по умолчанию для файла-результата транскрипции совпадает с именем, указанным для задачи медицинской транскрипции (MedicalTranscriptionJobName ).
Вот несколько примеров использования OutputKey:
- Если вы укажете ‘DOC-EXAMPLE-BUCKET’ как
OutputBucketNameи ‘my-transcript.json’ какOutputKey, путь к результату вашей транскрипции будетs3://DOC-EXAMPLE-BUCKET/my-transcript.json. - Если вы укажете ‘my-first-transcription’ как
MedicalTranscriptionJobName, ‘DOC-EXAMPLE-BUCKET’ какOutputBucketNameи ‘my-transcript’ какOutputKey, путь к результату вашей транскрипции будетs3://DOC-EXAMPLE-BUCKET/my-transcript/my-first-transcription.json. - Если вы укажете ‘DOC-EXAMPLE-BUCKET’ как
OutputBucketNameи ‘test-files/my-transcript.json’ какOutputKey, путь к результату вашей транскрипции будетs3://DOC-EXAMPLE-BUCKET/test-files/my-transcript.json. - Если вы укажете ‘my-first-transcription’ как
MedicalTranscriptionJobName, ‘DOC-EXAMPLE-BUCKET’ какOutputBucketNameи ‘test-files/my-transcript’ какOutputKey, путь к результату вашей транскрипции будетs3://DOC-EXAMPLE-BUCKET/test-files/my-transcript/my-first-transcription.json.
Если вы укажете имя подкаталога ведра Amazon S3, которого не существует, оно будет создано для вас.
--output-encryption-kms-key-id (строка)
Ключ KMS, который вы хотите использовать для шифрования результата медицинской транскрипции.
Если используете ключ из текущей учетной записи Amazon Web Services, вы можете указать ключ KMS четырьмя способами:
- Используйте сам идентификатор ключа KMS. Например,
1234abcd-12ab-34cd-56ef-1234567890ab. - Используйте псевдоним для идентификатора ключа KMS. Например,
alias/ExampleAlias. - Используйте Amazon Resource Name (ARN) для идентификатора ключа KMS. Например,
arn:aws:kms:region:account-ID:key/1234abcd-12ab-34cd-56ef-1234567890ab. - Используйте ARN для псевдонима ключа KMS. Например,
arn:aws:kms:region:account-ID:alias/ExampleAlias.
Если используете ключ из другой учетной записи Amazon Web Services, чем текущая учетная запись Amazon Web Services, вы можете указать ключ KMS двумя способами:
- Используйте ARN для идентификатора ключа KMS. Например,
arn:aws:kms:region:account-ID:key/1234abcd-12ab-34cd-56ef-1234567890ab. - Используйте ARN для псевдонима ключа KMS. Например,
arn:aws:kms:region:account-ID:alias/ExampleAlias.
Если вы не укажете ключ шифрования, результат будет зашифрован с помощью ключа по умолчанию Amazon S3 (SSE-S3).
Если вы укажете ключ KMS для шифрования результата, вы также должны указать расположение результата с помощью параметра OutputLocation.
Обратите внимание, что роль, осуществляющая запрос, должна иметь разрешение на использование указанного ключа KMS.
--kms-encryption-context (карта)
Карта пар ключ:значение обычного текста, без секретных ключей, известных как пары контекста шифрования, предоставляющие дополнительный уровень безопасности для ваших данных. Дополнительную информацию см. в разделах контекст шифрования KMS и асимметричные ключи в KMS.
key -> (строка)
value -> (строка)
Сокращённый синтаксис:
KeyName1=string,KeyName2=string
Синтаксис JSON:
{"string": "string"
...}
--settings (структура)
Укажите дополнительные необязательные параметры в вашем запросе, включая идентификацию канала, альтернативные транскрипции и разделение по говорящим. Это позволяет применять пользовательские словари к вашей задаче транскрипции.
ShowSpeakerLabels -> (boolean)
Включает разделение по говорящим (диарку) в вашем выходном файле транскрипции. Разделение по говорящим маркирует речь отдельных говорящих в вашем медиафайле.
Если вы включите ShowSpeakerLabels в своём запросе, вам также необходимо включить MaxSpeakerLabels.
Для получения дополнительной информации см. Разделение по говорящим (диарку).
MaxSpeakerLabels -> (integer)
Укажите максимальное количество говорящих, которые вы хотите выделить в вашем медиа.
Обратите внимание, что если в вашем медиа содержится больше говорящих, чем указанное число, несколько говорящих будут обработаны как один.
Если вы указываете поле MaxSpeakerLabels, вы должны установить поле ShowSpeakerLabels в значение true.
ChannelIdentification -> (boolean)
Включает идентификацию канала в аудио с несколькими каналами.
Идентификация канала транскрибирует аудио на каждом канале независимо, а затем объединяет вывод для каждого канала в один транскрипт.
Если у вас аудио с несколькими каналами и вы не включите идентификацию канала, ваше аудио будет транскрибировано непрерывно, и ваша транскрипция не будет разделять речь по каналам.
Для получения дополнительной информации см. Транскрипция многоканального аудио.
ShowAlternatives -> (boolean)
Чтобы включить альтернативные транскрипции в выходные данные транскрипции, включите ShowAlternatives в запросе на транскрипцию.
Если вы включите ShowAlternatives, вам также необходимо включить MaxAlternatives, которое является максимальным количеством альтернативных транскрипций, которые вы хотите сгенерировать Amazon Transcribe Medical.
Для получения дополнительной информации см. Альтернативные транскрипции.
MaxAlternatives -> (integer)
Укажите максимальное количество альтернативных транскрипций, которые вы хотите включить в свою транскрипцию Amazon Transcribe Medical.
Если вы выберете число, большее, чем количество альтернативных транскрипций, сгенерированных Amazon Transcribe Medical, будут включены только фактическое количество альтернативных транскрипций.
Если вы включите MaxAlternatives в своём запросе, вы также должны включить ShowAlternatives со значением true.
Для получения дополнительной информации см. Альтернативные транскрипции.
VocabularyName -> (string)
Имя пользовательского словаря, который вы хотите использовать при обработке вашей задачи медицинской транскрипции. Имена пользовательских словарей чувствительны к регистру.
Язык указанного пользовательского словаря должен соответствовать коду языка, который вы указываете в запросе на транскрипцию. Если языки не совпадают, пользовательский словарь не применяется. Не возникает ошибок или предупреждений, связанных с несоответствием языков. Американский английский (en-US) — единственный допустимый язык для Amazon Transcribe Medical.
Синтаксис сокращённой записи:
ShowSpeakerLabels=boolean,MaxSpeakerLabels=integer,ChannelIdentification=boolean,ShowAlternatives=boolean,MaxAlternatives=integer,VocabularyName=string
JSON-синтаксис:
{
"ShowSpeakerLabels": true|false,
"MaxSpeakerLabels": integer,
"ChannelIdentification": true|false,
"ShowAlternatives": true|false,
"MaxAlternatives": integer,
"VocabularyName": "string"
}
--content-identification-type (string)
Маркирует всю личную медицинскую информацию (PHI), идентифицированную в вашей транскрипции. Для получения дополнительной информации см. Идентификация личной медицинской информации (PHI) в транскрипции.
Возможные значения:
PHI
--specialty (string)
Укажите преобладающую медицинскую специальность, представленную в вашем медиа. Для пакетной транскрипции PRIMARYCARE — единственное допустимое значение. Если вам нужны дополнительные специальности, обратитесь к .
Возможные значения:
PRIMARYCARE
--type (string)
Укажите, содержит ли ваше входное медиа только одного человека (DICTATION) или содержит разговор между двумя людьми (CONVERSATION).
Например, DICTATION может использоваться медицинским работником для транскрипции голосовых заметок; CONVERSATION может использоваться для транскрипции диалога врач-пациент во время посещения пациента в клинике.
Возможные значения:
CONVERSATIONDICTATION
--tags (list)
Добавляет один или несколько пользовательских тегов, каждый в виде пары «ключ:значение», к новой задаче медицинской транскрипции во время её запуска.
Дополнительную информацию об использовании тегов с Amazon Transcribe см. в разделе Пометка ресурсов.
(структура)
Добавляет метаданные в виде пары «ключ:значение» к указанному ресурсу.
Например, вы можете добавить тег Department:Sales к ресурсу, чтобы указать, что он относится к отделу продаж вашей организации. Вы также можете использовать теги для управления доступом на основе тегов.
Дополнительную информацию о тегах см. в разделе Пометка ресурсов.
Key -> (string)
Department:Sales ключ — это «Department».Value -> (string)
Вторая часть пары «ключ:значение», которая образует тег, связанный с данным ресурсом. Например, в теге Department:Sales значение — это «Sales».
Обратите внимание, что вы можете установить значение тега в пустую строку, но не можете установить значение тега в null. Пропуск значения тега эквивалентен использованию пустой строки.
Синтаксис сокращённой записи:
Key=string,Value=string ...
JSON-синтаксис:
[
{
"Key": "string",
"Value": "string"
}
...
]
--cli-input-json | --cli-input-yaml (string) Читает аргументы из предоставленной JSON-строки. JSON-строка следует формату, предоставленному в --generate-cli-skeleton. Если на командной строке указаны другие аргументы, эти значения переопределят значения, предоставленные JSON. Невозможно передавать произвольные двоичные значения с помощью предоставленного JSON-значения, так как строка будет воспринята буквально. Это может не быть указано вместе с --cli-input-yaml.
--generate-cli-skeleton (string) Выводит JSON-скелет в стандартный вывод без отправки запроса к API. Если предоставлено значение null или значение input, выводит пример JSON-ввода, который можно использовать в качестве аргумента для --cli-input-json. Аналогично, если предоставлено yaml-input, выводится пример YAML-ввода, который можно использовать с --cli-input-yaml. Если предоставлено значение output, проверяет входные данные команд и возвращает пример JSON-вывода для этой команды. Сгенерированный JSON-скелет не является стабильным между версиями AWS CLI, и нет гарантий обратной совместимости в сгенерированном JSON-скелете.
Глобальные параметры
--debug (boolean)
Включить отладочную регистрацию.
--endpoint-url (string)
Переопределить URL по умолчанию команды указанным URL.
--no-verify-ssl (boolean)
По умолчанию AWS CLI использует SSL при общении с AWS-сервисами. Для каждого SSL-соединения AWS CLI будет проверять сертификаты SSL. Этот параметр переопределяет стандартное поведение проверки сертификатов SSL.
--no-paginate (boolean)
Отключить автоматическую постраничную навигацию. Если автоматическая постраничная навигация отключена, AWS CLI сделает только один вызов для первой страницы результатов.
--output (string)
Стиль форматирования для вывода команды.
- json
- text
- table
- yaml
- yaml-stream
--query (string)
Запрос JMESPath для фильтрации данных ответа.
--profile (string)
Использование определенного профиля из файла учетных данных.
--region (string)
Регион для использования. Переопределяет настройки конфигурации/среды.
--version (string)
Отображение версии этого инструмента.
--color (string)
Включить/отключить цветной вывод.
- on
- off
- auto
--no-sign-request (boolean)
Не подписывать запросы. Учетные данные не будут загружены, если этот аргумент указан.
--ca-bundle (string)
Образец сертификата CA для использования при проверке SSL-сертификатов. Переопределяет настройки конфигурации/среды.
--cli-read-timeout (int)
Максимальное время чтения сокета в секундах. Если значение установлено в 0, чтение сокета будет блокирующим и не будет иметь таймаута. Значение по умолчанию — 60 секунд.
--cli-connect-timeout (int)
Максимальное время подключения сокета в секундах. Если значение установлено в 0, подключение сокета будет блокирующим и не будет иметь таймаута. Значение по умолчанию — 60 секунд.
--cli-binary-format (string)
Стиль форматирования, используемый для двоичных блоков. По умолчанию используется формат base64. Формат base64 ожидает, что двоичные блоки будут предоставлены как строка, закодированная в base64. Формат raw-in-base64-out сохраняет совместимость с поведением AWS CLI V1, а двоичные значения должны передаваться буквально. При предоставлении содержимого из файла, соответствующего двоичному блоку, fileb:// всегда будет обрабатываться как двоичное значение и будет использовать содержимое файла напрямую независимо от настройки cli-binary-format. При использовании file:// содержимое файла должно быть должным образом отформатировано для настроенного cli-binary-format.
- base64
- raw-in-base64-out
--no-cli-pager (boolean)
Отключить пейджер CLI для вывода.
--cli-auto-prompt (boolean)
Автоматически запрашивать параметры ввода CLI.
--no-cli-auto-prompt (boolean)
Отключить автоматическое запроса параметров ввода CLI.
Примеры
Примечание
Для использования следующих примеров необходимо установить и настроить AWS CLI. Дополнительную информацию можно найти в руководстве по началу работы в руководстве пользователя AWS CLI.
Если не указано иное, все примеры используют правила цитирования, характерные для Unix-подобных систем. Эти примеры необходимо адаптировать к правилам цитирования вашей оболочки. Дополнительную информацию можно найти в разделе "Использование кавычек с строками" в руководстве пользователя AWS CLI.
Пример 1: Транскрипция медицинского диктанта, хранящегося в виде аудиофайла
Следующий пример транскрибирует аудиофайл. Вы указываете расположение выходных данных транскрипции в параметре OutputBucketName.
aws transcribe start-medical-transcription-job \
--cli-input-json file://myfile.json
Содержание myfile.json:
{
"MedicalTranscriptionJobName": "simple-dictation-medical-transcription-job",
"LanguageCode": "language-code",
"Specialty": "PRIMARYCARE",
"Type": "DICTATION",
"OutputBucketName":"amzn-s3-demo-bucket",
"Media": {
"MediaFileUri": "s3://amzn-s3-demo-bucket/your-audio-file.extension"
}
}
Вывод:
{
"MedicalTranscriptionJob": {
"MedicalTranscriptionJobName": "simple-dictation-medical-transcription-job",
"TranscriptionJobStatus": "IN_PROGRESS",
"LanguageCode": "language-code",
"Media": {
"MediaFileUri": "s3://amzn-s3-demo-bucket/your-audio-file.extension"
},
"StartTime": "2020-09-20T00:35:22.256000+00:00",
"CreationTime": "2020-09-20T00:35:22.218000+00:00",
"Specialty": "PRIMARYCARE",
"Type": "DICTATION"
}
}
Для получения дополнительной информации, см. Обзор пакетной транскрипции в руководстве разработчика Amazon Transcribe.
Пример 2: Транскрипция диалога врач-пациент, хранящегося в виде аудиофайла
Следующий пример транскрибирует аудиофайл, содержащий диалог врач-пациент. Вы указываете расположение выходных данных транскрипции в параметре OutputBucketName.
aws transcribe start-medical-transcription-job \
--cli-input-json file://mysecondfile.json
Содержание mysecondfile.json:
{
"MedicalTranscriptionJobName": "simple-dictation-medical-transcription-job",
"LanguageCode": "language-code",
"Specialty": "PRIMARYCARE",
"Type": "CONVERSATION",
"OutputBucketName":"amzn-s3-demo-bucket",
"Media": {
"MediaFileUri": "s3://amzn-s3-demo-bucket/your-audio-file.extension"
}
}
Вывод:
{
"MedicalTranscriptionJob": {
"MedicalTranscriptionJobName": "simple-conversation-medical-transcription-job",
"TranscriptionJobStatus": "IN_PROGRESS",
"LanguageCode": "language-code",
"Media": {
"MediaFileUri": "s3://amzn-s3-demo-bucket/your-audio-file.extension"
},
"StartTime": "2020-09-20T23:19:49.965000+00:00",
"CreationTime": "2020-09-20T23:19:49.941000+00:00",
"Specialty": "PRIMARYCARE",
"Type": "CONVERSATION"
}
}
Для получения дополнительной информации, см. Обзор пакетной транскрипции в руководстве разработчика Amazon Transcribe.
Пример 3: Транскрипция многоканального аудиофайла диалога врач-пациент
Следующий пример транскрибирует аудио с каждого канала в аудиофайле и объединяет отдельные транскрипции с каждого канала в единый выходной результат транскрипции. Вы указываете расположение выходных данных транскрипции в параметре OutputBucketName.
aws transcribe start-medical-transcription-job \
--cli-input-json file://mythirdfile.json
Содержание mythirdfile.json:
{
"MedicalTranscriptionJobName": "multichannel-conversation-medical-transcription-job",
"LanguageCode": "language-code",
"Specialty": "PRIMARYCARE",
"Type": "CONVERSATION",
"OutputBucketName":"amzn-s3-demo-bucket",
"Media": {
"MediaFileUri": "s3://amzn-s3-demo-bucket/your-audio-file.extension"
},
"Settings":{
"ChannelIdentification": true
}
}
Вывод:
{
"MedicalTranscriptionJob": {
"MedicalTranscriptionJobName": "multichannel-conversation-medical-transcription-job",
"TranscriptionJobStatus": "IN_PROGRESS",
"LanguageCode": "language-code",
"Media": {
"MediaFileUri": "s3://amzn-s3-demo-bucket/your-audio-file.extension"
},
"StartTime": "2020-09-20T23:46:44.081000+00:00",
"CreationTime": "2020-09-20T23:46:44.053000+00:00",
"Settings": {
"ChannelIdentification": true
},
"Specialty": "PRIMARYCARE",
"Type": "CONVERSATION"
}
}
Для получения дополнительной информации, см. Идентификацию каналов в руководстве разработчика Amazon Transcribe.
Пример 4: Транскрипция аудиофайла диалога врач-пациент с идентификацией говорящих в выходных данных транскрипции
Следующий пример транскрибирует аудиофайл и помечает речь каждого говорящего в выходных данных транскрипции. Вы указываете расположение выходных данных транскрипции в параметре OutputBucketName.
aws transcribe start-medical-transcription-job \
--cli-input-json file://myfourthfile.json
Содержание myfourthfile.json:
{
"MedicalTranscriptionJobName": "speaker-id-conversation-medical-transcription-job",
"LanguageCode": "language-code",
"Specialty": "PRIMARYCARE",
"Type": "CONVERSATION",
"OutputBucketName":"amzn-s3-demo-bucket",
"Media": {
"MediaFileUri": "s3://amzn-s3-demo-bucket/your-audio-file.extension"
},
"Settings":{
"ShowSpeakerLabels": true,
"MaxSpeakerLabels": 2
}
}
Вывод:
{
"MedicalTranscriptionJob": {
"MedicalTranscriptionJobName": "speaker-id-conversation-medical-transcription-job",
"TranscriptionJobStatus": "IN_PROGRESS",
"LanguageCode": "language-code",
"Media": {
"MediaFileUri": "s3://amzn-s3-demo-bucket/your-audio-file.extension"
},
"StartTime": "2020-09-21T18:43:37.265000+00:00",
"CreationTime": "2020-09-21T18:43:37.157000+00:00",
"Settings": {
"ShowSpeakerLabels": true,
"MaxSpeakerLabels": 2
},
"Specialty": "PRIMARYCARE",
"Type": "CONVERSATION"
}
}
Для получения дополнительной информации, см. Идентификацию говорящих в руководстве разработчика Amazon Transcribe.
Пример 5: Транскрипция медицинского разговора, хранящегося в виде аудиофайла, с до двух вариантов транскрипции
Следующий пример создает до двух альтернативных транскрипций из одного аудиофайла. Каждая транскрипция имеет уровень уверенности. По умолчанию Amazon Transcribe возвращает транскрипцию с наибольшей уверенностью. Можно указать, чтобы Amazon Transcribe возвращал дополнительные транскрипции с более низкими уровнями уверенности. Вы указываете расположение выходных данных транскрипции в параметре OutputBucketName.
aws transcribe start-medical-transcription-job \
--cli-input-json file://myfifthfile.json
Содержание myfifthfile.json:
{
"MedicalTranscriptionJobName": "alternatives-conversation-medical-transcription-job",
"LanguageCode": "language-code",
"Specialty": "PRIMARYCARE",
"Type": "CONVERSATION",
"OutputBucketName":"amzn-s3-demo-bucket",
"Media": {
"MediaFileUri": "s3://amzn-s3-demo-bucket/your-audio-file.extension"
},
"Settings":{
"ShowAlternatives": true,
"MaxAlternatives": 2
}
}
Вывод:
{
"MedicalTranscriptionJob": {
"MedicalTranscriptionJobName": "alternatives-conversation-medical-transcription-job",
"TranscriptionJobStatus": "IN_PROGRESS",
"LanguageCode": "language-code",
"Media": {
"MediaFileUri": "s3://amzn-s3-demo-bucket/your-audio-file.extension"
},
"StartTime": "2020-09-21T19:09:18.199000+00:00",
"CreationTime": "2020-09-21T19:09:18.171000+00:00",
"Settings": {
"ShowAlternatives": true,
"MaxAlternatives": 2
},
"Specialty": "PRIMARYCARE",
"Type": "CONVERSATION"
}
}
Для получения дополнительной информации, см. Альтернативные транскрипции в руководстве разработчика Amazon Transcribe.
Пример 6: Транскрипция аудиофайла медицинского диктанта с до двух альтернативных транскрипций
Следующий пример транскрибирует аудиофайл и использует фильтр словаря для маскирования нежелательных слов. Вы указываете расположение выходных данных транскрипции в параметре OutputBucketName.
aws transcribe start-medical-transcription-job \
--cli-input-json file://mysixthfile.json
Содержание mysixthfile.json:
{
"MedicalTranscriptionJobName": "alternatives-conversation-medical-transcription-job",
"LanguageCode": "language-code",
"Specialty": "PRIMARYCARE",
"Type": "DICTATION",
"OutputBucketName":"amzn-s3-demo-bucket",
"Media": {
"MediaFileUri": "s3://amzn-s3-demo-bucket/your-audio-file.extension"
},
"Settings":{
"ShowAlternatives": true,
"MaxAlternatives": 2
}
}
Вывод:
{
"MedicalTranscriptionJob": {
"MedicalTranscriptionJobName": "alternatives-dictation-medical-transcription-job",
"TranscriptionJobStatus": "IN_PROGRESS",
"LanguageCode": "language-code",
"Media": {
"MediaFileUri": "s3://amzn-s3-demo-bucket/your-audio-file.extension"
},
"StartTime": "2020-09-21T21:01:14.592000+00:00",
"CreationTime": "2020-09-21T21:01:14.569000+00:00",
"Settings": {
"ShowAlternatives": true,
"MaxAlternatives": 2
},
"Specialty": "PRIMARYCARE",
"Type": "DICTATION"
}
}
Для получения дополнительной информации, см. Альтернативные транскрипции в руководстве разработчика Amazon Transcribe.
Пример 7: Транскрипция аудиофайла медицинского диктанта с повышенной точностью с помощью пользовательского словаря
Следующий пример транскрибирует аудиофайл и использует предварительно созданный пользовательский медицинский словарь для повышения точности транскрипции. Вы указываете расположение выходных данных транскрипции в параметре OutputBucketName.
aws transcribe start-transcription-job \
--cli-input-json file://myseventhfile.json
Содержание mysixthfile.json:
{
"MedicalTranscriptionJobName": "vocabulary-dictation-medical-transcription-job",
"LanguageCode": "language-code",
"Specialty": "PRIMARYCARE",
"Type": "DICTATION",
"OutputBucketName":"amzn-s3-demo-bucket",
"Media": {
"MediaFileUri": "s3://amzn-s3-demo-bucket/your-audio-file.extension"
},
"Settings":{
"VocabularyName": "cli-medical-vocab-1"
}
}
Вывод:
{
"MedicalTranscriptionJob": {
"MedicalTranscriptionJobName": "vocabulary-dictation-medical-transcription-job",
"TranscriptionJobStatus": "IN_PROGRESS",
"LanguageCode": "language-code",
"Media": {
"MediaFileUri": "s3://amzn-s3-demo-bucket/your-audio-file.extension"
},
"StartTime": "2020-09-21T21:17:27.045000+00:00",
"CreationTime": "2020-09-21T21:17:27.016000+00:00",
"Settings": {
"VocabularyName": "cli-medical-vocab-1"
},
"Specialty": "PRIMARYCARE",
"Type": "DICTATION"
}
}
Для получения дополнительной информации, см. Пользовательские медицинские словари в руководстве разработчика Amazon Transcribe.
Вывод
MedicalTranscriptionJob -> (структура)
Предоставляет подробную информацию о текущей работе по медицинской транскрипции, включая статус работы и, применительно, причину ошибки.
MedicalTranscriptionJobName -> (строка)
TranscriptionJobStatus -> (строка)
Предоставляет статус указанной работы по медицинской транскрипции.
Если статус равен COMPLETED, работа завершена, и вы можете найти результаты по адресу, указанному в TranscriptFileUri. Если статус равен FAILED, FailureReason предоставляет детали о причинах сбоя вашей работы по транскрипции.
LanguageCode -> (строка)
en-US) — единственный поддерживаемый язык для медицинских транскрипций.MediaSampleRateHertz -> (целое число)
MediaFormat -> (строка)
Media -> (структура)
Описание расположения медиафайла в Amazon S3, которое вы хотите использовать в своем запросе.
Для получения информации о поддерживаемых форматах медиа обратитесь к параметру MediaFormat или к разделу "Форматы медиа" в руководстве разработчика Amazon S3.
MediaFileUri -> (строка)
Расположение медиафайла в Amazon S3, который вы хотите транскрибировать. Например:
s3://DOC-EXAMPLE-BUCKET/my-media-file.flacs3://DOC-EXAMPLE-BUCKET/media-files/my-media-file.flac
Обратите внимание, что ведро Amazon S3, содержащее ваш входной медиафайл, должно находиться в той же области Amazon Web Services, где вы отправляете свой запрос транскрипции.
RedactedMediaFileUri -> (строка)
Расположение медиафайла для редактирования в Amazon S3. Например:
s3://DOC-EXAMPLE-BUCKET/my-media-file.flacs3://DOC-EXAMPLE-BUCKET/media-files/my-media-file.flac
Обратите внимание, что ведро Amazon S3, содержащее ваш входной медиафайл, должно находиться в той же области Amazon Web Services, где вы отправляете свой запрос транскрипции.
Предупреждение
RedactedMediaFileUri создает отредактированный аудиофайл в дополнение к отредактированному транскрипту. Он поддерживается только для запросов транскрипции Call Analytics (StartCallAnalyticsJob).Transcript -> (структура)
Предоставляет URI Amazon S3, который вы можете использовать для доступа к вашему транскрипту.
TranscriptFileUri -> (строка)
Расположение вашего транскрипта в Amazon S3. Вы можете использовать этот URI для доступа или загрузки вашего транскрипта.
Обратите внимание, что это расположение в Amazon S3, которое вы указали в своем запросе, используя параметр OutputBucketName.
StartTime -> (метка времени)
Дата и время начала обработки указанной работы по медицинской транскрипции.
Метки времени имеют формат YYYY-MM-DD'T'HH:MM:SS.SSSSSS-UTC. Например, 2022-05-04T12:32:58.789000-07:00 представляет собой работу по транскрипции, начатую в 12:32 по UTC-7 4 мая 2022 года.
CreationTime -> (метка времени)
Дата и время создания запроса на указанную работу по медицинской транскрипции.
Метки времени имеют формат YYYY-MM-DD'T'HH:MM:SS.SSSSSS-UTC. Например, 2022-05-04T12:32:58.761000-07:00 представляет собой работу по транскрипции, начатую в 12:32 по UTC-7 4 мая 2022 года.
CompletionTime -> (метка времени)
Дата и время завершения обработки указанной работы по медицинской транскрипции.
Метки времени имеют формат YYYY-MM-DD'T'HH:MM:SS.SSSSSS-UTC. Например, 2022-05-04T12:33:13.922000-07:00 представляет собой работу по транскрипции, завершенную в 12:33 по UTC-7 4 мая 2022 года.
FailureReason -> (строка)
Если TranscriptionJobStatus имеет значение FAILED, то FailureReason содержит информацию о причинах сбоя запроса на работу по транскрипции.
Поле FailureReason содержит одно из следующих значений:
-
Unsupported media format. Указанный вMediaFormatформат медиа недействителен. Обратитесь к параметруMediaFormatдля списка поддерживаемых форматов. -
The media format provided does not match the detected media format. Формат медиа, указанный вMediaFormat, не соответствует формату входного файла. Проверьте формат медиа вашего файла и исправьте указанное значение. -
Invalid sample rate for audio file. Указанная вMediaSampleRateHertzчастота дискретизации недействительна. Частота дискретизации должна быть между 16 000 и 48 000 герц. -
The sample rate provided does not match the detected sample rate. Указанная вMediaSampleRateHertzчастота дискретизации не соответствует частоте дискретизации, обнаруженной в вашем входном медиафайле. Проверьте частоту дискретизации вашего медиафайла и исправьте указанное значение. -
Invalid file size: file size too large. Размер вашего медиафайла превышает возможности обработки Amazon Transcribe. Для получения дополнительной информации см. квоты сервиса. -
Invalid number of channels: number of channels too large. В вашем аудио больше каналов, чем может обработать Amazon Transcribe. Для получения дополнительной информации см. квоты сервиса.
Settings -> (структура)
Предоставляет информацию о дополнительных настройках, включенных в ваш запрос. Дополнительные настройки включают идентификацию канала, альтернативные транскрипции, разделение по говорящим, пользовательские словари и фильтры пользовательских словарей.
ShowSpeakerLabels -> (булево значение)
Включает разделение по говорящим (диарзацию) в вашем выходном транскрипте. Разделение по говорящим маркирует речь отдельных говорящих в вашем медиафайле.
Если вы включите ShowSpeakerLabels в своем запросе, вы также должны включить MaxSpeakerLabels.
Для получения дополнительной информации см. Разделение говорящих (диарзация).
MaxSpeakerLabels -> (целое число)
Укажите максимальное количество говорящих, которые вы хотите разделить в вашем медиа.
Обратите внимание, что если ваше медиа содержит больше говорящих, чем указанное количество, несколько говорящих обрабатываются как один.
Если вы указываете поле MaxSpeakerLabels, вы должны установить поле ShowSpeakerLabels в значение true.
ChannelIdentification -> (булево значение)
Включает идентификацию канала в аудио с несколькими каналами.
Идентификация канала транскрибирует аудио на каждом канале независимо, а затем объединяет вывод каждого канала в один транскрипт.
Если у вас аудио с несколькими каналами и вы не включили идентификацию канала, ваше аудио транскрибируется непрерывно, и ваш транскрипт не разделяет речь по каналам.
Для получения дополнительной информации см. Транскрипция аудио с несколькими каналами.
ShowAlternatives -> (булево значение)
Чтобы включить альтернативные транскрипции в выходной транскрипт, укажите ShowAlternatives в своем запросе на транскрипцию.
Если вы включаете ShowAlternatives, вы также должны включить MaxAlternatives, которое является максимальным количеством альтернативных транскрипций, которые вы хотите сгенерировать Amazon Transcribe Medical.
Для получения дополнительной информации см. Альтернативные транскрипции.
MaxAlternatives -> (целое число)
Укажите максимальное количество альтернативных транскрипций, которые вы хотите включить в ваш транскрипт Amazon Transcribe Medical.
Если вы выберете число, большее, чем количество альтернативных транскрипций, сгенерированных Amazon Transcribe Medical, будут включены только фактическое количество альтернативных транскрипций.
Если вы включаете MaxAlternatives в своем запросе, вы также должны включить ShowAlternatives со значением true.
Для получения дополнительной информации см. Альтернативные транскрипции.
VocabularyName -> (строка)
Имя пользовательского словаря, который вы хотите использовать при обработке вашей работы по медицинской транскрипции. Имена пользовательских словарей чувствительны к регистру.
Язык указанного пользовательского словаря должен соответствовать коду языка, который вы указываете в своем запросе на транскрипцию. Если языки не совпадают, пользовательский словарь не применяется. Ошибок или предупреждений, связанных с несоответствием языка, нет. Английский язык США (en-US) — единственный допустимый язык для Amazon Transcribe Medical.
ContentIdentificationType -> (строка)
Specialty -> (строка)
Type -> (строка)
StartMedicalTranscriptionJob.Tags -> (список)
Теги, каждый в форме пары ключ:значение, назначенные указанной работе по медицинской транскрипции.
(структура)
Добавляет метаданные в виде пары ключ:значение к указанному ресурсу.
Например, вы можете добавить тег Department:Sales к ресурсу, чтобы указать, что он относится к отделу продаж вашей организации. Вы также можете использовать теги для управления доступом на основе тегов.
Для получения дополнительной информации о тегах см. Тегирование ресурсов.
Key -> (строка)
Department:Sales ключом является «Department».Value -> (строка)
Вторая часть пары ключ:значение, которая образует тег, связанный с данным ресурсом. Например, в теге Department:Sales значением является «Sales».
Обратите внимание, что вы можете установить значение тега в пустую строку, но вы не можете установить значение тега в null. Пропуск значения тега эквивалентен использованию пустой строки.
© Copyright 2025, Amazon Web Services. Created using Sphinx.