tf.raw_ops.Mfcc
Преобразует спектрограмму в форму, полезную для распознавания речи.
tf.raw_ops.Mfcc(
spectrogram,
sample_rate,
upper_frequency_limit=4000,
lower_frequency_limit=20,
filterbank_channel_count=40,
dct_coefficient_count=13,
name=None
)
Коэффициенты Мел-частотного кепстрального анализа (MFCC) представляют собой способ представления аудиоданных, который эффективно используется как входной признак для машинного обучения. Они создаются путем взятия спектра спектрограммы («кепструм») и отбрасывания некоторых более высоких частот, которые менее значимы для человеческого уха. Они имеют долгую историю в области распознавания речи, и https://en.wikipedia.org/wiki/Mel-frequency_cepstrum — хороший ресурс для получения дополнительной информации.
| Аргументы | |
|---|---|
spectrogram | A Tensor типа float32. Обычно генерируется операцией Spectrogram, с magnitude_squared установленным в true. |
sample_rate | A Tensor типа int32. Частота дискретизации исходного аудио. |
upper_frequency_limit | Необязательный float. По умолчанию 4000. Наивысшая частота, используемая при расчете кепструма. |
lower_frequency_limit | Необязательный float. По умолчанию 20. Наименьшая частота, используемая при расчете кепструма. |
filterbank_channel_count | Необязательный int. По умолчанию 40. Разрешение мел-банка, используемого внутри. |
dct_coefficient_count | Необязательный int. По умолчанию 13. Количество выходных каналов, генерируемых на каждый временной срез. |
name | Имя операции (необязательно). |
| Возвращаемое значение | |
|---|---|
A Tensor типа float32. |
© 2022 The TensorFlow Authors. All rights reserved.
Licensed under the Creative Commons Attribution License 4.0.
Code samples licensed under the Apache 2.0 License.
https://www.tensorflow.org/versions/r2.9/api_docs/python/tf/raw_ops/Mfcc