tf.raw_ops.Mfcc
Преобразует спектrogram в форму, полезную для распознавания речи.
tf.raw_ops.Mfcc(
spectrogram,
sample_rate,
upper_frequency_limit=4000,
lower_frequency_limit=20,
filterbank_channel_count=40,
dct_coefficient_count=13,
name=None
)
Коэффициенты мел-частотного кепстра представляют собой способ представления аудиоданных, который эффективен в качестве входного признака для машинного обучения. Они создаются путем взятия спектра спектrogram ( «кепструма») и отбрасывания некоторых более высоких частот, менее значимых для человеческого уха. Они имеют давнюю историю в мире распознавания речи, и https://en.wikipedia.org/wiki/Mel-frequency_cepstrum — хороший ресурс для получения дополнительной информации.
| Аргументы | |
|---|---|
spectrogram | A Tensor типа float32. Обычно генерируется операцией Spectrogram, с magnitude_squared установленным в true. |
sample_rate | A Tensor типа int32. Частота дискретизации исходного аудио. |
upper_frequency_limit | Необязательный float. По умолчанию 4000. Наивысшая частота для расчета кепструма. |
lower_frequency_limit | Необязательный float. По умолчанию 20. Наименьшая частота для расчета кепструма. |
filterbank_channel_count | Необязательный int. По умолчанию 40. Разрешение мел-банка, используемого внутри. |
dct_coefficient_count | Необязательный int. По умолчанию 13. Количество выходных каналов на временной срез. |
name | Имя операции (необязательно). |
| Возвращаемые значения | |
|---|---|
A Tensor типа float32. |
© 2022 The TensorFlow Authors. All rights reserved.
Licensed under the Creative Commons Attribution License 4.0.
Code samples licensed under the Apache 2.0 License.
https://www.tensorflow.org/api_docs/python/tf/raw_ops/Mfcc