tf.raw_ops.Mfcc
Преобразует спектр в форму, полезную для распознавания речи.
tf.raw_ops.Mfcc(
spectrogram, sample_rate, upper_frequency_limit=4000, lower_frequency_limit=20,
filterbank_channel_count=40, dct_coefficient_count=13, name=None
)
Коэффициенты мел-частотных кепстральных коэффициентов (MFCC) — это способ представления аудиоданных, который эффективно используется в качестве входного признака для машинного обучения. Они создаются путем взятия спектра спектрограммы («кепструма») и отбрасывания некоторых более высоких частот, которые менее значимы для человеческого уха. Они имеют давнюю историю в области распознавания речи, и https://en.wikipedia.org/wiki/Mel-frequency_cepstrum — хороший ресурс для дополнительного изучения.
| Аргументы | |
|---|---|
spectrogram | A Tensor типа float32. Обычно генерируется операцией Spectrogram, с magnitude_squared установленным в true. |
sample_rate | A Tensor типа int32. Частота дискретизации исходного аудио. |
upper_frequency_limit | Необязательный float. По умолчанию 4000. Наивысшая частота, используемая при расчете кепструма. |
lower_frequency_limit | Необязательный float. По умолчанию 20. Наименьшая частота, используемая при расчете кепструма. |
filterbank_channel_count | Необязательный int. По умолчанию 40. Разрешение мел-фильтрового банка, используемого внутри. |
dct_coefficient_count | Необязательный int. По умолчанию 13. Количество выходных каналов на временной срез. |
name | Имя операции (необязательно). |
| Возвращаемое значение | |
|---|---|
A Tensor типа float32. |
© 2020 The TensorFlow Authors. All rights reserved.
Licensed under the Creative Commons Attribution License 3.0.
Code samples licensed under the Apache 2.0 License.
https://www.tensorflow.org/versions/r2.3/api_docs/python/tf/raw_ops/Mfcc