tf.raw_ops.Mfcc
Преобразует спектrogram в форму, полезную для распознавания речи.
tf.raw_ops.Mfcc(
spectrogram, sample_rate, upper_frequency_limit=4000, lower_frequency_limit=20,
filterbank_channel_count=40, dct_coefficient_count=13, name=None
)
Коэффициенты мел-частотного кепстрального анализа (MFCC) — это способ представления аудиоданных, который эффективен в качестве входного признака для машинного обучения. Они создаются путем взятия спектра спектrogram («кепстра»), и отбрасывания некоторых более высоких частот, которые менее значимы для человеческого уха. Они имеют давнюю историю в области распознавания речи, и https://en.wikipedia.org/wiki/Mel-frequency_cepstrum — хороший ресурс для получения дополнительной информации.
| Аргументы | |
|---|---|
spectrogram | A Tensor типа float32. Обычно генерируется операцией Spectrogram, с magnitude_squared установленным в true. |
sample_rate | A Tensor типа int32. Количество выборок в секунду исходного аудио. |
upper_frequency_limit | Необязательный float. По умолчанию 4000. Наибольшая частота, используемая при расчете кепстра. |
lower_frequency_limit | Необязательный float. По умолчанию 20. Наименьшая частота, используемая при расчете кепстра. |
filterbank_channel_count | Необязательный int. По умолчанию 40. Разрешение мел-банка, используемого внутри. |
dct_coefficient_count | Необязательный int. По умолчанию 13. Количество выходных каналов, генерируемых за один временной срез. |
name | Имя операции (необязательно). |
| Возвращаемое значение | |
|---|---|
A Tensor типа float32. |
© 2020 The TensorFlow Authors. All rights reserved.
Licensed under the Creative Commons Attribution License 3.0.
Code samples licensed under the Apache 2.0 License.
https://www.tensorflow.org/versions/r2.4/api_docs/python/tf/raw_ops/Mfcc