tf.raw_ops.AudioSpectrogram
Создаёт визуализацию аудиоданных во времени.
tf.raw_ops.AudioSpectrogram(
input, window_size, stride, magnitude_squared=False, name=None
)
Спектры — это стандартный способ представления аудиоинформации как ряда срезов частотной информации, по одному срезу для каждого временного окна. Объединение их в последовательность образует отличительный отпечаток звука во времени.
Этот оператор ожидает в качестве входных данных аудиоданные, хранящиеся в виде чисел с плавающей точкой в диапазоне от -1 до 1, вместе с шириной окна в выборках и шагом, определяющим, на сколько смещать окно между срезами. Из этого он генерирует трёхмерный вывод. Первый размер — для каналов на входе, поэтому, например, стерео аудиовход будет иметь здесь два канала. Второй размер — время, с последующими частотными срезами. Третий размер содержит значение амплитуды для каждой частоты в течение этого временного среза.
Это означает, что макет при преобразовании и сохранении в виде изображения повернут на 90 градусов по часовой стрелке по сравнению с типичным спектром. Время уменьшается вниз по оси Y, а частота уменьшается слева направо.
Каждое значение в результате представляет собой квадратный корень из суммы действительных и мнимых частей преобразования Фурье для текущего окна выборок. Таким образом, наименьший размер представляет собой мощность каждой частоты в текущем окне, а смежные окна объединяются в следующем размере.
Чтобы получить более интуитивное и наглядное представление об этой операции, вы можете запустить tensorflow/examples/wav_to_spectrogram, чтобы прочитать аудиофайл и сохранить полученный спектр в виде изображения PNG.
| Аргументы | |
|---|---|
input | A Tensor типа float32. Представление аудиоданных с плавающей запятой. |
window_size | An int. Ширина входного окна в выборках. Для максимальной эффективности это должно быть степенью двойки, но принимаются и другие значения. |
stride | An int. Насколько далеко друг от друга должны быть центры смежных окон выборок. |
magnitude_squared | Необязательный bool. По умолчанию False. Возвращать ли квадратный модуль или просто модуль. Использование квадратного модуля может избежать дополнительных вычислений. |
name | Имя операции (необязательно). |
| Возвращаемое значение | |
|---|---|
A Tensor типа float32. |
© 2022 The TensorFlow Authors. All rights reserved.
Licensed under the Creative Commons Attribution License 4.0.
Code samples licensed under the Apache 2.0 License.
https://www.tensorflow.org/versions/r2.9/api_docs/python/tf/raw_ops/AudioSpectrogram