tf.raw_ops.AudioSpectrogram
Создаёт визуализацию аудиоданных во времени.
tf.raw_ops.AudioSpectrogram(
input, window_size, stride, magnitude_squared=False, name=None
)
Спектрограммы — стандартный способ представления аудиоинформации как ряда срезов частотной информации, по одному срезу для каждого временного окна. Объединяя их в последовательность, они образуют отличительную «отпечатку» звука во времени.
Этот оператор ожидает в качестве входных данных аудиоданные, представленные числами с плавающей точкой в диапазоне от -1 до 1, вместе с шириной окна в выборках и шагом, определяющим, на сколько смещать окно между срезами. Из этого он генерирует трёхмерный вывод. Первый размер — для каналов на входе, поэтому, например, стерео аудио ввод будет иметь два значения. Второй размер — время, с последовательными частотными срезами. Третий размер имеет значение амплитуды для каждой частоты в течение этого временного среза.
Это означает, что макет при преобразовании и сохранении в виде изображения поворачивается на 90 градусов по часовой стрелке относительно типичной спектрограммы. Время идёт вниз по оси Y, а частота уменьшается слева направо.
Каждое значение в результате представляет собой квадратный корень из суммы действительной и мнимой частей преобразования Фурье для текущего окна выборок. Таким образом, наименьший размер представляет собой мощность каждой частоты в текущем окне, а смежные окна объединяются в следующем измерении.
Для более интуитивного и визуального представления того, что делает эта операция, вы можете запустить tensorflow/examples/wav_to_spectrogram, чтобы считать аудиофайл и сохранить полученную спектрограмму в формате PNG.
| Аргументы | |
|---|---|
input | A Tensor типа float32. Представление аудиоданных с плавающей точкой. |
window_size | An int. Ширина входного окна в выборках. Для максимальной эффективности она должна быть степенью двойки, но принимаются и другие значения. |
stride | An int. Расстояние между центрами смежных окон выборок. |
magnitude_squared | Необязательный bool. По умолчанию False. Возвращать квадрат модуля или только модуль. Использование квадратного модуля может избежать дополнительных вычислений. |
name | Имя операции (необязательно). |
| Возвращаемое значение | |
|---|---|
A Tensor типа float32. |
© 2022 The TensorFlow Authors. All rights reserved.
Licensed under the Creative Commons Attribution License 4.0.
Code samples licensed under the Apache 2.0 License.
https://www.tensorflow.org/api_docs/python/tf/raw_ops/AudioSpectrogram