检测音频文件中的低频音
Posted
技术标签:
【中文标题】检测音频文件中的低频音【英文标题】:Detecting a low frequency tone in an audio file 【发布时间】:2015-03-06 16:45:30 【问题描述】:我知道这个问题已经被问过一百次了……但我对我的结果感到沮丧,所以我想再问一次。在深入研究 fft 之前,我需要弄清楚这个简单的任务。
我需要检测音频文件中的 20 赫兹音调。我自己插入 20hz 音调,就像在图片中一样。 (可以是任何频率,只要听众听不到,所以我想我应该选择20hz到50hz左右的频率)
有关音频文件的信息。
afinfo 1.m4a
File: 1.m4a
File type ID: adts
Num Tracks: 1
----
Data format: 1 ch, 22050 Hz, 'aac ' (0x00000000) 0 bits/channel, 0 bytes/packet, 1024 frames/packet, 0 bytes/frame
Channel layout: Mono
estimated duration: 8.634043 sec
audio bytes: 42416
audio packets: 219
bit rate: 33364 bits per second
packet size upper bound: 768
maximum packet size: 319
audio data file offset: 0
optimized
format list:
[ 0] format: 1 ch, 22050 Hz, 'aac ' (0x00000000) 0 bits/channel, 0 bytes/packet, 1024 frames/packet, 0 bytes/frame
Channel layout: Mono
----
我遵循了这三个教程,并提出了一个可以读取音频缓冲区并为我提供 fft 双打的工作代码。
http://blog.bjornroche.com/2012/07/frequency-detection-using-fft-aka-pitch.htmlhttps://github.com/alexbw/iPhoneFFTHow do I obtain the frequencies of each value in an FFT?
我读取数据如下
// If there's more packets, read them
inCompleteAQBuffer->mAudioDataByteSize = numBytes;
CheckError(AudioQueueEnqueueBuffer(inAQ,
inCompleteAQBuffer,
(sound->packetDescs?nPackets:0),
sound->packetDescs),
"couldn't enqueue buffer");
sound->packetPosition += nPackets;
int numFrequencies=2048;
int kNumFFTWindows=10;
SInt16 *testBuffer = (SInt16*)inCompleteAQBuffer->mAudioData; //Read data from buffer...!
OouraFFT *myFFT = [[OouraFFT alloc] initForSignalsOfLength:numFrequencies*2 andNumWindows:kNumFFTWindows];
for(long i=0; i<myFFT.dataLength; i++)
myFFT.inputData[i] = (double)testBuffer[i];
[myFFT calculateWelchPeriodogramWithNewSignalSegment];
for (int i=0;i<myFFT.dataLength/2;i++)
NSLog(@"the spectrum data %d is %f ",i,myFFT.spectrumData[i]);
和我的输出日志类似
Everything checks out for 4096 samples of data
Set up all values, about to init window type 2
the spectrum data 0 is 42449.823771
the spectrum data 1 is 39561.024361
.
.
.
.
the spectrum data 2047 is -42859933071799162597786649755206634193030992632381393031503716729604050285238471034480950745056828418192654328314899253768124076782117157451993697900895932215179138987660717342012863875797337184571512678648234639360.000000
我知道我还没有计算幅度,但我怎样才能检测到声音中有 20 赫兹呢?我需要学习 Goertzel 算法吗?
【问题讨论】:
从您的图片中,我不清楚您是在以较低频率突发的 20Hz 正弦波还是以 20Hz 突发的较高频率正弦波。 先做一个低通滤波。然后使用自相关,对于噪声信号,它通常比 FFT 中的谐波更好 如果底部图中的这些脉冲是 20Hz 单周期,那么您将无法使用 FFT 或 Goertzel 算法轻松可靠地实时获取它们。如果您将它们用作文件中的隐藏标记,那么我将对数据进行低通过滤,然后进行自相关,甚至只是观察高于某个阈值的正确宽度的部分。 (已编辑:自相关不会很好地拾取那些单周期) 我还看到您正在使用 AAC - 您可能希望通过在 Audacity 中进行压缩后查看添加的音调来确认最终文件中是否出现了该音调。音频压缩通过丢弃部分听不见的信号来工作,因此它可能会在您有机会处理它之前移除 20Hz 音调。 @Katie 是的,我用几个程序检查了音频,并确保没有修剪低频。我最初的想法是在 20z 中插入 5 个幅度很大的周期,所以当我得到 5 次正布尔值时,使用一个简单的计数器继续应用我的逻辑,这是个坏主意吗? 【参考方案1】:有很多方法可以传达信息,这些信息被插入然后从一些预先存在的波形中检索。输入的信息可能会有所不同,例如幅度(幅度调制)或频率(频率调制)等。您在这里有策略吗?请注意,您希望传达的信息密度可能会受到调制频率等因素的影响(较高的频率自然可以传达更多信息,因为它可以每秒解析更多次变化)。
如果发送者和接收者都有源音频(参考),则可以使用另一种方法。在这种情况下,接收器可以在参考和实际接收到的音频之间进行差异,以解析传输的额外信息。对此的一种变体是让发送者发送 ~~same~~ 音频两次,首先发送参考未触及的音频,然后发送相同参考音频的调制版本,这样接收者只是在这两个声音之间进行区分 ~~same ~~ 剪辑来解析嵌入的音频。
回到你原来的问题......如果发送方和接收方达成协议......说一段时间 X 发送参考纯 20 Hz 音调,然后发送另一个周期 X 20 Hz 音调由您调制输入信息以改变其幅度或频率...然后只需重复此模式...在接收端,他们只是在每对这样的时间段之间进行差异以解析您的调制信息...以便使源音频工作不能有任何低于某个频率的音调,比如 100 Hz(如果需要,你可以移除这样的频段)只是为了消除源音频的干扰......你没有提到你想要传输什么样的数据......如果它的声音你首先会需要将其拉伸,实际上将其频率范围从 1 kHz 范围降低到您的低 20 Hz 范围......一旦接收方可获得差异结果,然后挤压此曲线以将其恢复到 1kHz 的正常语音范围...也许比你有更多的工作时间 f或者,但这可能只是工作......真正的 AM/FM 收音机使用调制通过兆赫兹载波频率发送语音,因此它可以工作
【讨论】:
感谢您的建议,接收器没有要比较的音频文件。我们正在尝试从 http 服务器流式传输。如果我使用更高的频率,听众不会检测到它吗?文件格式必须为 22050 Hz aac。以上是关于检测音频文件中的低频音的主要内容,如果未能解决你的问题,请参考以下文章