这是本系列的最后一篇。部件已全部组装完毕——现在只剩下把这套系统提升到商用产品品质的信号处理收尾工作。关键词有两个:前处理(Pre-processing)与调制指数(Modulation Index)。
载波不是零件,而是软件
先纠正一个容易产生的误解。指向性扬声器的载波与被调制的波,并不是某个物理零件嗡嗡作响制造出来的,而是由DSP(数字信号处理器)或MCU中的软件算法以数学方式生成的。AM调制的实体不过是一行乘法——音频信号 × 40kHz载波。其结果的包络(Envelope)承载着音频信息,而这一切运算都跑在第11篇所见的192kHz采样之上。
这个事实有实务上的含义:不更换换能器与放大器,仅靠固件更新就能改变音质。第13篇所见的调制方式选择,以及本篇要看的前处理滤波器与调制指数管理,全都在代码里。反过来说,软件无法越过硬件已经划定的界限。本篇有一半的篇幅,就是用数字确认那条界线究竟画在哪里。
分阶段信号处理——前处理占一半
沿着实际产品的信号路径走一遍就会发现,决定品质的环节是调制之前的前处理。
- 平方根处理(Square Root)——还记得第7篇的Berktay法则吗?空气把包络的平方还原为声音。那么事先给信号加上平方根,就会与空气的平方相抵消,原音得以复原。用数学先发制人地补偿空气这个非线性解调器的失真,是这套系统中最优雅的一着。
- 均衡器(EQ)——削掉低频——由于第13篇所见的换能器带宽(BW)限制,远离载波的低音成分本来就载不上去,只会留下失真。事先削掉无法再现的低频,可以减少失真与能量浪费。
- DSP内部处理 → 输出——振荡器(OSC)生成40kHz载波,调制器与前处理后的音频相乘,功放放大电压,换能器阵列辐射出去。剩下的交给空气。
这里第二项听起来可能有些奇怪。照理说应该努力挽救低音,却说要削掉它。让我们正面看清其中的理由。
低频之壁——把12dB/oct扳回来要付多少
Berktay的关系式说,复原音是包络平方的二阶微分。微分一次意味着乘上与频率成正比的权重,因此微分两次就乘上频率的平方。振幅与频率的平方成正比,换算成分贝就是每倍频程12dB的斜率。也就是说,参量扬声器天生就是低音每降一个倍频程就掉12dB的结构。第1篇那把"声音的手电筒"之所以听起来格外细而尖,根本原因就在这里。
那么用EQ把低频推上去做平,不就行了吗?把数值算出来,立刻就能看出为何做不到。以5kHz为基准点,要把某个频率抬到同一电平需要推多少dB,结果如下。
| 目标频率 | 低于基准(5kHz)的倍频程数 | 所需提升量 | 包络振幅倍数 |
|---|---|---|---|
| 4,000Hz | 0.32 | +3.9 dB | 1.6倍 |
| 2,000Hz | 1.32 | +15.9 dB | 6.2倍 |
| 1,000Hz | 2.32 | +27.9 dB | 25倍 |
| 500Hz | 3.32 | +39.9 dB | 98倍 |
| 200Hz | 4.64 | +55.7 dB | 611倍 |
| 100Hz | 5.64 | +67.7 dB | 2,434倍 |
表中数值由 12 × log₂(5000 ÷ f) 一个式子算出,最后一列是把该dB换算为电压比。这里起决定作用的事实是包络振幅存在上限。调制指数m不能超过1,因此包络能有的余裕最多也就是几倍;可要把1kHz做平需要25倍,100Hz则需要2,434倍。为救100Hz而推EQ,等于把其他所有频段都压到它下面68dB。
所以实务上的选择不是"做平",而是"决定在哪里放弃"。通常200~300Hz以下干脆切掉,只对其上一两个倍频程做部分补偿。若不切掉,那些成分成不了声音,却白白吃掉包络的余量,结果削减了听得见的频段的音量。削低频的EQ并非"扔掉低音"的措施,而是"夺回中高频音量"的措施,原因就在于此。以心理声学方式补强低频感知、或按子阵列分别均衡来修整响应的研究之所以持续不断,正是因为这堵墙在物理上如此坚固。
切掉带宽的决断——为什么是语音频带
高频一侧同样有墙。如第13篇所见,换能器的可用宽度为 BW = f_r / Q,而双边带调制要吃掉音频上限的两倍。在40kHz载波下,音频上限放在哪里,所要求的Q便随之变化。
| 音频上限 | 占用频谱 | 所需带宽 | 允许的最大Q | 现实性 |
|---|---|---|---|---|
| 20kHz(全频音频) | 20~60kHz | 40kHz | 1.00 | 事实上不可能 |
| 16kHz | 24~56kHz | 32kHz | 1.25 | 接近不可能 |
| 8kHz(宽带语音) | 32~48kHz | 16kHz | 2.50 | 用低Q元件可行 |
| 4kHz(标准语音) | 36~44kHz | 8kHz | 5.00 | 较为宽裕 |
与第13篇的Q表对照阅读,图景便完整了。为获得高灵敏度而把Q提到20~30的元件,带宽只有1.3~2kHz,其音频上限连1kHz都不到。反之,要把20kHz音频全部载上去就得把Q降到1,而那样声压会崩溃,参量阵便不成立。在这两堵墙之间实际敞开的那扇门,就是语音频带。
所幸语音很能承受带宽的削减。语音清晰度研究的经典之作表明,对清晰度有贡献的信息分散在很宽的频率范围内,却大量集中于中频;而电话网仅用300~3,400Hz便承载了近百年的对话,正是活生生的实证。指向性扬声器最先在广播提示、展览讲解与警示音领域站稳脚跟,并非营销的结果,而是因为物理所允许的频带恰好就是人声的频带。
调制指数 m——要把器皿装到几分满
最后一个把手是调制指数(Modulation Index, m)。定义很简单——音频信号振幅与载波振幅之比。直观地说,它衡量的是把音频这个"内容物"往超声波这个"器皿"里装得有多满。
- m低时(例如0.1)——超声波发得很强,但其中音频的变化幅度微乎其微,解调后的声音很小。
- m高时(例如1.0)——最大限度利用载波振幅,声音又大又清晰。
由此得出指向性扬声器音量的公式——体感音量 = 超声波声压(SPL) + 调制指数(m)。由于解调后可听声的声压与超声波声压的平方以及m成正比,即使换能器喷出130dB的超声波,只要m接近0就什么也听不见。在提高输出之前先把m填满,才是正确的顺序。
然而提高m是有代价的,而且代价不只是失真,还有带宽。经过平方根前处理的包络 √(1 + m·s) 会制造出原信号中没有的谐波,而这些谐波有意义地存活到第几次,取决于m。取音频上限4kHz、把−40dB以上视为有效来计算,结果如下。
| 调制指数 m | 平方根包络的有效谐波 | DSB占用带宽 | 允许最大Q | 复原音相对电平 | 无补偿时的THD |
|---|---|---|---|---|---|
| 0.3 | 二次 | 16kHz | 2.50 | −10.5 dB | 28.7% |
| 0.5 | 二次 | 16kHz | 2.50 | −6.0 dB | 44.7% |
| 0.7 | 三次 | 24kHz | 1.67 | −3.1 dB | 57.3% |
| 0.9 | 四次 | 32kHz | 1.25 | −0.9 dB | 66.9% |
| 1.0 | 八次 | 64kHz | 0.62 | 0 dB(基准) | 70.7% |
制作此表用到三项计算。有效谐波次数是把 √(1 + m·cos θ) 展开成傅里叶级数后,数出相对基波仍在−40dB以上的最高次数;占用带宽为该次数 × 4kHz × 2(双边带);允许Q为 40kHz ÷ 占用带宽。最后一列是第7篇的关系式 m / √(1 + m²)。
这张表是本篇最重要的一张。把m从0.5提到1.0,声音大了6dB,但所需带宽从16kHz变成64kHz,扩大到四倍。而要承受这64kHz,Q必须在0.62以下,可那样的换能器根本发不出足够的超声波声压。也就是说把m填满的设计不可能存在,实务的落点大多在 m = 0.5~0.7 附近——用放弃6dB音量的代价,同时买下带宽与低失真。
m的优化——增益、归一化、压缩器
话虽如此,也不能把m一味放大。一旦 m > 1,就会因过调制(Over-modulation)而使波形塌陷。实务的目标是"峰值处恰好 m = 1.0",梯子共有三级。
- 输入增益设定——在前置放大器或DSP输入端调节音频大小,使信号峰值刚好触及 m = 1.0。
- 归一化(Normalization)——仅靠固定增益,安静的曲目m会偏低,吵闹的曲目又会撕裂。固件实时把输入信号的最大值逼近数字满量程。
- 压缩器/限幅器(Compressor/Limiter)——压住瞬时峰值以防过调制,同时把平均m保持在高位。原理与广播音频的响度管理相同。
第三项为何如此重要,可以用峰均比(Crest Factor)来解释。把峰值对准 m = 1.0 后,平均调制指数就会按峰均比往下掉,复原音的平均电平也同样往下掉。
| 峰均比 | 典型素材 | 平均调制指数 | 平均复原音电平 |
|---|---|---|---|
| 18 dB | 未压缩的古典录音 | 0.126 | −18.0 dB |
| 12 dB | 一般音乐音轨 | 0.251 | −12.0 dB |
| 9 dB | 轻度修整过的旁白 | 0.355 | −9.0 dB |
| 6 dB | 为广播压缩过的语音 | 0.501 | −6.0 dB |
| 3 dB | 强力限幅的提示广播 | 0.708 | −3.0 dB |
平均调制指数按 10 的(−峰均比 ÷ 20)次方计算。表所传达的信息很明确——在同样的硬件上,把峰均比从18dB降到6dB,体感音量便提高12dB。不加大功放、不增加换能器,仅靠信号处理就得到的12dB。这正是压缩器在指向性扬声器中不是"损害音质的妥协"而是核心部件的原因。当然压缩过度会让音乐的表现力消失,因此按用途分别设定——提示广播压得重,背景音乐压得轻。
延迟预算——实时这一条件
至此的所有处理,都必须在输入进来的瞬间完成。把各阶段各用多少时间列成预算,结果如下。滤波器延迟以线性相位FIR为准,按(抽头数 − 1)÷ 2 ÷ 采样率计算。
| 处理阶段 | 条件 | 延迟 |
|---|---|---|
| 输入AD转换 | Sigma-Delta抽取滤波器 | 约 1.00 ms |
| 低频补偿EQ | 线性相位FIR 512抽头 @ 48kHz | 5.31 ms |
| 分块处理缓冲 | 256样本 @ 192kHz | 1.33 ms |
| 希尔伯特变换(SSB系) | 257抽头 @ 192kHz | 0.67 ms |
| 平方根后的带宽限制 | 129抽头 @ 192kHz | 0.33 ms |
| PWM调制·输出级 | 比较器 + 栅极驱动 | 0.05 ms |
| 合计 | 8.70 ms |
这8.7ms该怎么看?按音速343m/s计算,声音飞过3米所需的时间恰好就是8.7ms。若听者在10米之外,仅穿过空气就要29.2ms。也就是说,指向性扬声器的信号处理延迟相当于把扬声器往后挪了3米,在大多数安装环境中都会淹没在传播延迟里。
不过有两种情况需要重新编排预算。一是与影像配合的展览,画面与声音的错位人会敏感地察觉。二是说话者听自己声音的扩声,此时延迟会妨碍发声。这两种情况下,只要把最重的项目——低频补偿EQ——从线性相位FIR换成最小相位IIR,就能收回5.31ms中的大部分。这是用相位特性去换延迟的交易。
这项技术做不到的事
在为系列收尾之前,把至此所有数字勾勒出的界线一次汇总。
- 发不出真正的低音。12dB/oct的斜率不是调制方式或信号处理能够消除的性质,它出自Berktay关系式本身。要把100Hz做平需要2,434倍振幅这一计算,就是这堵墙的高度。
- 装不下全频音频。要把20kHz音频载到40kHz载波上就需要 Q ≤ 1 的换能器,而这样的元件发不出参量阵所需的声压。
- 失真无法归零。平方根前处理在理论上能精确抵消失真,但其效果只能兑现到换能器所给出的带宽为止。第13篇的计算中,一旦截断带宽失真就回到8~13%,正是明证。
- 大声音很昂贵。复原音与超声波声压的平方成正比,看似只要把超声波提高3dB就能让可听声提高6dB;但实际上元件数量与驱动功率会一起增加,而那些功率大部分成不了声音,只变成热。
这份清单并非要贬低这项技术。恰恰相反,它准确地告诉我们把它用在哪里才能取胜。把语音频带的信息以很窄的角度准确送达——这正是这项技术胜过任何其他扬声器的地方。
系列收官——十四篇的旅程
《指向性扬声器的科学》在此完结。回头看去,它其实是一句话——把声音载到听不见的超声波上(调制·信号处理),以窄波束瞄准发射(阵列·波束成形),空气便会自行复原声音(PAA)。在第1篇"声音的手电筒"这个比喻背后,堆叠着这么多的物理、数学与工程。
把各篇所回答的问题逐一回顾:第1~3篇讲它是什么·用在哪里;第4~5篇讲为何选超声波作载波;第6~7篇讲空气如何成为解调器(Westervelt与Berktay);第8篇讲如何瞄准那道波束;第9~10篇讲产生超声波的元件的物性与谐振;第11篇给出以数字方式处理它的采样规则;第12~13篇铺陈承载信息的文法与策略;而本篇第14篇讲的是如何把这一切调校成一条完整的信号链。
在这段旅程中反复出现的结构只有一个:几乎所有的收益,都是卖掉别的东西换来的。窄波束以低效率为代价,高声压以窄带宽为代价,大音量以宽占用带宽为代价。所谓好的设计,就是知道在眼下这个用途里,哪一边可以交出去。本系列之所以画了那么多表格,原因正在于此——只有天平两端都写着真实的数字,才能作出决定。
感谢您一路同行。系列虽已完结,但相关技术的新消息与实验,今后仍会在本博客继续呈现。
系列完整目录
- 什么是指向性扬声器——声音的手电筒
- 把声音载到听不见的声音上——工作原理第一步
- 指向性扬声器应用案例——展览·安全·零售·办公
- 什么是超声波——定义·种类·传播特性
- 为什么是超声波——产生原理与应用地图
- 空气变成扬声器的魔法——PAA非线性声学
- PAA理论深化——Berktay·Westervelt·KZK
- 为声音瞄准——相控阵与波束成形
- 压电效应——电变成声的瞬间
- 超声波换能器设计——谐振与排布
- 奈奎斯特定理——数字声音的起点
- 调制入门——AM·FM·PWM一览对比
- 指向性扬声器的调制策略——谐振与PWM
- 信号处理优化——带宽与调制指数(本篇,完结)
本系列是将亲自研究整理的超声波指向性声学技术讲义资料改编为博客形式而成。图版摘自该资料。
参考资料
- H. O. Berktay, "Possible exploitation of non-linear acoustics in underwater transmitting applications," JSV 2(4), 435 (1965):复原音为包络平方的二阶微分这一关系式。正文12dB/oct低频斜率与平方根前处理的依据
- H. O. Berktay, D. J. Leahy, "Farfield performance of parametric transmitters," JASA 55(3), 539 (1974):包络近似成立的远场条件及其极限
- M. Yoneyama et al., "The audio spotlight: An application of nonlinear interaction of sound waves to a new type of loudspeaker design," JASA 73(5), 1532 (1983):空气中参量扬声器的首次实现实验与低频不足的实测
- T. Kamakura et al., "Parametric loudspeaker — characteristics of acoustic field and suitable modulation of carrier ultrasound," Electron. Commun. Jpn. 74(9), 76 (1991):不同载波调制方式的声场·失真比较
- T. D. Kite, J. T. Post, M. F. Hamilton, "Parametric array in air: Distortion reduction by preprocessing," JASA 103(5), 2871 (1998):以前处理降低失真这一思路的原典。正文平方根前处理一节的依据
- P. Ji, W.-S. Gan, E.-L. Tan, J. Yang, "Performance analysis on recursive single-sideband amplitude modulation for parametric loudspeakers," IEEE ICME, 748 (2010):前处理系调制的失真·带宽性能分析
- F. Karnapi et al., "Method to enhance the low-frequency perception from a parametric array loudspeaker," JASA 110(5), 2741 (2001):从感知层面补强物理上难以再现的低频的尝试
- C. Zhang et al., "Sub-array equalization technique for the parametric array loudspeaker to reduce nonlinear distortion," INTER-NOISE 263, 1497 (2021):把阵列分开均衡以同时处理响应与失真的技术
- J. Yang et al., "Preprocessing Methods of Parametric Array Loudspeakers," in Parametric Array Loudspeakers, 109 (2025):平方根·SSB·反复修正等前处理技术的总体梳理
- N. R. French, J. C. Steinberg, "Factors Governing the Intelligibility of Speech Sounds," JASA 19(1), 90 (1947):量化各频段对清晰度贡献的经典之作。正文语音频带一节的依据
- H. E. Bass et al., "Atmospheric absorption of sound: Further developments," JASA 97(1), 680 (1995):计算40kHz载波随距离损失能量的依据
- US 5,889,870 — Acoustic heterodyne device and method:把音频载到超声波载波上获得可听声的方式的专利