第 1 篇中我们把指向性扬声器比作"声音的手电筒"。声音只朝一个方向发射,瞄准方向之外一片安静——可这究竟如何做到?无论换成多好的扬声器,只要直接发出可听声,声音就会向四面扩散。指向性扬声器的答案在于思路的反转:不是发射可听声,而是把它装载到听不见的声音上。
装载到听不见的声音上——超声载波
指向性扬声器使用人耳听不见的 20kHz 以上高频段,即超声波,作为载波(Ultrasound Carrier)。实际产品通常工作在 40kHz 以上。这里有两把钥匙。
- 直线传播的秘密——频率越高(波长越短),波的衍射即扩散就越少,直线性越强。波长远短于可听声的超声波,具备接近光的直线性。这正是第 1 篇所说"手电筒般的声音"得以成立的物理依据。
- 调制(Modulation)——把想要传递的可听语音信号装载到高能量的超声信号上再辐射出去。正如收音机把语音装载在电波上,指向性扬声器把语音装载在超声波上。

听到这里立刻会产生疑问:超声波是听不见的声音,那么装载其上的语音,我们究竟如何听到?既没有接收机,也没有耳机。
什么是调制——把声音刻在包络上
调制用一句话概括就是"让载波的幅度随声音信号一起摆动"。在最基本的调幅(AM)中,发射出去的波形具有如下形态。
发射的超声波 =(基准幅度)×[1 + m × 声音信号(t)]× cos(2π × 载波频率 × t)
其中方括号内即包络(envelope)。超声波本身以 40kHz 快速振荡,但其幅度的轮廓线完全依循我们想传递的声音形状。声音并非刻在波形上,而是刻在轮廓上。
式中的 m 是调制指数(modulation index),决定包络摆动的深度。m 小则声音小;m 越接近 1 声音越大,但失真也随之增大。把这一个数值放在何处,正是音量与音质之间的调节旋钮,第 14 篇将正面处理。
调制还会在频率轴上于载波两侧产生边带(sideband)。在 40kHz 载波上装载至 20kHz 的音频,实际占用带宽即为 20~60kHz。一个设计约束立刻浮现——下边带的下缘正好触及听觉上限 20kHz。因此实务中会从上方截断音频带宽(语音播报有 8kHz 左右已足够),或把载波取得更高。
空气成为扬声器——参量声阵列
这一问题的答案,正是该技术的心脏——参量声阵列(Parametric Array)现象。其定义如下:强超声波穿过空气时,因空气的非线性(Non-linearity),超声波逐渐衰减,而装载其上的可听声得以复原。
按顺序追溯一遍。
- 超声波束辐射——载有语音的强超声波束射入空气。此时尚无任何声音。
- 空气的非线性——声压足够强时,空气不再是"温顺"的介质。受压一侧的声速略快于膨胀一侧,波形便自行发生畸变。
- 自解调(Self-Demodulation)——在这种畸变中,装载于超声波上的可听信号自行分离并复活。高频超声被空气迅速吸收而消失,复原后的可听声则能传得更远。
归根结底,制造声音的不是扬声器的振膜,而是波束经过的空气本身。超声波束的整条路径成了一只细长的虚拟扬声器。这就是"空气成为扬声器"并非夸张的原因,也是波束之外的人什么都听不到的原因。
为何能够复原——包络"平方的二阶导数"
1965 年整理出的自解调关系式,以惊人的简洁概括了这一现象。复原的可听声压大致由下式决定。
可听声压 ∝ 对(包络的平方)关于时间求两次导数
虽短,这一行却囊括了指向性扬声器的全部优点与弱点。
- "平方"带来失真——因为使用的不是包络本身而是其平方,于是产生了原本不存在的谐波与和差分量。这是与元件品质无关的源自原理的失真。因此实务中采用预补偿:预先对包络开平方后再发射。平方与平方根相抵,原波形便得以还原。
- "二阶导数"削弱低频——一次时间求导等效于增益随频率成正比上升,两次便形成每倍频程 12dB 的斜率。即高音容易出来、低音急剧衰减。第 1 篇所说"低频偏弱"这一局限,其确切出处正是此项。
归纳起来,指向性扬声器的信号处理,就是同时完成抵消平方(失真校正)与抵消二阶导数(低频补偿)两件事。这两项校正能推进到什么程度,直接决定产品音质,具体技法见第 12~14 篇。
为何偏偏是空气——非线性明明是水更大
这里有一处怪异。这项技术原本诞生于水中,而非线性本身水比空气更大。表示介质非线性程度的系数 β,水约为 3.5,空气却仅有 1.2。空气接近理想气体,故 β = 1 +(γ−1)/2,代入双原子分子气体的比热比 γ = 1.4,即刻得出 1.2。
然而这一方式在空气中反而奏效得多。原因在于左右差频生成效率的并非 β 本身,而是β 除以介质的 ρc³。此处 ρ 为密度,c 为声速。
| 介质 | 密度 ρ | 声速 c | 非线性系数 β | ρc³ |
|---|---|---|---|---|
| 空气(20℃) | 1.2 kg/m³ | 343 m/s | 1.2 | 约 4,800 万 |
| 水 | 1,000 kg/m³ | 1,500 m/s | 3.5 | 约 3.4 万亿 |
仅看 ρc³,水约为空气的 7 万倍。即便计入水在 β 上近三倍的优势,以相同声压所能生成的差频分量仍是空气一侧占优 两万倍以上。空气这种"软"介质的属性,在此处成了压倒性的长处。
代价同样明确。空气会迅速吸收超声波,波束在数米之内便失去力量。参量声阵列在水中可用作传播数公里的声呐,而在空气中则成为数米至数十米的室内设备,原因正在于此。同一原理因介质不同而成为截然不同的产品。
载波频率如何选择
载波越高波束越窄,但空气吞噬得也越快。下表以直径 100mm 圆形阵列为基准,依国际标准计算式(20℃、湿度 50%)与圆形口径的指向特性求得。
| 载波频率 | 波长 | 波束宽(−3dB,口径 100mm) | 空气吸收 | 实务评价 |
|---|---|---|---|---|
| 25kHz | 13.7mm | 约 8.1° | 0.73dB/m | 作用距离长,但有可听泄漏风险 |
| 40kHz | 8.6mm | 约 5.0° | 1.32dB/m | 应用最广的平衡点 |
| 60kHz | 5.7mm | 约 3.4° | 1.98dB/m | 波束锐利但损失距离 |
| 100kHz | 3.4mm | 约 2.0° | 3.28dB/m | 仅限近距离,换能器不易采购 |
40kHz 之所以近乎成为事实标准,表中已见分晓:它距听觉上限足够远,载波被直接听见的风险低;吸收尚可承受;且廉价压电换能器多集中在这一频段。换能器的谐振特性见第 9、10 篇。
硬件的演进——从穹顶到阵列
实现原理的硬件也历经数代演进。

- 过去——物理反射:用形似碟形天线的穹顶(抛物面反射罩)汇聚声音。原理简单,但体积大、安装受限。
- 当前——换能器阵列:将多个小型超声换能器排布于平面,通过控制各单元的相位(Phase)来操纵波束方向与声压。无需反射罩,一块薄面板即可成束,并可电子化改变瞄准方向。
- 最新——MEMS 扬声器:以半导体工艺制造的超微型扬声器芯片。超小型化与超薄化正推进到可搭载于移动设备的阶段。
平面阵列与相位控制,正是第 1 篇所说面声源(Planar Source)的实际实现方法,将以波束成形(Beamforming)之名在第 8 篇详述。表中的波束宽归根结底也是口径做多大的问题——阵列的尺寸即指向性的尺寸。
信号在一台扬声器内部走过的路
以上是物理。而在真实的设备内部,为了用上这套物理,信号要依次穿过若干级。每一级的职责不同,做得不到位时暴露出的症状也不同。不妨把前面几节里散落的概念排成一条线,看看它们各自站在哪个位置。
| 级 | 做什么 | 这一级薄弱时 |
|---|---|---|
| 1. 输入与带宽限制 | 接收音频并切掉上限。若是语音播报,通常在8kHz附近切断 | 下边带落到20kHz以下,载波附近的成分会被耳朵直接听见 |
| 2. 低频补偿 | 把二阶导数每倍频程削去的12dB预先抬起来 | 人声变得单薄尖细,在同样音量下清晰度下降 |
| 3. 预补偿——包络整形 | 预先抵消空气将要施加的平方(平方根一类的整形) | 谐波与和差成分原样留下,声音粗糙浑浊 |
| 4. 调制 | 把整形后的包络装载到载波上。用调制指数m在音量与失真之间取舍 | 提高m会变响,失真也随之陡增;降低m则变得安静 |
| 5. 放大与驱动 | 提供足以同时驱动数百个阵元的电压与电流 | 峰值被削顶,包络被压平,上游所有校正统统白费 |
| 6. 换能器阵列 | 把电转成超声,并以阵元之间的相位差形成波束 | 偏离谐振的频率辐射不出去,可承载的带宽随之变窄 |
| 7. 空气 | 充当解调器。声音在波束经过的整条路径上被生成 | 温湿度一变,吸收随之改变,音量与射程一同波动 |
这张表最值得留意的是顺序。校正在前,失真的成因在最后。普通扬声器里制造失真的部件位于链条末端,其后再无可施力之处;而参量扬声器事先就知道制造失真的是空气,连它的公式都知道。于是可以反着算,把答案预先放进前级。所谓失真源于原理,不只意味着无可回避,也意味着它是可计算的。
与此同时,这条链条由最弱的一环决定。预补偿再精巧,只要在第5级被削顶就归于无用;第6级带宽一窄,第2级辛苦抬起的低频压根就辐射不出去。这正是信号处理与硬件无法各自单独优化的原因,也是本系列把物理、电路与信号处理并排放在一起讲的原因。
关于第4级再补一句。同一现象也常被用两个超声来讲解:同时发出40kHz与41kHz,其差值1kHz便能听见。这并非另一套原理,而是同一个式子换了个切法。说"晃动包络",与说"把这份晃动在频率轴上分解为载波与边带",指的是同一件事。双音只是其中最简单的情形——待承载的声音仅为一个纯音的情形。
声音从何处开始能被听到
普通扬声器在振膜正前方最响。参量扬声器则不同。辐射面正前方只有超声波,几乎没有可听声,因为声音是在波束穿行空气的过程中一点点积累而成的。
因此声压随距离所描的曲线颇为奇特。自辐射面出发会先上升一段,直到载波因吸收而失去力量、无法再生成新的声音时,才开始下降。普通扬声器自始至终只会衰减,而这一边最响的位置在离扬声器数米之处。
这一性质有两点实用含义。其一是太近反而听不清:若要像自助终端那样在 50cm 处使用,设计就必须不同。其二是安全余量是反着来的。可听声最小之处正是超声最强之处,故人越靠近设备,所得越少而所受暴露越多。第 3 篇之所以如此强调安装高度与角度,其缘由就藏在这一条曲线里。
三个常见误解
- "超声波会完全消失"——并不准确。它是因吸收而逐渐减少的,在扬声器正前方载波最强。设定安装高度与角度,使人头不处于近距离范围,是设计的基本功。
- "只有波束内才听得到"——仅在自由空间成立。波束触及墙面、地面或玻璃时,该点便如新声源般扩散至整个房间。瞄准什么占了设计的一半。
- "只要调制就能出声"——声音是有了,但原样输出失真很大。未校正上述平方与二阶导数项的原始 AM,连语音清晰度都难以保证。
三句话总结
- 把可听语音装载到听不见的超声波包络上(调制),以直线性强的波束发射。
- 空气的非线性使其自行解调,但复原音是包络平方的二阶导数形态,故失真与低频不足在原理上如影随形。
- 该原理以换能器阵列与相位控制实现,硬件正从穹顶走向 MEMS 而不断缩小。
系列导览
《指向性扬声器的科学》将按以下顺序展开。
- 什么是指向性扬声器——声音的手电筒
- 把声音装载到听不见的声音上——工作原理第一步(本篇)
- 指向性扬声器应用案例——展览、安全、零售、办公
- 什么是超声波——定义、种类、传播特性
- 其后:参量声阵列(PAA)、波束成形、压电换能器、奈奎斯特、调制、信号处理
本系列是将笔者自行研究整理的超声指向性声学讲义,改写为博客形式呈现。图版摘自该资料。
参考资料
- H. O. Berktay, "Possible exploitation of non-linear acoustics in underwater transmitting applications," JSV 2(4), 435 (1965):本文"包络平方的二阶导数"关系式的原典
- P. J. Westervelt, "Parametric Acoustic Array," JASA 35(4), 535 (1963):非线性相互作用产生差频分量的理论
- M. Yoneyama et al., "The audio spotlight: An application of nonlinear interaction of sound waves to a new type of loudspeaker design," JASA 73(5), 1532 (1983):以换能器阵列在空气中实现参量扬声器的实验
- T. Kamakura et al., "Parametric loudspeaker — characteristics of acoustic field and suitable modulation of carrier ultrasound," Electron. Commun. Jpn. 74(9), 76 (1991):不同载波调制方式下的声场与失真特性比较
- "Dynamic single sideband modulation for realizing parametric loudspeaker," AIP Conf. Proc. 1022, 613 (2008):以边带处理同时兼顾带宽与失真的调制技法
- H. E. Bass et al., "Atmospheric absorption of sound: Further developments," JASA 97(1), 680 (1995):表中空气吸收系数(25kHz 0.73 · 40kHz 1.32 · 60kHz 1.98 · 100kHz 3.28 dB/m)的计算依据
- US 5,889,870 — Acoustic heterodyne device and method:以超声载波获得可听声的方式专利
- Amplitude modulation — Wikipedia:包络、调制指数与边带的基本定义
- Sideband — Wikipedia:载波两侧产生的边带与占用带宽
- Nonlinear acoustics — Wikipedia:大声压下波形发生畸变的非线性声学概观
- Sound from ultrasound — Wikipedia:以超声波产生可听声的技术总览