机器人感知这件事,视觉和触觉最近被讨论得比较多,听觉相对安静。Treble Technologies在做的事情,是把声音在物理空间里的传播变成可仿真、可生成的数据。公司2020年由Finnur Pind和Jesper Pedersen在冰岛雷克雅未克创立,刚完成1800万美元A-2轮融资,由Paladin Capital Group领投,老股东KOMPAS VC、Frumtak Ventures、欧洲创新委员会基金跟投,累计融资约3600万欧元。Pind的判断是,在实验室里表现良好的AI模型和设备,遇到混响、背景噪声或不熟悉的物理环境时就会失效。
声音是物理现象,不是信号处理问题
Treble的技术路线是基于物理的声学建模,模拟声音如何在空间中传播,结合声学仿真、数字孪生和合成数据生成,让开发者在造出物理原型之前就能评估产品表现。这个路径跟传统的音频处理方法不太一样。传统方法更多是在信号层面做降噪、增强、识别,而Treble做的是从空间几何、材料属性、声源位置的物理关系出发,计算声音在特定空间里的传播效果。一个房间的墙壁材质、家具摆放、空间尺寸,都会改变声音的反射和混响模式。把这些参数输入模型,就能生成接近真实空间的声学数据。
亚马逊和罗技已经在用
客户方面,亚马逊和罗技已经在用Treble的平台测试音频产品。亚马逊高级音频研究经理Wontak Kim说,用虚拟声学环境评估音频质量、测试物理测试无法复现的场景,是他们开发Alexa的重要环节。这句话点出了一个实际需求,很多声学场景在真实环境里很难复现或控制。比如特定的混响条件、特定位置的背景噪声、多个声源同时存在的情况,要在真实房间里精确搭出来成本很高。仿真环境让这些场景可以按需生成和反复测试。
机器人只靠视觉,听不到拐角后面的事
Paladin的投资者François Ruether给出的判断是,今天的机器人基本只靠视觉感知,它们能检测前方有什么,但无法解读有人在另一个房间摔倒或拐角处发生碰撞这类声音。这个描述指向的是物理AI的一个能力缺口。视觉有视线限制,拐角后面、墙后面、另一个房间里发生的事情,摄像头看不到,但声音能传过来。一个完整的感知系统需要同时处理看到和听到的信息,才能对周围环境有更完整的判断。Treble这笔融资的落点,就是在美国市场扩张的同时加大物理AI方向的投入,因为语音和音频正在成为智能机器的重要接口。声学仿真从音频产品测试延伸到机器人感知,中间隔着一层转换。测试音箱和耳机的声学表现,关心的是音质和降噪效果;机器人听觉关心的是事件识别和空间定位,比如声音从哪个方向来、是什么类型的声音、是否代表异常情况。Treble已有的物理声学建模能力能不能支撑这类任务,取决于它的仿真数据能不能覆盖机器人实际会遇到的声音场景。亚马逊和罗技的用例证明了它在消费音频领域的价值,机器人方向还在早期。
