AI 语音终端,要检查模型之外的六个环节
声音进入设备后,还要经过采集、唤醒、识别、对话、合成和播放。网络、断电或升级异常时,设备也应给出清楚反馈。
先测完整语音链路
终端通常包含麦克风采集、声学前端、唤醒/活动检测、识别、对话、合成与播放。乐鑫 ESP-SR 的官方文档把 AEC、降噪、VAD、增益和唤醒分别列为声学前端能力,这说明“能录到声音”和“能稳定交互”是两件不同的事。
测试时要同时播放扬声器内容并从真实距离说话;安静房间里的单次成功不能代表全双工体验。
每个状态都要有反馈
待机、倾听、识别、思考、回答、断网与故障都需要清楚的声音、灯效或屏幕反馈。状态机应独立于某个模型供应商,避免切换服务后整套体验被重写。
三个容易遗漏的降级路径
- 网络不可用时,保留本地提示和必要的离线命令。
- 服务超时时,明确结束本轮交互并允许重新唤醒。
- 播放、动作或屏幕异常时,回到安全且可理解的状态。
设备上线后还要能管理和更新
产品化还包括设备身份、配置下发、日志、版本、灰度升级和回滚。Android 官方 A/B 更新机制通过备用分区降低升级失败后设备不可用的风险;具体产品不一定采用同一实现,但“可回滚、可观测、可重试”应成为 OTA 设计目标。