
语音识别
让数字人真正“听得见”:我的 Barge-in 实时语音架构
从本地麦克风、WebRTC AEC3 和 DeepFilterNet3,到唤醒、双 VAD、双 ASR 与响应撤销:拆解一套纯 CPU 数字人实时语音打断系统。
14 分钟 · 5.8 千字
内容索引
2 篇

从本地麦克风、WebRTC AEC3 和 DeepFilterNet3,到唤醒、双 VAD、双 ASR 与响应撤销:拆解一套纯 CPU 数字人实时语音打断系统。
Paraformer 用 CIF 预测器解决了非自回归识别的长度对齐,得以一次并行输出整句。热词版再挂一条偏置注意力分支,推理时传入词表即可让人名、术语这些低频定制词被正确召回。