
语音识别
让数字人真正“听得见”:我的 Barge-in 实时语音架构
从本地麦克风、WebRTC AEC3 和 DeepFilterNet3,到唤醒、双 VAD、双 ASR 与响应撤销:拆解一套纯 CPU 数字人实时语音打断系统。
14 分钟 · 5.8 千字
归档
12 篇

从本地麦克风、WebRTC AEC3 和 DeepFilterNet3,到唤醒、双 VAD、双 ASR 与响应撤销:拆解一套纯 CPU 数字人实时语音打断系统。
MoE 越稀疏越省算力,也越容易训崩。K3 把稀疏度推到 896 选 16(不到 2% 激活),靠归一化、SiTU-GLU、Quantile Balancing 三个稳定器把它拉住——名字里的 Stable 才是重点。