
让 数字 人 真正 “听得见”: 我的 Barge-in 实时 语音 架构
从本地麦克风、WebRTC AEC3 和 DeepFilterNet3,到唤醒、双 VAD、双 ASR 与响应撤销:拆解一套纯 CPU 数字人实时语音打断系统。
Speech recognition14 min · 5.8K characters
Archive
13 posts

从本地麦克风、WebRTC AEC3 和 DeepFilterNet3,到唤醒、双 VAD、双 ASR 与响应撤销:拆解一套纯 CPU 数字人实时语音打断系统。
测试集:《包西意图标准化模块_测试问题集.xlsx》400 条。400 条逐条结果和混淆矩阵见 D:/xwechat_files/wxid_5pqlkzkrgfn422_d3cd/…
回答操作事件用于在最终回答中提供“查看详情、修改展示、继续处理、确认执行”等入口。 客户端只接受声明式 JSON,不接受可执行代码。
自然语言是信息化交互的第一道关口。用户说出的、键盘输入的或 OCR 识别出的内容,往往不是可以直接用于业务路由和工具参数的规范表达,常见问题包括: 错别字、ASR 同音错误、OCR…
这套系统可以接入同事的 DeepAgent 实现,但不是在前端新增一个接口地址就能完成。 当前最合适的目标架构是: Vue 只负责输入、会话展示、审批交互和固定模板渲染。
本文说明如何在 lanque-app 中修改现有固定回答模板、增加数据组件,或接入一个全新的模板类型。 最重要的区别: src/answers 负责“数据最后怎么画”。