不少产品都被称为“数字人”,但实际能力可能完全不同:有的只是把一段文字生成口播视频,有的可以在直播间循环讲解,还有的能够听取现场问题、结合企业知识即时回答并完成预约、查询或工单创建。
真正需要实时服务时,判断产品的关键不是人物是否逼真,而是它能否形成一条稳定的闭环:听见用户、理解意图、找到依据、组织答案、自然表达,并在必要时调用业务系统。
这类系统更适合称为 AI交互智能体。本文从技术链路和验收指标出发,说明它与传统播报数字人的差异。
先区分三类常见“数字人”
1. 离线成片数字人
输入脚本后生成一条完整视频,适合短视频、课程、新闻播报和企业培训。
它的优势是画面稳定、可审核、输出清晰度高;但视频生成完成后内容就固定了,观众无法在播放过程中改变它的回答。
2. 直播播报数字人
将脚本、素材和推流连接起来,可以长时间循环或按节目单播报,也可以根据预设规则切换商品、背景与话术。
它比离线成片更实时,但很多系统仍然以“内容调度”为主,用户提出开放问题时,只能从固定回复中选择。
3. 实时交互智能体
用户说话后,系统实时完成语音识别、语义理解、知识检索、答案生成、语音合成和数字人驱动。回答过程中还要支持打断、追问、上下文延续和业务动作。
因此,实时交互智能体不是在传统数字人上增加一个聊天框,而是一套持续运行的音视频智能系统。
| 对比维度 | 离线成片 | 直播播报 | 实时交互智能体 |
|---|---|---|---|
| 主要输入 | 脚本或音频 | 脚本、节目单、素材 | 用户语音、知识、业务状态 |
| 输出方式 | 完整视频文件 | 实时推流 | 流式语音、画面与业务动作 |
| 用户打断 | 不支持 | 通常有限 | 必须支持 |
| 知识更新 | 修改脚本后重做 | 更新话术库 | 更新知识库即可生效 |
| 业务系统调用 | 较少 | 可做简单联动 | 查询、预约、工单等完整链路 |
一条实时交互链路由什么组成
企业项目通常至少包含以下七层。
唤醒与声音采集
系统要判断什么时候开始听、什么时候结束一轮输入。展厅和门店存在背景音乐、人群交谈和设备回声,仅靠麦克风“收到声音”远远不够。
需要重点处理:
- 唤醒词或触屏启动;
- 语音活动检测(VAD);
- 回声消除和噪声抑制;
- 远场麦克风和拾音范围;
- 多人同时说话时的输入策略。
流式语音识别(ASR)
流式识别会在用户说话过程中持续输出中间结果,而不是等整句话结束才开始处理。专有名词、产品型号、人名、地名和中英文混说需要通过热词或词典校正。
验收时不要只朗读标准普通话,应使用真实环境中的自然问法、停顿、改口和口音进行测试。
意图理解与对话管理
大模型负责理解问题和生成答案,但企业应用还需要一个对话管理层决定:
- 当前问题是否属于服务范围;
- 是否需要追问缺失条件;
- 是否检索知识库;
- 是否调用业务接口;
- 是否触发敏感内容规则;
- 是否转人工或结束会话。
没有对话管理,模型可能“能回答”,却无法稳定执行企业流程。
企业知识库与检索
知识库不是把所有文档一次性上传就结束。高质量问答需要对资料进行版本、权限、来源和有效期管理。
建议至少记录:
- 文档名称和责任部门;
- 生效与失效时间;
- 适用产品、区域和用户类型;
- 原始出处和审核状态;
- 敏感等级与可回答范围。
关于知识库的回答,应优先展示依据或关联页面,避免把模型生成内容包装成企业正式承诺。
语音合成与数字人驱动
答案生成后,流式 TTS 会尽快开始合成前半句,同时驱动口型、字幕、眨眼、表情和身体微动作。
这里需要解决三个同步问题:
- 声音与口型同步;
- 字幕与语音进度同步;
- 打断发生后,声音、字幕和动作同时停止。
如果只有声音停止,但人物仍继续做动作,用户会明显感到系统“失控”。
多媒体与页面联动
复杂内容不应全部依赖口播。智能体回答“办理流程”“展品细节”或“产品区别”时,可以同步展示流程图、图片、视频和网页卡片。
多媒体联动需要由结构化指令触发,而不是让模型随意拼接地址。系统应验证素材权限、文件状态和终端是否支持展示。
业务系统调用
当用户提出“帮我预约”“查询订单”“创建工单”时,智能体需要调用经过授权的 API。
调用前应确认必要参数和用户授权;调用后要明确说明结果。涉及写入、支付、个人信息或高风险操作时,应增加二次确认和人工兜底。
响应速度应该怎么测
“低延迟”不能只看模型接口耗时。用户感受到的是端到端延迟:
用户说完 → 系统判断结束 → 识别完成 → 检索与生成 → 合成首段语音 → 数字人开始开口
建议分别记录:
- 结束检测耗时;
- ASR 最终结果耗时;
- 知识检索耗时;
- 模型首 Token 时间;
- TTS 首包时间;
- 渲染与播放缓冲时间;
- 从用户说完到听到首个有效音节的总时间。
同时观察 P50、P95 和失败率。平均值很好看但 P95 很高,意味着大量用户仍会遇到明显卡顿。
项目可以把“首响小于某个目标”作为优化方向,但应在真实网络、真实终端和真实知识库下测量,而不是把实验室数据当作交付承诺。
打断不是“停止播放”这么简单
自然对话中,用户经常在智能体说话时补充条件或纠正问题。一个完整的打断过程包括:
- 从数字人自身的扬声器声音中识别人声;
- 判断是真实打断还是环境噪声;
- 停止当前 TTS、字幕、口型和动作;
- 取消尚未完成的模型与业务请求;
- 保留已经说过的上下文;
- 开始识别用户的新问题;
- 基于新条件继续回答。
因此,PoC 中应专门设计“短促插话”“连续打断”“说到一半改口”和“智能体说话时背景有人交谈”等测试。
企业PoC建议验证的12项指标
对话质量
- 真实问题命中率;
- 多轮追问是否保留正确上下文;
- 超出知识范围时是否拒答或转人工;
- 专业词、人名和数字识别是否准确。
实时体验
- 首响时间的 P50 与 P95;
- 打断成功率和停止耗时;
- 口型、字幕与声音同步程度;
- 长时间运行是否出现音画不同步或内存增长。
业务闭环
- 查询与写入接口的成功率;
- 参数缺失时是否主动追问;
- 人工转接是否携带会话摘要;
- 日志能否还原用户输入、知识来源、模型输出和业务结果。
如果项目涉及内网和数据边界,可结合数字人API与私有化部署方案以及企业接入指南共同评估。
常见选型误区
只看人物逼真度
形象决定第一印象,但持续体验更多取决于拾音、响应速度、知识准确性和异常处理。
用标准问题演示代替真实测试
演示问题通常短、清晰且已被提前准备。PoC 应从客服记录、访客提问或真实业务数据中抽样。
默认大模型什么都能做
模型并不知道企业最新价格、政策和库存,也不应自行执行高风险操作。知识、权限、流程和审计必须由系统明确控制。
忽略终端环境
同一套软件在办公室测试正常,放到嘈杂大厅、远场麦克风和公共网络后可能完全不同。终端、声学和网络是交互体验的一部分。
什么场景值得优先使用
适合优先落地的场景通常具备三个特征:问题高频、知识边界可整理、业务动作可标准化。例如:
- 官网售前咨询与线索收集;
- 门店迎宾、产品介绍与预约;
- 景区和博物馆互动讲解;
- 企业制度、IT 和培训助手;
- 政务大厅办事指引;
- 课程导学和标准问题答疑。
如果只是批量生成视频,没有实时问答需求,离线成片可能更简单、更稳定;如果需要用户追问、系统查询和现场服务,再选择实时交互智能体。
结语
AI交互智能体的价值不在于“数字人加大模型”这个标签,而在于把声音、知识、形象和业务系统组织成一个可持续运行的服务入口。
评估方案时,应把重点从单次演示效果转向真实场景中的响应、准确、打断、执行、审计和长期运维。你可以先查看AirX实时交互智能体能力,或通过商务合作页面提交场景、终端和知识库情况,获取针对性的PoC清单。
