WAIC 2026 · EDITORIAL MINUTES

黄俊洪:数字人会说话不稀奇,能被打断才接近真实交互

因为它们往往只能按稿输出,不能听懂现场、被用户打断并自然接话。直播不是一段预生成视频,而是一条持续变化的互动流。缺少状态理解,数字人越逼真,机械反应带来的违和感反而越明显。

五个核心问题与回答

01

为什么多数数字人仍只是“会动的播音稿”?

形象和口型已经很逼真,产品为什么仍不好用?

因为它们往往只能按稿输出,不能听懂现场、被用户打断并自然接话。直播不是一段预生成视频,而是一条持续变化的互动流。缺少状态理解,数字人越逼真,机械反应带来的违和感反而越明显。

02

长时间直播最先暴露哪些工程问题?

短 Demo 成功为什么不能证明可以开播?

长时运行会同时考验稳定性、拟态和动态交互:画面不能崩,动作与表达要自然,输入发生变化时还要实时调整。工程目标被概括为“不崩、好看、省钱”,三者缺一都难以形成可持续业务。

03

“随时打断”为什么是关键分水岭?

多轮问答不已经是互动了吗?

回合制对话要求用户等待系统说完,真实交流却包含沉默、聆听、插话和修正。VM 从设计之初就把静默、聆听、说话三种状态和实时打断放进模型,产品单位由“生成一句话”变成“维持一场互动”。

04

这类能力怎样证明不是 Demo?

视频效果好看,如何判断商业可用性?

要看是否已进入直播间、赛事、游戏互动、数字分身和智能助理等真实流程,能否承受在线流量、内容安全、延迟和成本约束,并持续产生用户反馈。平台闭环比一次舞台展示更有说服力。

05

数字人与垂类 Agent 的共同壁垒是什么?

这只是内容行业的虚拟人技术吗?

更可迁移的部分是实时多模态 Agent:持续感知状态、在打断中保持任务、调用场景知识并稳定输出。真正壁垒不是“会说”,而是“能听、能接、能持续做”,并且整个过程可运营、可审核。

沿着对话,回到问题如何展开

01从“有问必答”走向“使命必达”

黄俊洪:AI 应用正在发生重要转变,从有问必答走向使命必达。数字人也不能只完成内容生成,而要承担实时互动任务。

纪要:直播把 Agent 的所有短板同时放大:延迟、记忆、情绪、内容安全和持续运行。它因此是比离线视频更严格的产品试验场。

02市场很热,交互仍然很冷

黄俊洪:大多数数字人只能照稿念,能说不会听,能输出但不能互动。

纪要:“能说”是生成能力,“会听”则要求系统理解当前角色、对方意图和对话节奏。后者决定数字人是媒体素材还是服务入口。

03三段训练服务三个业务目标

黄俊洪:团队通过分阶段训练、偏好优化、蒸馏加速和自纠偏,持续处理稳定、形象与成本问题。

纪要:技术名词只有对应运营指标才有意义。蒸馏对应延迟和成本,自纠偏对应长时间运行,偏好优化对应形象与交互质量。

04交互从第一天进入设计

黄俊洪:我们从设计第一天就把交互作为核心。它不是回合制聊天,而是可以随时打断、随时接话的真人式体验。

纪要:这改变了系统架构:输入输出必须并行,状态可中断又能恢复,动作与语音要在同一时间线上协调。

05真正跑起来才算产品

黄俊洪:展示的直播、游戏互动和数字分身不是单纯 Demo,而是在平台上真实运行的场景。

纪要:对投资判断而言,下一步仍需追问留存、成本、人工兜底和内容风险。真实运行证明了起点,却不自动证明规模化利润。

06乘法来自能力复用

黄俊洪:当底层能力可以在直播、赛事、陪伴和游戏间复用,增长就不只是加法,而可能成为乘法。

纪要:这一判断成立的条件是同一套交互基座确实能跨场景复用,而不是每增加一个场景都重新做一套定制项目。

现场画面

黄俊洪:数字人会说话不稀奇,能被打断才接近真实交互现场画面 1
2026 WAIC 腾讯 AI in Action 应用创新论坛 · 90:39 视频画面
黄俊洪:数字人会说话不稀奇,能被打断才接近真实交互现场画面 2
2026 WAIC 腾讯 AI in Action 应用创新论坛 · 95:53 视频画面

来源与整理说明

查看公开回放来源 ↗

已从整场回放中定位 12 分钟 发言片段,保留原始时间边界。依据公开回放整理;不是 WAIC 官方通稿。

从现场纪要继续判断