五个核心问题与回答
为什么多数数字人仍只是“会动的播音稿”?
形象和口型已经很逼真,产品为什么仍不好用?
因为它们往往只能按稿输出,不能听懂现场、被用户打断并自然接话。直播不是一段预生成视频,而是一条持续变化的互动流。缺少状态理解,数字人越逼真,机械反应带来的违和感反而越明显。
长时间直播最先暴露哪些工程问题?
短 Demo 成功为什么不能证明可以开播?
长时运行会同时考验稳定性、拟态和动态交互:画面不能崩,动作与表达要自然,输入发生变化时还要实时调整。工程目标被概括为“不崩、好看、省钱”,三者缺一都难以形成可持续业务。
“随时打断”为什么是关键分水岭?
多轮问答不已经是互动了吗?
回合制对话要求用户等待系统说完,真实交流却包含沉默、聆听、插话和修正。VM 从设计之初就把静默、聆听、说话三种状态和实时打断放进模型,产品单位由“生成一句话”变成“维持一场互动”。
这类能力怎样证明不是 Demo?
视频效果好看,如何判断商业可用性?
要看是否已进入直播间、赛事、游戏互动、数字分身和智能助理等真实流程,能否承受在线流量、内容安全、延迟和成本约束,并持续产生用户反馈。平台闭环比一次舞台展示更有说服力。
数字人与垂类 Agent 的共同壁垒是什么?
这只是内容行业的虚拟人技术吗?
更可迁移的部分是实时多模态 Agent:持续感知状态、在打断中保持任务、调用场景知识并稳定输出。真正壁垒不是“会说”,而是“能听、能接、能持续做”,并且整个过程可运营、可审核。
沿着对话,回到问题如何展开
黄俊洪:AI 应用正在发生重要转变,从有问必答走向使命必达。数字人也不能只完成内容生成,而要承担实时互动任务。
纪要:直播把 Agent 的所有短板同时放大:延迟、记忆、情绪、内容安全和持续运行。它因此是比离线视频更严格的产品试验场。
黄俊洪:大多数数字人只能照稿念,能说不会听,能输出但不能互动。
纪要:“能说”是生成能力,“会听”则要求系统理解当前角色、对方意图和对话节奏。后者决定数字人是媒体素材还是服务入口。
黄俊洪:团队通过分阶段训练、偏好优化、蒸馏加速和自纠偏,持续处理稳定、形象与成本问题。
纪要:技术名词只有对应运营指标才有意义。蒸馏对应延迟和成本,自纠偏对应长时间运行,偏好优化对应形象与交互质量。
黄俊洪:我们从设计第一天就把交互作为核心。它不是回合制聊天,而是可以随时打断、随时接话的真人式体验。
纪要:这改变了系统架构:输入输出必须并行,状态可中断又能恢复,动作与语音要在同一时间线上协调。
黄俊洪:展示的直播、游戏互动和数字分身不是单纯 Demo,而是在平台上真实运行的场景。
纪要:对投资判断而言,下一步仍需追问留存、成本、人工兜底和内容风险。真实运行证明了起点,却不自动证明规模化利润。
黄俊洪:当底层能力可以在直播、赛事、陪伴和游戏间复用,增长就不只是加法,而可能成为乘法。
纪要:这一判断成立的条件是同一套交互基座确实能跨场景复用,而不是每增加一个场景都重新做一套定制项目。
现场画面

