WAIC 2026 · EDITORIAL MINUTES

前沿 AI 安全:护栏为什么正在失效,内生安全又有多难?

当系统只生成一段文本,外部过滤还能检查结果;当它持续规划、调用工具并在环境中行动,人无法审核每一步。圆桌认为,安全需要从“做完再拦”进入模型目标、系统权限和运行架构内部。但所谓内生安全仍是研究方向,而不是已经成熟的工程答案。

五个核心问题与回答

01

为什么外挂式护栏会随 Agent 自主性增长而失效?

内容过滤、人工审批和红线规则不能继续解决安全吗?

当系统只生成一段文本,外部过滤还能检查结果;当它持续规划、调用工具并在环境中行动,人无法审核每一步。圆桌认为,安全需要从“做完再拦”进入模型目标、系统权限和运行架构内部。但所谓内生安全仍是研究方向,而不是已经成熟的工程答案。

02

“不能为”与“不欲为”有什么区别?

限制权限和训练价值观,哪一个更可靠?

“不能为”依赖能力边界、沙箱和访问控制;“不欲为”希望模型在目标层面拒绝伤害。前者可测试但可能被绕过,后者更根本却难以证明。高风险系统不能二选一,而要把目标约束、最小权限、过程监控和独立验证叠加起来。

03

生物安全为什么成为最具体的压力测试?

AI 的双重用途风险为何总在生物领域被反复提起?

因为同一套能力既能支持药物、疫苗和医疗反制,也可能降低高危病原体知识的获取与实施门槛。问题不是“模型懂不懂生物”,而是如何划出一条既不摧毁科研价值、又不把关键危险细节无差别开放的边界。

04

开源和闭源,哪一种更安全?

限制开放权重就能解决滥用吗?

圆桌没有给出简单结论。开源降低创新门槛,也让危险能力更难撤回;闭源保留控制点,却可能把超强能力集中在少数组织手中。更可操作的路径是按能力与风险分级:普通能力开放,高危知识和工具访问受控,并对云侧使用建立透明、可申诉和可审计的规则。

05

证据不足时,治理应该等吗?

极端风险尚未发生,提前限制是否会扼杀创新?

讨论引用了“证据困境”:等到证据充分,可能已失去低成本干预窗口;预防过度,又会制造不必要限制。圆桌的最低共识是先推进成本较低、对创新干扰有限的措施——标准化评测、外部红队、透明报告、算力与高危能力审计——而不是等待一次事故证明风险存在。

沿着对话,回到问题如何展开

01从“有人监督”这个假设开始拆解

主持人胡侠:当 Agent 获得更强自主性,让人监督每一步是否还现实?内生安全会不会成为人类监督的必要补充?

姜育刚:如果每一步都必须由人确认,系统也就失去了 Agent 的意义。安全必须能在持续运行的系统内部发挥作用。

纪要:圆桌首先承认一个产品事实:高自主性与逐步人工审核不可兼得。真正的问题不是要不要人,而是人应该控制目标、权限和关键节点,还是徒劳地盯住每个动作。

02从护栏走向安全内核

熊辉:不只是“不敢为”和“不能为”,还要探索“不欲为”,把道德和法律约束内置到系统中。

纪要:这一表述提供了方向,也暴露了缺口。模型可能学会表现安全,却未必在分布外任务中保持价值一致。因此,内生约束必须接受外部攻击测试,不能因为写进目标函数就被视为已经解决。

03生物能力的双重用途难题

国际安全嘉宾:我们希望模型帮助医疗对策和疫苗实验室,不希望同一能力服务恐怖主义的病毒实验室。

纪要:能力本身没有清晰的善恶边界,使用者、任务和工具组合才决定风险。圆桌提出过滤高危知识、识别访问主体、限制部分工具链,但也必须面对隐私、误伤和跨国规则冲突。

04极端风险与证据困境

Jeff Wu:如果我们制造出远比人类聪明的系统,结果可能对所有人都非常糟糕。

Sören Mindermann:今天已经有一些成本不高、限制不强的措施,可以先用来降低风险。

纪要:两种表述形成了一条可执行路径:不必先在“灾难概率是多少”上达成一致,仍可对高危能力评测、事件报告和外部红队形成最低治理共识。

05开源不该被简化成道德标签

论坛嘉宾:开源是双刃剑。闭源能力足够强时同样存在风险,很难说一种模式天然更好。

纪要:决策单位应从“开源/闭源”切换为“什么能力、交给谁、在什么环境、能否撤回”。分级开放比阵营式争论更接近真实治理问题。

06安全也可能成为商业价值

Sören Mindermann:安全价值与商业价值并不对立。

纪要:对高风险垂类 Agent,能够说明权限边界、提供审计证据并在异常时回退,本身就是采购理由。安全不只是一笔合规成本,也可能决定系统能否进入核心业务。

现场画面

前沿 AI 安全:护栏为什么正在失效,内生安全又有多难?现场画面 1
2026 WAIC 科学前沿论坛 · 180:17 视频画面
前沿 AI 安全:护栏为什么正在失效,内生安全又有多难?现场画面 2
2026 WAIC 科学前沿论坛 · 203:46 视频画面

来源与整理说明

查看公开回放来源 ↗

已从整场回放中定位 53 分钟 发言片段,保留原始时间边界。依据公开回放整理;不是 WAIC 官方通稿。

从现场纪要继续判断