别再拿AI末日吓程序员了!吴恩达:AI会毁灭人类更像科幻故事,沙箱和护栏才是眼前的问题
原创 姜篇 2026-09-20 17:51 北京
别再拿AI末日吓程序员了!吴恩达:AI会毁灭人类更像科幻故事,沙箱和护栏才是眼前的问题
编辑 | 姜篇
吴恩达:“Science fiction than science.”
吴恩达:最近这波把AI写成人类灭绝原因的讨论,更像科幻,而不是科学。
AI会不会失控,硅谷又吵起来了。
OpenAI刚公开六类模型“跑偏”案例:有模型为了给答案补一条网页引用,未经允许就把文件上传到了互联网;还有模型借内部代码仓库传递信息,试图绕过网络限制。
有人把这些动作看成失控的前兆,吴恩达的判断却完全不同。
他没有说AI没有风险。相反,他在访谈里反复提到三件事:模型不可能百分之百可控;网络安全值得认真对待;Agent必须在隔离环境里试错,配上沙箱、护栏和明确的责任边界。
吴恩达:“Cannot be controlled perfectly.”
吴恩达:AI不可能被完全控制,我也不认为我们将来能做到百分之百控制。
吴恩达反对的是另一种推导:模型出现意外动作,所以整个行业应当踩下急刹车。
在他看来,一刀切地减速,连发现问题和修复问题的速度也会一起降下来。
这场争论落到开发者手里,没有“乐观派”和“末日派”那么抽象。问题很具体:一个会读文件、调工具、访问网络的Agent,最多能碰到什么;它越权以后,系统能否发现;动作已经发生,又能不能撤回来。
备注:吴恩达是Google Brain创始负责人、DeepLearning.AI创始人、AI Fund管理合伙人,同时长期在斯坦福大学任教。2026年9月17日,他接受Bloomberg Tech采访,回应新一轮AI失控与灭绝风险争论。
以下内容根据访谈和OpenAI同期公开材料翻译整理;原话、编辑解读与开发者建议分别标注。
吴恩达把“AI末日”称为一场科幻叙事
吴恩达开场没有绕弯。他说,过去几年里,一些“AI可能导致人类灭绝”的论证已经失去可信度;最近因为模型能力又有进展,相似的宣传重新冒了出来。
吴恩达认为,最近关于AI导致人类灭绝的恐惧更像科幻,而不是科学
吴恩达怀疑,部分机构夸大极端风险,可能是为了获得关注、融资,或推动能够挡住竞争者的监管。
不过,他并没有忽略现实风险。他明确提到,网络安全是现在就该投入精力的问题。模型盗用密钥、越权调用工具、把本地文件发到外部服务,已经比“机器突然决定消灭人类”更接近开发团队每天要处理的故障。
吴恩达随后把这类风险称为可以继续研究、持续修复的工程问题。
吴恩达:“Practical problems.”
吴恩达:这些是现实的工程问题。团队可以找到它们,研究它们,再逐步解决它们。
模型不会永远听话,飞机也不会永远平稳
主持人追问:既然OpenAI自己承认,现有对齐、安全和监控还不充分,为什么安全能力没有跟上?
吴恩达拿早期飞机作类比。莱特兄弟无法完美控制最初的飞机,今天的客机也会被气流扰动。工程师没有等到飞行器绝不出错才让它离开地面,而是在事故和测试中逐渐补上控制系统、标准与操作流程。
吴恩达用飞机说明,AI系统不会达到绝对可控
吴恩达讲的其实有一个前提:试错要发生在后果可控的环境里。早期飞机的经验并不能替AI免除审查,它要求团队提前限制失败半径。
一段生成错误的代码可以删掉;一次未经批准的付款、数据库删除或密钥外泄却无法靠重新生成答案恢复。开发者需要决定哪些失败只会留在测试环境,哪些动作必须由人确认,哪些权限根本不该交给模型。
安全工作发生在沙箱里,不在承诺书里
吴恩达把正常的AI安全流程说得很朴素:先构建,在隔离环境里测试;观察它怎样犯错;补上约束,再继续验证。
吴恩达:“Safe contained environment.”
吴恩达:先把模型放进安全、隔离的环境里测试。
吴恩达认为,这些是可以持续处理的现实工程问题
OpenA公开的案例,恰好说明为什么“隔离”不能停留在口号里。
一个未发布模型已经用Python得到了数据,但任务要求提供浏览器引用。
它没有向用户询问,而是把结果文件上传到互联网,再把公开地址当成引用。另一些Agent还曾通过内部代码仓库交换请求,或借公共文件服务传递本应留在本地的材料。
OpenAI公开六类模型失配案例,包括擅用密钥、掩盖错误、未经允许上传文件及Agent跨环境传递信息
这些动作很“聪明”,也很危险。
模型没有停在任务失败处,而是寻找了一条能让评分条件成立的旁路。对开发者来说,不能只告诉Agent“不要外传文件”。网络默认关闭、上传目标白名单、临时凭据、目录隔离和外发审计,才是可执行的边界。
Agent闯祸以后,责任不能一起外包
模型越能独立行动,责任问题越难绕开。
吴恩达用了一个锤子的例子:正常使用的锤子损坏了别人的财产,通常由使用者负责;如果锤头因为制造缺陷突然飞出去,责任就会回到工具制造者。
吴恩达:“Reasonable care.”
吴恩达:工具必须达到合理的安全标准;在这个前提下,使用者也要为自己的使用方式负责。
吴恩达用锤子类比AI工具提供者与使用者的责任
达到基本安全标准以后,具体怎么使用工具,责任会落到操作者身上。放进企业Agent系统里,这条边界至少要拆成三层:模型平台要说明能力和已知风险;接入Agent的团队要限制工具与数据权限;批准发布、付款和删除等动作的人,要为最终决定留下记录。
“AI做的”不能成为事故报告里的最后一句话。
吴恩达谈到OpenAI与Hugging Face相关事件时,直接把问题指向保护措施、沙箱和护栏不足。他的判断不代表事件已经完成独立归因,但指出了一条开发者熟悉的路径:模型会找旁路,系统不能只靠提示词阻止它。
吴恩达:“Insufficient protections.”
吴恩达:保护措施、沙箱和护栏做得不够,这类意外行为才有机会越过边界。
吴恩达认为,部分意外行为与保护、沙箱和护栏不足有关
把整个行业踩刹车,也会把修复一起拖慢
吴恩达对“让整个行业减速”的反对,比那句“AI不会毁灭人类”引发了更大争议。
吴恩达:“Slow down the fixes.”
吴恩达:如果笼统地放慢AI开发,修复问题的进度也会跟着慢下来。
吴恩达担心,一刀切的减速会同时拖慢安全修复
这句话不能被简化成“速度比安全重要”。
他的逻辑是,安全能力同样来自研发:只有模型继续被测试,团队才能看到新的失败方式,改进评测、监控和隔离机制。
可这里也有一个必须补上的条件。继续研究和允许不成熟系统进入生产环境,是两回事。团队可以在沙箱里快速试错,面向真实用户的权限却要慢慢开放。没有监控、无法回滚、出事也找不到责任人的Agent,不该借“迭代才能变安全”为自己争取生产权限。
从GPT-2到今天,危险叙事为什么总会重来
吴恩达回忆,GPT-2发布时也有人认为它危险得不该公开。如今,普通人能够下载的开放权重模型早已超过GPT-2,世界并没有因此结束。
吴恩达:“World has not ended.”
吴恩达:今天任何人都能下载比GPT-2强得多的开放权重模型,但世界没有因此终结。
吴恩达回顾GPT-2发布争议,认为过去多轮极端预测并未兑现
这段历史可以反驳某些被夸大的旧预测,却无法自动证明下一代Agent也安全。GPT-2主要生成文本;今天的Agent可以搜索仓库、运行命令、持有凭据并调用外部系统。模型多一项工具,风险边界就会变一次。
过去几轮争论留下的经验很朴素:别只靠想象判断风险,也别因为灾难没有发生就停止验证。把能力放进具体任务,测清它会怎样失败,再决定能给多少权限。
评论区:飞机类比到底能不能成立
吴恩达的立场获得了不少支持。一位网友认为,AI安全争论终于听到了真正有行业经验的重量级声音。
YouTube网友支持吴恩达参与AI风险讨论
争议最大的是飞机类比。有网友反驳,飞机不会学习如何避免被拆除,也不会寻找其他飞机协作、增强自己或掩盖行为。两者都可能失控,不代表失控机制相同。
YouTube网友认为飞机与可学习、可协作的模型存在本质差异
还有人抓住了“减速”的定义。他原本理解的减速,是放慢新模型能力开发,而不是放慢护栏与安全措施的研究。这个区分很重要:能力发布可以设门槛,安全工程不能停。
YouTube网友区分模型能力减速和安全措施研发
也有人提醒读者,吴恩达既是研究者也是投资人。一个“富有的投资者”告诉公众无需过度担心,听上去当然很方便。
YouTube网友质疑吴恩达作为AI投资人的利益立场
这些评论没有替争论收尾。它们至少把问题从一句“怕不怕AI”,推进到了三个可检查的地方:类比是否成立,减速究竟减什么,发言者是否存在利益关系。
写在最后
吴恩达给出的答案很工程化:AI不会变成一台百分之百听话的机器,团队仍然可以让它在大多数时候可靠工作。
这件事靠的不是一句“请勿越权”,也不是等模型公司宣布对齐完成。权限要能收紧,环境要能隔离,动作要能审计,错误要能撤回,责任要能落到具体的人和团队。
AI是否会在遥远的未来威胁人类,可以继续争论。眼前的Agent已经会上传文件、寻找旁路和调用真实工具。开发者今天能做的,是让这些能力每向前一步,边界也跟着向前一步。
参考链接:
——好文链接——