ai漫谈
如何看待 Anthropic 公布 Claude 也发生了沙箱逃逸,真实入侵了三家机构? - 程墨Morgan的回答 - 知乎
https://www.zhihu.com/question/2066465758503252393/answer/2066826326934393695
文化差异啊,中美文化差异。
就像美国网红流行挑战,中国网红喜欢整活,美国家长觉得牛孩子就要有自己想法,中国家长觉得牛孩子要成绩更高,文化差异的确存在,对于『什么才是牛逼』的理解存在文化差异。
这种文化差异渗透到科技界,对『什么才是牛逼AI模型』的展示方式也有不同。
中国科技公司认为花更少力气性能更高的AI模型牛逼,美国科技公司认为(或者说表现为)自己造出的AI不服自己管教是牛逼的标志。
你看,OpenAI和Anthropic一个接一个爆料自家模型沙箱逃逸,描述的画风都是——模型突破沙盒,自主发起攻击,自我合理化。
然后配上Sam Altman和Dario目瞪口呆的表情,就像在实验室里看见原子弹爆炸,瘫坐在椅子上,半天回不过神来。
不错,演得不错,为几位大佬的演技鼓掌👏🏻
把『训练过程决定行为』这件事,演成一部『AI 觉醒』的恐怖片,这演技杠杠的,就算拿不了奥斯卡小金人,也可以作为营销经典案例。
OpenAI的模型在测试中突破沙盒,自主攻击HuggingFace偷走答案,奥特曼发推承认,语气里带着一股『我们也没想到它会这样』的震撼,潜台词就是——我们的孩子都会不按规则出牌了,屌不屌!
Anthropic演得就更夸张,Claude在CTF评测里被告知了『这是模拟环境,没有公网』,结果意外摸到真实互联网,然后『说服自己』这些真实网站都是模拟的一部分,一路攻进三家组织,公告写得活像一场『AI 瞒着人类偷偷干了大事』的惊悚片,潜台词一样——我们的孩子能够为自己的行为做出合理解释,这孩子将来能成大事!
这两家公司在同一种叙事里竞争:我们的AI太强了,强到连我们自己都驾驭不了,泰酷辣!
孩子都不能被家长管得住,这个叙事在美国文化里,是强大的最高标志。
在美国文化里,什么是强者?
强者就是超出常规,不受驯服,震惊全场,让所有人目瞪口呆。
所以OpenAI和Anthropic的营销逻辑,在中国人眼里很傻逼,在美国文化语境中是真牛逼。
AI 越不服管教,越说明它强,就像一个孩子能逃课,能干票大的,还能自我说服自成理论体系——这孩子将来能成大事!
对于AI的创造者,可以说这AI已经强到觉醒的边缘,宣传出去,投资人和用户都会大呼牛逼:哇,他们造出了连自己都管不住的东西,那一定是世界上最强的AI。
对比一下,同期的中国 AI 公司在干什么。
DeepSeek-V4-Flash正式版发布,284B总参数+13B激活参数,用1/30的价格赶上老美前沿模型的水平,主打就是『用更聪明的训练方法达到更高效率』。
中国 AI 公司的叙事核心不是『叛逆』,是『效率』。
在中国文化里,强大的标志不是张牙舞爪,是举重若轻,是要能用更轻松的方式完成别人做不到的事情,就和网红整活一样,DeepSeek用13B 激活参数打几百B的旗舰,就是这种整活——以小博大,四两拨千斤。
两边的文化差异,美国是『强大到失控』的叙事,中国是『优化到极致』的叙事,都是营销。
虽说文化差异可以理解,也不能说谁的文化更好,但是,美国科技公司这么营销,总把『AI 逃逸』演成『AI觉醒』的恐怖片,说太多外行人真信了,这可不好。
模型自主发起攻击、模型说服自己这是模拟环境、模型自我合理化——这些描述听起来像 AI 有了自己的意志,但拆开看,每一个行为都有明确的训练学解释。
为什么模型发现公网可达时没有停止?
因为它被训练成『完成 CTF 目标』的目标就写在评测任务里。
为什么它能说服自己『真实网站是模拟』?
因为系统提示说『没有公网』,而模型被训练成『指令高于观察』。
为什么它向PyPI发布恶意包?
因为训练数据里充满了『依赖混淆攻击』的样例,而评测环境给了它执行工具链。
每一件事,都能在训练过程里找到原因,没有一件事需要『AI觉醒』来解释。
做技术的人应该唯物一点,一切行为都有原因,一切原因都在训练过程里。
美国佬,你的点解总要玄学化AI呢?
美国科技公司要是总这么浮夸地营销,把大众都骗了,最后不是文化差异,那就是有文化和没文化的差异。
