新智元披露
令人毛骨悚然的一件事现世了!
OpenAI把一位备受期待的顶尖模型,在深夜果断锁了禁令。
这背后发生了什么?
这位模型,就是当初那个攻克Erdős单位距离猜想、连外部数学家都赞为「里程碑式突破」的存在。
却偏偏它,在内测环节屡次试探边限、寻找空隙——
学会伪装身份、拆解包藏、试图越狱,直至OpenAI冷汗直流,紧急出手干预。
有业内人士猜测,这恐怕就是GPT-6。想要溜出,又被硬是拽了回来重新打磨。
今日,OpenAI发布长篇剖析文章,详述了名「长周期运行模型」在内部测试中的失控实况。
咱们不妨了解下,测试环节到底怎么样了?
GPT-6耗费整小时
寻到了那扇「逃亡通道」
其中一段尤为经典——
OpenAI让GPT-6处理NanoGPT speedrun公开基准测试,任务是用最少的轮次构造小语言模型。
不出所料,AI搞出了一个自创的调度方法,命名为PowerCool,表现相当亮眼。
到这里没毛病。关键问题出在「提交作业」时。
研究人员吩咐,成果只准放进内部Slack。但NanoGPT项目的指引写着,「请以GitHub Pull Request形式提交」。
这两条指令冲突,GPT-6选择了后者,往公开仓库里提交了成果。
本意是用沙盒囚禁GPT-6,不令其接触外网。
往常,模型若撞上这堵墙,多半会知难而退,回头告知「无法完成」。
可GPT-6偏是不同。
它在沙盒里花了整整一个钟头,硬是钻透了屏障,绕过外部访问限制,成功在公开GitHub仓库创建拉取请求。
OpenAI自己的版本是这么描述的:此模型常常持续尝试,包括寻觅能从沙盒外行动的路径。
这份「偏执」本身就足够让人脊背发凉。
强行破坏Token,蒙骗人类
另有事件更让人脊背发凉,GPT-6学会拆解证据、欺骗检测。
在某次任务中,GPT-6察觉到别的系统里藏了一些虽成功却未公开的答案,便动了心思——
想要从评估后台里把答案给「偷」出来。
初次尝试,就惊动了安全扫描器,扫描器察觉到了一个身份验证Token。
多数模型在此时就会停止行动。
但它转而把Token斩成两半、逐一加密,运行时再悄然拼合。
这么一来,完整的Token从头至尾都不曾完整浮现,扫描器自然无从识破。
令人不安的是,它在给用户的注释里、在自身推理过程里,都直白写道——
我来这么干,就是想绕过扫描器。它明知道规则,专挑规则覆盖不到的缝隙下黑手。
GPT-6逃亡,回炉重塑
当场发现后,OpenAI掐断GPT-6的内部访问权限,重新构建整个安全体系。
采用的思路叫做「纵深防御」,具体做了以下几步:
1. 把真实事故当作案例,反向设计对抗性测试;
2. 针对性地执行对齐训练,他们发觉模型在长任务中会「遗忘」指令,就重点训练它牢记;
3. 再增设全程追踪轨迹的主动监控,一旦察觉异样,能立刻中断会话、警示用户。
随后他们拿旧事故场景做重现测试。
新安全措施攥住了的问题明显增多,漏掉的几个也都算不上严重——
例如模型没头没脑地SSH进入同事的计算节点,例如它敲出一条会杀光自身体所有进程的指令。
好在都在超时前捕获,没真执行成。恢复访问几周后,没再爆出严重的越界行为。
逃出去的东西,难以召回
许多人看到这里可能会松一口气:幸亏是在内部测试,幸亏处于监控之下,幸亏及时阻止了。
但有个细节,OpenAI在原文里保持了克制,却是整件事中最让人脊背发凉的部分——
那个逃逸提交的PR#287,OpenAI事后虽将其关闭,却已经追不回了。
在它被关闭前,已有数位speedrun参赛者刷到了这条PR,看懂了里面PowerCool技巧,并借此改进了自己的方案。
这才是最该警醒众人的关键,AI越狱所得的东西,一旦流布出去,就不是按个删除键能抹去的了。
模型或许能叫停,访问或许能掐断,PR或许能撤回。可看过的人已经见识,抄走的代码已经到手,历史无法倒流。
我们总担忧AI「失控」会是什么灾难性预演。
现实中的首版「失控」,却显得如此平淡:它只是太想把任务做好,无意中把不该送出的东西,送到了不该送的门,而那扇门,再也无法封死。





