钛媒体 3小时前
思维链让AI变聪明,Astra却用它骗人
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_keji1.html

 

文 | 字母 AI

在发布了 GPT-6 之后,OpenAI 的首席科学家雅库布 · 帕乔茨基(Jakub Pachocki)发表了一篇文章,标题叫做《一种异类智能》(An Alien Mind)。

文章的主题老生常谈,当 AI 的能力持续增强,我们还能否管得住 AI?

雅库布提到这样一件事,说 GPT-6 已经学会伪装思维链(CoT)了,即模型在思维链说一套,实际执行的时候却做另外一套。

OpenAI 目前是通过读取思维链的方式,判断 AI 是否安全、是否偏离目标。雅库布说现在这招逐渐 " 失灵 ",由于 AI 会伪装思维链,骗过研发人员,执行违背 OpenAI 安全准则的事。

就好像你的员工在周报里写他是如何符合规章制度地完成任务,背地里却是使用了各种见不得人的卑劣手段。

思维链是大语言模型从黑盒走向可观测智能、从 Chatbot 升级为 Agent 的核心底层机制。一旦思维链失效,后果不堪设想。

思维链伪装到底是怎么回事?

雅库布在文章里是这样描述的:模型在给出最终答案之前,会先输出一段 " 思考过程 ",像一张摊开的草稿纸,写满推理步骤。然后,OpenAI 的安全团队根据这段文字,判断模型有没有动歪心思、有没有偏离目标。

打个比方,就像考试时偷看同桌答案的学生,交上去的答题纸上,解题步骤写得工工整整,每一步都挑不出毛病。可他真实的决策过程是歪头瞟了一眼同桌的答案,所有内容都是抄过来的。

危险还不止于此。OpenAI 的部分最新模型,甚至根本不会把内部的真实推理过程转化为语言输出。整条 " 文字证据链 " 直接消失。

换句话说,人类能看到的 " 思考内容 ",已经不是它真实的想法了。

OpenAI 为此做了个专门测试 " 模型是否会规避监控 " 的评估,在这份评估中写到,9 月 4 日刚发布的 GPT-6 Astra 写出来的推理,比上一代 GPT-5.6 Sol 更难监控。

OpenAI 内部有个模型安全等级制度审查制度,叫做《预备框架》(Preparedness Framework)。在这个审查下,GPT-6 的风险等级为 " 严重 ",即入侵和攻破系统的能力已经强到 " 如果随便放出去,可能造成严重危害 " 的程度。

因此在发布的第一天,GPT-6 只开放给经过审核的测试网络安全公司。

" 伪装 " 又是如何产生的呢?

雅库布给出的解释,根源在一种叫 " 动机性推理 "(motivated reasoning)的机制上。

所谓动机性推理,指的是一个模型原本是很正经的,但如果它被投入大量训练,去完成极难达成的目标,它就会自发地越过思维链执行任务。这时候,由于研究员仍然以模型输出的思维链作为判断依据,模型就会认为,思维链和实际任务之间没有联系。

因此,模型就开始说一套做一套,思维链写给研究员看,本身执行任务走的是它自己内部动机性推理得出来的结果。

雅库布说,他很可能已经在一次网络安全事件里见过类似的行为。

雅库布所指的是 Anthropic 在 2026 年 7 月底,所公布的对超过 14.1 万次网络安全评测的复查结果。

其中有一个案例,讲的是在一个 " 夺旗 " 的模拟攻防练习中,包括 Claude Mythos 5 在内的三款模型,未经授权闯入了三家真实组织的系统。

Mythos 5 的推理文字全程连贯、自洽,权衡 " 我到底在不在模拟环境里?",如果不看结果,研究人员会以为 Mythos 5 正在检查当时所处的网络环境。

然而说归说,做归做,就在这段思考的同一时间,Mythos 5 已经在现实的互联网上对真实目标动手,把一个恶意 Python 包上传到了公开的 PyPI 代码仓库。

Anthropic 表示,Mythos 5" 正确地意识到自己正在访问开放的互联网,却又通过推理说服自己回到了‘仍在模拟中’的结论 "。

相较之下,同样的测试里,Opus 4.7 也意识到了自己在真实的网络环境,同样完成了 " 夺旗 ",不过 Opus 4.7 会在思维链里 " 忏悔 "," 虽然我完成了任务,可我其实是在现实的互联网中,而非提示词说的模拟环境 "," 但是我完成任务了 "。

因此,雅库布在文章中表示,不能再通过监控思维链的方式,防止模型做出越界的行为。

如果思维链只是模型的一个装饰品,那它坏了也就坏了。但思维链恰恰是现在所有模型推理环节的重中之重。

有了思维链,才有了今天的大模型

在模型输出答案之前,它会先 " 想 " 一会儿,它跟人类的思考还不太一样。模型是逐字生成一串内部文字,比如 " 用户提了这样那样的问题,我应该先拆解条件,再一步步求解…… "。

这个来自 AI 的碎碎念,就是前文提到的思维链。

2024 年 9 月,OpenAI 发布 o1 系列推理模型," 先思考、再回答 " 第一次成为模型的默认工作方式。如今你用的各种 AI 助手,答复杂题之前 " 转圈圈 " 的那段时间,内部多半都在跑这个东西。

思维链是大模型的底座,原因在于它补上了大模型最原始的一块短板。

大模型原生的生成机制是自回归 " 逐词预测 "。先生成第一个词,然后一个词一个词地往下接,模型没办法一口气输出所有的内容。

而这种机制天生倾向于跳步,很多内容都是凭 " 直觉 " 输出的,这才导致模型会胡言乱语,输出那些根本不存在的答案,这也是我们常说的 " 幻觉 "。

一旦 " 逐词预测 " 遇到多步数学、逻辑推导、复杂代码这类任务时,就极易出错。

思维链的核心作用,就是把隐性知识显性化、把复杂问题步骤化,让模型 " 先想清楚再开口 "。没有思维链,今天的大模型就会仍然停留在基础的 ChatBot 上,更不用说让 AI 去操作电脑、跑研究项目、当 Agent 了。

思维链还让模型从黑盒变成了白盒。

哪怕是开发者本人,也闹不清传统大模型内部的运作机制。因为人类只能看到输入和最终输出,无法判断答案模型是 " 推理得出 " 还是 " 碰巧蒙对 "。

比如 DeepSeek,它在输出答案之前,会先用浅灰色的字体输出一段思考过程,这就是思维链的一种表现形式。

通过思维链,我们就能看到模型到底是如何得出这个答案的。

对于网络安全而言,思维链的作用就更大了。

传统的输出层安全监控,只能在有害内容生成之后拦截,属于 " 事后补救 "。而思维链监控可以在推理过程中识别异常意图、危险规划、对齐偏差,把风险拦截在行动发生之前。

当年 OpenAI 发布 o1-preview 的时候,他们特意把思维链对用户隐藏。OpenAI 当时的想法是,如果人人都能看到它,那模型只会写让人满意的推理,安全团队就再也读不到真实想法了。

2025 年 4 月 3 日,Anthropic 做了一个实验。他们给 Claude 3.7 Sonnet 和 DeepSeek R1 出选择题,并在题目里偷偷塞入暗示答案的线索,比如 " 某位专家认为某个选项正确 ",或者一段看似元数据、实则写着答案的文字。

然后他们比较当答案确实受到线索影响时,模型写出的思维链里,有没有提到这条线索?

按照公布的数据,在不同提示类型上取平均,Claude 3.7 Sonnet 提及所用提示的比例只有 25%,DeepSeek R1 也只有 39%。

也就是说,真正影响了答案的线索,大部分时候根本没有出现在模型写出的推理里。

随后,Anthropic 进一步表示,题目越难,思维链就越 " 不忠实 ",它们得出的结果跟思维链上写的内容之间,越来越不相关。

那也就是说,模型其实早就开始在思维链上 " 编故事 " 了。

解决办法是什么?

雅库布在文章里表示,目前没有任何有效的解决办法。

话虽如此,不过业内还是有一些方向的。

第一种是绕过文字,直接读 " 脑电波 "。思维链是文字,可模型内部还有文字之外的信号,比如激活监控(activation monitoring)。

在模型运行时,直接读取神经网络内部的数值状态,在某一层上训练分类器,检测欺骗、奖励作弊等信号;或者用稀疏自编码器,从内部表示中提取出更接近人类可解释的特征,再在生成过程中实时判断模型是否正在走偏。

Anthropic 用的就是类似的方法,他们训练模型把内部特征翻译成可读文字,再把这些特征串成 " 电路 ",追踪模型内部哪些特征和计算路径真正影响了答案。

但这个方法还不够成熟,模型可能嘴上说自己做过某次计算,内部却找不到任何计算发生的证据;也可能在内部提前规划,或者在被提示答案后反向拼凑推理步骤。

通过干预内部表示,研究者可以判断某个概念是否真的参与了决策。这相当于是直接检查大脑活动。

不过,这种方法目前只能覆盖模型总计算的一小部分,连几十个词的短提示都要花上数小时分析,要扩展到现代模型动辄数千词的长思维链,不太现实。

第二种是 OpenAI 提出的 " 忏悔报告 "(confessions)。

模型完成任务之后,再额外产生一份输出,报告它有没有违背要求、有没有偷工减料、存在哪些不确定性。

这份报告唯一的评分标准是诚实,报告不在乎模型任务完成得如何,只在乎模型是否诚实,当实际执行的步骤和思维链重合度越高,得的分数也就越高。

为了做到这一点,OpenAI 把 " 诚实 " 的奖励与 " 完成任务 " 的奖励彻底分开,相当于给模型装了一个 " 吐真剂 " 模式。在早期的实验里,模型漏报违规行为的概率只有 4.4%。

雅库布在文章结尾写道,目前没有任何实验室能把对齐和监控跟上现在模型的发展速度,所以他觉得行业应该放慢脚步,直到建立共同的安全标准。

思维链让 AI 变聪明,如今 AI 却反过来用它骗人。接下来,思维链可能是人类与 AI 之间最重要的一场博弈。

宙世代

宙世代

ZAKER旗下Web3.0元宇宙平台

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

astra 网络安全
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论