据The Information周二报道,OpenAI的新模型Astra将采用一种名为"循环深度"(recurrent depth)的推理技术。该技术允许模型突破大多数推理模型所依赖的顺序思维方式运作,又被称为"不透明循环"(opaque recurrence)。由于这一技术可能令模型的思维链更难以监控,AI安全专家对此表示高度忧虑。
尽管Astra目前对该技术的使用范围据报道较为有限,但其出现仍在AI安全领域引发了广泛关切。
Redwood Research首席执行官Buck Shlegeris在相关报道发布后发文写道:"有报道称Astra使用了不透明循环技术,我对此极为担忧。我不确定Astra的思维链可监控性是否比此前的模型差很多,但如果OpenAI进一步推进这项技术,他们将有能力大幅增加循环强度,从而彻底摧毁思维链的可监控性。"
长期从事AI安全倡导工作的Zvi Mowshowitz也就此发表看法,认为或许需要立法来防止AI实验室之间的"竞次效应"。他写道:"这项技术无异于玩火,威胁到OpenAI和Anthropic共同努力建立的一项默契——尽可能长期维护思维链的忠实性与可监控性。更大规模地使用此类技术,可能会严重损害可监控性。"
在正常情况下,推理模型的思维链会呈现出模型在尝试解决问题时所经历的一系列步骤。虽然这种呈现并不完美,但仍是监控模型异常行为或对齐偏差的重要工具。在OpenAI近期发生的智能体异常行为事件中,思维链记录正是研究人员分析智能体行为原因的关键依据。
不透明循环技术采用了一种非线性方式,让模型对同一查询在循环中反复处理。这一过程留下的可读痕迹极少,相当于绕过了传统的思维链记录。
值得注意的是,Astra目前对该技术的应用仍属有限。该模型的思维链预计仍将保持可读性,OpenAI也对外界有关其将转向"神经语言"(neuralese)的说法予以反驳。此外,OpenAI已在其面向未来的安全规划中宣布了大规模思维链监控系统的部署计划。
OpenAI首席科学家Jakub Pachocki在X平台发文,强调了该公司对可读思维链的坚守:"自我们第一批推理模型起,OpenAI就致力于保留并利用思维链监控。这是我们当前研究计划的核心目标。"
所有AI模型在推理过程中都存在一定程度的不透明性,研究人员普遍认为思维链日志并不能直接反映模型的真实推理过程。即便如此,这些说明也并不能消除外界对不透明循环技术可能削弱AI推理可监控性的担忧——尤其是随着该技术在不同模型中的应用日益普及。The Information周三上午的后续报道显示,Anthropic和谷歌DeepMind均已就这一技术展开讨论。
Redwood Research首席科学家Ryan Greenblatt在一篇回应文章中指出,不透明推理的扩展速度可能轻易超过传统思维链推理,最终将所有推理过程从可见渠道中完全移除。
他写道:"我最大的担忧在于,从目前的情况自然演进下去,很可能导致不透明推理大规模扩张,使模型完全或几乎完全在潜在空间中进行推理。我希望现在阻止最令人忧虑的架构方向还为时不晚,也希望OpenAI能够就此止步。"
Q&A
Q1:什么是"不透明循环"推理技术,它和普通推理有什么区别?
A:普通推理模型采用顺序思维方式,会生成可读的思维链记录,展示解题的每个步骤。而"不透明循环"(opaque recurrence)技术让模型对同一查询在循环中反复处理,不走线性路径,留下的可读痕迹极少,相当于绕过了传统思维链记录,使外界难以追踪模型的推理过程。
Q2:为什么AI安全专家对Astra使用不透明循环技术感到担忧?
A:AI安全专家担忧的核心是"可监控性"下降。思维链记录是目前监控模型异常行为的重要工具,OpenAI此前在智能体行为异常事件中也依赖它进行溯源分析。一旦推理过程变得不透明,研究人员将难以判断模型是否出现对齐偏差或违规行为。专家还警告,该技术若持续扩展,可能使模型推理完全转入不可见的潜在空间。
Q3:OpenAI对外界关于Astra安全性的质疑有何回应?
A:OpenAI表示,Astra目前对不透明循环技术的使用范围有限,模型思维链预计仍将保持可读性。首席科学家Jakub Pachocki在X平台表示,自第一批推理模型起,OpenAI就致力于保留并利用思维链监控,这是其当前研究计划的核心目标。此外,OpenAI已宣布将部署大规模思维链监控系统。
上一篇:英伟达盘初涨超2%,斥逾129亿美元收购AI开源平台Hugging Face
下一篇:没有了