OpenAI新模型陷入失控争议,首席科学家回应
当地时间9月2日,新模型陷席科学OpenAI首席科学家雅库布・帕乔基(Jakub Pachocki)在社交平台发文,入失就近日围绕新模型Astra“不可监控”的控争争议作出回应。
这场争议源于此前一天,议首有消息称OpenAI即将发布的新模型陷席科学Astra模型采用了一种名为循环深度(Recurrent Depth)的推理技术。该模式下,入失同一组Transformer层被反复计算,控争部分推理过程发生在模型内部,议首不必全部以思维链形式呈现,新模型陷席科学因此也被称为“不透明循环”。入失

帕乔基表示,期望避免因信息失实引发一场冲向不可监控状态的议首军备竞赛——即各大实验室竞相开发能力过强、人类难以监控、新模型陷席科学无法审查的入失模型,导致安全管控彻底失效。控争
他强调,包括Astra在内的前沿模型,计算图深度与GPT-4相差不超过两倍,解释模型架构并未如外界担忧的那样出现跳跃式的繁琐度增长。
此处的计算图深度是指模型完成一次推理任务必须依次执行、无法并行加速的最长计算步骤链条。过去平常Transformer架构下的层内计算可以大规模并行,串行的深度约等于模型层数。
而市场传言的循环深度可以把同一套模块反复循环迭代多轮做思考,在输出下一个token(词元)前增加内部推理深度,而非仅依赖更长的可见文本思维链,可以提升数学、编码等性能并降低成本。
该架构隐含的安全风险在于,当计算图深度拉得极高,模型可以在内部隐式完成海量推理步骤,不必在输出里吐出完整思维链,人类就看不到它中间思考、谋划、找漏洞的过程,进而进入不可监控状态,安全审计与思维链监控全部失效。

相关消息披露后,AI安全界反应强烈。非营利AI安全组织Redwood Research首席执行官巴克・施莱格里斯(Buck Shlegeris)发文称“极度担忧”。他结合此前OpenAI模型进攻Hugging Face社区事件表示,不确定Astra思维链可监测性是否比之前的模型差很多,但如果进一步推进这项技术,大幅增加循环次数,将彻底损坏思维链的可监测性。这一点尤其令人担忧,因为如果调查人员无法查看思维链,相关安全事件调查将会更加艰难,这着实令人恐惧。
曾参与调查Hugging Face安全事件的Redwood Research首席科学家瑞安・格林布拉特(Ryan Greenblatt)也表示,这可能是迄今为止AI安全最严重的一次倒退。长期关注AI安全的作家兹维・莫肖维茨(Zvi Mowshowitz)则指责这一技术是“玩火”,甚至表示需要法律来阻止AI实验室之间竞相降低标准的竞赛。
帕乔基在回应中承认,思维链监控确实易碎,且正朝着更艰难的方向发展,但并非由架构变更导致。OpenAI自首批推理模型一直致力于呵护和利用思维链监控,并认为该技术有助于观察模型对齐能力如何从训练分布中泛化。加强思维链监控仍是当前研究项目的核心目标。
OpenAI方面表示,将为Astra部署额外的思维链监控,以飞速监测并遏制潜在的不当行为。另据市场消息,Astra对循环深度技术的使用有限度,模型思维链仍有望保持可读性。行业内Anthropic和Google DeepMind等平台已在讨论类似技术。
相关文章
据日本富士新闻网18日报道,日本埼玉县17日发生一起交通事故,一名28岁越南籍男子骑自行车在路上遭小型卡车撞击后死亡。卡车司机肇事后逃逸。日媒报道截图据报道,日本警方逮捕了这起交通事故的嫌犯下田隼人。2026-09-21
在今天凌晨1点举行的XBOX发布会上,备受希望的《女神异闻录6》正式公布了首支预告片。作为ATLUS旗下经典角色扮演系列的正统续作,本作一经亮相便引发了广泛关注。不过,此次发布会并未透露具体的发售日期2026-09-21
清晨7点的早高峰,北京的李女士骑着电动车在中关村的车流中穿梭。她得先送老大去五公里外的小学,再折返三公里送老二到幼儿园,最后赶在9点前打卡上班。这种为子女教育奔波的日常,正在成为千万多子女家庭的生活缩2026-09-21
银行业是“牵一发而动全身”的系统性行业。2025年上半年,在一系列货币政策、财政政策“组合拳”之下,实体企业有效融资需求恢复成效如何?存款定期化趋势是否有逆转迹象?住房按揭、个人消费和个人经营等贷款市2026-09-21
9月15日,墨西哥独立日前夕,美国驻墨西哥使馆在社交媒体平台发帖,称墨西哥用于庆祝活动的烟花等“并非墨西哥制造”,以“墨西哥万岁,中国制造”来调侃墨西哥国庆,并借机抹黑中墨经贸合作。9月18日,中国驻2026-09-21
日本知名玩具厂商Good Smile Company良笑社)近日正式公开了传奇游戏制作人小岛秀夫的黏土人彩色原型。小岛秀夫成为全球首位被正式“黏土人化”的游戏开发者。过去该系列2026-09-21

最新评论