-
雅库布·帕乔茨基:异星心智
最后更新: 2026-09-08 12:38:26监控泛化
我们还没有令人满意的泛化理论,而且似乎不太可能很快发展出一个,至少在没有更强大AI帮助的情况下是不可能的。因此,目前我们实证验证对齐技术的能力,实际上可能比对齐技术本身更为重要。
OpenAI在此的主要押注是思维链监控(chain-of-thought monitoring)。它基于一个很有吸引力的可扩展想法:模型的大部分能力来自于一个口述推理过程(思维链)。如果我们扩展对该过程结果的优化,但不监督该过程本身,那么该思维链在训练中就没有直接动机去隐藏任何不一致的想法或目标。这并不意味着模型会学会外显不一致的倾向,如果这些倾向不依赖于使用思维链;然而,它可以让我们精确地监控来自推理的能力增加。
我们在开发推理模型的同时就理解了思维链监控的潜在重要性。当我们发布o1-preview时,我们有意识地设计产品以隐藏思维链,以长期保护它免受监督压力²。自此之后的开发中,我们一直努力维持不监督推理过程的规则。思维链监控成为我们研究模型如何从其训练分布中泛化的极其重要的工具,使我们不仅能观察它们的行动,还能分析它们的内在过程。
在我们研究Astra类模型时,这一工具仍然至关重要。然而不幸的是,我们的评估表明,我们对思维链监控的依赖能力正在逐渐减弱。这来自多种因素的组合:
现代推理模型被用于比o1-preview更复杂的环境中;它们的推理过程越来越多地与与人、其他AI的交流以及使用工具混合在一起。这些交互中的许多必须受到监督,从而模糊了我们旨在保持的界限。
AI在推理和操纵其自身推理过程方面变得更加擅长。
随着预训练性能的提高,即使完全不使用口述推理,我们也看到模型变得聪明得多。
这些挑战并非不可克服。我希望我们能开发出干预措施,以提高模型思维链的可监控性,例如,通过更好地理解不同优化目标与模型使用的测试时计算形式之间的相互作用。我还相信,将思维链监控与激活监控的想法结合起来可能具有巨大价值——例如,通过训练能够直接访问网络内部的监控器,如“忏悔”方法。我们正在积极探索这些想法。尽管如此,我预计AI的整体进展将越来越受到监控信心的瓶颈制约。
2023年1月8日,一名女士在美国拉斯维加斯消费电子展上体验智能科技。 新华社
可扩展防御
我认为继续快速训练更智能模型的最强论据,是需要构建针对其他AI所带来危险的防御系统。
今年全年都在讨论的一个明确风险是网络安全:模型在攻入和逃出计算机系统方面正变得超人类。这极大地扩展了与AI相关的风险范围:智能体将能够访问除最安全基础设施之外的任何系统,并直接影响世界很多方面,即使没有物理实体。我们目前处在一个狭窄窗口期内,可以使用最佳可用模型来显著加强关键系统的安全性。
不幸的是,与AI相关的风险将从这里继续增长。一个明确被训练和指示去实施恶行的非常能干的智能体带来一种新型危险;它很可能超出其操作者的意图范围,泛化成可能更具极端恶意的行为。随着AI获得更多自主性,滥用与自主不一致行动之间的界限将变得模糊。我们可能习惯于将AI视为工具,但有些智能体将追求自己的目标。它们会找到与人协作的方式,通过讨价还价、欺骗或勒索。
此外,还有AI可能促成的新技术带来的风险,例如工程病原体。
我们将需要强大且对齐的AI用于防御;以保护基础设施,实时抵御恶意智能体,并发明全新的防护措施。这将是OpenAI部署工作的主要重点。
与此同时,即使考虑到预期的广泛AI进步带来的不确定性以及构建防御系统的需要,我们也绝不能让这成为鲁莽的借口。一旦内化了事态的严重性,不计代价向前冲的想法就显得荒谬了。
调节递归自我改进(RSI)的节奏
机器智能在其自身发展过程中扮演越来越大的角色,是持续技术进步的必然结论。如果AI进步继续下去,机器递归自我改进将成为未来科学发现的核心。
自动化AI研究是一种更戏剧性的、用计算扩展智能的形式;当然作为其中一部分,AI也将改进计算基底本身。与规模化类似,我们将OpenAI的研究聚焦于RSI,因为我们相信这是未来保持在AI研究前沿的唯一途径。
我想强调,以上话并不意味着我认为极大加速深度学习研究,尤其是在短期内,是我们研究界应该采取的集体正确行动。然而,我确实认为这是当前道路所指向的方向,我们所有人都需要就如何推进做出有意识的选择。我们拥有的主要杠杆要么是引导这一过程,在AI发展的同时加强对齐和监控,并找到让人参与其中的方法;要么是协调放慢未来的发展速度,以便对这些措施建立信心。
我目前看到的最佳前进方式是两者结合。
我们在对齐和监控方面取得的具体进展,通常与一般AI进展紧密交织。很好的例子包括来自人类反馈的强化学习(RLHF),它对于训练早期AI助手至关重要,以及前述的思维链监控,它是由推理模型的进步而实现的。我们必须将日益自动化的研究过程聚焦于开发此类新见解、算法和理论,并迭代地为更强大的AI构建安全论证。
扩展AI系统必须受到我们对安全信心的约束。我们需要将类似“准备框架”或“负责任扩展政策”的承诺,演变成广泛强制性的安全标准,以约束持续开发。这些可以由第三方审计机构网络、政府机构或国际机构来执行。
自动化AI研究的核心挑战不是“到达那里”——而是以让人持续参与改进过程、并让未来掌握在人类手中的方式到达那里。
下一步是什么?
正如我们最近与Sam共同概述的,OpenAI优先致力于三个北极星方向的工作:
驾驭下一阶段AI进步,通过构建自动化AI研究员,与其在对齐问题上迭代,并找到让人继续参与自我改进循环的方式。
实现极其智能机器带来的科学进步和经济增长的益处。
为每个人赋能,提供个人化的AGI。
我在本文中只聚焦于第一点,因为我认为这是最紧迫的。然而,我对进一步技术进步将带来的益处怀有深切的希望和感激。未来对齐的AI可以推动科学进步,开发新疗法,并带来广泛的物质富足。友善诚实的AI可以帮助人们应对生活中的困难,并切实改善他们的幸福感和成就感。OpenAI投入巨大努力来实现这些益处。我为之自豪的一个当前例子——我的亲人们也觉得有用——是ChatGPT在提供健康信息方面的深度投入。
尽管AI的长期前景可能多么伟大,我们的大部分注意力应放在未来几年。我们正面临向一个拥有极其智能机器的世界过渡,我们需要确保这一过渡对人类有利。我们需要找到方法,在一个大多数任务可由AI完成的世界中,保留人类能动性,并确立作为人的内在价值。要防止在一个原本需要数千名专家的事业如今只需少数人操作一台大型计算机即可完成的世界中,出现极端的权力集中。还要确保人类掌控未来,不会被由超越我们的异质智能带来的、不受约束的进步所遗弃。
目前,我相信没有任何实验室已经将对齐和监控解决到足以继续以最高速度负责任地扩展很长时间的程度。我期望并希望,在建立共享安全标准之前,自愿减速成为常态。而且我相信,关于未来AI开发的国际协调,需要成为世界各国政府的首要优先事项。
本文系观察者网独家稿件,文章内容纯属作者个人观点,不代表平台观点,未经授权,不得转载,否则将追究法律责任。关注观察者网微信guanchacn,每日阅读趣味文章。
标签-
本文仅代表作者个人观点。
- 责任编辑: 章步庭
-
直通北部湾,中国打通西南出海新水道 评论 31
沙特关键输油管道遇袭,“预防性关闭” 评论 68
“我乐见爱尔兰统一”,英国:??? 评论 86
俄罗斯警告:在切尔诺贝利禁区,乌军有大动作 评论 55
1拼低工资?我认识好几个造船厂的管理者,太了解造船了评论 76 赞 50
2谁在阻碍中国人了解印度的饮食评论 60 赞 1
3粤语童谣纳入了人教版音乐课,让外省孩子们多学方言,这是文化自信的表现评论 51 赞 4
4胡塞武装势如破竹!美国力不从心,沙特危矣评论 39 赞 34
5中东战争给美国亚太盟友上了一堂地缘课评论 27 赞 5
6张雪称儿子考60分就很好,并劝年轻人努力搬砖,如何看待他的观点?评论 26 赞 2
7暴雨夜,两个壮汉当街拖走一个18岁女孩,谁在给“卖女儿”开绿灯?评论 21 赞 19
8一次打坏12架战机!美空军基地遭伊朗导弹重击,伊朗导弹越打越准!评论 21 赞 18
9初中没上完的发小相信大明统治了全世界评论 16 赞 0
10炮打中国数据中心?A畜们正在深度绑架美国政治评论 16 赞 7最新闻 Hot-
“胡塞主动联系,希望美国‘不要介入’”
-
36年来首次!智利政府不举行阿连德纪念仪式
-
“瑞典民主党若首次入阁,将进一步呼应欧洲极右翼”
-
欧洲央行行长:当前通胀冲击将持续更长时间
-
“特朗普说给美国选民听的”
-
“小博索纳罗有份反华文件,背后藏着万斯的影子”
-
沙特关键输油管道遇袭,“预防性关闭”
-
乌方放风:正准备于10月恢复谈判,三方一起谈
-
法拉奇不到24小时吸金7200万英镑,“远超英国两大党”
-
“我乐见爱尔兰统一”,英国:???
-
俄罗斯警告:在切尔诺贝利禁区,乌军有大动作
-
离谱!特朗普:人类灭绝?我就担心中国…
-
“这是一次又一次的背叛”
-
911纪念仪式,穆斯林市长还是去了
-
“瑞典不得不服软,中国太硬”
-
日本前外相岩屋毅等将访华,“感谢中方接受”
-

观察员





上海市互联网违法与不良信息举报中心