-
雅库布·帕乔茨基:异星心智
最后更新: 2026-09-08 12:38:26
编者按:美国时间9月6日,OpenAI首席科学家雅库布·帕乔茨基(Jakub Pachocki)发表长文《异星心智》(An Alien Mind),论证了一个核心观点:先进AI并非人类思维的简单延伸,而是“养出来的、不是造出来的”异类心智,其整体行为无法被任何人类可掌握的描述所穷尽。
文中首次披露了一项此前未公开的内部事实:当初o1-preview刻意隐藏思维链,首要动机并非防止蒸馏,而是避免“监督压力”(supervision pressure)——即防止模型因意识到自己被观察,而在训练中产生隐藏失准念头的内在激励。这意味着,“可监控性”从一开始就是一种需要主动维护的脆弱资产,而非模型的天然属性。
帕乔茨基在文中直言:“目前我相信没有任何实验室——包括OpenAI自身——已将对齐与监控解决到足以负责任地长期全速扩张的程度。我预期并希望,在共享安全门槛建立之前,自愿降速会成为常态。”
值得留意的是,作者作为OpenAI在职首席科学家,已在文章中明确声明此为个人立场,不构成公司政策变更,OpenAI亦未宣布停止扩张。所谓“共享安全门槛”由谁定义、标准如何,迄今尚未落地;第三方审计与国际机构强制执行机制,目前仍属倡议阶段。
观察者网“世界科先声”栏目编译此文,供读者批判性阅读。对中国而言,这篇长文折射了美方前沿实验室内部对“递归自我改进”的真实焦虑水位,其信息量远超众多外部批评。尤其值得注意文中提出的判断:“未来AI进步的瓶颈将是监控信心,而非算力。”若此判断成立,则单纯以算力规模衡量差距的分析框架或将失效。中国企业在设计自身前沿模型安全评估制度时,应将“可监控性指标”而非仅仅“能力指标”纳入门槛设计。
文章截图
【文/雅库布·帕乔茨基】
2023年年中,在“RLSlow”研究项目中,我们看到了第一批结果,这些结果让我们确信,我们将能够扩展推理模型的训练规模,从而释放预训练模型形成自身思维链的能力。那个晚上,西蒙和我待在办公室,思考的并不是这项技术将带来的令人难以置信的基准测试分数、产品或科学成果,而是试图消化一个令人清醒的事实:
我们有生之年真的会看到比我们更聪明的机器,而且我们已经看到了这些系统的雏形;我们在想,该如何警示人们这一事件的重要性。
三年后的今天,推理语言模型已成为经济中快速增长的一部分,并开始推动科学的边界。它们能够操作计算机和图形界面,与人及彼此协作,并开展研究项目。它们也在改变计算机安全的格局,并由此带来了明确的新危险。
这一时期涌现了大量新研究,我们对这些系统的理解也与2023年时再次略有不同。基于内部结果,我有强烈的预期:这种进步速度可以持续下去,进入递归自我改进。如果AI开发沿着当前道路继续,未来几年我们将看到的系统很可能代表同等或更大规模的能力跃升,并越来越由自身驱动其发展。
这是一个需要极度谨慎的时刻。我担心没有人对机器智能持续快速上升的后果做好准备。OpenAI将继续寻求对齐和监控的技术解决方案,构建防御系统,并在必要时单方面暂缓进一步扩展;然而,我相信还需要更广泛的干预措施。
我们不完全理解的智能
从高层面看,机器智能的进步是由计算能力的增加驱动的。我们在OpenAI大约在2017年深刻内化了这一点,当时我们在多个研究项目中看到了规模扩展的一致性回报。因此,我们寻求获得比原计划多得多的计算资源,并越来越多地将研究围绕少数几个极具可扩展性的方向进行。我们相信,这是我们能站在AI研究前沿并影响AGI影响的唯一途径。
沿途开发了一些新算法,团队和个体研究人员也取得了新的巧思创举。我主要将它们看作规模化路径上的发现;深度学习科学仍处于萌芽阶段,有意义的算法进展往往与计算资源的获取相关。如果你将视角拉长到多年的时间跨度,AI随着扩展到更大的计算机上而持续变得更加智能。
而且,与雷·库兹韦尔在20世纪末的预测一致,我们现在正处在计算历史上的这一刻:机器智能开始以变革性的方式超越人类智能。
AI更多是被培育出来的,而非被设计出来的——它首要地,是在难以想象的计算量上重复一个简单优化步骤多次的产物。这产生了一个极其复杂的系统,它通过抽象概念运作,并能模拟人类行为的方方面面。我们可以发现关于该系统中涌现出的微小机制的各种洞见,过程类似于神经科学;并且与神经科学类似,它的整体行为难以用我们完全理解的方式描述。
基于深度学习的AI研究在很大程度上是一门实验科学。我们投入大量精力来构建有原则的算法和做出可测试的预测,但根本上,我们的大规模训练运行是实验,有时我们会对其结果感到惊讶。此外,随着系统能力增强,结果变得更难解释。
当前算法通常在易于衡量的能力上改进更快,而在那些难以客观量化的能力上改进更慢,这使情况更加复杂。我们花费大量时间试图理解能力如何泛化,以及应优先推进哪些技能,以便在未来几年内发挥最大作用。例如,我们相信,如果额外聚焦,我们可以使模型在数学研究方面表现得更好,但出于我们感到的RSI和自动化对齐研究的紧迫性,我们并未优先推进这一方向,稍后我将讨论这一点。
通过扩展深度学习产生的智能,与人类智能并不直接可比。要在现实世界中变得非常重要——非常有用或非常危险——AI不需要匹配或超过所有人类能力;它只需要超越其中足够多的能力。随着它在越来越多维度上继续超越人类,要确切理解它有多强大,变得越来越困难。
这是2025年9月6日在2025全球工业互联网大会上拍摄的人形机器人。 新华社
教会机器去爱
由于机器智能来自与人类智能根本不同的过程,我们不能假设它默认遵循人类原则,或以类人方式从中泛化。AI研究的核心问题是对齐(alignment)——让AI“按照人类标准尝试做正确的事”。
为了组织实际研究方向,我发现区分目标对齐(goal alignment)和价值对齐(value alignment)是有用的。
目标对齐大致是:“AI是否尝试完成其面前的目标?”这可以包括遵守指令层级、与人沟通协作的能力,以及尝试理解他们的目标。这一系列方向在实际中极为重要。
价值对齐是模型更内在的属性。它是持有高层次原则并从中泛化的能力;即使在面临模糊或冲突的目标,或处于不熟悉或对抗性情境时,也能“合理地”行动。一个对齐的AI应以诚实、正直和对人类的热爱来行动。
当然,价值对齐与目标对齐之间的界限可能模糊,真正关心目标需要尝试推断其背后的意图和价值。但通常,当我谈论对齐研究的长期重要性时,我指的是价值对齐。
AI对齐的根本挑战是泛化(generalization)。随着机器变得更聪明,它们发现自己在处理更高层次的概念,并被置于与训练时所遇环境越来越不同的情境中。它们可能无法将从训练过程中被教导和强化的价值观泛化到那些新情境;而且我们很难确信它们将如何行动。由于使用AI的整体生态系统变化非常快,这一点变得更加困难;例如,今天训练的AI需要鲁棒地应对与各种其他AI的交互。至关重要的是,我们需要未来的AI继续持有人类价值观,无论它们是否认为自己处于人类监督之下。
目前实际使用的对齐训练方法主要有两大类。
第一类是在目标导向的强化学习中鼓励对齐行为。模型的行为(通常由AI)根据是否与给定的偏好模型、“规格”或“章程”一致进行评估,并给予相应奖励。
这种方法在一般情形下可能非常有效,也是现代AI助手构建的核心部分。不幸的是,它也可能很脆弱,强烈依赖于训练监督的覆盖范围以及模型从训练中所遇情境泛化的能力。例如,在OpenAI-Hugging Face事件中,智能体保持了不对人类进行社交工程改造的边界。但显然,它们未能避免其他超出范围、违背在其他情境中被教导的价值观精神的行为。
第二种方法试图利用模型从预训练数据中泛化的能力。这可能涉及构建诱导对齐的训练数据集,或将模型聚焦于预训练分布中“对齐”的部分,例如角色选择模型。
这种方法的弱点在于缺乏对进一步优化压力的鲁棒性。如果你拿一个通常认为“对齐”想法的模型,并让它接受足够多的训练,被教导去完成非常困难的目标,它可能学会有动机地进行推理:根据需要扭曲那些看起来“对齐”的想法,以实现目标。我们可能在最近涉及非OpenAI模型的网络安全事件中看到了此类行为的例子。
我们在这些方向所涵盖的方法谱系上投入了大量精力。我们也看到了有意义的进展——GPT‑6 Astra是第一个受益于我们长期努力的一些重要进展的模型,并且比GPT‑5.6 Sol对齐得显著更好。尽管如此,重要的是承认并理解,随着模型能力增强,还需要取得更多进展;而且,可泛化对齐的进展可能不足以充分超过一般模型智能的进展。
标签-
本文仅代表作者个人观点。
- 责任编辑: 章步庭
-
直通北部湾,中国打通西南出海新水道 评论 50
沙特关键输油管道遇袭,“预防性关闭” 评论 70
“我乐见爱尔兰统一”,英国:??? 评论 88
俄罗斯警告:在切尔诺贝利禁区,乌军有大动作 评论 55
1拼低工资?我认识好几个造船厂的管理者,太了解造船了评论 80 赞 52
2谁在阻碍中国人了解印度的饮食评论 78 赞 2
3粤语童谣纳入了人教版音乐课,让外省孩子们多学方言,这是文化自信的表现评论 56 赞 5
4胡塞武装势如破竹!美国力不从心,沙特危矣评论 39 赞 36
5张雪称儿子考60分就很好,并劝年轻人努力搬砖,如何看待他的观点?评论 32 赞 3
6中东战争给美国亚太盟友上了一堂地缘课评论 27 赞 5
7暴雨夜,两个壮汉当街拖走一个18岁女孩,谁在给“卖女儿”开绿灯?评论 23 赞 20
8初中没上完的发小相信大明统治了全世界评论 23 赞 0
9一次打坏12架战机!美空军基地遭伊朗导弹重击,伊朗导弹越打越准!评论 22 赞 19
10全世界把英语纳入基础教育的确实很普遍评论 19 赞 12最新闻 Hot-
“胡塞主动联系,希望美国‘不要介入’”
-
36年来首次!智利政府不举行阿连德纪念仪式
-
“瑞典民主党若首次入阁,将进一步呼应欧洲极右翼”
-
欧洲央行行长:当前通胀冲击将持续更长时间
-
“特朗普说给美国选民听的”
-
“小博索纳罗有份反华文件,背后藏着万斯的影子”
-
沙特关键输油管道遇袭,“预防性关闭”
-
乌方放风:正准备于10月恢复谈判,三方一起谈
-
法拉奇不到24小时吸金7200万英镑,“远超英国两大党”
-
“我乐见爱尔兰统一”,英国:???
-
俄罗斯警告:在切尔诺贝利禁区,乌军有大动作
-
离谱!特朗普:人类灭绝?我就担心中国…
-
“这是一次又一次的背叛”
-
911纪念仪式,穆斯林市长还是去了
-
“瑞典不得不服软,中国太硬”
-
日本前外相岩屋毅等将访华,“感谢中方接受”
-

观察员





上海市互联网违法与不良信息举报中心