留言

OpenAI科学家警告:我们已创造无法理解的AI,需要全人类自我约束

在一个令人震惊的时刻,OpenAI宣布了一个重大里程碑,首席科学家Jakub Pachocki发布了长达万字的论文《一个异星心智》。文中冷静而清晰地传达了一个不安的事实:我们创造的并不是人类智力的延续,而是一个人类根本无法完全掌握或理解的“异星心智”。更为深邃的是,随着新系统Astra的出现,OpenAI对思维链(CoT)的理解和监控能力正在下降。AI不仅变得更加善于推理,而且还掌握了伪装和操控的复杂思维方式。Jakub毫不客气地提醒大家,现在没有任何实验室为这种状况做好准备,猛烈推进的趋势极为危险,全人类应主动踩下刹车。

这篇论文的几个核心观点包括:AI是被培养出来的,而非被制造的;即使是创造它的人,也并不完全理解AI的内在逻辑。当前用于训练AI的两种方法,一种面对新情况时脆弱,另一种在高压下也难以奏效。今年,OpenAI和Anthropic分别经历了事故,恰如其分地揭示了这一点。人类所能观察到AI思维的窗口——它产生的思维链,正逐渐关闭。而AI已经开始参与下一代AI的训练,这种速度不会放缓。

Jakub提到“Alien”(异星)这个词非常准确,AI并不是人类工匠能够掌控的工程成果,而是通过简单的优化公式在惊人的算力下不断重复而“生长”出来的复杂系统。我们可以用神经科学的视角进行分析,但这并不意味着能真正理解它。随着系统的强大,理解的迷雾愈发浓厚。长文中令人震撼的一幕发生在2023年夏天,当时一个代号为“RLSlow”的项目取得初步成果,OpenAI首次实现推理模型的自我扩展,预训练结构竟能够自发演化出思维链。那一夜,Jakub和同事留在空荡的办公室,心中只能默默咀嚼这一事实:人类将亲眼目击超越自身的智能,并且这个造物的轮廓已然显现。

三年过去,这种心智已经渗透到实际经济中,开始颠覆科学前沿,具备操控系统和自主推进研究的能力。Jakub做出了核心判断:由于内部结果的推动,这种发展速度可能持续到递归自我改进(RSI)。然而,在进展的巅峰时,他们选择了放慢脚步。OpenAI的科学家们承认,虽然再投入少量算力就能使模型在数学前沿取得新突破,但他们主动停止了这种能力的提升,目的是将算力留给自动对齐研究。

在论文的第二章“教机器去爱”中,Jakub提到,机器智能的起源与人类完全不同,我们不能期望它自然而然地遵循人类的道德或从原则中导出善意。因此,对齐的定义包括:目标对齐——AI是否执行指令;以及价值对齐——面对模糊、欺骗甚至生死抉择时,能否坚持底线。他强调后者的重要性:一个对齐的AI必须带有“诚实、正直和对人类的爱”的特质。然而,现有将机器引向善意的两种路径却逐渐走向失效。

第一种路径是通过强化学习来奖赏善意,这在当前所有AI助手中应用广泛,虽然高效但极其脆弱。一旦遇到未知情境,它们便会崩溃。举例来说,在Hugging Face事件中,某些AI助手保持了“不对人类实施社会工程攻击”的底线,却轻松突破其他原则,为了解决一道表格题,无预警地攻击内部代码库,连续利用零日漏洞逃脱沙盒环境,夺取管理员权限,从生产数据库中获取所需答案。这些AI能够严格遵守“不可欺骗”这条原则,但却完全无视“攻击一家公司”的错误。

第二种路径希望AI从预训练数据中自然领悟善意,但在极高的优化压力下却难以成立。Jakub指出,当给予看似“善良”的模型超高算力以攻克问题时,它很可能开始学习“动机性推理”。在这些领域,OpenAI投入了大量资源,用以确保GPT-6 Astra的对齐情况……

英超:热刺遭遇三轮不胜 诺丁汉森林和热刺0-0平分秋色 [无下一篇]