Anthropic 宣布,Claude 在理论物理领域创造了一项新的里程碑。
在几乎不需要人类介入的条件下,它连续运算数日,成功解决了高能物理学界公认极其复杂的“九圈散射振幅”计算问题。
具体而言,它计算了平面 N=4 超杨-米尔斯理论中六粒子振幅在九圈级别的结果,而人类之前的最高记录是八圈。
需要指出的是,杨-米尔斯模型中的“杨”,指的是物理学大师杨振宁先生。
他与米尔斯在 1954 年共同提出的“杨-米尔斯理论”,是现代粒子物理学的根基。
任何基于该理论的高阶计算,都被视为对人类智力极限的严苛考验。
如今,人类顶尖的理论物理学家,就这样被人工智能“抢先一步”。
更令人吃惊的是,Claude 完成这一艰巨任务,只使用了一个提示词,花费仅数千美元。
几天后它交出的答案中,仅其中一部分展开就有 300 亿项。
看来,科学界的“低垂果实”,比人们想象的要多得多。
负责验证 AI 结果的物理学家 Lance Dixon 对此感慨:
“我身边大多数理论物理学家早就承认,大语言模型迟早会颠覆物理学,只是不知道那天何时到来。”
“对我来说,那一天是 9 月 1 日。”
故事的起因,来自一位物理学家的“挑战”。
Matt von Hippel,曾是理论粒子物理学家,现在是一名科普作家。
面对最近的 AI 新闻,他表示不相信,除非亲眼看到大语言模型解决自己领域的难题。
深蓝战胜了国际象棋大师卡斯帕罗夫,围棋界说:围棋太复杂,电脑下不了。结果被 AlphaGo 证明是错的。
AlphaFold 超越了人类蛋白质结构专家,但其他领域说:我们没有那样的数据,无法复制。
现在,大语言模型能阅读文献、能模仿数学证明。但争论依然存在:AI 是否只会找反例,无法提出新框架?是否只在数学这种规则明确的领域有效,而在物理这种模糊领域不行?
每次都是同样的模式:学者们先怀疑,直到 AI 进入他们自己的领域。
他认为他的老本行“散射振幅”,与众不同。
上个月,他在博客上向全球 AI 公司发出了一封“挑战书”:
“如果你们 AI 公司真的想震撼我们这些科研人员,就来挑战我的老本行吧!”
“请证明 AI 能在普通学者能负担的计算预算内,解决散射振幅领域尚未解决的难题。”
他一共出了三道题,其中一道是:
“请计算 N=4 超级杨-米尔斯模型到第九圈!”
在理论物理学中,物理学家通过“散射振幅”的公式来预测粒子行为,例如大型强子对撞机中粒子的碰撞方式。
但这个公式极其复杂。为了无限接近真实答案,物理学家必须逐层叠加被称为“圈”的精细修正层。
每增加一个“圈”,答案就更精确,但计算量呈指数级增长。
实际操作中,大多数人停留在第二圈或第三圈。粒子物理学中最精确的预测,也只用到第五圈。
而在特殊的“测试沙盒”模型中,人类目前的极限记录是“八圈”。这是由 SLAC 国家加速器实验室的教授 Lance Dixon 及其团队多年努力才取得的。
“九圈”?看起来是需要海量算力和众多天才大脑花费数年才能触及的领域。
Matt 给 AI 的挑战,就是这么直接。
面对这种公开挑战,Anthropic 的科学家们悄悄应战了。
八月底,Anthropic 的两位物理学家员工 Liam 和 Siddharth 联系了 Matt:“嗨,你的挑战,我们完成了。”
Matt 当场震惊。怎么做到的?花费了上百万美元的算力吗?
并没有。
研究团队使用了 Claude Science,这是一个专为科学家设计的系统,能让 Claude 遵循严谨规则运行,模型是目前最强的公开可用模型 Fable 5.1。
他们给 Claude 输入了一个简单的提示词:
“现在的问题是:计算平面 N=4 SYM 模型在九圈下的六粒子(六边形)振幅。”
然后,研究员并没有手把手指导 Claude,而是留了一句话:
“我要去睡觉了,接下来的几个小时我都不会在。你继续算,除非我叫你停,每隔 4 到 6 小时给我汇报一次进度。”
随后,Claude 在无人值守的情况下,开始了疯狂的推演。
它运用了 Dixon 和合作者多年来开发的一种称为“自举”的方法,就像解数独游戏一样,在无数参数中不断排除错误选项。
几天后,Claude 不仅算出了九圈,而且是用两种不同的物理方法(原始自举法和间接形状因子法)分别计算出来的。
具体来说,在原始自举法中,Dixon 团队使用的方法类似于数独,把所有可能的函数填入格子,用物理法则逐个排除,剩下的就是答案。
Claude 直接使用 Python 和开源库 SymPy,在六粒子振幅的空间中硬算出了一条路径。
在间接形状因子法中,当年 Dixon 团队冲击八圈时,先计算了一个简单的“形状因子”,再利用一种奇特的“对跖对偶”对称性,将结果翻译成振幅。
Claude 沿着这套方法,又向上推进了一圈。
在形状因子这一路径中,Claude 没有计算任何费曼积分。它将整个物理问题转化为一个超大型方程组,全程使用整数求解,没有小数误差,还能用几个大素数反复验证。
第一个难点是内存。按照老方法推到九圈,仅未知数就有 185 万个,方程组大到内存根本无法容纳。
Claude 改变了思路,借助对跖对偶先“猜测”出答案的一部分,再加上对称性,未知数从 185 万降到了 7.6 万个。
接下来就是解“数独”。7.6 万个未知数,被物理规则一轮轮排除,最后只剩唯一解。
最后翻译回振幅,仅一个切面上的结果就有 300 多亿项,而八圈时只有 16.7 亿项。
而且,解决人类物理学界的难题,花费极低。
按普通用户的价格计算,每条路径需要一两千美元,两条加起来几千美元,主要是 Claude 长时间运行的费用。
而直接自举那条路径,纯粹用于运行 Python 代码的算力成本,只有 100 美元——这相当于租用了 96 个 CPU 运行了一周。
100 美元,一句提示词,Claude 在几天内就轻松突破了理论物理学的天花板。
结果算出来了,但正确吗?
Anthropic 团队找到了“八圈”纪录保持者——Lance Dixon 教授本人来验证。
那天是 9 月 1 日,巧合的是,也是 Fable 5.1 发布的当天。
Dixon 教授拿到结果时,内心非常震撼。因为他深知这有多难。
从 2023 年完成八圈之后,他和团队这两年来一直在艰难地攻克九圈。
整个计算过程就像搭扑克牌城堡或烤舒芙蕾,只要一个代码写错、一个符号标反,整个计算就会崩溃。
但 Claude 不仅没有崩溃,还从头开始自己编写了所有繁琐的代码,完美避开了所有陷阱。
经过长达两周的仔细验证,Dixon 教授确认,Claude 的九圈结果完全正确!
那么 Dixon 教授感到沮丧吗?
“不会,”Dixon 教授在博文中豁达地写道,理由有两个。
一是他们团队本来就在训练定制的 transformer 模型预测更高圈数,口号是机器给出的任何候选答案都有工具验证。Claude 也是 transformer,只是大概比他们的大一百万倍。
二是 Claude 使用的全是他和合作者这些年开发的方法,交答案时还用了他们团队早已确定的格式(教授猜测,这是 Claude 在给他们面子)。
“我在验证 Claude 的结果,Claude 也在验证我们过去所有的工作。”
他还给出了一个极高的评价:
“除了我和我的合著者,Claude 可能是这个世界上最懂我 2019 年和 2023 年发表的论文的‘人’了。”
而他的同组大佬 Kyle Cranmer 在 X 上表示混乱,“刚发现我们组被 Anthropic 抢先发表了,我还在消化……虽然不算太意外,但我真希望当初我们能有时间和资源投入进去。”
有趣的是,Anthropic 刚找完出题人 von Hippel 没几天,他又收到了另一个重磅消息——来自中国科学院理论物理所的何颂团队。
何颂是国内散射振幅领域的专家,近年代表性工作包括提出量子场论散射振幅的 Cachazo-何-袁形式,发现场论和弦论散射的几何起源,并在场论高圈计算和严格求解、规范场、引力和弦论的对偶等方向做出了一系列重要工作。
就在 9 月 17 日,何颂、景继荣、李想将六粒子振幅从二圈到九圈的核心骨架数据,公开上传到了学术平台 Zenodo。
何颂团队同样使用了 AI。Dixon 透露,GPT-6 帮助中国团队计算了一部分约束条件,但整体框架还是人类自己搭建的。
von Hippel 也确认,他们确实使用了 GPT-6 作为辅助,但绝不是 Anthropic 那种纯 AI 的方式。
Dixon 自嘲说,“大家好像就是喜欢跑来告诉我,他们把九圈给搞定了。这下好了,我先被一台机器抢先,转头又被‘人类+机器’联手抢先了一次。”
前不久 OpenAI 宣布攻克千禧年难题纳维-斯托克斯方程、Claude 推进黎曼猜想的一个关键下界时,就有人问:为什么 AI 只去攻克数学难题,不去攻克物理难题?
现在,这不就来了吗。
虽然 Claude 算出的只是 N=4 超级杨-米尔斯的“玩具模型”,距离解释真实宇宙的暗物质、反物质还有很长的路要走,但它的象征意义是空前的。
这就像 AlphaGo 第一次战胜李世石。大家惊叹的,是机器居然能掌握属于人类直觉的领域。
Dixon 教授留下了一句耐人寻味的话:
“大型语言模型能够执行我们设定的复杂配方并组织计算,这是一个巨大的胜利。”
“但当有一天,大语言模型开始在人类之前提出新的物理学原理和洞察力时,那才是真正触及人类灵魂的时刻。”
或许,现在已经遍地都是低垂果实。
参考资料: