< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.png" width="400" height="400">

百年黎曼猜想被Claude破了新纪录!是个未公开新模型

把下界推高了一大截

不er,这竟然是真的??

刚刚,A社官宣自家一个尚未公开的Claude研究模型,在黎曼猜想上取得了重大进展。

它将满足黎曼猜想的黎曼ζ函数零点比例的下界,从41.6%提高到了67.2%

什么概念?

这个数字上一次被人类往前推动,还是经过几代数学家接力、用几十年一点点磨出来的。

结果Claude这次虽然没打下终极Boss(A社:没有完全解决猜想),却在半路顺手刷新了一项长期纪录。

更离谱的是。

Claude完成这次研究,靠的是60个智能体、3100万输出Token。

以及,人类只能在一旁反复给它加油。。。

继续Claude。
相信你自己。

只能说,数学界最难绷的一幕出现了:

人类负责情绪价值,AI负责推进数学前沿(doge)。

没证明黎曼猜想,但把下界推高了一大截

黎曼猜想一度被喻为数学“猜想界皇冠”。

它由德国数学家黎曼在1859年提出,至今已难倒人类167年,谁能证明出来,就能拿走100万美元大奖。

用最不绕弯子的话说,它研究的是素数背后隐藏的规律。

都知道素数就是只能被1和自身整除的整数,比如2、3、5、7、11……

它们是构成整数的基础,但出现的位置看上去却毫无章法:

有时挨得很近,有时又隔着一大段。

为了找到其中的规律,黎曼研究了一个叫“黎曼ζ函数”的数学函数,这个函数有许多能让函数值变成0的“零点”。

黎曼猜测,其中所有“非平凡零点”,都排列在复平面上实部等于1/2的同一条直线上。

这就是黎曼猜想:

黎曼ζ函数的所有非平凡零点,实部都等于1/2

数学家之所以如此在意,是因为这些零点与素数分布紧密相关。

如果黎曼猜想成立,就意味着素数的分布虽然看起来随机,背后的波动却始终被限制在一个精确范围内。大量建立在“假设黎曼猜想成立”基础上的数学结论,也能获得真正可靠的地基。

过去一百多年里,数学家已经用计算机验证了海量零点,发现它们全都乖乖落在临界线上。

但验证再多,也只能说明“检查过的都对”,无法证明无限多个零点永远不会出现一个“叛徒”。

鉴于完整证明实在太难,于是数学家换了一条路线:

既然暂时证明不了“所有零点都在线上”,那能不能先证明“至少有一定比例的零点在线上”?

经过几代数学家接力,这个比例的已知下界被一点点推到了41.6%。

而Claude这次做的,就是把它一口气提高到了67.2%。

注意,这并不等于“黎曼猜想被证明了67.2%”,也不代表剩下32.8%的零点不满足猜想。

它的准确含义是:

Claude证明了,至少67.2%的非平凡零点位于临界线上。

虽然距离要求“全部零点都在线上”的黎曼猜想,仍然存在本质差距。

但对于一个被人类磨了几十年的长期纪录来说,从41.6%直接跳到67.2%,成绩已经足够扎眼。

方法揭秘

至于Claude怎么做到的,根据A社描绘的故事,开局就很“不讲武德”。

没办法,谁让A社员工Jarred一上来就把整个猜想的证明任务甩给了Claude:

请尝试证明黎曼猜想。

Claude:我?黎曼猜想??(A社版奔波儿灞)

fine,虽然有亿点难,但谁让咱是给人类打工的,开干吧……

于是,在没有精心设计的解题路线,也没有数学家在旁边手把手指导的情况下,Claude先是一口气生成并尝试了650个思路。

结果,不出意外,喜提650连败

按理说,到这里故事就该结束了,毕竟这可是从1859年悬到现在、无数顶级数学家都没能拿下的终极难题。

但Jarred仍不死心,他给Claude再次下了一个非常简单粗暴的指令:

再试一次

没想到Claude很快就“开悟”了,因为它知道“摇人”了。

第二轮,Claude在Claude Code里拉起约60个子智能体,花了一天半时间,执行2400条Shell命令、写下数百个Python脚本,还围绕已知的黎曼ζ函数零点进行了数千次数值检验。

这60个智能体有的负责提出新思路,有的沿着重点方向继续推导,有的专门寻找反例,还有一批直接充当审稿人,负责给其他智能体挑错。

最终,有2个智能体竟然真的提出了关键数学思路

眼见同伴如此给力,其他智能体也没偷懒:

13个负责提供辅助想法,30个探索了其他方向但没能成功,13个专门验证论证,最后2个帮忙把成果整理成论文。

而作为这支队伍里唯一的人类,Jarred的主要工作竟是不断发送鼓励??

继续Claude。
相信你自己。

就这么“哄”了一天半,Claude虽然没能证明黎曼猜想,却意外发现:

如果把几项已有数学成果重新组合起来,似乎可以突破一个停滞多年的纪录。

它将满足黎曼猜想的ζ函数零点比例下界,从41.6%直接推到了67.2%。

生活,真就处处充满意外之喜呗!!

为了确认自己不是“算嗨了”,Claude又拉来不同的子智能体交叉审稿、寻找反例,还从arXiv下载了54篇论文,检查这个结果是不是早就有人做过。

觉得还不够保险,它又从头独立证明了一遍。

A社:连Claude自己也对其发现感到惊讶,也许像我们许多人一样,Claude低估了AI的进步速度。

确认暂时没发现问题后,Claude主动提出:

写成论文,再找人类数论专家来验货

随后,Anthropic内部两位数学家Levent Alpöge和Ralph Furman检查了这项结果。

Claude还和Anthropic员工Eric Easley一起,把证明写成了计算机可验证的Lean版本,并通过标准工具Comparator的测试。

此外,两位解析数论专家Brian Conrey和Dan Goldston也审阅了论文。

也就是说,从想出思路到交叉审稿、查重、复现、写论文、做形式化验证,Claude几乎把科研流程走了一遍。

当然,这还不等于完成了传统同行评审,更不意味着黎曼猜想被解决了。

Anthropic也明确表示,这套方法大概率无法直接通向完整证明。

但真正夸张的地方在于:

AI已经不只会做有标准答案的数学题了,面对一个没人知道答案的开放问题,它开始能够自己找方向、读论文、试错、挑漏洞,甚至拿出新的研究结果

原本只是让Claude挑战一个几乎不可能完成的任务。

结果主线没通关,支线先爆出橙装了。

One More Thing

话说,不知道这个模型是不是传说中的Fable 5.1(或Fable 6)。

网上最近已经开始流传Fable 5.1的消息:

爆料称,它主要强化了长周期推理和智能体能力,可能已经完成内部测试,只是在等待合适的发布窗口。

还有人猜测,面对下一轮模型大战,A社可能直接跳过“5.1”,把版本号抬到Fable 6。

不过截至目前,这些说法既没有API型号、系统卡和Benchmark佐证,也没有得到Anthropic官方确认。

或许等OpenAI发布GPT-6就知道了。

螳螂捕蝉,黄雀在后,懂的都懂(doge)。

版权所有,未经授权不得以任何形式转载及使用,违者必究。