营业时间:周一至周六 10:00-19:00

  • 发送邮件至 [email protected]
  • 亚博入口专注结合背景资料辅助读者建立个人判断体系。,为用户提供专业可靠的体验。
  • 有任何疑问? +86 138-
亚博入口
亚博入口
亚博入口
亚博入口
亚博入口
亚博入口
亚博入口
亚博入口
亚博入口
亚博入口
亚博入口
亚博入口

围绕亚博娱乐平台,亚博入口持续打磨更优质的服务。

仅凭1300张H200显卡,就在一项高难度科学基准测试中超越了GPT-6 Astra。

日前,前OpenAI研究副总裁Liam Fedus在X平台上发帖,展示了Periodic Labs的首个模型:Periodic Neon。

帖子中最引人注目的一句话是:

仅用1300张H200,加上数月的实验数据,Neon在其自有的分析基准上胜过了GPT-6 Astra。

Periodic门洛帕克高磁场材料实验室实拍,机械臂正在样品上方操作。

上图中,一排排样品托上放置着刚合成出的候选材料,它们将被送入X射线衍射仪记录“指纹”,随后转化为Neon需要解读的图谱。

实验室全天候运转,进行合成、测量和数据输入。

Fedus表示,他们首批攻克的目标是超导体、磁体和半导体材料中的难题。

一位做大模型出身的人,为何转向材料研究?

Fedus曾是ChatGPT的核心创造者之一,在OpenAI负责后训练,深知模型如何变得更强。

去年创立Periodic时,他就明确表达:

互联网上的文本总量约为10T token,最前沿的模型已经将其全部读取。AI要更进一步,需要互联网上不存在的新数据。

这些新数据从何而来?实验室。

于是,他联合前谷歌DeepMind化学与物理研究负责人Ekin Dogus Cubuk,从零开始自建实验室、自主生成数据,目标只有一个:打造一个AI科学家。

一年后,首份成果出炉。

Neon拥有约1T参数,在一项高难度的X射线衍射(XRD)分析测试中,成功率达到55.3%,超越了GPT-6 Astra和Claude Fable 5.1。

从参数规模看,据业内传闻,Astra总参数达数万亿量级,而Neon仅为1T;

从算力看,按黄仁勋公开说法,Astra背后是10万张以上的Grace Blackwell;Neon最终训练峰值规模仅1300张H200。

这种巨大反差迅速在业内引发热议。

Jeff Dean第一时间在Fedus的帖子下留言祝贺。

1300对10万,这组数字背后,揭示了让AI持续进化的另一条路径。

一张考卷,将2.7%提升至55.3%

Neon解决的问题是X射线衍射分析(简称XRD)。

什么是X射线衍射?

比喻来说:一束X射线射入晶体,会在特定角度产生亮峰。材料不同,亮峰位置各异,如同指纹。

合成出的物质是否为超导体、磁性材料或半导体材料,首先需验证这枚“指纹”是否匹配。

Periodic Lab里的X射线衍射仪。Neon学习的XRD数据即由此类设备生成。

问题在于,实验室合成的样品往往极不纯净,多种物质相互重叠,如同数百人的指纹杂乱地印在同一张纸上。

材料科学家要分辨其中成分,通常需启动软件、查阅数据库、对比文献,耗时颇长。

Periodic挑选了134道这类“连专家都棘手”的难题,组成基准测试FrontierXRD。

Neon的55.3%正是在这134道题上取得的。

所有模型均使用Periodic自建的科学工具环境Periodic Harness。

与基于Claude Code、配备标准XRD工具的方案相比,在单题成本相近的情况下,Periodic Harness的成功率是后者的3.8倍。

AI做科研,一半依赖智能,一半依赖工具。

为防止模型“背答案”,团队还额外准备了198道题,题目涉及的化学体系在训练数据中均被刻意排除。Neon依然领先于众多前沿模型。

不过官方也承认,这套题比FrontierXRD简单。

成本方面,Neon更具优势。

最高配置下,Neon成功率为55.3%,每题成本约4美元;GPT-6 Astra每题成本约7美元,成绩却低于Neon;Claude Fable 5.1成本与Astra相近,成功率仅约40%。

互联网即将被AI读尽,他们想打造一口永不枯竭的“数据水井”

抛开性能分数,Periodic真正想展示的是其在门洛帕克建立的高通量材料实验室。

Periodic Lab实拍:机械臂夹取样品送入设备。

从最初的首批实验,到如今24小时不间断运行,Periodic将材料发现拆解为一个循环:

先预测要合成什么,基于对材料稳定性和性质的预判;

再预测如何将其合成出来;

最后确认实际产物是什么,性质是否达标。获取结果后修正预测,进入下一轮。

Periodic的材料发现循环:做什么、怎么做、做了什么,三段紧密衔接。

每循环一次,实验室就产出一批新鲜、私有、带有物理反馈的数据。这些数据正是Neon的原料。

Periodic的中训练语料,混合了学术文献、代码和实验数据,规模目前每月翻倍。

他们还发现,先通过中训练注入科学知识,后续的强化学习效果更佳。

而且实验进行时,GPU无需闲置等待。模型可利用已有实验数据继续分析、优化预测。

Periodic那篇研究博客的标题,叫“自然就是学习环境”。

它瞄准的是AI领域无法回避的挑战:

过去几年,Scaling依赖不断堆叠互联网数据。但互联网上的文本,已快被前沿模型读尽。

接下来,谁拥有能持续产出新数据的环境,谁就多了一条继续Scaling的路径。

互联网是一座越挖越少的矿藏,实验室则是一口能源源不断出水的井。

自然不提供标准答案,Periodic请来AI裁判

将强化学习引入物理世界,难度远超数字世界。

数字世界的RL,已让智能体编写了几乎所有代码,并解开了悬而未决的数学猜想,秘诀在于派出海量智能体,执行快速且能自动评分的任务。

到了物理世界,这三方面全受阻:

智能体不能随意增加,多跑一条实验路径,就多一份电力、设备和工程消耗;一次实验可能耗时数天;结果还常模棱两可。

最后一点最为关键。Periodic在研究博客中精辟指出:科学可以被证伪,却不易被验证。

一张XRD图谱,仅看拟合是否匹配,无法低成本判断分析是否成功。还需专家评估每个物相是否有图谱支持,化学上是否合理。

Periodic的方法,是将专家的判断“蒸馏”成裁判。

他们请材料专家为数千个XRD图谱标注,再用这些标签校准一个由Opus 5和GPT-5.6 Sol组成的LLM裁判组,三组数据极具说服力:

专家之间的一致率为77.2%;

LLM裁判与单个专家的一致率为74.6%;

LLM裁判与专家共识的一致率为84%。

也就是说,这个AI裁判的可靠性,已接近人类专家之间的水平。

能将“说不清”转化为可训练的奖励,是Neon的一项核心技术亮点。

1300对10万,这些显卡如何节省出来

1300张H200,是Neon最终训练时,中训练和强化学习两个阶段同时运行所需的最大显卡数量。

而Astra的10万张以上Blackwell,对应的是前沿通用模型的大规模训练。

因此,1300对10万,无法直接计算效率倍数,但至少说明这1300张显卡被Periodic充分利用。

科学任务上的强化学习有个怪毛病:模型处理一道题,需边思考、边查资料、边运行工具,一趟可能耗时一个多小时;但用这道题的结果更新模型,只需几分钟。

Periodic的解决方法,是让解题和学习分离,各自使用独立的GPU,互不等待。

这里有一个真实的失败案例。

他们最初的RL循环,训练、推理和模型编写的代码全混在一起,没有任何隔离。

直到有一次,模型编写的代码申请了80GB内存,导致整个任务当场崩溃。

于是他们自研了沙箱pbox。

它直接调用RL任务所在GPU节点上闲置的CPU来运行科学工具,数据全程不出集群。

与测试过的一家托管沙箱服务相比,数据往返速度提升了4.5倍,吞吐量是其3.3倍。

训练空闲下来的算力,再分配给物理模拟等科学计算任务,整个集群的利用率常年保持在95%以上。

Periodic的思路不难理解:算力总量拼不过巨头,就拼每个GPU小时能换回多少科学产出。

飞轮仍是那个飞轮,燃料变了

Neon已部署进Periodic的实验室,分析真实实验,帮助团队寻找更优的超导体和磁体。

还差哪一步?

回到之前提到的三段循环中,Neon这次仅验证了最后一段:理解实验室到底做出了什么。

至于让AI指挥整个科研项目、设计合成路径、决定下一轮跑哪些实验,Periodic官方表示,正在将这套方法向这些方向扩展。

Fedus的措辞也很谨慎:模型目前是“帮我们决定”,而非替科学家拍板。

准确说:实验、数据、训练之间的飞轮已开始转动,但要实现全自主闭环,还有两个环节未打通:决定做什么,以及如何将其合成出来。

Periodic也未否认算力的价值。

官方表示,将训练算力扩大到与当前前沿模型相当的量级,能解锁更强的科学能力。他们也提到,未来可换用更强的开放权重模型作为底座。

GPU依然重要,但光有GPU已不够。

回顾Fedus的履历:在GPT-4技术报告的贡献者名单中,他的职责是“数据飞轮”负责人。

三年后,他将这个飞轮从互联网文字搬进了真实的物理实验室。

飞轮仍是那个飞轮,变化的只是喂入的内容:从人类书写的文字,换成了自然给出的回答。

下一阶段的Scaling,比的或许不再只是谁能买下十万张芯片,还要看谁的实验室能不停地向模型输送真实世界的数据。

参考资料:

https://periodic.com/news/building-labs-that-learn

https://periodic.com/news/nature-is-our-learning-environment

https://periodic.com/news/ai-infrastructure-at-periodic

https://x.com/LiamFedus/status/1973055380193431965

https://a16z.com/announcement/investing-in-periodic-labs/

本文来自微信公众号“新智元”,作者:ASI启示录,36氪经授权发布。

我们助力2000家电竞企业成长

选择亚博入口,无需编程即可快速搭建你的电竞资讯站点

获取报价