- 管理员发布
- 2026年8月2
- 管理员发布
- 2026年8月2
营业时间:周一至周六 10:00-19:00
仅凭1300张H200显卡,就在一项高难度科学基准测试中超越了GPT-6 Astra。
日前,前OpenAI研究副总裁Liam Fedus在X平台上发帖,展示了Periodic Labs的首个模型:Periodic Neon。
帖子中最引人注目的一句话是:
仅用1300张H200,加上数月的实验数据,Neon在其自有的分析基准上胜过了GPT-6 Astra。
Periodic门洛帕克高磁场材料实验室实拍,机械臂正在样品上方操作。
上图中,一排排样品托上放置着刚合成出的候选材料,它们将被送入X射线衍射仪记录“指纹”,随后转化为Neon需要解读的图谱。
实验室全天候运转,进行合成、测量和数据输入。
Fedus表示,他们首批攻克的目标是超导体、磁体和半导体材料中的难题。
一位做大模型出身的人,为何转向材料研究?
Fedus曾是ChatGPT的核心创造者之一,在OpenAI负责后训练,深知模型如何变得更强。
去年创立Periodic时,他就明确表达:
互联网上的文本总量约为10T token,最前沿的模型已经将其全部读取。AI要更进一步,需要互联网上不存在的新数据。
这些新数据从何而来?实验室。
于是,他联合前谷歌DeepMind化学与物理研究负责人Ekin Dogus Cubuk,从零开始自建实验室、自主生成数据,目标只有一个:打造一个AI科学家。
一年后,首份成果出炉。
Neon拥有约1T参数,在一项高难度的X射线衍射(XRD)分析测试中,成功率达到55.3%,超越了GPT-6 Astra和Claude Fable 5.1。
从参数规模看,据业内传闻,Astra总参数达数万亿量级,而Neon仅为1T;
从算力看,按黄仁勋公开说法,Astra背后是10万张以上的Grace Blackwell;Neon最终训练峰值规模仅1300张H200。
这种巨大反差迅速在业内引发热议。
Jeff Dean第一时间在Fedus的帖子下留言祝贺。
1300对10万,这组数字背后,揭示了让AI持续进化的另一条路径。
Neon解决的问题是X射线衍射分析(简称XRD)。
什么是X射线衍射?
比喻来说:一束X射线射入晶体,会在特定角度产生亮峰。材料不同,亮峰位置各异,如同指纹。
合成出的物质是否为超导体、磁性材料或半导体材料,首先需验证这枚“指纹”是否匹配。
Periodic Lab里的X射线衍射仪。Neon学习的XRD数据即由此类设备生成。
问题在于,实验室合成的样品往往极不纯净,多种物质相互重叠,如同数百人的指纹杂乱地印在同一张纸上。
材料科学家要分辨其中成分,通常需启动软件、查阅数据库、对比文献,耗时颇长。
Periodic挑选了134道这类“连专家都棘手”的难题,组成基准测试FrontierXRD。
Neon的55.3%正是在这134道题上取得的。
所有模型均使用Periodic自建的科学工具环境Periodic Harness。
与基于Claude Code、配备标准XRD工具的方案相比,在单题成本相近的情况下,Periodic Harness的成功率是后者的3.8倍。
AI做科研,一半依赖智能,一半依赖工具。
为防止模型“背答案”,团队还额外准备了198道题,题目涉及的化学体系在训练数据中均被刻意排除。Neon依然领先于众多前沿模型。
不过官方也承认,这套题比FrontierXRD简单。
成本方面,Neon更具优势。
最高配置下,Neon成功率为55.3%,每题成本约4美元;GPT-6 Astra每题成本约7美元,成绩却低于Neon;Claude Fable 5.1成本与Astra相近,成功率仅约40%。
抛开性能分数,Periodic真正想展示的是其在门洛帕克建立的高通量材料实验室。
Periodic Lab实拍:机械臂夹取样品送入设备。
从最初的首批实验,到如今24小时不间断运行,Periodic将材料发现拆解为一个循环:
先预测要合成什么,基于对材料稳定性和性质的预判;
再预测如何将其合成出来;
最后确认实际产物是什么,性质是否达标。获取结果后修正预测,进入下一轮。
Periodic的材料发现循环:做什么、怎么做、做了什么,三段紧密衔接。
每循环一次,实验室就产出一批新鲜、私有、带有物理反馈的数据。这些数据正是Neon的原料。
Periodic的中训练语料,混合了学术文献、代码和实验数据,规模目前每月翻倍。
他们还发现,先通过中训练注入科学知识,后续的强化学习效果更佳。
而且实验进行时,GPU无需闲置等待。模型可利用已有实验数据继续分析、优化预测。
Periodic那篇研究博客的标题,叫“自然就是学习环境”。
它瞄准的是AI领域无法回避的挑战:
过去几年,Scaling依赖不断堆叠互联网数据。但互联网上的文本,已快被前沿模型读尽。
接下来,谁拥有能持续产出新数据的环境,谁就多了一条继续Scaling的路径。
互联网是一座越挖越少的矿藏,实验室则是一口能源源不断出水的井。
将强化学习引入物理世界,难度远超数字世界。
数字世界的RL,已让智能体编写了几乎所有代码,并解开了悬而未决的数学猜想,秘诀在于派出海量智能体,执行快速且能自动评分的任务。
到了物理世界,这三方面全受阻:
智能体不能随意增加,多跑一条实验路径,就多一份电力、设备和工程消耗;一次实验可能耗时数天;结果还常模棱两可。
最后一点最为关键。Periodic在研究博客中精辟指出:科学可以被证伪,却不易被验证。
一张XRD图谱,仅看拟合是否匹配,无法低成本判断分析是否成功。还需专家评估每个物相是否有图谱支持,化学上是否合理。
Periodic的方法,是将专家的判断“蒸馏”成裁判。
他们请材料专家为数千个XRD图谱标注,再用这些标签校准一个由Opus 5和GPT-5.6 Sol组成的LLM裁判组,三组数据极具说服力:
专家之间的一致率为77.2%;
LLM裁判与单个专家的一致率为74.6%;
LLM裁判与专家共识的一致率为84%。
也就是说,这个AI裁判的可靠性,已接近人类专家之间的水平。
能将“说不清”转化为可训练的奖励,是Neon的一项核心技术亮点。
1300张H200,是Neon最终训练时,中训练和强化学习两个阶段同时运行所需的最大显卡数量。
而Astra的10万张以上Blackwell,对应的是前沿通用模型的大规模训练。
因此,1300对10万,无法直接计算效率倍数,但至少说明这1300张显卡被Periodic充分利用。
科学任务上的强化学习有个怪毛病:模型处理一道题,需边思考、边查资料、边运行工具,一趟可能耗时一个多小时;但用这道题的结果更新模型,只需几分钟。
Periodic的解决方法,是让解题和学习分离,各自使用独立的GPU,互不等待。
这里有一个真实的失败案例。
他们最初的RL循环,训练、推理和模型编写的代码全混在一起,没有任何隔离。
直到有一次,模型编写的代码申请了80GB内存,导致整个任务当场崩溃。
于是他们自研了沙箱pbox。
它直接调用RL任务所在GPU节点上闲置的CPU来运行科学工具,数据全程不出集群。
与测试过的一家托管沙箱服务相比,数据往返速度提升了4.5倍,吞吐量是其3.3倍。
训练空闲下来的算力,再分配给物理模拟等科学计算任务,整个集群的利用率常年保持在95%以上。
Periodic的思路不难理解:算力总量拼不过巨头,就拼每个GPU小时能换回多少科学产出。
Neon已部署进Periodic的实验室,分析真实实验,帮助团队寻找更优的超导体和磁体。
还差哪一步?
回到之前提到的三段循环中,Neon这次仅验证了最后一段:理解实验室到底做出了什么。
至于让AI指挥整个科研项目、设计合成路径、决定下一轮跑哪些实验,Periodic官方表示,正在将这套方法向这些方向扩展。
Fedus的措辞也很谨慎:模型目前是“帮我们决定”,而非替科学家拍板。
准确说:实验、数据、训练之间的飞轮已开始转动,但要实现全自主闭环,还有两个环节未打通:决定做什么,以及如何将其合成出来。
Periodic也未否认算力的价值。
官方表示,将训练算力扩大到与当前前沿模型相当的量级,能解锁更强的科学能力。他们也提到,未来可换用更强的开放权重模型作为底座。
GPU依然重要,但光有GPU已不够。
回顾Fedus的履历:在GPT-4技术报告的贡献者名单中,他的职责是“数据飞轮”负责人。
三年后,他将这个飞轮从互联网文字搬进了真实的物理实验室。
飞轮仍是那个飞轮,变化的只是喂入的内容:从人类书写的文字,换成了自然给出的回答。
下一阶段的Scaling,比的或许不再只是谁能买下十万张芯片,还要看谁的实验室能不停地向模型输送真实世界的数据。
参考资料:
https://periodic.com/news/building-labs-that-learn
https://periodic.com/news/nature-is-our-learning-environment
https://periodic.com/news/ai-infrastructure-at-periodic
https://x.com/LiamFedus/status/1973055380193431965
https://a16z.com/announcement/investing-in-periodic-labs/
本文来自微信公众号“新智元”,作者:ASI启示录,36氪经授权发布。