顶刊雷达 · 本周 Day 4。北京大学深圳研究生院牵头,联合 EACOMP 公司、福建时代新能源器件科技创新实验室、江西师范大学,发表在 Nature Machine Intelligence 2026-07-30(DOI 10.1038/s42256-026-01277-x)。
被检验的对象是字节跳动 Seed 团队今年 1 月发在同一本期刊上的电解液配方模型(Nature MI 8 卷 186-196 页)。这是「可复用性报告」栏目,跟上周四那篇广州国家实验室复现化学模型是同一个栏目。两个月里,这个栏目已经被中国团队用了两次。
先讲全文最反直觉的一个发现。 他们想测这个模型在没见过的高温条件下行不行。什么信息都不给模型,让模型直接做预测,成绩是 0.922,相当不错。 然后他们做了一件所有人都会做的事:给它补 20 条高温数据再考一次。按常理这只会更好。 结果成绩从 0.922 暴跌到 0.75。补了数据,反而比什么都不补更差。 继续加数据才慢慢爬回来,一直加到 800 条才达到 0.961。作者把这个现象叫"少样本困境",原因是:那 20 条数据太少、不具代表性,却又足够被模型记住,于是把它原本还不错的判断给带偏了。 这条对所有做微调的人都有直接的警示意义:补一点点数据,可能比不补更糟。 |
📖 先补 4 个名词(非本行的读者看这里) 电解液配方:锂电池里那层导电的液体,由几种溶剂加锂盐按比例调配而成。它难在"整体不等于部分之和":几种分子混在一起会互相影响,性能是它们协同作用涌现出来的,不能靠单独看每个分子。 预训练与微调:先拿海量便宜数据(比如计算模拟)把模型的基本功练出来,这叫预训练;再拿少量昂贵数据(比如真实实验)教它具体任务,这叫微调。后面会看到,这两个阶段的数据不能省得一样多。 零样本与少样本:零样本是完全没见过这类情况就直接考;少样本是给它看几条例子再考。这篇文章最大的发现,就出在"少样本"这个环节上。 R²(决定系数):衡量预测准不准。1.0 是完美,0 是"跟直接猜平均值一样"。0.9 以上算相当好,0.4 左右就基本不能用了。下面全篇都在看这个数。 |
速览 · 4 个关键对照 复现电导率预测 0.981 / 0.985 本文 / 原公开模型 | 补 20 条数据之后 0.922 → 0.75 补了反而更差 | 换一种没见过的锂盐 0.42 → 0.96 补 500 条数据后 | 扩展后预测电池效率 误差减半 0.155 对基线 0.33 |
|
一、被检验的是什么
先说清楚原模型解决的是什么问题。电解液不是单个分子,而是好几种溶剂加锂盐调出来的混合物。它的麻烦在于:性能是几种成分互相作用、协同涌现出来的,光知道每个分子长什么样,推不出混在一起会怎样。
字节跳动 Seed 团队那个模型的做法是把两层信息拼起来:分子的结构,加上配方里各成分的比例。而且它保证一个性质叫"置换不变",意思是你把配料表的顺序打乱,模型给出的答案不变。这符合化学常识:一杯溶液不会因为你先写哪个成分而改变性质。
它还同时干两件相反的事:正着算(给配方,预测性能)和反着生成(给目标性能,生成配方)。笔者在今年二月份精读了这篇文章而且还复现了这篇文章的部分内容。
这次检验团队做了四件事,一件比一件深:先原样复现,再测它对数据的依赖,再换全新的化学体系考它,最后把它改造去预测电池层面的性能。
二、复现:数字对上了,生成还更好
第一步先把原论文的结果跑一遍:
对得上。更有意思的是生成任务这边,复现版本反而更好。在"生成的配方里碳酸乙烯酯含量必须超过 20%"这个带约束的任务上,成功率 38.19% 对原版 22.11%;不加约束引导时是 3.12% 对 0.8%。生成分子的浓度分布也更紧地聚在目标值周围。
作者对此的解释还是比较克制:这说明原架构在标准化训练配置下保有稳健的生成能力,而不是宣称自己做得更好。
超参数这块也测了,结论对做工程的人有用:
· 随机种子几乎没影响,说明模型数值上是稳的 · 学习率调高会明显劣化预测,作者认为是步子迈太大直接越过了最优点 · 输出层维度设得过大,会大幅拉低电导率的预测精度 · batch size 影响很小 |
第三条背后有个原因值得说一句:电导率的实验数据量远小于阴离子比,数据少的那个任务,对模型容量更敏感。
少样本困境 原本的模型成绩 0.922补 20 条新数据之后成绩掉到 0.75 数据来源:Nature Machine Intelligence(2026-07-30)· DOI 10.1038/s42256-026-01277-x 北京大学深圳研究生院 · 科研 AGENT 实验室 |
↑ 长按保存或截图发到 AI4Science / 电池材料 / 机器学习群
三、换个场景,它还灵吗
这一节是全文最有价值的部分。他们从三个方向把模型推到训练数据覆盖不到的地方:
| | |
|---|
| | 补 20 条掉到 0.75 |
| | |
| | 补 20 条掉到 0.519 |
| | 补 100 条到 0.89,补 500 条到 0.96 |
这张表有三层意思。
第一,"少样本困境"不是偶然。温度和新溶剂这两行都出现了同样的塌陷:补一点点数据反而更差。而盐浓度那一行没有,是稳步上升的。这说明这个坑不是每次都会踩,但你事先不知道会不会踩。
第二,最后一行是最硬的考验。他们找了一个原研究里完全没有的主盐(六氟砷酸锂),凑了 1827 条数据。零样本成绩 0.42,基本等于不能用。但补 100 条就跳到 0.89,补 500 条达到 0.96。
作者对这一行的解读我认为很中肯:这既暴露了它对陌生化学体系的无能,也证明了它适应得很快。换句话说,这个模型不能直接拿来就用,但值得拿来当起点。
四、数据该省在哪一头
这一节的结论最能直接省钱。
他们分别砍掉预训练阶段和微调阶段的数据,看各自影响多大:
读法很清楚:预训练数据砍掉九成,成绩几乎没变;微调数据砍到一成,成绩明显下滑。
这对做实验的人是个实在的指导:预训练用的是便宜的计算数据,微调用的是昂贵的实验数据。这个结果说明钱要花在实验数据上,计算数据够用就行,堆再多边际收益也不大。
他们还做了一件很聪明的事:把 11 个分子性质逐个从训练数据里拿掉,看少了谁最要命。结果暴露出这些性质之间的耦合关系:
· 少了密度,粘度就预测不准(这两个物理上本来就耦合) · 少了粘度,电导率大幅变差(因为粘度是模型内嵌那条经验公式里的显式项) · 少了酸解离常数,大多数其他性质都跟着崩,影响面最广 |
这类分析的价值在于:如果你要为自己的体系攒数据,它告诉你哪几项是必须测的,哪几项可以先放一放。
五、改造之后能预测电池性能了
前面都是检验,这一节是这篇报告真正超出"复现"的地方:他们把这个模型改造了,让它去预测原本预测不了的东西。
原模型只算分子的物理化学性质。他们往上加了两层:
| | |
|---|
| 分子的两个电子能级,性质从 11 项扩到 13 项 | |
| | |
| | |
有两个细节值得单独说。
一是加了新任务,老任务没退步。原有 11 项性质的精度保持不变,说明这个架构确实能同时干多件事而不用互相让路。
二是库仑效率这一项的对比很有力。虽然 R² 只有 0.768 看着一般,但换成误差来比:改造后的模型误差是 0.155,而先前研究里线性回归、随机森林、Boosting、Bagging 这四种常规方法都在 0.33 上下。误差差不多减了一半。
生成任务也扩展到了同时满足四个目标。在最严苛的高效率约束下,改造版的成功率 32.7%,原版只有 5.1%。这个差距说明改造是有实际价值的,不只是多了几个输出口。
六、作者自己划的边界
边界 1 · 性能被训练数据的覆盖范围牢牢卡住。作者说得很直接:一次简单的数据划分,根本不足以决定一个模型的真实性能 边界 2 · 只会算静态的性质。电解液在实际工作中是动态变化的,捕捉这种动态响应的能力还有很大空间 边界 3 · 生成一大堆候选,还得靠人挑。模型会吐出大量配方,最终仍需要领域知识筛选后才能进实验。因为原始文章生成式AI来直接生成配方。 边界 4 · 没有闭环反馈。模型预测跟实验或模拟结果之间没有回路,这限制了它在全自动设计流程里的用处 |
七、连着三天,一层一层往下挖
三天下来,答案其实是同一个:这些系统在自己熟悉的地盘上都很能干,一旦挪出去就要重新验证,而且验证方式本身也不见得可靠。
今天这篇还额外贡献了一条:挪出去之后,补一点点数据可能比不补更糟。这大概是本周最实用的一个提醒。
数据来源 · 访问层级说明 Reusability report: Exploring the utility and extensibility of an integrated modelling framework for liquid electrolyte design,Nature Machine Intelligence,2026-07-30 在线发表 · DOI 10.1038/s42256-026-01277-x(订阅制)| 扩展框架代码开源 Zenodo 10.5281/zenodo.19048302,数据在 HuggingFace 与 figshare |
💬 评论区聊聊 最实际的一个问题:你有没有遇到过"加了数据反而变差"的情况?这篇文章给出了一个解释:那点数据太少、不具代表性,却又足够被记住。如果真是这样,补数据之前是不是该先估一下"至少要补多少才安全"?另一个问题:这篇说钱该花在微调数据而不是预训练数据上,跟你的经验对得上吗? 📤 发给做电池材料 / AI4Science 的人 把这一篇发给他,重点是第三节和第四节两张表。"补 20 条数据反而更差"和"预训练砍九成没事、微调砍九成就崩"这两条,对正在攒数据集或者做微调的团队是直接能用的。扩展框架代码已开源,可以直接接自己的体系。 |
📂 顶刊雷达 · 本周节奏 明天 Day 5(周五):Nature MI · 多智能体系统需要透明度。连着三天的验证话题告一段落,明天转入治理:如果一群 AI 一起干活出了事,你怎么查清楚是哪一步错的。 本周主线:从"AI 能做什么",到"我们怎么知道它做得对",再到"谁来负责"。Day 1 Raygun 蛋白缩放 / Day 2 虚拟细胞 / Day 3 四家实验室对测催化剂 / Day 4 本文 电解液模型复用 / Day 5 多智能体透明度 / Day 6 AI 与气候研究 / Day 7 收官 实验室自动化的前景与挑战。 |
科研 AGENT 实验室 · 顶刊雷达 · Nature MI 电解液模型可复用性报告
2026-08-06