两段科研代码卡住分子模拟,演化式编程代理把候选程序通过率由不足1%推到60%以上,并让训练与推理提速4倍

2026-08-01 17:19 烁域科技
22

烁域科技

科研工程 · 算法演化

核心判断:科研代码优化只有把性能目标与科学正确性放进同一套验收,演化式搜索才会成为工程能力;速度可以由机器探索,可信边界必须由测试与专家共同守住。

分子模拟 瓶颈算法 候选搜索 回归测试 科学验收

药物与材料研发需要反复模拟分子相互作用。传统量子方法准确却缓慢,机器学习力场试图缩短计算时间,但训练与推理仍可能被少数底层算法卡住。Google Cloud与Schrödinger在2026年6月披露的案例中,团队锁定邻居列表计算和Ewald求和两处瓶颈,

并用演化式编程代理反复生成、测试和改进候选实现。优化后,候选程序同时满足正确性与性能要求的通过率由五千次评估中的40个、也就是不足1%,提高到60%以上;机器学习力场的训练与推理速度提升4倍。

这组结果不能理解为科研人员退出编码。案例真正展示的是另一种分工:专家定义目标与测试,智能代理扩大算法搜索,完整回归套件拦截错误,工程师再决定哪些实现进入生产。

两段瓶颈代码限制分子模拟速度

样本

先找到真正限制吞吐的两段代码

科研软件规模很大,性能问题却常集中在少数核心路径。Schrödinger团队没有让代理泛化改写整个代码库,而是先用工程分析确认邻居列表和Ewald求和是关键限制。科研负责人还应检查提速是否改变后续实验选择,

只有真实工作量和决策节奏变化,性能收益才进入业务。邻居列表负责聚合原子周围信息,Ewald求和处理长程势能。后者在原有PyTorch实现中缺少成熟的向量化算法,简单循环在大规模模拟里逐渐成为主要瓶颈

代码审查仍需关注可读性、依赖变化和维护成本,极快却无人能解释的实现未必适合长期使用。领域专家对候选的接受理由要写进记录,既包括速度收益,也包括科学可解释性、维护难度和失败后的回退方式。选对目标决定了搜索价值。

若优化的是低频函数,即使局部速度翻倍,整体训练也可能几乎不变;性能剖析因此必须发生在生成代码之前。性能剖析还应覆盖真实数据规模与硬件配置,避免在小样本上选出的热点到了生产环境失去代表性。

性能目标与科学正确性双闸门

目标

把快与正确写进同一个评分函数

团队把逆时间作为主要性能指标,基线分数为7.9,同时要求所有候选通过完整测试套件。代理不能靠跳过计算、降低精度或只适配单个样本来换取高分。成功方法可以封装为任务模板,

让其他高成本函数复用同一套剖析、搜索、测试与评审步骤。跨团队复用时,接收方必须重新验证数据、硬件和误差要求,不能把另一个实验室的**实现直接当成通用答案。回归测试覆盖复杂系统,包括无序水模型

用来检查演化程序在科学语义上仍与原实现一致。性能目标和功能正确性共同决定候选是否合格。目标函数的权重需要由科研与工程团队共同确定,因为速度、精度和资源费用往往存在真实取舍。这项设计对企业科研同样重要。

目标函数必须包含吞吐、误差界限、数值稳定、资源消耗和可复现性,否则代理只会优化最容易看见的单一数字。候选被拒绝时应保存原因,是数值偏差、内存过高、硬件不兼容还是测试不全,这些都能改进下一轮搜索。

候选生成测试淘汰再演化循环

搜索

让代理扩大候选空间,让测试快速淘汰

演化式编程代理不断提出实现、运行评测、保留更优候选,再根据结果继续变异。它的优势不是一次写对,而是能在明确边界内尝试远多于人工日常可承受的方案。团队也要关注搜索消耗本身,候选评估的算力与时间不能超过预期节省,优化账必须算完整。

案例中的Ewald求和最终以并行批量矩阵乘法替换简单循环,使计算更适合现代硬件。这个结果来自搜索、测试和比较,而不是语言模型凭直觉给出一段答案。科研数据与专有算法还涉及访问边界,自动搜索只能读取完成任务所需的代码、样本和运行资源。

候选生成环境应与生产隔离,限制可访问资源和执行时间,并保存代码、参数、测试结果与失败原因。失败样本同样能帮助专家看见搜索空间中的陷阱。测试集应包含典型样本、边界结构和历史失败案例,并定期随研究范围扩大而更新。

通过率由不足百分之一升到百分之六十以上

证据

通过率变化比单个最快样本更重要

案例称,早期五千次评估只有40个程序同时正确且更快,通过率不足1%;改进后超过60%的候选满足要求,性能分数则由7.9接近30。对随机算法,还要多次重复评测并记录方差,不能把一次幸运运行当成稳定性能。单个最快结果可能来自偶然路径,

稳定通过率更能说明搜索策略、测试设计和实现空间已经发生结构性改善。团队因此获得的不只是一个补丁,还有更可靠的优化方法。当模型、数据或底层框架升级,原有测试与性能基线需要重跑,避免旧结论被环境变化悄悄掏空。

发布前仍要在不同规模、不同分子结构与真实硬件上复测,并比较速度、显存、数值误差和失败模式。科学软件不能只凭一张**成绩单进入主干。进入生产前可以保留旧实现作为对照与回退路径,出现异常时快速切回,避免一次优化影响全部实验。

四倍提速连接药物催化与材料研发

落地

4倍提速要继续穿过科研工作流

两个基础算法优化后,机器学习力场训练与推理均实现4倍提速。更快的推理意味着团队可以在相同时间里筛选更大的化学空间,缩短候选探索周期。

业务价值会出现在药物发现、催化剂设计和材料研发等下游,但提速本身不保证新药或材料成功。实验验证、领域判断与后续工程仍决定科研结果能否成立。

留存

把算法搜索沉淀为可重复工程流程

企业可以为高成本计算建立标准入口:先做性能剖析,再定义目标与测试,随后开放隔离搜索,最后由领域专家评审候选并完成生产回归。不同硬件架构对并行方式的收益不同,企业要明确优化结果适用的设备、软件版本与数据范围。

每次成功优化都应保存基线、数据集、硬件、测试版本、候选轨迹和接受理由。环境变化或代码升级后,团队才能判断旧结果是否仍然成立。隔离环境既保护生产系统,也让每个候选在一致条件下比较,减少缓存与资源竞争造成的误判。演化式编程的长期意义,

不是让机器替代科研工程师,而是把大量候选试验交给自动搜索,把人的时间留给问题定义、科学边界、证据审查和新方向判断。自动搜索应设置预算上限与提前停止条件,当连续多轮没有显著改善时,把资源交回专家重新检查目标和搜索空间。

end

编辑:丁帆

审核:董晓龙

本文章由烁域科技原创出品,版权归属烁域科技所有。部分图片为原创配图资产,如有版权问题,请联系公众号客服。

如果您对企业 AI 系统搭建、企业健康管理及相关科技创新感兴趣,烁域科技为您提供全面的行业资讯、技术解析与实践观察。关注我们,助您掌握前沿行业动态,共创科技未来。

关注烁域科技

昵称:
内容:
验证码:
提交评论
评论一下
电话咨询
15221995259
微信客服
微信客服
扫码咨询