一个在生态学界躺了 20 年、始终没能在实际尺度上解开的方程被 Claude 认出来可以解然后真解开了。这是理论物理学家 Matthew Schwartz 于 10 月 1 日公开的开源工具套件 BootLoops 交出的成绩之一同一天他还在 Anthropic 网站发表了长文《Claude-shaped science》。从散射振幅起步Schwartz 本行是散射振幅。项目起点是 2026 年夏天 Anthropic 发布 Claude Fable 5 之后——更早一次实验写在 2025 年 12 月他用 Claude Opus 4.5 当研究助理成果是那篇《Vibe Physics》。他给新模型的第一个任务是把自己散射振幅论文及邻近文献里的方法统一进一套基于 S 矩阵 bootstrap 与半数值 bootstrap 的框架。他说一个前沿费曼积分能让研究组耗上好几年而 Claude 用约 20 分钟复现了他一篇论文的结果此前他亲手写代码花了几周模型还指出一个他并不知道的更好算法。当他要求从最简单的对数函数推进到更难的椭圆函数时模型自行推广了移植过来的机制并写掉了大部分新代码。最终工具端到端算完 30 个积分15 个以新方法复现已知结果另 15 个是此前从未被算出过的其中包括椭圆费曼积分。四个学科的实际战果生态学Claude 认出生态学家 Rampal Etienne 在 2005 年提出的方程可解——那个方程把 Stephen Hubbell 的中性生物多样性理论变成了可精确检验的形式。把它套到森林普查数据上巴拿马运河 Barro Colorado 岛的树种构成变化速度比中性理论允许的快 4.5 倍。他随后与植物生物学教授 James O’Dwyer 搭了一个物种生活史的最小预测模型正把范围从巴拿马扩到全球其他森林样地。群体遗传学工具解出一个 30 年前的积分表达式描述自然选择如何作用于稀有突变并应用到 gnomAD——约 730,000 个人类外显子组、146 万份基因组拷贝的拟合。他与 Michael Desai 分析 1000 Genomes Project 中 57 亿对邻近突变找到了基因转换的证据而几乎所有使用连锁遗传变异的分析都忽略这一机制。经济学与 Isaiah Andrews、Jesse M. Shapiro 合作的 NBER 工作论文 35782 于 9 月发布。在五本经济学期刊的 4,452 个已发表复现包中这套开源 LLM 工作流在 3,460 篇文章或附录里发现了不一致496 篇的运行时间缩短 10 倍以上且精度不降923 篇给出了符合原文目标与假设的新扩展。工作流把 MATLAB、Stata 等商业工具写的包移植成开源代码约 30,000 个例程并核对了几乎所有能与已发表表格对照的数字。语言学与三位语言学家做出 AccStack覆盖 6,072 种语言的词重音数据库附 160,000 条音系学文献目录。此外还有大氧化事件跨越四次冰期的定量模型与地球化学家 David Johnston、太阳黑子生命周期推广到恒星黑子的族群研究与天体物理学家 Cecilia Garraffo、演化树贝叶斯证据的精确可检验计算与 Scott Edwards、Paul Lewis、以及 George Watson 1939 年那批格点积分里最后一个——三维随机游走回归概率的精确解。工作流与它承认的短板三个月里这套流程产出 36 篇手稿、覆盖 18 个领域、19 位合作者选题来自约 400 个候选问题。Claude Code 终端跑在 Google Cloud 虚拟机上连接 GitHub 与 Overleaf 仓库一个主会话协调各项目会话、分配算力并验证结果后台子代理把中间结果写进 markdown 文件。他说 Fable 5 的安全分类器在工作中频繁触发而这种安排能把每次拦截限制在单个代理内不至于毁掉整个会话。他记录的反复出现的失败模式包括模型过早宣布胜利时间估计过长或过短本该写个工具几分钟解决的事却默认跑好几天长会话被压缩后丢上下文。对策是把协议技能写进 harness、坚持自己看图表、以对抗性裁判身份复核他反复对模型说的是“想得更聪明而不是更费力”。版权归 Anthropic但不是 Anthropic 的产品仓库只有 10 月 1 日这一个 commitMIT 许可证文字与图表走 CC BY 4.049 个工具包项目拆成 6 个并列仓库代码是 Python 3.12 加部分 Julia只在 Linux x86_64 以及 x86_64、arm64 的 Debian 容器上验证macOS 不在发布测试范围内。仓库声明代码由 Matthew D. Schwartz 创作、由 Claude 在他监督下撰写版权归 Anthropic PBC但不是 Anthropic 官方支持的产品由 Schwartz 维护且这些工具是研究仪器不适合临床、精算、支付、监管或公共安全决策。身份披露值得注意Schwartz 在项目期间是 Anthropic 的访问研究员NBER 论文也注明他为此研究担任 Anthropic 承包商并写明 Anthropic 不为其结果背书项目主页称 Anthropic 提供了资金而 BootLoops 由他本人拥有和维护。口径也有差异——他说覆盖 18 个领域项目主页写的是 22 个。对中国读者而言这套工具的分量不在“又一个开源 LLM 应用”。它瞄准的是科研流程里最难自动化的一环把论文结论变成可重复、可任意精度复算的代码。Schwartz 定的验收标准很直白——一个图只有在其完整函数形式已知、且一段 Python 脚本能在笔记本上以任意精度求值时才算被解决而它还刻意与模型解耦Claude、Gemini、ChatGPT 都能驱动。
阅读完成 · 觉得有帮助?