Back to essays
AI Research · Karpathy · Agentic · 2026-03

karpathy/autoresearch:3 文件 + 1 agent = 100 实验/晚

2026-07-29 · 11 min read
AutoResearch · 自主科研封面(金色粒子云)
Audio version · MiniMax TTS · male-qn-jingying · 2:25
★ 范式转变 · 2026-03

"研究现在完全属于跨计算集群的 AI agent swarm 的领域。"

2026 年 3 月,Andrej Karpathy 在 GitHub 上开源了 karpathy/autoresearch —— 630 行 Python,3 个文件,让一个 AI coding agent 在单 GPU 上跑一整夜的 ML 实验。

我读完整个项目后意识到:这不只是个工具,这是科研范式的转变。从此你不再写 train.py,你写 program.md

三个文件 · 一个范式

Karpathy 把项目控制在最少文件数。三个文件,每个角色清晰:

三个文件 + 一个 agent 的概念图
karpathy/autoresearch 的三个文件:prepare.py 冻结、train.py agent 修改、program.md 人类修改。中心是 AI coding agent(Claude Code / OpenAI Codex),围绕 program.md 的指令循环迭代。
文件内容谁改
prepare.py固定常量、数据准备、BPE tokenizer、dataloader、evaluation❌ 冻结(任何人都不改)
train.py完整 GPT 模型本体、Muon + AdamW 优化器、训练循环🤖 Agent(agent 改这一个文件)
program.md给 agent 的指令(实验方向、边界、假设、研究组织代码)👤 人类(这就是新的"代码")

设计原则是单文件范围 —— agent 只改 train.py。这让 diff 可读、scope 不爆炸、人类 review 友好。

"You are not programming Python. You are programming the program.md Markdown files that provide context to the AI agents and set up your autonomous research org." —— karpathy/autoresearch README

5 分钟 · 100 实验 · 一晚

循环很简单。Agent 编辑 train.py → 跑 5 分钟(固定时间,wall clock)→ 比较 val_bpb(bits per byte,越低越好)→ 更好就保留,否则回滚。

5 分钟实验循环流程图
单次实验循环:① Agent 编辑 train.py → ② 跑 5 分钟(单 GPU)→ ③ 对比 val_bpb → ④ keep / discard。中心红框是设计核心:固定 5 分钟。一晚 100 个实验。

为什么 5 分钟?为什么不跑到收敛?

Karpathy 给了两个理由:

数学很简单:~12 次实验/小时,~100 次/晚。Agent 不睡觉,你一晚醒来看到 100 行实验日志 + 一个更好的模型。

100 实验模拟时序图
一晚 100 个实验的模拟时序:横轴是实验编号(~5 分钟/次),纵轴是 val_bpb。蓝点 = 失败实验(被回滚),红点 = 保留实验(更新当前最佳)。下图是累计保留曲线 —— 100 次后保留 15 次左右(12% 命中率),但每次保留都比上次更好。

三阶段范式转变

Karpathy 把这放进了一个更宽的框架:AI 介入研究的三阶段

范式转变三阶段
Vibe Coding → Agentic Engineering → Independent Research。当前位于第三阶段的开端,autoresearch 是它的种子项目。
阶段人类角色AI 角色代表
Vibe Coding写 prompt写代码、人类 reviewChatGPT + copy-paste
Agentic Engineering编排多步执行、实时监督Devin、Cursor Composer
Independent Research定方向跑实验、过夜自治★ autoresearch ★

关键转变在第三阶段:人类从"操作工"变成"研究组织的设计者"。你的产出不再是"我跑了一次实验",而是"我设计了让 agent 跑 100 次实验的研究组织"。

30+ 生态项目

autoresearch 不是孤例。2026-03 之后,整个生态爆炸

AutoResearch 生态 30+ 项目 treemap
30+ 个项目按 stars 大小排列。karpathy 92.3k 一骑绝尘。右侧 5 个 next-big 是 End-to-End 完整流水线(AI-Scientist / AutoResearchClaw / AI-Scientist / RD-Agent / AutoResearchClaw)。底部 6 个是其他分类(Deep Research / Code Agents / Skills / Domain / Writing / Awesome)。颜色 = 类别。
类别代表项目做了什么
End-to-End Systemskarpathy/autoresearch · SakanaAI/AI-Scientist-v2 · microsoft/RD-Agent · aiming-lab/AutoResearchClaw完整研究流水线:想法 → 文献 → 实验 → 论文
Deep Researchkaixindelele/ChatPaper (19.3k) · stanford-oval/stormAI 帮你读 paper、写综述
Code AgentsWecoAI/AIDE · bytedance/deer-flow实验代码自动生成 + 调试
Skills & PluginsK-Dense-AI/claude-scientific-skills (15.5k)"Skills" 范式(program.md 的进化)
Domain-Specificsnap-stanford/Biomni垂直领域:生物医学

其中两个项目最值得对比:

前者的价值是"教范式",后者的价值是"做产品"。Karpathy 给的是种子,aiming-lab 把它长成了森林。

我的"金融版 autoresearch"

我之前做的 A 股情绪指数 项目 —— 13 成分、滚动分位数、5 年回测 —— 实际上就是一个手工版的 autoresearch

对比一下:

autoresearch 范式A 股情绪指数 v1 → v2 → v2 行业版
Agent 修改 train.py我修改 compute.py(v1 → v2 加 7 个成分)
5 分钟固定时间预算固定 5%/95% 滚动分位数规则
val_bpb 单一指标a_sentiment 0-100 分数
Self-healing repairAutoResearchClaw 的 repair.py(4 层反伪造)
100 实验/晚3 个手动循环(24.4 → 14.7 → 26.1 行业版)
Single iteration loopv0.4.0 HITL Co-Pilot

我手动跑了 3 个版本(大盘版行业版 v1行业版 v2)。如果用 autoresearch 的范式 + 写一个 program.md一晚 100 个版本不是梦

局限:创造力的天花板

autoresearch 自动化方法论。但 Karpathy 自己也很清楚:创造力的天花板还在人那里

DataCamp 的原话:"AutoResearch right now automates the methodical part of ML research: running and evaluating hundreds of small experiments. The creative part — picking the right research direction, framing the question — still needs human intent."

100 实验/晚意味着 100 次确认你 prior 的机会,不是 100 个发现。AutoResearch 是你研究品味的放大器,不是替代品。

5 件立即可做的事

如果你看完也想动手:

  1. 装上 uvcurl -LsSf https://astral.sh/uv/install.sh | sh
  2. Clone & 试单次git clone https://github.com/karpathy/autoresearch && cd autoresearch && uv sync && uv run prepare.py && uv run train.py(5 分钟)
  3. 写第一份 program.md:用 Markdown 描述你的实验方向 —— 这就是"研究组织代码"
  4. 拉 Claude Code 或 OpenAI Codex:在仓库里启动,prompt 它"读 program.md 然后开始"
  5. 让它跑一晚:第二天 review results.tsv + diff 历史

完整项目代码:github.com/karpathy/autoresearch(MIT,630 LOC,92.3k stars)。

三个 Takeaway

完整调研(Obsidian 笔记)

更长的深度研究版本在 Obsidian vault 里: