OpenResearch:把 Claude Code / Codex 改造成并行研究 Agent 的本地工作台

AI
Agent
科研
开源
自动化
2026/9/29
·

阅读时间: 大约 9 分钟

OpenResearch:把 Claude Code / Codex 改造成并行研究 Agent 的本地工作台

OpenResearch 本地工作台:每个研究方向是一条独立实验线

当大家还在争论”通用 coding agent 能不能自己做科研”时,alphaXiv 给出了一个更务实的答案:不重新造一个 agent,而是把现成的通用 coding agent(Claude Code、Codex、OpenCode、Cursor、Google Antigravity)专用化成研究 agent。这个叫 OpenResearch(CLI 命令 orx)的 local-first 工作台,让每个研究方向拥有自己的 agent 会话和隔离的 git worktree,并行地读文献、提假设、跑实验、产出研究物。本文基于其官网与 GitHub README,拆解它的机制、适用面与现实门槛。

一、背景:为什么要”专用化”而非”重造”

做科研的 agent 和写业务代码的 agent 不是一回事:前者要反复读论文、改实验脚本、记录每一次超参变体、保留可复现的实验谱系。OpenResearch 的思路是站在成熟 coding agent 肩膀上——这些 agent 已经有了工具调用、终端操作、代码编辑能力,缺的是一套研究工作流的骨架:并行隔离、实验树、证据归档、多算力后端。OpenResearch 补的就是这层骨架,而不是再训练一个模型。

二、它是什么:local-first 的研究工作台

orx up 会在本地起一个 dashboard(http://127.0.0.1:4791),配本地 SQLite 存储。核心承诺是”项目、对话、实验、运行、日志、代码和产物都留在你自己的机器上”——建项目、跑 run 都不会把代码发布出去。openresearch.sh 账号只用于组织和托管算力这类服务端能力。

它给研究 agent 提供了六件事(官方 README 自述):

  • 并行探索:每个研究方向一个独立 agent 会话 + 隔离 git worktree;
  • 可复现实验:在 git 原生的实验树里追踪变体,每次 run 都收到对应 commit 的不可变归档;
  • 证据在上下文中:日志、diff、文件、结果、产物都和产生它们的那次工作绑定;
  • agent 可选:每个会话自己选 harness 和模型——Claude Code、Codex、OpenCode、Cursor、Antigravity 都行;
  • 算力可选:本地、自有基础设施,或托管算力;
  • 本地所有权:数据不离开本机。

三、Autoresearch:闭环自动化

OpenResearch 可以把整个研究闭环自动跑起来:提想法 → 改代码 → 发起实验 → 检查证据 → 决定下一步试什么。多个 agent 并行探索不同方向,实验树保留它们的谱系。官网首屏就展示了这样一棵实验树:Baseline(复现论文,1 run)、Experiment(测更长上下文窗口,3 runs)、Sweep(扫优化器与调度,8 runs)、Experiment(收紧评测 harness,4 runs)、Ablate(消融正则项,5 runs)——一眼能看清每条方向跑了几轮、当前状态如何。

四、关键工程事实

项值
出品方alphaXiv
技术栈Rust 69% + TypeScript 25%
许可证MIT
版本v0.2.13,已发 134 个 release,22 位贡献者
本地入口orx up → 127.0.0.1:4791,SQLite
支持的 agentClaude Code / Codex / OpenCode / Cursor / Antigravity
算力后端本地、SSH、Slurm、Kubernetes、Ray、Hugging Face Jobs、Modal、Tinker、托管算力
本地模型可接 LM Studio、oMLX、Ollama 或自定义 OpenCode 端点

常用命令包括 orx projects、orx runs、orx logs <run-id>、orx exp run、orx discover keyword <query>、orx paper <arxiv-id-or-doi>,并用 orx install-skills 把 OpenResearch 技能装进支持的 coding agent。同一份 commit 快照可以在本地、SSH、Slurm、K8s、Ray、Modal 等环境间搬迁,不需要先把仓库 publish。

五、口径与现实门槛

  1. Windows 仍是 beta 且未签名:Windows 安装包需要先装 Git for Windows,安装包未签名,系统会弹”Windows 已保护你的电脑”,要手动选”更多信息→仍要运行”。macOS 托管设备上的 CLI 也可能被设备管理策略拦截,需用已公证的 App 版。
  2. 远程服务无应用层鉴权:orx up --remote user@host 把工作台放在远端 GPU 旁、浏览器在本地,但远程服务只绑回环、没有应用级认证——同一台机器上的其他用户能访问它。官方明说了这一点,多租户服务器上要自行加保护。
  3. 遥测默认开启但可关:官方 release 版会发送 opt-out 的粗粒度使用事件(绑随机安装 ID,不含代码/提示词/文件内容/路径/仓库名/token/邮箱),orx telemetry off 关闭;源码构建不带遥测。
  4. 它不替你判断”研究值不值得做”:Autoresearch 闭环强在执行与归档,选题质量、假设是否成立,仍依赖你接入的 agent 模型本身和你给的初始方向。
  5. 成熟度:134 个 release 说明迭代极快,但版本号还在 0.2.x、Windows beta,工作流可能仍在快速变动,别当生产级稳定平台用。

六、适用与不适用

适合:需要并行扫多个实验方向、又想保留 git 级可复现谱系的研究者/小团队;已有 Slurm 或 Modal 算力、想让通用 coding agent 接手文献复现与超参扫描的人;重视数据本地所有权、不想把代码和实验记录交给云 SaaS 的团队。

不适合:想要”开箱即用的 AI 研究员”、不愿自己配 agent 和算力后端的用户;Windows 上追求签名/企业级稳定的环境;多租户共享服务器上直接暴露远程工作台而不加额外鉴权的做法。

七、它意味着什么

OpenResearch 的路线判断值得记一笔:在”自研科研大模型”和”调 API 做问答”之间,它选了第三条路——把成熟 coding agent 当大脑,用一层 local-first 的工程骨架把并行、隔离、可复现、多算力这些研究工作流需求补齐。这比从零训一个科研 agent 务实得多,也解释了它为什么能同时兼容五家 coding agent。对学术界和小团队而言,这类工具正在把”并行跑十几个实验变体、保留每一次 commit 证据”从实验室工程师的手工活,变成一个本地 dashboard 里的并行队列。它离”自动做出有价值的新发现”还很远,但已经把”并行试错 + 可复现归档”这层基础设施铺好了。

参考来源