OpenHands 1.0 发布:开源编程 Agent 终于能进生产了

2026-09-16 开源Agent编程自托管

All Hands AI 在 9 月 8 日把 OpenHands 推到 1.0。它就是之前那个 OpenDevin,从一个社区实验正式变成「工程团队能部署到生产」的自主编程 Agent。最关键的不是版本号,是它终于把三件事做成了系统级保证,而不是文档里的建议。

数字先放一边:配 Qwen3-Coder-480B 在 SWE-bench Verified 上解掉 68% 的任务,配 Claude Sonnet 4.5 开 extended thinking 能到 72%。这两个分数都和同榜的商业编程 Agent 持平甚至更高,但基础设施成本低一大截。

对一个人公司真正有用的三件事:

  • Docker 沙箱是默认隔离,不是选项。 每个任务都在独立容器里跑,CPU、内存、网络都能按会话限死。自主编程 Agent 要边写边跑测试、装包、起服务,没有隔离就是在拿主机安全开玩笑——这点 OpenHands 当成系统保证来做。
  • BYOM(自带模型)。 模型选择是配置项,不是架构约束。本地模型、商业 API、主权云模型都能接。对代码不能出内网的人,这意味着可以在自己机器上把整套流程跑完,上下文一句都不出本地。
  • 成本可算。 自托管跑在 H100 上,每个解掉的任务大约 0.2–1.05 美元。量大(批量修已知 issue、跑测试、写集成代码)时,比订阅制按人头收费划算得多。

几个要泼的冷水:

  • 68% 是「配 Qwen3-Coder-480B」这个前提下,不是随便挂个模型就这分数。底座弱了,Agent 框架也救不回来。
  • 它解决的是「工程任务自动化」,不是「改一行代码」。想拿它替代日常结对编程,先把任务边界划清楚。
  • 1.0 刚出,插件系统和资源限额这些能力需要你真跑一遍才知道踩不踩坑。

我的建议:如果你手上有「每月重复几十次」的工程杂活(已知 bug 批量修、测试套件、routine refactor),值得现在就用 Docker 沙箱 + 一个开源模型自托管试一轮。重点不是追 72% 的榜单数字,是把「可隔离、可锁版本、成本可算」当成纪律用起来——这三条才是它从玩具变工具的分界线。

原文出处 · 事实以此为准
TechPillow · OpenHands 1.0
阅读原文 ↗