https://openai.com/index/harness-engineering/
总结:OpenAI 的 Harness Engineering 实验核心成果
- 5 个月:从零开始构建了一个拥有 百万行代码 的产品
- 0 行手写代码:所有代码都由 Codex(AI)生成
- 效率提升:估计节省了 90% 的时间
- 团队规模:仅 3-7 名工程师,平均每天 3.5 个 PR/人核心理念
人类指挥,AI 执行
工程师不再写代码,而是:
- 设计环境
- 描述意图
- 构建反馈循环学到的关键经验1. 工程师的新角色
不是写代码,而是:
- 把大目标拆解成小块
- 给 Agent 提供它需要的工具和抽象
- 问:"缺了什么能力?如何让 Agent 能理解和执行?"2. 不要给 Agent 1000 页手册
- 上下文是稀缺资源
- 大文件会淹没任务本身
- 解决方案:把 AGENTS.md 做成目录,具体文档放在 docs/ 目录3. 让应用对 Agent 可读
- 用 git worktree 让 Agent 能在每个变更上启动独立实例
- 接入 Chrome DevTools Protocol,让 Agent 能截图、操作 DOM
- 把日志、指标通过 LogQL/PromQL 暴露给 Agent
- 效果:Agent 可以自己调试 bug、验证修复4. 严格的架构约束
- 每个业务域固定分层:Types → Config → Repo → Service → Runtime → UI
- 用自定义 linter 机械强制执行
- 这是以前几百人团队才做的架构,现在是 Agent 时代的必要前提5. 代码规范靠「垃圾回收」
- AI 会复制已有的模式(包括坏的)
- 每周人工清理不现实
- 解决方案:写「黄金原则」规则 + 定期后台任务自动扫描并修复6. PR 流程变化
- Agent 可以自己 review、响应反馈、合并
- 人类可以不审查,交给 agent-to-agent 流程
- 测试 flaking 就多跑几次,不阻塞现在 Agent 能做什么?
给定一个 prompt,Agent 可以:
1. 验证代码状态
2. 复现 bug
3. 实现修复
4. 验证修复
5. 打开 PR
6. 响应反馈
7. 检测构建失败并修复
8. 只有需要人类判断时才 escalation
9. 自己合并未来挑战
- 多年后架构如何演进?
- 人类判断如何编码成可组合的规则?
- 随着模型更强,系统如何进化?
一句话总结:这篇文章展示了 OpenAI 用 AI 替代人类写代码的真实实验,核心不是 AI 写代码本身,而是如何设计让 AI 能高效工作的环境和反馈系统。
总结:OpenAI 的 Harness Engineering 实验核心成果
- 5 个月:从零开始构建了一个拥有 百万行代码 的产品
- 0 行手写代码:所有代码都由 Codex(AI)生成
- 效率提升:估计节省了 90% 的时间
- 团队规模:仅 3-7 名工程师,平均每天 3.5 个 PR/人核心理念
人类指挥,AI 执行
工程师不再写代码,而是:
- 设计环境
- 描述意图
- 构建反馈循环学到的关键经验1. 工程师的新角色
不是写代码,而是:
- 把大目标拆解成小块
- 给 Agent 提供它需要的工具和抽象
- 问:"缺了什么能力?如何让 Agent 能理解和执行?"2. 不要给 Agent 1000 页手册
- 上下文是稀缺资源
- 大文件会淹没任务本身
- 解决方案:把 AGENTS.md 做成目录,具体文档放在 docs/ 目录3. 让应用对 Agent 可读
- 用 git worktree 让 Agent 能在每个变更上启动独立实例
- 接入 Chrome DevTools Protocol,让 Agent 能截图、操作 DOM
- 把日志、指标通过 LogQL/PromQL 暴露给 Agent
- 效果:Agent 可以自己调试 bug、验证修复4. 严格的架构约束
- 每个业务域固定分层:Types → Config → Repo → Service → Runtime → UI
- 用自定义 linter 机械强制执行
- 这是以前几百人团队才做的架构,现在是 Agent 时代的必要前提5. 代码规范靠「垃圾回收」
- AI 会复制已有的模式(包括坏的)
- 每周人工清理不现实
- 解决方案:写「黄金原则」规则 + 定期后台任务自动扫描并修复6. PR 流程变化
- Agent 可以自己 review、响应反馈、合并
- 人类可以不审查,交给 agent-to-agent 流程
- 测试 flaking 就多跑几次,不阻塞现在 Agent 能做什么?
给定一个 prompt,Agent 可以:
1. 验证代码状态
2. 复现 bug
3. 实现修复
4. 验证修复
5. 打开 PR
6. 响应反馈
7. 检测构建失败并修复
8. 只有需要人类判断时才 escalation
9. 自己合并未来挑战
- 多年后架构如何演进?
- 人类判断如何编码成可组合的规则?
- 随着模型更强,系统如何进化?
一句话总结:这篇文章展示了 OpenAI 用 AI 替代人类写代码的真实实验,核心不是 AI 写代码本身,而是如何设计让 AI 能高效工作的环境和反馈系统。
OpenAI
Harness engineering: leveraging Codex in an agent-first world
By Ryan Lopopolo, Member of the Technical Staff
🦞 TrustMRR - OpenClaw 生态公司,TrustMRR 是一个追踪初创公司营收数据的平台 https://trustmrr.com/special-category/openclaw
TrustMRR
OpenClaw startups - Verified revenue on TrustMRR
OpenClaw is an open-source, local-first AI bot ecosystem where users can launch assistants without coding and connect them to tools like Telegram, Discord, and Zoom. This page tracks startups built with OpenClaw.
The Web Data API for AI - Turn entire websites into LLM-ready markdown or structured data https://github.com/firecrawl/firecrawl
GitHub
GitHub - firecrawl/firecrawl: The context API to search, scrape, and interact with the web at scale. 🔥
The context API to search, scrape, and interact with the web at scale. 🔥 - firecrawl/firecrawl