sunny.logs
3 subscribers
41 photos
5 files
62 links
$ tail -f /var/log/sunny
Download Telegram
一个很实用,很 vibe 的小工具!👍 https://agentation.dev/
Please open Telegram to view this post
VIEW IN TELEGRAM
1
https://openai.com/index/harness-engineering/

总结:OpenAI 的 Harness Engineering 实验核心成果
- 5 个月:从零开始构建了一个拥有 百万行代码 的产品
- 0 行手写代码:所有代码都由 Codex(AI)生成
- 效率提升:估计节省了 90% 的时间
- 团队规模:仅 3-7 名工程师,平均每天 3.5 个 PR/人核心理念
人类指挥,AI 执行
工程师不再写代码,而是:
- 设计环境
- 描述意图
- 构建反馈循环学到的关键经验1. 工程师的新角色
不是写代码,而是:
- 把大目标拆解成小块
- 给 Agent 提供它需要的工具和抽象
- 问:"缺了什么能力?如何让 Agent 能理解和执行?"2. 不要给 Agent 1000 页手册
- 上下文是稀缺资源
- 大文件会淹没任务本身
- 解决方案:把 AGENTS.md 做成目录,具体文档放在 docs/ 目录3. 让应用对 Agent 可读
- 用 git worktree 让 Agent 能在每个变更上启动独立实例
- 接入 Chrome DevTools Protocol,让 Agent 能截图、操作 DOM
- 把日志、指标通过 LogQL/PromQL 暴露给 Agent
- 效果:Agent 可以自己调试 bug、验证修复4. 严格的架构约束
- 每个业务域固定分层:Types → Config → Repo → Service → Runtime → UI
- 用自定义 linter 机械强制执行
- 这是以前几百人团队才做的架构,现在是 Agent 时代的必要前提5. 代码规范靠「垃圾回收」
- AI 会复制已有的模式(包括坏的)
- 每周人工清理不现实
- 解决方案:写「黄金原则」规则 + 定期后台任务自动扫描并修复6. PR 流程变化
- Agent 可以自己 review、响应反馈、合并
- 人类可以不审查,交给 agent-to-agent 流程
- 测试 flaking 就多跑几次,不阻塞现在 Agent 能做什么?
给定一个 prompt,Agent 可以:
1. 验证代码状态
2. 复现 bug
3. 实现修复
4. 验证修复
5. 打开 PR
6. 响应反馈
7. 检测构建失败并修复
8. 只有需要人类判断时才 escalation
9. 自己合并未来挑战
- 多年后架构如何演进?
- 人类判断如何编码成可组合的规则?
- 随着模型更强,系统如何进化?
一句话总结:这篇文章展示了 OpenAI 用 AI 替代人类写代码的真实实验,核心不是 AI 写代码本身,而是如何设计让 AI 能高效工作的环境和反馈系统。