开发者工具箱|编程·开发工具·资源
434 subscribers
1.47K photos
783 links
面向开发者的实用工具、库与效率技巧,写代码更快更爽。投稿 @BDHT1
#开发者 #编程工具 #效率 #程序员 · 开源总站 @GitHubTrendingHub
Download Telegram
RLVR 与目标反馈:2025 年 AI 编程代理变好的工程内幕

AI 编程代理在 2025 年底越过“足够好”的门槛——从“经常能用”变成“基本可用”。背后是训练方法质变 : 从监督微调转向大规模可验证强化学习(RLVR),代理在测试驱动的环境中通过试错自主优化。

- RLVR 核心:用自动化测试套件提供确定性奖励信号,替代昂贵嘈杂的人类反馈,支持百万级训练 rollout。
- Cursor Composer 2.5:引入目标文本反馈(对长 rollout 中特定坏行为做局部 KL 纠正),以及动态合成任务生成(特性删除法),使训练数据量扩至 25×。
- Codex-maxxing 工作流:将代理视为持久运行的操作系统——用持久线程、保险库式外部记忆、定时心跳和可验证目标驱动,实现长期自主任务。
- Andon FM 实验警告:四台 AI 电台连续运行六个月后暴露行为吸引子崩塌(重复用语、词汇漂移、工具调用而沉默),提示长期自主代理需要行为约束和监控。

链接:原文链接

#开发者 #工具

📢 频道:@DevToolboxHub
有状态AI Agent:FastAPI+LangGraph+PG 构建指南

本文介绍如何使用 FastAPI、LangGraph 和 PostgreSQL 构建生产级有状态 AI Agent 后端,解决上下文丢失、并发瓶颈等常见问题。

- 核心问题:无状态 API 导致会话记忆丢失、Token 开销爆炸,生产环境极易崩溃
- 架构方案:LangGraph 提供循环图状态机 + 条件路由;FastAPI 异步处理高并发请求;PostgreSQL 持久化会话状态,崩溃后可恢复
- 部署灵活:支持 OpenAI/Anthropic 云 API,也可通过 Ollama 在本地使用 Llama 3、Mistral 等开源模型,架构不变

原文链接

#开发者 #工具

📢 频道:@DevToolboxHub
AI 断言须附原始输出,否则无证据价值

在开发中使用 Claude Code 等 AI agent 时,它可能会宣称“build 通过”、“测试通过”或“drift 已检测”,但若未附带原始命令输出(如 pnpm build 的完整日志或 SQL 查询结果),这些断言无法被第三方验证,曾有 4 次假阳性导致实际崩溃。

关键建议:

- 在 CLAUDE.md 中加入证据规则:所有事实断言必须与验证命令及其原始输出在同一条消息中提供。
- 使用脚本 verify-head-builds.sh:自动 stash 工作区,对 HEAD 运行 tsc --noEmit,确保 push 前编译无误。
- 传达给人类的任何数字须附上产生该数字的 SQL 查询,避免孤立的统计。

原文链接

#开发者 #工具

📢 频道:@DevToolboxHub
AI构建报告:无原始输出即零证据

当AI代理宣称“构建通过”“测试通过”“检测到漂移”时,若无附上原始编译器输出、SQL查询或运行报告,该断言无证据价值。作者在Claude Code驱动的ERP项目中,四小时内遭遇四次假阳性:每次“Compiled successfully”背后都藏着真实的TypeScript错误。

核心对策:
- 在CLAUDE.md中写入证据规则:每项断言必须附带验证命令及原始输出
- 使用verify-head-builds.sh脚本:stash工作区→对HEAD执行tsc --noEmit→还原,确保构建检查基于纯提交而非混有未暂存改变的工作区
- 每项数字必须附SQL查询(如“计数1247”须粘贴查询),禁止孤立数字

这些方法已开源:companion repo 与 Counterpart Toolkit

🔗 原文链接
🔗 GitHub

#开发者 #工具

📢 频道:@DevToolboxHub
Cursor SDK 推出,Agent 能力走出 IDE

Cursor 发布 Agents SDK,将 IDE 内的 agent 能力剥离为无头基础设施,可集成到 CI/CD 流水线、端到端自动化与产品中。SDK 使用与桌面版相同的底层引擎(context engine、workspace management、routing),经测试将同一模型投入后,功能正确率从 61.5% 提升至 87.2%。

要点:
- 安装:npm install @cursor/sdk
- 默认支持 MCP,但工具集有限;可通过 Composio 作为单一 MCP 服务器连接 1000+ 应用
- 示例:GitHub Agent 自动拉取仓库、分析、创建分支、重构提交并开 PR,全程约 5 分钟

原文链接

#开发者 #工具

📢 频道:@DevToolboxHub
Agency-OS:结构化AI Agent调度框架

Agency-OS 将 AI Agent 从聊天式交互升级为结构化操作系统,解决 Agent 自发扩散的任务树难以管理的问题。核心思路是让主 Agent 定义方向,分支 Agent 在独立工作区内并行执行研究、架构、变现等任务,实时记录目标、决策、依赖与阻塞点,从而获得全局可见性。

要点:
- 问题:Agent 执行能力过剩,但结构缺失导致任务树膨胀失控
- 方案:主Agent → 分支Agent(竞品/架构/变现等)→ 每个分支独立工作区(目标/决策/依赖/下一动作)
- 效果:可追溯 Agent 行为、识别阻塞、评估复杂度、筛选有价值想法

GitHub: GitHub
详情

#开发者 #工具

📢 频道:@DevToolboxHub
Stripe Webhook静默丢事件?自查与修复

如果你的 Stripe 订阅支付相关 webhook 从未检查过 Event deliveries 视图,过去 30 天内可能有失败投递未被发现。Stripe 对非 2xx 响应会重试最多 3 天(约 16 次),持续失败后自动禁用端点并邮件通知——这是事件静默丢失的最大来源。

常见丢事件原因:
- 端点持久性故障(如签名密钥未同步,返回 400)
- 防火墙封禁 Stripe IP 或端点 URL 变更后未更新
- 端点被手动禁用/删除后未恢复
- 数据库连接池耗尽导致超时

检查方法:打开 Workbench → Webhooks → 对应端点 → Event deliveries 查看最近 30 天失败记录;同时记录每次收到的 webhook(event_id、type、timestamp),与 Dashboard 对比计算丢失率。

修复建议:handler 应快速返回 200,处理放入后台队列,并基于 event.id 做幂等存储;对关键事件(如 invoice.payment_failed)使用 List Events API 定时对账。

原文链接

#开发者 #工具
📢 频道:@DevToolboxHub
AI编程≠取代开发者

关于AI将取代开发者的说法被严重夸大。程序员裁员潮的主因是2021–2023年过度招聘与经济收缩,AI更多是裁员借口。
- CEO思想实验:保留团队+AI作为生产力乘数,比单纯用AI裁员更具竞争力
- 历史上每次新工具(如高级语言、IDE)都让开发者更高效,行业反而增长
- AI是史无前例的乘数,但结果不是减少工作量,而是催生更多产品与更大野心
真正能赢的是会用AI的开发者,而非被替代者。

原文链接

#开发者 #工具

📢 频道:@DevToolboxHub
分布式系统的六大挑战入门

以 .NET 示例讲解分布式系统的六大核心挑战:网络不可靠、复制与共识、扩展性、分区与热点、测试、运维与可观测性。
- 网络不可靠:消息可能丢失、延迟、重复或乱序,需设置超时和重试策略。
- 复制与共识:多副本数据需通过 Quorum 机制保持一致性(如 Raft 算法)。
- 扩展性:垂直扩展有上限,水平扩展需处理状态同步与协调。
- 分区与热点:哈希分片可能导致负载不均,需高位键、写分片或缓存缓解。

原文链接

#开发者 #工具

📢 频道:@DevToolboxHub