AI应用测试
传统软件测试依赖确定性:给定输入,固定输出,测试通过即代表代码正确。但将语言模型集成到应用中后,这种模式彻底瓦解。同样的提示词两次,得到不同回答,有时正确,有时微妙的错误,甚至出现自信的幻觉文本,却没有任何错误提示。对于非确定性行为,传统断言测试已无能为力。由此,“评估”(Eval)应运而生:它不再判断“输出是否等于预期”,而是测量“在代表性样本上,模型行为正确率是否满足阈值”。Eval 让开发者能在非确定性环境下迭代改进 AI 功能,而非因恐惧停滞。作为例证,作者为妻子税务事务所构建了客户留言分类系统,并演示了如何为实际应用编写完整的端到端评估测试。 #AI #软件测试 #大语言模型 #评估 #Eval #确定性 #科技
传统软件测试依赖确定性:给定输入,固定输出,测试通过即代表代码正确。但将语言模型集成到应用中后,这种模式彻底瓦解。同样的提示词两次,得到不同回答,有时正确,有时微妙的错误,甚至出现自信的幻觉文本,却没有任何错误提示。对于非确定性行为,传统断言测试已无能为力。由此,“评估”(Eval)应运而生:它不再判断“输出是否等于预期”,而是测量“在代表性样本上,模型行为正确率是否满足阈值”。Eval 让开发者能在非确定性环境下迭代改进 AI 功能,而非因恐惧停滞。作为例证,作者为妻子税务事务所构建了客户留言分类系统,并演示了如何为实际应用编写完整的端到端评估测试。 #AI #软件测试 #大语言模型 #评估 #Eval #确定性 #科技
推出多 LLM AI 工作空间,发布桌面应用与代理工具
正式推出全新 AI 工作空间,整合多 LLM 代理、结构化项目工作流与持久化上下文,覆盖软件开发、研究、商业等领域。同时发布桌面应用 Beta 版(支持 macOS、Windows、Linux)、CLI 工具及开发者库。其多 LLM 代理库 @compilr-dev/agents 已更新至 v0.6,支持 9 个供应商、21 种工具和 13 项技能;代码分析库 @compilr-dev/agents-coding 达到 v1.0,提供 TypeScript、Python、Go 等语言的 AST 解析、Git 操作、智能运行器等 60 余种工具。所有产品共享同一引擎,用户可使用自己的 API 密钥,实现多代理团队协作、视觉模型编辑和跨会话上下文保持。 #AI #LLM #工作空间 #开发工具 #开源 #CLI #代理 #代码分析 #Compilr
正式推出全新 AI 工作空间,整合多 LLM 代理、结构化项目工作流与持久化上下文,覆盖软件开发、研究、商业等领域。同时发布桌面应用 Beta 版(支持 macOS、Windows、Linux)、CLI 工具及开发者库。其多 LLM 代理库 @compilr-dev/agents 已更新至 v0.6,支持 9 个供应商、21 种工具和 13 项技能;代码分析库 @compilr-dev/agents-coding 达到 v1.0,提供 TypeScript、Python、Go 等语言的 AST 解析、Git 操作、智能运行器等 60 余种工具。所有产品共享同一引擎,用户可使用自己的 API 密钥,实现多代理团队协作、视觉模型编辑和跨会话上下文保持。 #AI #LLM #工作空间 #开发工具 #开源 #CLI #代理 #代码分析 #Compilr
AI无法被消除,与其抵制不如积极应对
一篇题为“AI sucks. Hating it is not enough”的个人评论文章引发讨论。作者指出,许多人对AI感到愤怒并试图抵制,但AI带来的风险是真实存在的,且无法被“发明”或“抵制”掉,监管的效力也有限。作者本人是技术专家与环保主义者,曾为应对气候变化奉献一切,如今却看到同行因AI问题撕裂。他呼吁反对者放下偏激,承认AI将深刻改变世界,与其消极抵制,不如主动塑造未来,在承认其存在的前提下争取更公平、更可持续的发展路径。文章强调:对AI的恐惧合理,但纯情绪化抵制无效,需要务实且高远的行动。 #AI #人工智能 #技术伦理 #科技评论 #抵制无效 #未来塑造 #社会分歧
一篇题为“AI sucks. Hating it is not enough”的个人评论文章引发讨论。作者指出,许多人对AI感到愤怒并试图抵制,但AI带来的风险是真实存在的,且无法被“发明”或“抵制”掉,监管的效力也有限。作者本人是技术专家与环保主义者,曾为应对气候变化奉献一切,如今却看到同行因AI问题撕裂。他呼吁反对者放下偏激,承认AI将深刻改变世界,与其消极抵制,不如主动塑造未来,在承认其存在的前提下争取更公平、更可持续的发展路径。文章强调:对AI的恐惧合理,但纯情绪化抵制无效,需要务实且高远的行动。 #AI #人工智能 #技术伦理 #科技评论 #抵制无效 #未来塑造 #社会分歧
Anthropic 推出 Claude Tag,深化企业级 AI 协作布局
Anthropic 于周二在 Salesforce 旗下的 Slack 办公通讯应用中正式推出全新人工智能代理产品 Claude Tag,进一步深化其在企业级市场的布局。此前 Anthropic 已在 Slack 中提供 Claude 服务,但功能相对有限。Claude Tag 可视为一款 AI 代理,能够直接嵌入 Slack 工作流,协助用户执行复杂任务、自动回复消息、管理项目等,显著提升团队协作效率。这一举措表明 Anthropic 正加速进军企业服务领域,与 OpenAI、微软等对手展开竞争。企业级 AI 市场已成为各大 AI 初创公司的核心战场,Claude Tag 的推出有望巩固 Anthropic 在企业协作场景中的优势,推动 AI 代理从通用对话向业务深度集成演进。 #Anthropic #ClaudeTag #Slack #企业级AI #AI代理 #协作 #科技新闻 #人工智能
Anthropic 于周二在 Salesforce 旗下的 Slack 办公通讯应用中正式推出全新人工智能代理产品 Claude Tag,进一步深化其在企业级市场的布局。此前 Anthropic 已在 Slack 中提供 Claude 服务,但功能相对有限。Claude Tag 可视为一款 AI 代理,能够直接嵌入 Slack 工作流,协助用户执行复杂任务、自动回复消息、管理项目等,显著提升团队协作效率。这一举措表明 Anthropic 正加速进军企业服务领域,与 OpenAI、微软等对手展开竞争。企业级 AI 市场已成为各大 AI 初创公司的核心战场,Claude Tag 的推出有望巩固 Anthropic 在企业协作场景中的优势,推动 AI 代理从通用对话向业务深度集成演进。 #Anthropic #ClaudeTag #Slack #企业级AI #AI代理 #协作 #科技新闻 #人工智能
Semgrep Guardian
两年前,生产环境代码仍由人类逐行编写,如今这一局面已被颠覆。AI助手的普及使传统工程师产出代码量激增,而代码审查却大幅减少;同时,从未写过代码的公民开发者也开始每日向生产环境推送关联客户数据的软件。未经审查的代码量急剧上升,前沿模型加速了漏洞发现与利用,应用安全团队面临的漏洞数量已是两年前的10倍。传统人工审查有限,且多数工具在代码写入后于CI/CD阶段运行,为时已晚。Semgrep Guardian应运而生,作为专门用于智能体代码安全的解决方案,它实时扫描并修复AI生成代码中的漏洞、恶意包和硬编码密钥。Guardian运行于IDE内,已集成Cursor、Claude Code、GitHub Copilot等工具,支持MCP服务器。部署仅需一下午,无需安装软件即可覆盖数百名开发者。目前Guardian每周运行超300万次扫描,95%在5秒内完成。一家B2B SaaS公司部署后,每周自动拦截超过180个关键漏洞,这些漏洞此前会被遗漏至开发流程后期。 #AI安全 #代码安全 #Semgrep #AI生成代码 #网络安全 #DevSecOps #应用安全
两年前,生产环境代码仍由人类逐行编写,如今这一局面已被颠覆。AI助手的普及使传统工程师产出代码量激增,而代码审查却大幅减少;同时,从未写过代码的公民开发者也开始每日向生产环境推送关联客户数据的软件。未经审查的代码量急剧上升,前沿模型加速了漏洞发现与利用,应用安全团队面临的漏洞数量已是两年前的10倍。传统人工审查有限,且多数工具在代码写入后于CI/CD阶段运行,为时已晚。Semgrep Guardian应运而生,作为专门用于智能体代码安全的解决方案,它实时扫描并修复AI生成代码中的漏洞、恶意包和硬编码密钥。Guardian运行于IDE内,已集成Cursor、Claude Code、GitHub Copilot等工具,支持MCP服务器。部署仅需一下午,无需安装软件即可覆盖数百名开发者。目前Guardian每周运行超300万次扫描,95%在5秒内完成。一家B2B SaaS公司部署后,每周自动拦截超过180个关键漏洞,这些漏洞此前会被遗漏至开发流程后期。 #AI安全 #代码安全 #Semgrep #AI生成代码 #网络安全 #DevSecOps #应用安全
Anthropic 推出 Claude Tag
Anthropic 近日发布 Claude Tag,这是一个始终在线的 Claude 实例,集成于 Slack 频道中,可像团队成员一样参与讨论。它能够读取频道上下文、加入线程、与其他用户互动,并支持两种工作模式:被动回应或主动介入。用户可通过 @Claude 提任务、提问或获取回应,所有对话对频道内成员可见。该 AI 具备自主代理能力,能分解任务、使用工具并异步完成工作,同时持续学习频道中的信息,无需重复解释。Anthropic 表示,其产品团队 65% 的代码已由内部版 Claude Tag 生成。Claude Tag 还能充当教练或任务管理者,在频道中跟进未完成事宜,提升团队协作效率。 #Anthropic #Claude #Slack #AI助手 #企业AI #智能代理 #协作工具 #科技新闻
Anthropic 近日发布 Claude Tag,这是一个始终在线的 Claude 实例,集成于 Slack 频道中,可像团队成员一样参与讨论。它能够读取频道上下文、加入线程、与其他用户互动,并支持两种工作模式:被动回应或主动介入。用户可通过 @Claude 提任务、提问或获取回应,所有对话对频道内成员可见。该 AI 具备自主代理能力,能分解任务、使用工具并异步完成工作,同时持续学习频道中的信息,无需重复解释。Anthropic 表示,其产品团队 65% 的代码已由内部版 Claude Tag 生成。Claude Tag 还能充当教练或任务管理者,在频道中跟进未完成事宜,提升团队协作效率。 #Anthropic #Claude #Slack #AI助手 #企业AI #智能代理 #协作工具 #科技新闻
AI生成UI默认不可访问
当前,AI代码生成工具(如Claude Code、Codex、Cursor)可在8秒内生成React侧边栏组件,视觉上看似完美:流畅的悬停状态、旋转的V形图标、和谐间距。但检查浏览器的无障碍树会发现,根侧元素树接收到的角色为"通用"、名称为"无"、可聚焦性为"假"。对于屏幕阅读器用户、键盘导航者和语音控制用户而言,该组件实际上不存在。这是因为大多数大语言模型优化视觉输出,却为辅助技术读取的层生成近乎零的语义信息。本文阐述了架构原因,并提出五层强制系统,包括静态分析、运行时测试、CI集成和可访问组件抽象,使语义正确性自动实现而非空想。示例使用React和Tailwind,但无障碍树关注的是接收到的DOM,而非框架。值得注意的是,Vercel的v0等专业工具已开始将可访问原语硬编码到生成管道中,输出基于Radix的shadcn/ui组件,继承其无障碍合约。但v0是例外,ChatGPT、Claude、Copilot、Cursor等通用工具仍生成本文剖析的<div>汤。即使v0的输出也需验证层确认实际运行效果。测试显示,29行代码中存在10种不同故障,几乎每个元素语义错误且故障叠加。屏幕阅读器用户听到的是平坦、无结构的文本,无交互提示。过去两个月测试中,<div onClick>替代<button>或<a>普遍存在,ARIA状态属性缺失、键盘处理缺失、地标缺失、图标无文本替代等问题几乎无处不在。通用AI工具虽有改进,但默认输出仍不可访问,需系统强制。 #AI #无障碍 #前端开发 #React #语义HTML #代码生成 #大模型 #可访问性
当前,AI代码生成工具(如Claude Code、Codex、Cursor)可在8秒内生成React侧边栏组件,视觉上看似完美:流畅的悬停状态、旋转的V形图标、和谐间距。但检查浏览器的无障碍树会发现,根侧元素树接收到的角色为"通用"、名称为"无"、可聚焦性为"假"。对于屏幕阅读器用户、键盘导航者和语音控制用户而言,该组件实际上不存在。这是因为大多数大语言模型优化视觉输出,却为辅助技术读取的层生成近乎零的语义信息。本文阐述了架构原因,并提出五层强制系统,包括静态分析、运行时测试、CI集成和可访问组件抽象,使语义正确性自动实现而非空想。示例使用React和Tailwind,但无障碍树关注的是接收到的DOM,而非框架。值得注意的是,Vercel的v0等专业工具已开始将可访问原语硬编码到生成管道中,输出基于Radix的shadcn/ui组件,继承其无障碍合约。但v0是例外,ChatGPT、Claude、Copilot、Cursor等通用工具仍生成本文剖析的<div>汤。即使v0的输出也需验证层确认实际运行效果。测试显示,29行代码中存在10种不同故障,几乎每个元素语义错误且故障叠加。屏幕阅读器用户听到的是平坦、无结构的文本,无交互提示。过去两个月测试中,<div onClick>替代<button>或<a>普遍存在,ARIA状态属性缺失、键盘处理缺失、地标缺失、图标无文本替代等问题几乎无处不在。通用AI工具虽有改进,但默认输出仍不可访问,需系统强制。 #AI #无障碍 #前端开发 #React #语义HTML #代码生成 #大模型 #可访问性
Claude Tag 上线,Slack 协作迈入 AI 代理时代
Anthropic 旗下 AI 助手 Claude 推出新功能 Claude Tag,允许团队在 Slack 中将 Claude 添加为团队成员,并赋予其特定频道和工具访问权限。用户可直接在对话中标记 Claude 委派任务,如会议总结、回复起草或文档分析,无需切换平台。早期采用者报告项目周转速度加快,常规分析和内容生成效率显著提升。该功能通过管理员权限设置控件满足企业对数据隐私的担忧。分析认为,这标志着 AI 代理从独立工具向集成协作者转型,预计类似功能将在未来两年内扩展到 Microsoft Teams 等平台。实施挑战包括培训团队有效提出请求及设定 AI 决策边界,行业建议创建最佳实践手册。在监管合规方面,公司需审计数据流向并保持人类监督。 #ClaudeTag #Slack #AI助手 #协作工具 #企业效率 #Anthropic #人工智能
Anthropic 旗下 AI 助手 Claude 推出新功能 Claude Tag,允许团队在 Slack 中将 Claude 添加为团队成员,并赋予其特定频道和工具访问权限。用户可直接在对话中标记 Claude 委派任务,如会议总结、回复起草或文档分析,无需切换平台。早期采用者报告项目周转速度加快,常规分析和内容生成效率显著提升。该功能通过管理员权限设置控件满足企业对数据隐私的担忧。分析认为,这标志着 AI 代理从独立工具向集成协作者转型,预计类似功能将在未来两年内扩展到 Microsoft Teams 等平台。实施挑战包括培训团队有效提出请求及设定 AI 决策边界,行业建议创建最佳实践手册。在监管合规方面,公司需审计数据流向并保持人类监督。 #ClaudeTag #Slack #AI助手 #协作工具 #企业效率 #Anthropic #人工智能
如何用Claude Code创建强大的自动循环
在编码代理的使用中,“循环”概念正受到广泛关注。它让代理以自我验证的循环模式工作,从而实现更高程度的自主性。与过去需要频繁介入、手动验证每个步骤的用法不同,循环允许人类更多充当后台角色,代理能端到端地完成任务,大幅提高工作效率。例如,在无循环场景下,两个代理会反复打断你要求确认,你只能同时处理有限任务;而在循环模式下,每个代理被设定目标后自行验证并修复错误,只在完成后才报告,你可以同时启动更多代理。实现这种循环的最简单方法是使用 `/goal` 命令,例如在Claude Code或Codex中定义目标并指定验证方式(如通过Playwright MCP进行端到端浏览器点击测试),代理就会持续工作直至目标达成。 #ClaudeCode #编码代理 #循环 #AI工具 #自动化 #编程效率 #开发实践
在编码代理的使用中,“循环”概念正受到广泛关注。它让代理以自我验证的循环模式工作,从而实现更高程度的自主性。与过去需要频繁介入、手动验证每个步骤的用法不同,循环允许人类更多充当后台角色,代理能端到端地完成任务,大幅提高工作效率。例如,在无循环场景下,两个代理会反复打断你要求确认,你只能同时处理有限任务;而在循环模式下,每个代理被设定目标后自行验证并修复错误,只在完成后才报告,你可以同时启动更多代理。实现这种循环的最简单方法是使用 `/goal` 命令,例如在Claude Code或Codex中定义目标并指定验证方式(如通过Playwright MCP进行端到端浏览器点击测试),代理就会持续工作直至目标达成。 #ClaudeCode #编码代理 #循环 #AI工具 #自动化 #编程效率 #开发实践