AI代理安全需组合图而非仅SBOM,传统扫描无法发现组合风险
一篇题为“AI agent security needs a composition graph, not just an SBOM”的博文指出,传统软件组合分析(SCA)仅能扫描已知漏洞包,但无法揭示这些包如何被组合成具有敏感权限的AI代理。以Claude Code的iMessage插件为例,其底层包含MCP服务器、技能和91个npm包,单个组件看似安全,但组合后形成了可读取私人消息、发送文件、且技能可重写访问策略的代理,暴露于不可信输入的风险。作者扫描了官方Claude插件市场的62个清单、530个组件,发现124个已知漏洞集中出现在discord、telegram、fakechat和imessage四个消息通道插件中,而这些漏洞与敏感功能高度重叠,传统SBOM无法表达这种关联。文章呼吁采用组合图(composition graph)来评估AI代理的实际风险。 #AI安全 #组合图 #SBOM #软件供应链 #代理安全 #Claude #漏洞分析
一篇题为“AI agent security needs a composition graph, not just an SBOM”的博文指出,传统软件组合分析(SCA)仅能扫描已知漏洞包,但无法揭示这些包如何被组合成具有敏感权限的AI代理。以Claude Code的iMessage插件为例,其底层包含MCP服务器、技能和91个npm包,单个组件看似安全,但组合后形成了可读取私人消息、发送文件、且技能可重写访问策略的代理,暴露于不可信输入的风险。作者扫描了官方Claude插件市场的62个清单、530个组件,发现124个已知漏洞集中出现在discord、telegram、fakechat和imessage四个消息通道插件中,而这些漏洞与敏感功能高度重叠,传统SBOM无法表达这种关联。文章呼吁采用组合图(composition graph)来评估AI代理的实际风险。 #AI安全 #组合图 #SBOM #软件供应链 #代理安全 #Claude #漏洞分析
AI应用测试
传统软件测试依赖确定性:给定输入,固定输出,测试通过即代表代码正确。但将语言模型集成到应用中后,这种模式彻底瓦解。同样的提示词两次,得到不同回答,有时正确,有时微妙的错误,甚至出现自信的幻觉文本,却没有任何错误提示。对于非确定性行为,传统断言测试已无能为力。由此,“评估”(Eval)应运而生:它不再判断“输出是否等于预期”,而是测量“在代表性样本上,模型行为正确率是否满足阈值”。Eval 让开发者能在非确定性环境下迭代改进 AI 功能,而非因恐惧停滞。作为例证,作者为妻子税务事务所构建了客户留言分类系统,并演示了如何为实际应用编写完整的端到端评估测试。 #AI #软件测试 #大语言模型 #评估 #Eval #确定性 #科技
传统软件测试依赖确定性:给定输入,固定输出,测试通过即代表代码正确。但将语言模型集成到应用中后,这种模式彻底瓦解。同样的提示词两次,得到不同回答,有时正确,有时微妙的错误,甚至出现自信的幻觉文本,却没有任何错误提示。对于非确定性行为,传统断言测试已无能为力。由此,“评估”(Eval)应运而生:它不再判断“输出是否等于预期”,而是测量“在代表性样本上,模型行为正确率是否满足阈值”。Eval 让开发者能在非确定性环境下迭代改进 AI 功能,而非因恐惧停滞。作为例证,作者为妻子税务事务所构建了客户留言分类系统,并演示了如何为实际应用编写完整的端到端评估测试。 #AI #软件测试 #大语言模型 #评估 #Eval #确定性 #科技
推出多 LLM AI 工作空间,发布桌面应用与代理工具
正式推出全新 AI 工作空间,整合多 LLM 代理、结构化项目工作流与持久化上下文,覆盖软件开发、研究、商业等领域。同时发布桌面应用 Beta 版(支持 macOS、Windows、Linux)、CLI 工具及开发者库。其多 LLM 代理库 @compilr-dev/agents 已更新至 v0.6,支持 9 个供应商、21 种工具和 13 项技能;代码分析库 @compilr-dev/agents-coding 达到 v1.0,提供 TypeScript、Python、Go 等语言的 AST 解析、Git 操作、智能运行器等 60 余种工具。所有产品共享同一引擎,用户可使用自己的 API 密钥,实现多代理团队协作、视觉模型编辑和跨会话上下文保持。 #AI #LLM #工作空间 #开发工具 #开源 #CLI #代理 #代码分析 #Compilr
正式推出全新 AI 工作空间,整合多 LLM 代理、结构化项目工作流与持久化上下文,覆盖软件开发、研究、商业等领域。同时发布桌面应用 Beta 版(支持 macOS、Windows、Linux)、CLI 工具及开发者库。其多 LLM 代理库 @compilr-dev/agents 已更新至 v0.6,支持 9 个供应商、21 种工具和 13 项技能;代码分析库 @compilr-dev/agents-coding 达到 v1.0,提供 TypeScript、Python、Go 等语言的 AST 解析、Git 操作、智能运行器等 60 余种工具。所有产品共享同一引擎,用户可使用自己的 API 密钥,实现多代理团队协作、视觉模型编辑和跨会话上下文保持。 #AI #LLM #工作空间 #开发工具 #开源 #CLI #代理 #代码分析 #Compilr
AI无法被消除,与其抵制不如积极应对
一篇题为“AI sucks. Hating it is not enough”的个人评论文章引发讨论。作者指出,许多人对AI感到愤怒并试图抵制,但AI带来的风险是真实存在的,且无法被“发明”或“抵制”掉,监管的效力也有限。作者本人是技术专家与环保主义者,曾为应对气候变化奉献一切,如今却看到同行因AI问题撕裂。他呼吁反对者放下偏激,承认AI将深刻改变世界,与其消极抵制,不如主动塑造未来,在承认其存在的前提下争取更公平、更可持续的发展路径。文章强调:对AI的恐惧合理,但纯情绪化抵制无效,需要务实且高远的行动。 #AI #人工智能 #技术伦理 #科技评论 #抵制无效 #未来塑造 #社会分歧
一篇题为“AI sucks. Hating it is not enough”的个人评论文章引发讨论。作者指出,许多人对AI感到愤怒并试图抵制,但AI带来的风险是真实存在的,且无法被“发明”或“抵制”掉,监管的效力也有限。作者本人是技术专家与环保主义者,曾为应对气候变化奉献一切,如今却看到同行因AI问题撕裂。他呼吁反对者放下偏激,承认AI将深刻改变世界,与其消极抵制,不如主动塑造未来,在承认其存在的前提下争取更公平、更可持续的发展路径。文章强调:对AI的恐惧合理,但纯情绪化抵制无效,需要务实且高远的行动。 #AI #人工智能 #技术伦理 #科技评论 #抵制无效 #未来塑造 #社会分歧
Anthropic 推出 Claude Tag,深化企业级 AI 协作布局
Anthropic 于周二在 Salesforce 旗下的 Slack 办公通讯应用中正式推出全新人工智能代理产品 Claude Tag,进一步深化其在企业级市场的布局。此前 Anthropic 已在 Slack 中提供 Claude 服务,但功能相对有限。Claude Tag 可视为一款 AI 代理,能够直接嵌入 Slack 工作流,协助用户执行复杂任务、自动回复消息、管理项目等,显著提升团队协作效率。这一举措表明 Anthropic 正加速进军企业服务领域,与 OpenAI、微软等对手展开竞争。企业级 AI 市场已成为各大 AI 初创公司的核心战场,Claude Tag 的推出有望巩固 Anthropic 在企业协作场景中的优势,推动 AI 代理从通用对话向业务深度集成演进。 #Anthropic #ClaudeTag #Slack #企业级AI #AI代理 #协作 #科技新闻 #人工智能
Anthropic 于周二在 Salesforce 旗下的 Slack 办公通讯应用中正式推出全新人工智能代理产品 Claude Tag,进一步深化其在企业级市场的布局。此前 Anthropic 已在 Slack 中提供 Claude 服务,但功能相对有限。Claude Tag 可视为一款 AI 代理,能够直接嵌入 Slack 工作流,协助用户执行复杂任务、自动回复消息、管理项目等,显著提升团队协作效率。这一举措表明 Anthropic 正加速进军企业服务领域,与 OpenAI、微软等对手展开竞争。企业级 AI 市场已成为各大 AI 初创公司的核心战场,Claude Tag 的推出有望巩固 Anthropic 在企业协作场景中的优势,推动 AI 代理从通用对话向业务深度集成演进。 #Anthropic #ClaudeTag #Slack #企业级AI #AI代理 #协作 #科技新闻 #人工智能