AI代理安全需组合图而非仅SBOM,传统扫描无法发现组合风险
一篇题为“AI agent security needs a composition graph, not just an SBOM”的博文指出,传统软件组合分析(SCA)仅能扫描已知漏洞包,但无法揭示这些包如何被组合成具有敏感权限的AI代理。以Claude Code的iMessage插件为例,其底层包含MCP服务器、技能和91个npm包,单个组件看似安全,但组合后形成了可读取私人消息、发送文件、且技能可重写访问策略的代理,暴露于不可信输入的风险。作者扫描了官方Claude插件市场的62个清单、530个组件,发现124个已知漏洞集中出现在discord、telegram、fakechat和imessage四个消息通道插件中,而这些漏洞与敏感功能高度重叠,传统SBOM无法表达这种关联。文章呼吁采用组合图(composition graph)来评估AI代理的实际风险。 #AI安全 #组合图 #SBOM #软件供应链 #代理安全 #Claude #漏洞分析
一篇题为“AI agent security needs a composition graph, not just an SBOM”的博文指出,传统软件组合分析(SCA)仅能扫描已知漏洞包,但无法揭示这些包如何被组合成具有敏感权限的AI代理。以Claude Code的iMessage插件为例,其底层包含MCP服务器、技能和91个npm包,单个组件看似安全,但组合后形成了可读取私人消息、发送文件、且技能可重写访问策略的代理,暴露于不可信输入的风险。作者扫描了官方Claude插件市场的62个清单、530个组件,发现124个已知漏洞集中出现在discord、telegram、fakechat和imessage四个消息通道插件中,而这些漏洞与敏感功能高度重叠,传统SBOM无法表达这种关联。文章呼吁采用组合图(composition graph)来评估AI代理的实际风险。 #AI安全 #组合图 #SBOM #软件供应链 #代理安全 #Claude #漏洞分析
AI应用测试
传统软件测试依赖确定性:给定输入,固定输出,测试通过即代表代码正确。但将语言模型集成到应用中后,这种模式彻底瓦解。同样的提示词两次,得到不同回答,有时正确,有时微妙的错误,甚至出现自信的幻觉文本,却没有任何错误提示。对于非确定性行为,传统断言测试已无能为力。由此,“评估”(Eval)应运而生:它不再判断“输出是否等于预期”,而是测量“在代表性样本上,模型行为正确率是否满足阈值”。Eval 让开发者能在非确定性环境下迭代改进 AI 功能,而非因恐惧停滞。作为例证,作者为妻子税务事务所构建了客户留言分类系统,并演示了如何为实际应用编写完整的端到端评估测试。 #AI #软件测试 #大语言模型 #评估 #Eval #确定性 #科技
传统软件测试依赖确定性:给定输入,固定输出,测试通过即代表代码正确。但将语言模型集成到应用中后,这种模式彻底瓦解。同样的提示词两次,得到不同回答,有时正确,有时微妙的错误,甚至出现自信的幻觉文本,却没有任何错误提示。对于非确定性行为,传统断言测试已无能为力。由此,“评估”(Eval)应运而生:它不再判断“输出是否等于预期”,而是测量“在代表性样本上,模型行为正确率是否满足阈值”。Eval 让开发者能在非确定性环境下迭代改进 AI 功能,而非因恐惧停滞。作为例证,作者为妻子税务事务所构建了客户留言分类系统,并演示了如何为实际应用编写完整的端到端评估测试。 #AI #软件测试 #大语言模型 #评估 #Eval #确定性 #科技