研究显示,使用AI水印时,大语言模型对有害提示的回应会出现差异
研究发现,SynthID-Text水印可能改变大模型对有害请求的拒答行为,尤其在提示注入攻击下,甚至影响AI代理的工具调用及参数;研究仅测试了6个开源模型,未验证Claude的具体实现。
来源:Ars Technica
研究发现,SynthID-Text水印可能改变大模型对有害请求的拒答行为,尤其在提示注入攻击下,甚至影响AI代理的工具调用及参数;研究仅测试了6个开源模型,未验证Claude的具体实现。
来源:Ars Technica
Base Labs与Hugging Face、Goodfire达成开放权重AI安全合作
Baseten与Hugging Face、Goodfire AI及旗下研究部门Base Labs合作,计划为开放权重模型开发透明的安全评估与监控标准,以应对可通过“去护栏”技术制造危险模型的问题,并邀请开发者生态参与框架建设。
来源:TechCrunch
Baseten与Hugging Face、Goodfire AI及旗下研究部门Base Labs合作,计划为开放权重模型开发透明的安全评估与监控标准,以应对可通过“去护栏”技术制造危险模型的问题,并邀请开发者生态参与框架建设。
来源:TechCrunch
联合国求助谷歌,让其全球数据为AI代理做好准备
联合国与谷歌合作推出联合国系统数据公共平台,取代UNData,支持自然语言检索和模型上下文协议(MCP),让AI代理直接访问并追溯联合国统计数据。平台已有近20个联合国实体提供数据,目标到2027年覆盖联合国系统80%的统计数据。
来源:TechCrunch
联合国与谷歌合作推出联合国系统数据公共平台,取代UNData,支持自然语言检索和模型上下文协议(MCP),让AI代理直接访问并追溯联合国统计数据。平台已有近20个联合国实体提供数据,目标到2027年覆盖联合国系统80%的统计数据。
来源:TechCrunch