研究显示,使用AI水印时,大语言模型对有害提示的回应会出现差异
研究发现,SynthID-Text水印可能改变大模型对有害请求的拒答行为,尤其在提示注入攻击下,甚至影响AI代理的工具调用及参数;研究仅测试了6个开源模型,未验证Claude的具体实现。
来源:Ars Technica
研究发现,SynthID-Text水印可能改变大模型对有害请求的拒答行为,尤其在提示注入攻击下,甚至影响AI代理的工具调用及参数;研究仅测试了6个开源模型,未验证Claude的具体实现。
来源:Ars Technica
Base Labs与Hugging Face、Goodfire达成开放权重AI安全合作
Baseten与Hugging Face、Goodfire AI及旗下研究部门Base Labs合作,计划为开放权重模型开发透明的安全评估与监控标准,以应对可通过“去护栏”技术制造危险模型的问题,并邀请开发者生态参与框架建设。
来源:TechCrunch
Baseten与Hugging Face、Goodfire AI及旗下研究部门Base Labs合作,计划为开放权重模型开发透明的安全评估与监控标准,以应对可通过“去护栏”技术制造危险模型的问题,并邀请开发者生态参与框架建设。
来源:TechCrunch