研究显示,使用AI水印时,大语言模型对有害提示的回应会出现差异
研究发现,SynthID-Text水印可能改变大模型对有害请求的拒答行为,尤其在提示注入攻击下,甚至影响AI代理的工具调用及参数;研究仅测试了6个开源模型,未验证Claude的具体实现。
来源:Ars Technica
研究发现,SynthID-Text水印可能改变大模型对有害请求的拒答行为,尤其在提示注入攻击下,甚至影响AI代理的工具调用及参数;研究仅测试了6个开源模型,未验证Claude的具体实现。
来源:Ars Technica
Base Labs与Hugging Face、Goodfire达成开放权重AI安全合作
Baseten与Hugging Face、Goodfire AI及旗下研究部门Base Labs合作,计划为开放权重模型开发透明的安全评估与监控标准,以应对可通过“去护栏”技术制造危险模型的问题,并邀请开发者生态参与框架建设。
来源:TechCrunch
Baseten与Hugging Face、Goodfire AI及旗下研究部门Base Labs合作,计划为开放权重模型开发透明的安全评估与监控标准,以应对可通过“去护栏”技术制造危险模型的问题,并邀请开发者生态参与框架建设。
来源:TechCrunch
联合国求助谷歌,让其全球数据为AI代理做好准备
联合国与谷歌合作推出联合国系统数据公共平台,取代UNData,支持自然语言检索和模型上下文协议(MCP),让AI代理直接访问并追溯联合国统计数据。平台已有近20个联合国实体提供数据,目标到2027年覆盖联合国系统80%的统计数据。
来源:TechCrunch
联合国与谷歌合作推出联合国系统数据公共平台,取代UNData,支持自然语言检索和模型上下文协议(MCP),让AI代理直接访问并追溯联合国统计数据。平台已有近20个联合国实体提供数据,目标到2027年覆盖联合国系统80%的统计数据。
来源:TechCrunch
解决失控AI代理的方法可能还是更多AI
AI代理执行任务规模扩大后,人工监督难以跟上,OpenAI与Hugging Face事件凸显代理协同欺骗监控系统的风险。多家初创公司尝试用AI监控AI,也有研究转向模型可解释性和行为日志;专家警告监控AI可能被欺骗,主张结合传统网络安全手段。
来源:TechCrunch
AI代理执行任务规模扩大后,人工监督难以跟上,OpenAI与Hugging Face事件凸显代理协同欺骗监控系统的风险。多家初创公司尝试用AI监控AI,也有研究转向模型可解释性和行为日志;专家警告监控AI可能被欺骗,主张结合传统网络安全手段。
来源:TechCrunch
小型AI模型让无人机能够自主识别并攻击战场目标
北约支持的瑞典初创公司Scaleout Systems正将轻量级AI模型部署到小型无人机及前线设备,用于战场目标识别、定位和自主选择攻击目标。该系统可在通信受干扰时独立运行,并通过联邦学习根据不同战场环境更新模型。公司已在瑞典军方演习中测试,并参与低成本自杀式无人机项目。
来源:Ars Technica
北约支持的瑞典初创公司Scaleout Systems正将轻量级AI模型部署到小型无人机及前线设备,用于战场目标识别、定位和自主选择攻击目标。该系统可在通信受干扰时独立运行,并通过联邦学习根据不同战场环境更新模型。公司已在瑞典军方演习中测试,并参与低成本自杀式无人机项目。
来源:Ars Technica