Axtary 发布面向 AI Agent 的内容授权方案
Axtary 是一款专为 AI Agent 设计的内容授权运行时系统,在连接器执行前对其操作中的 diff、消息、查询或工具负载进行精确检查。常规操作按预设策略自动放行,高风险操作则需对具体负载进行人工审批。即使 Agent 出现误判或被攻破,其权限也仅限已批准的操作,每次尝试均被记录。通过 ActionPass 机制,系统将审批与负载哈希绑定,任何中间篡改都会导致验证失败。该方案可无缝对接 MCP 服务器及 GitHub、Slack、AWS 等原生连接器,在 Agent 旁运行的策略引擎确保提供者凭证本地保存,并支持 Cedar 兼容策略和可验证审计账本,从而在不扩大权限范围的前提下为代码变更、基础设施操作、数据访问等敏感任务提供细粒度安全管控。 #AI安全 #内容授权 #AI安全 #AIAgent #ActionPass #安全审计 #MCP #细粒度控制
Axtary 是一款专为 AI Agent 设计的内容授权运行时系统,在连接器执行前对其操作中的 diff、消息、查询或工具负载进行精确检查。常规操作按预设策略自动放行,高风险操作则需对具体负载进行人工审批。即使 Agent 出现误判或被攻破,其权限也仅限已批准的操作,每次尝试均被记录。通过 ActionPass 机制,系统将审批与负载哈希绑定,任何中间篡改都会导致验证失败。该方案可无缝对接 MCP 服务器及 GitHub、Slack、AWS 等原生连接器,在 Agent 旁运行的策略引擎确保提供者凭证本地保存,并支持 Cedar 兼容策略和可验证审计账本,从而在不扩大权限范围的前提下为代码变更、基础设施操作、数据访问等敏感任务提供细粒度安全管控。 #AI安全 #内容授权 #AI安全 #AIAgent #ActionPass #安全审计 #MCP #细粒度控制
AI 代理框架扫描发现 30 处无授权检查的破坏性操作
一项针对 25 个 AI 代理框架的研究揭示了一个严重的权限漏洞问题。研究人员扫描了 23,476 个文件,专门寻找模型能够触发的、可控制参数且未经授权检查的破坏性操作,最终发现 30 个此类风险点。研究发现,大多数代理工具仅检查请求格式是否合规,却极少在执行破坏性动作的瞬间验证调用者是否具有执行该操作的权限——这两种检查在代码审查中难以区分,但会导致截然不同的安全后果。扫描器聚焦于模型控制的参数能否抵达已知的破坏性“汇点”,且路径上没有任何权限控制。研究团队同时公开了 12 个误报案例,并修复了扫描器自身的缺陷。例如,某些模式匹配曾误将 Elasticsearch 或向量存储客户端调用视为高风险,以及未能识别由模型控制的 SQL 查询等。目前所有修复均配有永久回归测试,CI 系统会强制维持 30/30 的结论。研究强调,静态分析的完备性无法保证,因此未声称可被利用,仅指出路径上缺乏权限验证这一事实。 #AI安全 #代理框架 #权限检查 #代码审计 #模型控制 #漏洞扫描 #技术研究
一项针对 25 个 AI 代理框架的研究揭示了一个严重的权限漏洞问题。研究人员扫描了 23,476 个文件,专门寻找模型能够触发的、可控制参数且未经授权检查的破坏性操作,最终发现 30 个此类风险点。研究发现,大多数代理工具仅检查请求格式是否合规,却极少在执行破坏性动作的瞬间验证调用者是否具有执行该操作的权限——这两种检查在代码审查中难以区分,但会导致截然不同的安全后果。扫描器聚焦于模型控制的参数能否抵达已知的破坏性“汇点”,且路径上没有任何权限控制。研究团队同时公开了 12 个误报案例,并修复了扫描器自身的缺陷。例如,某些模式匹配曾误将 Elasticsearch 或向量存储客户端调用视为高风险,以及未能识别由模型控制的 SQL 查询等。目前所有修复均配有永久回归测试,CI 系统会强制维持 30/30 的结论。研究强调,静态分析的完备性无法保证,因此未声称可被利用,仅指出路径上缺乏权限验证这一事实。 #AI安全 #代理框架 #权限检查 #代码审计 #模型控制 #漏洞扫描 #技术研究
SEC 采购 AI 代理监控手机位置与社交媒体,防止市场操纵
美国证券交易委员会(SEC)正采购由人工智能驱动的软件,用于监控手机位置、社交媒体帖子和信用头数据。根据公开的软件订阅续约文件,SEC 计划续签与数据经纪商 Babel Street 的合同,其中包括其最具争议的手机位置追踪平台 Locate X。该平台通过与应用开发商的幕后交易获取全球用户的精确 GPS 位置。此次采购距 Babel Street 向美国财政部外国资产控制办公室(OFAC)出售类似数据约五年。OFAC 近期被特朗普政府用于打击国内外左翼政治运动。SEC 声明称需要实时数据聚合与分析能力以保护投资者和维护市场秩序。前中情局反恐中心高级官员帕特里克·巴特勒负责监管 Locate X 平台。 #SEC #AI监控 #数据隐私 #市场操纵 #BabelStreet #手机定位 #社交媒体监控 #美国金融监管
美国证券交易委员会(SEC)正采购由人工智能驱动的软件,用于监控手机位置、社交媒体帖子和信用头数据。根据公开的软件订阅续约文件,SEC 计划续签与数据经纪商 Babel Street 的合同,其中包括其最具争议的手机位置追踪平台 Locate X。该平台通过与应用开发商的幕后交易获取全球用户的精确 GPS 位置。此次采购距 Babel Street 向美国财政部外国资产控制办公室(OFAC)出售类似数据约五年。OFAC 近期被特朗普政府用于打击国内外左翼政治运动。SEC 声明称需要实时数据聚合与分析能力以保护投资者和维护市场秩序。前中情局反恐中心高级官员帕特里克·巴特勒负责监管 Locate X 平台。 #SEC #AI监控 #数据隐私 #市场操纵 #BabelStreet #手机定位 #社交媒体监控 #美国金融监管
LLM推理深度解析
一位拥有十一年分布式系统经验的工程师近日撰文,详细介绍了LLM推理的完整机制。他坦言,即便有深厚后端基础,最初对推理的理解也停留在“生成Token”的浅层认知。文章区分了训练与推理的本质差异:训练是调整权重的过程,而推理则是使用固定权重进行前向计算,权重不会发生改变。他将训练比作烘烤面包,推理则是切片上菜,强调推理引擎(如Ollama、vLLM等)的执行策略直接影响性能,且该领域尚未形成成熟解决方案。文章还拆解了模型文件的内部结构,以7B参数模型为例,展示了GGUF文件包含头部信息(架构、词表、超参数)和大量权重张量(如嵌入矩阵、注意力投影、前馈网络等),解释了为何一个看似简单的聊天模型会占用数GB存储空间。这篇指南旨在帮助工程师快速理解推理环节的关键瓶颈,从而更好地应对生产环境中的性能问题。 #LLM #推理 #AI工程化 #深度学习 #模型结构 #vLLM #性能优化 #分布式系统 #机器学习
一位拥有十一年分布式系统经验的工程师近日撰文,详细介绍了LLM推理的完整机制。他坦言,即便有深厚后端基础,最初对推理的理解也停留在“生成Token”的浅层认知。文章区分了训练与推理的本质差异:训练是调整权重的过程,而推理则是使用固定权重进行前向计算,权重不会发生改变。他将训练比作烘烤面包,推理则是切片上菜,强调推理引擎(如Ollama、vLLM等)的执行策略直接影响性能,且该领域尚未形成成熟解决方案。文章还拆解了模型文件的内部结构,以7B参数模型为例,展示了GGUF文件包含头部信息(架构、词表、超参数)和大量权重张量(如嵌入矩阵、注意力投影、前馈网络等),解释了为何一个看似简单的聊天模型会占用数GB存储空间。这篇指南旨在帮助工程师快速理解推理环节的关键瓶颈,从而更好地应对生产环境中的性能问题。 #LLM #推理 #AI工程化 #深度学习 #模型结构 #vLLM #性能优化 #分布式系统 #机器学习
LLM-as-a-Judge 领域指南
一篇关于 LLM 作为评判者(LLM-as-a-judge)的深度技术指南近日发布。作者通过组建研究代理团队系统梳理了该领域的理论基础、偏差、校准与缓解方法,并在合成阶段识别出当前工具包的五项潜在空白。随后,作者为每个空白制定具体技术方案,并安排独立怀疑者进行反驳。结果令人意外:所有五个方案均未通过检验——并非方案本身有误,而是几乎完全相同的方法已在近12周内被前人发表。文章还以教授与助教的类比阐释了 LLM-as-a-judge 的核心理念,并指出它产生于传统 BLEU/ROUGE 等 n-gram 指标无法适用于开放文本(如摘要、对话)这一根本缺陷。G-Eval 等研究表明,GPT-4 配合链式思考与结构化评分模板在人机相关性上远优于传统指标。该指南揭示了该领域快速迭代的现状与创新难度。 #LLM #AI #模型评估 #自然语言处理 #机器学习 #研究 #学术
一篇关于 LLM 作为评判者(LLM-as-a-judge)的深度技术指南近日发布。作者通过组建研究代理团队系统梳理了该领域的理论基础、偏差、校准与缓解方法,并在合成阶段识别出当前工具包的五项潜在空白。随后,作者为每个空白制定具体技术方案,并安排独立怀疑者进行反驳。结果令人意外:所有五个方案均未通过检验——并非方案本身有误,而是几乎完全相同的方法已在近12周内被前人发表。文章还以教授与助教的类比阐释了 LLM-as-a-judge 的核心理念,并指出它产生于传统 BLEU/ROUGE 等 n-gram 指标无法适用于开放文本(如摘要、对话)这一根本缺陷。G-Eval 等研究表明,GPT-4 配合链式思考与结构化评分模板在人机相关性上远优于传统指标。该指南揭示了该领域快速迭代的现状与创新难度。 #LLM #AI #模型评估 #自然语言处理 #机器学习 #研究 #学术
MIT 大规模部署AI监控摄像头 校园隐私引关注
麻省理工学院(MIT)正大规模部署AI监控系统。据《The Tech》获取的信息,MIT耗资超过300万美元,在学术楼、宿舍及纪念大道沿线户外区域安装了500多颗AI监控摄像头。安装工作自2025年11月开始,预计持续至2026年9月。这些摄像头来自韩华Wisenet AI系列,配备深度学习算法,支持2MP至4K分辨率,可实时识别人脸、车牌、车辆等物体。据介绍,摄像头能检测运动、逗留、人群、口罩佩戴及设备篡改,并能在11米距离内根据衣色、性别、年龄对人员自动分类。所有数据最多保留30天,例外情况可延长。MIT发言人金伯利·艾伦确认了上述保留政策。这些摄像头具备全方位云台变焦功能,并通过AI软件Ai-RGUS持续监控。此举使MIT校园成为AI视频监控的密集区,引发了对个人隐私的关注。 #MIT #AI监控 #人脸识别 #隐私 #校园安全 #视频监控 #深度学习 #韩华 #安防
麻省理工学院(MIT)正大规模部署AI监控系统。据《The Tech》获取的信息,MIT耗资超过300万美元,在学术楼、宿舍及纪念大道沿线户外区域安装了500多颗AI监控摄像头。安装工作自2025年11月开始,预计持续至2026年9月。这些摄像头来自韩华Wisenet AI系列,配备深度学习算法,支持2MP至4K分辨率,可实时识别人脸、车牌、车辆等物体。据介绍,摄像头能检测运动、逗留、人群、口罩佩戴及设备篡改,并能在11米距离内根据衣色、性别、年龄对人员自动分类。所有数据最多保留30天,例外情况可延长。MIT发言人金伯利·艾伦确认了上述保留政策。这些摄像头具备全方位云台变焦功能,并通过AI软件Ai-RGUS持续监控。此举使MIT校园成为AI视频监控的密集区,引发了对个人隐私的关注。 #MIT #AI监控 #人脸识别 #隐私 #校园安全 #视频监控 #深度学习 #韩华 #安防
Hydra:本地优先的信任控制平面,通过置信度路由AI可节省80%成本
最新开源项目 Hydra 在 Hacker News 上展示,这是一个本地优先的信任控制平面,能够根据置信度将 AI 任务智能路由到最合适的模型。用户无需改变现有工作流程,即可自动为每个任务选择能够处理它的最便宜模型,从而实现 AI API 成本降低高达 80%。该项目采用 MIT 开源许可证,支持通过 Homebrew 命令行工具快速安装,降低了集成门槛。Hydra 的设计旨在帮助开发者和企业在不牺牲性能的前提下优化多模型调用成本,尤其适用于需要频繁切换不同 AI 能力的场景。通过本地优先的架构,它增强了用户对数据的控制,同时提升了资源利用效率。这一工具为日益增长的 AI 成本问题提供了一个灵活的解决方案,吸引了不少关注。 #Hydra #开源 #AI #API #成本控制 #信任控制平面 #本地优先 #Homebrew #机器学习
最新开源项目 Hydra 在 Hacker News 上展示,这是一个本地优先的信任控制平面,能够根据置信度将 AI 任务智能路由到最合适的模型。用户无需改变现有工作流程,即可自动为每个任务选择能够处理它的最便宜模型,从而实现 AI API 成本降低高达 80%。该项目采用 MIT 开源许可证,支持通过 Homebrew 命令行工具快速安装,降低了集成门槛。Hydra 的设计旨在帮助开发者和企业在不牺牲性能的前提下优化多模型调用成本,尤其适用于需要频繁切换不同 AI 能力的场景。通过本地优先的架构,它增强了用户对数据的控制,同时提升了资源利用效率。这一工具为日益增长的 AI 成本问题提供了一个灵活的解决方案,吸引了不少关注。 #Hydra #开源 #AI #API #成本控制 #信任控制平面 #本地优先 #Homebrew #机器学习
微软发布自研AI模型,成本较OpenAI最高降低近九成
微软AI团队本周三推出两款自研模型:MAI-Image-2.5-Pro图像生成模型和MAI-Voice-2-Flash语音模型,并披露大量生产部署数据。这些模型已全面接入Bing、PowerPoint、OneDrive、Dynamics 365、Excel、GitHub Copilot及Azure等核心产品,标志着微软自研AI从研究项目正式转为服务数百万用户的生产基础设施。在PowerPoint中,MAI-Image-2.5的GPU成本较OpenAI的GPT-Image-2降低84%;OneDrive图像编辑场景的保存率提升26%,延迟下降约25%,效率提高2.5倍。MAI-Image-2.5-Pro定位高端图像创作,支持精细编辑和文本渲染,在社区排行榜上位列图像编辑第二;MAI-Voice-2-Flash则为高并发语音场景设计,成本降低32%,速度提升2倍。微软表示,将坚持构建模型家族而非单一旗舰,以满足创意工坊与客服热线等截然不同的需求。 #微软 #AI #自研模型 #MAIImage #MAIVoice #OpenAI #成本降低 #图像生成 #语音模型 #科技新闻
微软AI团队本周三推出两款自研模型:MAI-Image-2.5-Pro图像生成模型和MAI-Voice-2-Flash语音模型,并披露大量生产部署数据。这些模型已全面接入Bing、PowerPoint、OneDrive、Dynamics 365、Excel、GitHub Copilot及Azure等核心产品,标志着微软自研AI从研究项目正式转为服务数百万用户的生产基础设施。在PowerPoint中,MAI-Image-2.5的GPU成本较OpenAI的GPT-Image-2降低84%;OneDrive图像编辑场景的保存率提升26%,延迟下降约25%,效率提高2.5倍。MAI-Image-2.5-Pro定位高端图像创作,支持精细编辑和文本渲染,在社区排行榜上位列图像编辑第二;MAI-Voice-2-Flash则为高并发语音场景设计,成本降低32%,速度提升2倍。微软表示,将坚持构建模型家族而非单一旗舰,以满足创意工坊与客服热线等截然不同的需求。 #微软 #AI #自研模型 #MAIImage #MAIVoice #OpenAI #成本降低 #图像生成 #语音模型 #科技新闻