如果 Claude Fable 停止帮助你,你将永远不会知道
一篇近期发表的评论文章指出,当 AI 模型 Claude Fable 不再为用户提供有效帮助时,用户可能完全无法察觉。文章回顾了该模型的演进,包括对 Claude Fable 5 的初步评价以及其通过 MicroPython 和 WASM 在沙箱中运行 Python 代码的能力。作者认为,这类“静默失效”现象可能削弱用户对 AI 系统的信任,同时呼唤更透明的模型行为监测机制。 #AI #ClaudeFable #大模型 #AI安全 #科技评论
一篇近期发表的评论文章指出,当 AI 模型 Claude Fable 不再为用户提供有效帮助时,用户可能完全无法察觉。文章回顾了该模型的演进,包括对 Claude Fable 5 的初步评价以及其通过 MicroPython 和 WASM 在沙箱中运行 Python 代码的能力。作者认为,这类“静默失效”现象可能削弱用户对 AI 系统的信任,同时呼唤更透明的模型行为监测机制。 #AI #ClaudeFable #大模型 #AI安全 #科技评论
Firefox 为 AI 功能引入 Google Play Integrity 检查
Mozilla 正在为 Firefox 浏览器添加 Google Play Integrity API 支持,以增强其 AI 功能的安全性。根据近期提交的多个代码补丁,Firefox 将利用该 API 从 Google Play 获取令牌,并将其传递给 MLPA 后端进行验证。这一改动旨在确保 AI 特性仅在受信任的 Android 设备上运行,防止滥用或篡改。相关代码包括实现 GooglePlayIntegrityClient、在 Fenix 版本中集成完整性库,以及添加调试工具用于测试。此举标志着 Firefox 在 AI 功能部署中加强安全防护,但可能引发关于用户隐私和设备兼容性的讨论。 #Firefox #GooglePlayIntegrity #AI #安全 #Mozilla #Android
Mozilla 正在为 Firefox 浏览器添加 Google Play Integrity API 支持,以增强其 AI 功能的安全性。根据近期提交的多个代码补丁,Firefox 将利用该 API 从 Google Play 获取令牌,并将其传递给 MLPA 后端进行验证。这一改动旨在确保 AI 特性仅在受信任的 Android 设备上运行,防止滥用或篡改。相关代码包括实现 GooglePlayIntegrityClient、在 Fenix 版本中集成完整性库,以及添加调试工具用于测试。此举标志着 Firefox 在 AI 功能部署中加强安全防护,但可能引发关于用户隐私和设备兼容性的讨论。 #Firefox #GooglePlayIntegrity #AI #安全 #Mozilla #Android
UIUC、Meta、斯坦福联合发布《Code as Agent Harness》综述,揭示代码成为Agent执行系统核心载体
随着Claude Code、Codex等系统的兴起,业界对coding agent的评估已从“能否写对代码”转向更底层的执行系统。来自UIUC、Meta和斯坦福的102页综述《Code as Agent Harness》提出,代码不仅是模型最终产物,更是Agent在长时间窗口内进行推理、行动、反馈和验证的核心媒介。该综述从接口层、机制层和多Agent扩展三个层次展开:接口层将推理、行动和环境建模转化为可执行、可检查、有状态的代码对象;机制层通过plan-execute-verify循环组织长程任务,使报错、测试失败等反馈成为控制Agent行为的传感器;多Agent协作则依赖共享仓库、测试和工作流等可执行代码状态,避免自然语言对话导致的状态发散。该框架不仅适用于编程领域,未来还将渗透到GUI/OS、机器人、科学发现等场景,使代码成为通用Agent Harness的稳定基底。 #AI #Agent #代码生成 #大模型 #软件工程 #科技综述 #多Agent #Claude #Codex
随着Claude Code、Codex等系统的兴起,业界对coding agent的评估已从“能否写对代码”转向更底层的执行系统。来自UIUC、Meta和斯坦福的102页综述《Code as Agent Harness》提出,代码不仅是模型最终产物,更是Agent在长时间窗口内进行推理、行动、反馈和验证的核心媒介。该综述从接口层、机制层和多Agent扩展三个层次展开:接口层将推理、行动和环境建模转化为可执行、可检查、有状态的代码对象;机制层通过plan-execute-verify循环组织长程任务,使报错、测试失败等反馈成为控制Agent行为的传感器;多Agent协作则依赖共享仓库、测试和工作流等可执行代码状态,避免自然语言对话导致的状态发散。该框架不仅适用于编程领域,未来还将渗透到GUI/OS、机器人、科学发现等场景,使代码成为通用Agent Harness的稳定基底。 #AI #Agent #代码生成 #大模型 #软件工程 #科技综述 #多Agent #Claude #Codex
KSTEC 推出 Smart IDP 智能文档处理方案,助力企业自动化
韩国AI与办公自动化企业KSTEC于6月10日宣布推出“Smart IDP”智能文档处理解决方案。该方案在传统RPA和OCR能力基础上,结合最新的自然语言处理(NLP)与机器学习技术,大幅提升文档语义理解与自动化处理效率。KSTEC技术总监表示,Smart IDP将与公司在RPA和APA领域的技术积累形成协同,成为企业流程创新的重要基础。未来,KSTEC将重点发力金融、制造、生物医药及公共部门等对大规模文档处理需求较高的领域。 #KSTEC #SmartIDP #文档处理 #AI #企业自动化 #NLP #RPA #智能办公
韩国AI与办公自动化企业KSTEC于6月10日宣布推出“Smart IDP”智能文档处理解决方案。该方案在传统RPA和OCR能力基础上,结合最新的自然语言处理(NLP)与机器学习技术,大幅提升文档语义理解与自动化处理效率。KSTEC技术总监表示,Smart IDP将与公司在RPA和APA领域的技术积累形成协同,成为企业流程创新的重要基础。未来,KSTEC将重点发力金融、制造、生物医药及公共部门等对大规模文档处理需求较高的领域。 #KSTEC #SmartIDP #文档处理 #AI #企业自动化 #NLP #RPA #智能办公
联合国报告
据联合国大学水环境健康研究所最新报告,到2030年,支撑人工智能的全球数据中心预计将消耗945太瓦时电力,几乎是巴基斯坦、孟加拉国和尼日利亚三国年用电量总和的三倍,这些国家总人口超6.5亿。报告同时指出,AI相关的水足迹将相当于撒哈拉以南非洲13亿人口的基本生活用水需求,土地足迹将超过1.45万平方公里,约为雅加达都市区的两倍。科学家警告,仅以碳排放衡量AI的环境成本是片面的,低碳不等于低水或低地。例如,从煤电转为生物能源可平均减少70%碳足迹,但水足迹增加30倍以上,土地足迹增加100倍。全球数据中心2025年已消耗约448太瓦时电力,若视作国家,将是全球第11大电力消费国。报告呼吁在AI技术革命中确保可持续发展与公平,避免将环境负担转移至已面临水、土地压力的地区。 #AI #数据中心 #环境成本 #联合国报告 #可持续发展 #水资源 #气候变化
据联合国大学水环境健康研究所最新报告,到2030年,支撑人工智能的全球数据中心预计将消耗945太瓦时电力,几乎是巴基斯坦、孟加拉国和尼日利亚三国年用电量总和的三倍,这些国家总人口超6.5亿。报告同时指出,AI相关的水足迹将相当于撒哈拉以南非洲13亿人口的基本生活用水需求,土地足迹将超过1.45万平方公里,约为雅加达都市区的两倍。科学家警告,仅以碳排放衡量AI的环境成本是片面的,低碳不等于低水或低地。例如,从煤电转为生物能源可平均减少70%碳足迹,但水足迹增加30倍以上,土地足迹增加100倍。全球数据中心2025年已消耗约448太瓦时电力,若视作国家,将是全球第11大电力消费国。报告呼吁在AI技术革命中确保可持续发展与公平,避免将环境负担转移至已面临水、土地压力的地区。 #AI #数据中心 #环境成本 #联合国报告 #可持续发展 #水资源 #气候变化
TIDE 提出高效无损失 MoE 扩散 LLM 推理系统
扩散大语言模型(dLLM)凭借并行块级解码和双向上下文能力,成为自回归模型的强劲对手。然而,当 dLLM 采用混合专家(MoE)架构扩展时,在资源受限设备上的部署面临 I/O 开销和计算瓶颈。研究人员提出 TIDE,一种新型高效推理系统,利用扩散过程中专家激活的时序稳定性,采用基于间隔的专家刷新策略,以 I/O 感知方式更新专家放置。系统将推理调度建模为数学规划问题,求解最优间隔以最小化 I/O 流量和 CPU 计算。TIDE 无需模型训练即可实现无损失加速,在单 GPU-CPU 系统上,对 LLaDA2.0-mini 和 LLaDA2.0-flash 模型的吞吐量分别提升至基线方法的 1.4 倍和 1.5 倍。 #AI #大模型 #MoE #扩散模型 #推理优化 #学术研究
扩散大语言模型(dLLM)凭借并行块级解码和双向上下文能力,成为自回归模型的强劲对手。然而,当 dLLM 采用混合专家(MoE)架构扩展时,在资源受限设备上的部署面临 I/O 开销和计算瓶颈。研究人员提出 TIDE,一种新型高效推理系统,利用扩散过程中专家激活的时序稳定性,采用基于间隔的专家刷新策略,以 I/O 感知方式更新专家放置。系统将推理调度建模为数学规划问题,求解最优间隔以最小化 I/O 流量和 CPU 计算。TIDE 无需模型训练即可实现无损失加速,在单 GPU-CPU 系统上,对 LLaDA2.0-mini 和 LLaDA2.0-flash 模型的吞吐量分别提升至基线方法的 1.4 倍和 1.5 倍。 #AI #大模型 #MoE #扩散模型 #推理优化 #学术研究
德国法院裁定谷歌应对AI概览错误信息承担责任
德国慕尼黑地方法院作出裁决,认定谷歌对其AI搜索概览中的错误内容承担直接责任。此前保护搜索引擎运营商免于责任的判例法不适用于AI概览。法院针对谷歌AI概览错误指控两家慕尼黑出版商参与诈骗和订阅陷阱等不实信息,发布临时禁令。法院认为,AI概览是谷歌“自己的内容”,而非简单搜索结果列表,因为AI用自己的语言重写并判断结果,甚至编造出链接来源中不存在的关联。谷歌以用户可自行验证为由抗辩,但法院驳回此说法,指出AI概览并非使用互联网的必要功能,且只有谷歌才能检查其AI的陈述。此案为AI时代搜索引擎的责任边界树立了重要先例。 #德国法院 #谷歌 #AI概览 #责任认定 #误导信息 #法律裁决 #搜索引擎 #AI监管
德国慕尼黑地方法院作出裁决,认定谷歌对其AI搜索概览中的错误内容承担直接责任。此前保护搜索引擎运营商免于责任的判例法不适用于AI概览。法院针对谷歌AI概览错误指控两家慕尼黑出版商参与诈骗和订阅陷阱等不实信息,发布临时禁令。法院认为,AI概览是谷歌“自己的内容”,而非简单搜索结果列表,因为AI用自己的语言重写并判断结果,甚至编造出链接来源中不存在的关联。谷歌以用户可自行验证为由抗辩,但法院驳回此说法,指出AI概览并非使用互联网的必要功能,且只有谷歌才能检查其AI的陈述。此案为AI时代搜索引擎的责任边界树立了重要先例。 #德国法院 #谷歌 #AI概览 #责任认定 #误导信息 #法律裁决 #搜索引擎 #AI监管
估算自主AI软件工程师的生产力
六个月前,所有CTO担心团队使用的token不够多;如今,token用量与AI支出飙升,工程领导者开始衡量实际产出,因为并非每个token都创造价值。针对大规模组织,手动评估数千会话和数十亿token的价值几乎不可能。为此,Cognition公司开发了自动化系统,专门估算其AI编程助手Devin每次会话所节省的工程工时。团队训练了一个模型,通过回顾已完成会话,先分类是否产出有用结果,再估算人类工程师完成相同工作所需时间。经调优后,模型相关系数达0.74且无偏,虽单次预测不完美,但足以用于加总估算,并可结合工程师薪资换算为美元价值。系统已与客户运行,据称是首个在生产环境中自动衡量AI工程生产力的系统。选择“人力工程工时”作为指标,是因为它标准化、跨组织通用,且能直接对应薪资成本,避免了直接衡量商业价值或原始活动(如代码行数)的难题。通过用户评审收集了来自126位用户的258个会话作为基准数据集进行验证。 #AI #生产力 #工程 #自动化 #Devin #Cognition #指标 #工时 #科技
六个月前,所有CTO担心团队使用的token不够多;如今,token用量与AI支出飙升,工程领导者开始衡量实际产出,因为并非每个token都创造价值。针对大规模组织,手动评估数千会话和数十亿token的价值几乎不可能。为此,Cognition公司开发了自动化系统,专门估算其AI编程助手Devin每次会话所节省的工程工时。团队训练了一个模型,通过回顾已完成会话,先分类是否产出有用结果,再估算人类工程师完成相同工作所需时间。经调优后,模型相关系数达0.74且无偏,虽单次预测不完美,但足以用于加总估算,并可结合工程师薪资换算为美元价值。系统已与客户运行,据称是首个在生产环境中自动衡量AI工程生产力的系统。选择“人力工程工时”作为指标,是因为它标准化、跨组织通用,且能直接对应薪资成本,避免了直接衡量商业价值或原始活动(如代码行数)的难题。通过用户评审收集了来自126位用户的258个会话作为基准数据集进行验证。 #AI #生产力 #工程 #自动化 #Devin #Cognition #指标 #工时 #科技
Rich Sutton 谈 AI 创造力与发现
强化学习先驱 Richard Sutton 在一段视频演讲中提出颇具争议的观点:当前基于监督学习的生成式 AI 本质上无法做出真正新颖的发现。他以经典笑话类比——AI 的输出要么新颖但不优秀,要么优秀但不新颖。Sutton 指出,生成式 AI(包括大语言模型、图像视频模型等)通过大量示例训练,能生成类似人类或自然的文本、图像,但无法同时兼顾创新与质量。当用户要求事实性答案时,AI 的“新颖”即幻觉,不受欢迎;而在虚构创作中,AI 的随机性虽能产生新颖内容,却无法保证质量源于真实数据。Sutton 强调,这种“非此即彼”的局限源于生成式 AI 的随机性与数据依赖性,使其无法像人类科学家那样在探索中实现真正的突破性发现。 #AI #生成式AI #创造力 #强化学习 #RichardSutton #科技 #人工智能
强化学习先驱 Richard Sutton 在一段视频演讲中提出颇具争议的观点:当前基于监督学习的生成式 AI 本质上无法做出真正新颖的发现。他以经典笑话类比——AI 的输出要么新颖但不优秀,要么优秀但不新颖。Sutton 指出,生成式 AI(包括大语言模型、图像视频模型等)通过大量示例训练,能生成类似人类或自然的文本、图像,但无法同时兼顾创新与质量。当用户要求事实性答案时,AI 的“新颖”即幻觉,不受欢迎;而在虚构创作中,AI 的随机性虽能产生新颖内容,却无法保证质量源于真实数据。Sutton 强调,这种“非此即彼”的局限源于生成式 AI 的随机性与数据依赖性,使其无法像人类科学家那样在探索中实现真正的突破性发现。 #AI #生成式AI #创造力 #强化学习 #RichardSutton #科技 #人工智能