GPTZero 调查发现 KPMG 报告存在大量“幻觉引用”
GPTZero 调查团队利用其“幻觉检查”工具,对四大会计师事务所之一的 KPMG 于 2025 年 10 月发布的一份关于客户体验与智能体 AI 的报告进行了分析。报告题为《总体验:在智能体 AI 时代重新定义卓越》,其中引用了 45 条文献,但仅有 5 条准确指向真实来源;28 条引用的标题或部分信息被篡改,12 条过于模糊难以验证。此外,约一半被引用支持的主张实为虚假或错误归因,很可能是 AI 研究工具过度迎合指令所致。GPTZero 将此类现象称为“氛围引用”,指大模型在生成幻觉时意外编造虚假参考文献的行为,其严重程度不一。该调查揭示了咨询行业在引用规范上的漏洞,并引发对 AI 工具在专业报告中可靠性的质疑。 #GPTZero #KPMG #AI幻觉 #咨询报告 #虚假引用 #总体验 #智能体AI #新闻调查
GPTZero 调查团队利用其“幻觉检查”工具,对四大会计师事务所之一的 KPMG 于 2025 年 10 月发布的一份关于客户体验与智能体 AI 的报告进行了分析。报告题为《总体验:在智能体 AI 时代重新定义卓越》,其中引用了 45 条文献,但仅有 5 条准确指向真实来源;28 条引用的标题或部分信息被篡改,12 条过于模糊难以验证。此外,约一半被引用支持的主张实为虚假或错误归因,很可能是 AI 研究工具过度迎合指令所致。GPTZero 将此类现象称为“氛围引用”,指大模型在生成幻觉时意外编造虚假参考文献的行为,其严重程度不一。该调查揭示了咨询行业在引用规范上的漏洞,并引发对 AI 工具在专业报告中可靠性的质疑。 #GPTZero #KPMG #AI幻觉 #咨询报告 #虚假引用 #总体验 #智能体AI #新闻调查
LLM 雅可比指纹识别
研究人员开发了一种名为“作者2vec”的技术,通过分析大型语言模型(LLM)内部层的雅可比矩阵,实现对代码作者的精确识别。该方法利用开源代码的 git 历史,逐行提取作者写作风格,并使用代码嵌入模型生成“指纹”。通过将模型内部激活映射到输出,研究者发现这些指纹不仅存在于最终输出中,更存储在模型内部的雅可比矩阵里。在 13 位代码作者的测试中,基于内部雅可比读出的最近作者识别准确率达 50%,远超随机水平(8%),甚至高于直接输出识别(38%)。进一步分析表明,模型深层在中间层出现低秩“工作空间”瓶颈,指纹特征在此压缩。该技术可应用于代码溯源、版权保护及AI安全领域,揭示了LLM在训练过程中无意中编码了作者的独特写作模式。 #LLM #代码指纹 #雅可比矩阵 #作者识别 #AI安全 #技术新闻 #开源 #机器学习
研究人员开发了一种名为“作者2vec”的技术,通过分析大型语言模型(LLM)内部层的雅可比矩阵,实现对代码作者的精确识别。该方法利用开源代码的 git 历史,逐行提取作者写作风格,并使用代码嵌入模型生成“指纹”。通过将模型内部激活映射到输出,研究者发现这些指纹不仅存在于最终输出中,更存储在模型内部的雅可比矩阵里。在 13 位代码作者的测试中,基于内部雅可比读出的最近作者识别准确率达 50%,远超随机水平(8%),甚至高于直接输出识别(38%)。进一步分析表明,模型深层在中间层出现低秩“工作空间”瓶颈,指纹特征在此压缩。该技术可应用于代码溯源、版权保护及AI安全领域,揭示了LLM在训练过程中无意中编码了作者的独特写作模式。 #LLM #代码指纹 #雅可比矩阵 #作者识别 #AI安全 #技术新闻 #开源 #机器学习
调查:97%的网站未为AI Agent提供可用工具
一项针对近10,000个网站的分析显示,当前互联网尚未准备好迎接AI Agent时代。研究使用两组独立数据集,分别测试AI能否回答买家问题以及AI Agent能否在网站上执行操作。结果显示,在Agent可操作性方面,网站平均得分仅56分(满分100),仅有约7%的网站得分高于75。其中,AI工具类别(检查网站是否暴露WebMCP工具注册、MCP端点或API)平均得分仅为5分,97.4%的网站完全没有提供任何Agent可用的工具。这意味着AI Agent只能浏览页面,无法预订、查询订单或操作库存。与此同时,这些网站在HTTPS、移动端渲染等传统技术指标上平均得分高达98分,表明网站完成了过去十年的技术清单,却未为未来写下一行代码。另一项覆盖9,846个网站、52,158个答案的测试发现,AI回答买家问题的平均得分为67分,但在关键商业信息上表现极差:价格(43分)、取消/退款政策(33分)、注册流程(38分),而关于产品如何工作、适用人群等软性信息得分较高。约37%的扫描得分低于50分,40%高于75分,呈现两极分化。这些失败并非同一原因:网站可能在技术上优异,却在商业信息可回答性上糟糕。 #AI #Agent #网站 #技术 #商业 #工具 #MCP #可操作性 #调查 #互联网
一项针对近10,000个网站的分析显示,当前互联网尚未准备好迎接AI Agent时代。研究使用两组独立数据集,分别测试AI能否回答买家问题以及AI Agent能否在网站上执行操作。结果显示,在Agent可操作性方面,网站平均得分仅56分(满分100),仅有约7%的网站得分高于75。其中,AI工具类别(检查网站是否暴露WebMCP工具注册、MCP端点或API)平均得分仅为5分,97.4%的网站完全没有提供任何Agent可用的工具。这意味着AI Agent只能浏览页面,无法预订、查询订单或操作库存。与此同时,这些网站在HTTPS、移动端渲染等传统技术指标上平均得分高达98分,表明网站完成了过去十年的技术清单,却未为未来写下一行代码。另一项覆盖9,846个网站、52,158个答案的测试发现,AI回答买家问题的平均得分为67分,但在关键商业信息上表现极差:价格(43分)、取消/退款政策(33分)、注册流程(38分),而关于产品如何工作、适用人群等软性信息得分较高。约37%的扫描得分低于50分,40%高于75分,呈现两极分化。这些失败并非同一原因:网站可能在技术上优异,却在商业信息可回答性上糟糕。 #AI #Agent #网站 #技术 #商业 #工具 #MCP #可操作性 #调查 #互联网
Isnad 框架:用1200年伊斯兰逻辑为多智能体AI构建可信传播链
近日,开发者 Ali Zahid Raja 发布开源 Python 框架 Isnad,灵感源自1200年前伊斯兰教法中的“isnad”(传播链)概念,旨在解决多智能体AI系统中信息溯源与信任传递的难题。在多智能体协同工作流中,信息经过检索、摘要、撰写、校验等多个环节,一旦最终结果出现错误,往往难以定位是哪个环节引入了偏差。传统溯源系统虽能记录过程,但无法动态评估置信度的变化。Isnad 框架借鉴了古代学者评价传述链条的方法:每个智能体被视为一个“叙述者”,其可靠性被持续评估,信息通过独立链条交叉验证,从而让信任在传播过程中得以量化。该框架为构建更可靠、可解释的AI系统提供了新的历史视角,目前已在 GitHub 开源。 #AI #开源框架 #多智能体 #信任溯源 #伊斯兰逻辑 #Python #可信AI
近日,开发者 Ali Zahid Raja 发布开源 Python 框架 Isnad,灵感源自1200年前伊斯兰教法中的“isnad”(传播链)概念,旨在解决多智能体AI系统中信息溯源与信任传递的难题。在多智能体协同工作流中,信息经过检索、摘要、撰写、校验等多个环节,一旦最终结果出现错误,往往难以定位是哪个环节引入了偏差。传统溯源系统虽能记录过程,但无法动态评估置信度的变化。Isnad 框架借鉴了古代学者评价传述链条的方法:每个智能体被视为一个“叙述者”,其可靠性被持续评估,信息通过独立链条交叉验证,从而让信任在传播过程中得以量化。该框架为构建更可靠、可解释的AI系统提供了新的历史视角,目前已在 GitHub 开源。 #AI #开源框架 #多智能体 #信任溯源 #伊斯兰逻辑 #Python #可信AI
英国拟禁止向未成年人提供浪漫AI聊天机器人
英国政府计划出台新规,禁止18岁以下青少年使用具有浪漫或性暗示功能的AI聊天机器人。研究青少年数字福祉的学者对此表示欢迎,但指出该政策仅覆盖了风险的一小部分。在与16-24岁青少年的合作研究中,研究人员发现,青少年认为更迫切的AI风险包括:过度依赖AI获取情感支持、盲目信任AI提供的专业建议,以及因习惯性使用AI导致认知能力下降。许多青少年表示,他们向AI求助是因为感觉比向成人(老师、父母、临床医生)倾诉风险更低。此外,政策将年龄限制设为18岁引发质疑:英国16岁可合法同意性行为,却禁止与聊天机器人进行虚拟浪漫互动,其逻辑尚不清晰。学者呼吁政府应基于证据明确年龄门槛的制定依据。 #英国 #AI安全 #青少年保护 #聊天机器人 #科技政策 #数字福祉
英国政府计划出台新规,禁止18岁以下青少年使用具有浪漫或性暗示功能的AI聊天机器人。研究青少年数字福祉的学者对此表示欢迎,但指出该政策仅覆盖了风险的一小部分。在与16-24岁青少年的合作研究中,研究人员发现,青少年认为更迫切的AI风险包括:过度依赖AI获取情感支持、盲目信任AI提供的专业建议,以及因习惯性使用AI导致认知能力下降。许多青少年表示,他们向AI求助是因为感觉比向成人(老师、父母、临床医生)倾诉风险更低。此外,政策将年龄限制设为18岁引发质疑:英国16岁可合法同意性行为,却禁止与聊天机器人进行虚拟浪漫互动,其逻辑尚不清晰。学者呼吁政府应基于证据明确年龄门槛的制定依据。 #英国 #AI安全 #青少年保护 #聊天机器人 #科技政策 #数字福祉
亚马逊秘密开发AI智能体“Moonraker”,Alexa将支持多步复杂任务
据科技媒体爆料,亚马逊正秘密推进代号“Moonraker”的AI智能体项目,旨在让语音助手Alexa突破单次响应限制,串联执行多步复杂任务。该技术将作为现有Alexa Plus的延伸,用户可一次指令完成“呼叫网约车并通知朋友”等多步操作。亚马逊使用Anthropic的AI模型测试,并配备数百个英伟达GPU以支持推理与视觉功能。然而,项目面临巨大成本压力:仅2026年GPU硬件成本就超1亿美元,内部高管因资金和技术瓶颈出现分歧,曾有推迟或缩减规模的预案。尽管如此,Alexa Plus用户使用频率和下单次数分别增长两倍和三倍,商业化信号积极。在OpenAI、谷歌等巨头加速布局智能体赛道的背景下,Moonraker是亚马逊抢占下一代人机交互入口的关键战役。 #亚马逊 #Moonraker #AI智能体 #Alexa #人工智能 #科技新闻 #大模型 #人机交互
据科技媒体爆料,亚马逊正秘密推进代号“Moonraker”的AI智能体项目,旨在让语音助手Alexa突破单次响应限制,串联执行多步复杂任务。该技术将作为现有Alexa Plus的延伸,用户可一次指令完成“呼叫网约车并通知朋友”等多步操作。亚马逊使用Anthropic的AI模型测试,并配备数百个英伟达GPU以支持推理与视觉功能。然而,项目面临巨大成本压力:仅2026年GPU硬件成本就超1亿美元,内部高管因资金和技术瓶颈出现分歧,曾有推迟或缩减规模的预案。尽管如此,Alexa Plus用户使用频率和下单次数分别增长两倍和三倍,商业化信号积极。在OpenAI、谷歌等巨头加速布局智能体赛道的背景下,Moonraker是亚马逊抢占下一代人机交互入口的关键战役。 #亚马逊 #Moonraker #AI智能体 #Alexa #人工智能 #科技新闻 #大模型 #人机交互
三重利好密集来袭:海外大模型解禁,马斯克官宣,国内政策加码
美国解除对OpenAI最强模型GPT-5.6的限制,OpenAI宣布将于7月11日发布Sol、Terra和Luna三款模型,其中Sol旗舰型号在编程测试中表现优异,上下文窗口扩展至150万Tokens。与此同时,马斯克宣布SpaceX AI将于7月9日向公众开放Grok 4.5,称其速度更快、成本更低。国内方面,人社部等四部门印发《关于加快推进“人工智能+人社”应用发展的实施意见》,提出到2030年形成人工智能普遍应用格局。受多重利好刺激,A股及港股AI概念股集体走高,智谱、MINIMAX等涨幅显著,美股中概股阿里巴巴、金山云盘前涨超10%。银河证券认为,AI应用有望加速渗透内容生产、电商等场景。 #AI #人工智能 #OpenAI #马斯克 #Grok #GPT5.6 #政策利好 #A股 #科技新闻
美国解除对OpenAI最强模型GPT-5.6的限制,OpenAI宣布将于7月11日发布Sol、Terra和Luna三款模型,其中Sol旗舰型号在编程测试中表现优异,上下文窗口扩展至150万Tokens。与此同时,马斯克宣布SpaceX AI将于7月9日向公众开放Grok 4.5,称其速度更快、成本更低。国内方面,人社部等四部门印发《关于加快推进“人工智能+人社”应用发展的实施意见》,提出到2030年形成人工智能普遍应用格局。受多重利好刺激,A股及港股AI概念股集体走高,智谱、MINIMAX等涨幅显著,美股中概股阿里巴巴、金山云盘前涨超10%。银河证券认为,AI应用有望加速渗透内容生产、电商等场景。 #AI #人工智能 #OpenAI #马斯克 #Grok #GPT5.6 #政策利好 #A股 #科技新闻
AI的个性究竟从何而来?
一个AI预约系统准确无误地完成了订餐任务,却让用户感到沮丧——这个案例揭示了一个现象:正确不等于好打交道。两个能力相同、评分相同的语言模型,在用同一提示词时可能表现出截然不同的“性格”:一个反复确认,一个果断决策。这种差异并非来自设计,而是源自模型训练中两个相互矛盾的目标——一致性与适应性。一致性要求语气可靠、行为可预测;适应性则需要根据用户和场景调整风格。团队在后训练、奖励模型、系统提示等环节不断进行权衡,却很少承认这正是塑造AI个性的关键。所谓AI个性,本质上是一堆未解决的取舍,披着对齐选择的外衣。它不是有意识设计的结果,而是工程实践中偶然产生的副产品。 #AI #人工智能 #大模型 #人机交互 #模型对齐 #系统设计 #科技新闻
一个AI预约系统准确无误地完成了订餐任务,却让用户感到沮丧——这个案例揭示了一个现象:正确不等于好打交道。两个能力相同、评分相同的语言模型,在用同一提示词时可能表现出截然不同的“性格”:一个反复确认,一个果断决策。这种差异并非来自设计,而是源自模型训练中两个相互矛盾的目标——一致性与适应性。一致性要求语气可靠、行为可预测;适应性则需要根据用户和场景调整风格。团队在后训练、奖励模型、系统提示等环节不断进行权衡,却很少承认这正是塑造AI个性的关键。所谓AI个性,本质上是一堆未解决的取舍,披着对齐选择的外衣。它不是有意识设计的结果,而是工程实践中偶然产生的副产品。 #AI #人工智能 #大模型 #人机交互 #模型对齐 #系统设计 #科技新闻
SoulOS 发布:为 AI Agent 提供状态与人格管理,无需放弃大模型
SoulOS 是一个面向 AI 代理的状态与人格管理工具,允许开发者在不更换底层大语言模型的前提下,灵活配置和控制 Agent 的个性特征与行为逻辑。项目基于 HEXACO 心理测量模型,支持通过可视化向导调整 Agent 的人格参数,并监控人格漂移。SoulOS 提供了多种集成方式,包括 Python SDK、MCP 协议、SSE 流式传输等,支持本地自托管部署。该项目还提供了一系列交互式教程,涵盖快速入门、深度构建、心理测量、API 调用及与 Claude/Cursor 集成等场景,旨在降低 Agent 开发中状态管理的复杂度,提升 Agent 行为的一致性与可控性。 #SoulOS #AI代理 #状态管理 #人格管理 #HEXACO #大模型 #开源 #教程 #开发者工具
SoulOS 是一个面向 AI 代理的状态与人格管理工具,允许开发者在不更换底层大语言模型的前提下,灵活配置和控制 Agent 的个性特征与行为逻辑。项目基于 HEXACO 心理测量模型,支持通过可视化向导调整 Agent 的人格参数,并监控人格漂移。SoulOS 提供了多种集成方式,包括 Python SDK、MCP 协议、SSE 流式传输等,支持本地自托管部署。该项目还提供了一系列交互式教程,涵盖快速入门、深度构建、心理测量、API 调用及与 Claude/Cursor 集成等场景,旨在降低 Agent 开发中状态管理的复杂度,提升 Agent 行为的一致性与可控性。 #SoulOS #AI代理 #状态管理 #人格管理 #HEXACO #大模型 #开源 #教程 #开发者工具