Anthropic 发布 Claude Mythos,自主任务时长突破 3 小时
Anthropic 推出的 Claude Mythos 模型以“神话”命名,却在现实中实现了 AI 自主能力的重大突破。该模型在 80% 的成功率下,最长连续自主任务时长达到 3 小时 6 分钟,打破了 AI 自主运行的纪录。这一成果远超此前专家预测的年底才能实现的目标,标志着 AI 在复杂任务中的持续执行能力取得实质性进展。Claude Mythos 的突破不仅展现了 AI 从辅助工具向自主主体的转变,也引发了对人类在效率驱动的新范式中角色的深刻思考。业界分析认为,AI 自主时长的提升将加速自动化在科研、开发等领域的应用,但同时也需要警惕人类适应期缩短带来的社会冲击。 #ClaudeMythos #Anthropic #AI自主 #人工智能 #科技突破 #效率革命
Anthropic 推出的 Claude Mythos 模型以“神话”命名,却在现实中实现了 AI 自主能力的重大突破。该模型在 80% 的成功率下,最长连续自主任务时长达到 3 小时 6 分钟,打破了 AI 自主运行的纪录。这一成果远超此前专家预测的年底才能实现的目标,标志着 AI 在复杂任务中的持续执行能力取得实质性进展。Claude Mythos 的突破不仅展现了 AI 从辅助工具向自主主体的转变,也引发了对人类在效率驱动的新范式中角色的深刻思考。业界分析认为,AI 自主时长的提升将加速自动化在科研、开发等领域的应用,但同时也需要警惕人类适应期缩短带来的社会冲击。 #ClaudeMythos #Anthropic #AI自主 #人工智能 #科技突破 #效率革命
LLM应用可观测性:OpenTelemetry成为关键工具
自2022年11月OpenAI发布ChatGPT以来,AI应用在全球爆发式增长,将大语言模型(LLM)集成到产品中已从实验性功能变为竞争基线。然而,构建生产级LLM应用面临独特挑战:模型输出具有非确定性,相同输入可能产生不同结果;需确保响应在上下文中的一致性,例如对“明天降雨概率”与“股市上涨概率”的回答应有所区别;此外,LLM供应商频繁更新模型和配置,可能导致服务降级或质量波动。OpenTelemetry(OTel)作为云原生计算基金会(CNCF)项目,通过标准化遥测数据生成与采集,帮助开发者观测LLM应用行为,避免供应商锁定。本文深入探讨了LLM可观测性的必要性、OTel的工作原理,以及如何通过实践Demo集成到应用中,同时分析了当前LLM专用OTel库的成熟度与GenAI语义约定。 #LLM #OpenTelemetry #可观测性 #AI应用 #大模型 #CNCF #非确定性 #质量监控 #技术
自2022年11月OpenAI发布ChatGPT以来,AI应用在全球爆发式增长,将大语言模型(LLM)集成到产品中已从实验性功能变为竞争基线。然而,构建生产级LLM应用面临独特挑战:模型输出具有非确定性,相同输入可能产生不同结果;需确保响应在上下文中的一致性,例如对“明天降雨概率”与“股市上涨概率”的回答应有所区别;此外,LLM供应商频繁更新模型和配置,可能导致服务降级或质量波动。OpenTelemetry(OTel)作为云原生计算基金会(CNCF)项目,通过标准化遥测数据生成与采集,帮助开发者观测LLM应用行为,避免供应商锁定。本文深入探讨了LLM可观测性的必要性、OTel的工作原理,以及如何通过实践Demo集成到应用中,同时分析了当前LLM专用OTel库的成熟度与GenAI语义约定。 #LLM #OpenTelemetry #可观测性 #AI应用 #大模型 #CNCF #非确定性 #质量监控 #技术
openJiuwen 推出 Auto Harness,实现 Agent 外部系统自动化优化
华为支持的 openJiuwen 社区开源了 JiuwenSwarm 中的 Auto Harness 框架,这是一套评测驱动的、覆盖 Harness 全栈组件的端到端自动优化方案。Harness 是 Agent 模型之外负责工具调用、上下文管理、任务编排等执行逻辑的系统,传统上高度依赖人工调试,耗时且难以复用。Auto Harness 将 Harness 拆分为通用基座层(Meta)和可插拔领域扩展层(Expert),Agent 可自主评测、规划修改并验证效果。基座层优化后自动生成 PR 待人工审核,扩展层则支持热加载即插即用。该框架首次实现 Harness 自动化优化的工程化落地,补全了 Agent “后训练”的另一块拼图。后续还将推进多 Agent 群体的 Swarm Post-Training,实现从模型到单兵再到团队的整体协同进化。 #openJiuwen #AutoHarness #Agent #后训练 #Harness #开源 #人工智能 #大模型 #工程化 #多Agent
华为支持的 openJiuwen 社区开源了 JiuwenSwarm 中的 Auto Harness 框架,这是一套评测驱动的、覆盖 Harness 全栈组件的端到端自动优化方案。Harness 是 Agent 模型之外负责工具调用、上下文管理、任务编排等执行逻辑的系统,传统上高度依赖人工调试,耗时且难以复用。Auto Harness 将 Harness 拆分为通用基座层(Meta)和可插拔领域扩展层(Expert),Agent 可自主评测、规划修改并验证效果。基座层优化后自动生成 PR 待人工审核,扩展层则支持热加载即插即用。该框架首次实现 Harness 自动化优化的工程化落地,补全了 Agent “后训练”的另一块拼图。后续还将推进多 Agent 群体的 Swarm Post-Training,实现从模型到单兵再到团队的整体协同进化。 #openJiuwen #AutoHarness #Agent #后训练 #Harness #开源 #人工智能 #大模型 #工程化 #多Agent
资源稀缺驱动硅谷之外AI创新
长期以来,AI基础设施高度集中于硅谷、西雅图、伦敦等科技中心,依赖超大规模云服务、开发者密度和资本。然而,随着计算成本飙升、电力消耗激增——2024年数据中心已消耗全球约1.5%电力,预计2030年升至近3%——传统模式难以为继。开发者开始面临能源供应、芯片运输、数据管辖权等硬约束,这种稀缺性反而催生了硅谷之外的创新。在印度,Yotta数据服务公司运营着超过1.6万块英伟达H100 GPU的Shakti云平台,支撑印度AI使命计划及本土多语言翻译平台Bhashini;在非洲,Cassava科技公司在南非、埃及等五国部署1.2万块英伟达GPU,打造非洲自主光纤骨干网,使当地初创企业和政府无需绕道欧美即可训练AI。这些地区将资源稀缺视为设计问题,而非事后补救,正在重塑全球AI基础设施版图。 #AI #人工智能 #资源稀缺 #数据中心 #印度 #非洲 #云服务 #英伟达 #科技新闻 #全球格局
长期以来,AI基础设施高度集中于硅谷、西雅图、伦敦等科技中心,依赖超大规模云服务、开发者密度和资本。然而,随着计算成本飙升、电力消耗激增——2024年数据中心已消耗全球约1.5%电力,预计2030年升至近3%——传统模式难以为继。开发者开始面临能源供应、芯片运输、数据管辖权等硬约束,这种稀缺性反而催生了硅谷之外的创新。在印度,Yotta数据服务公司运营着超过1.6万块英伟达H100 GPU的Shakti云平台,支撑印度AI使命计划及本土多语言翻译平台Bhashini;在非洲,Cassava科技公司在南非、埃及等五国部署1.2万块英伟达GPU,打造非洲自主光纤骨干网,使当地初创企业和政府无需绕道欧美即可训练AI。这些地区将资源稀缺视为设计问题,而非事后补救,正在重塑全球AI基础设施版图。 #AI #人工智能 #资源稀缺 #数据中心 #印度 #非洲 #云服务 #英伟达 #科技新闻 #全球格局
AI无状态架构引发审计螺旋,确定性核心架构被提出
一篇论文定义了AI增强应用的确定性核心架构,指出当前大语言模型部署为无状态模式是审计螺旋的根本原因。工程师修复缺陷后,不同模型给出的评分互相矛盾,标准不透明且无法检查,导致“改进永不终止”的循环。论文通过六个工件的生产参考实现证明,该模式并非理论而是已交付的方案。作者在论文评审中发现,五款独立审计模型依据固定标准评判时,约83%反馈属于无退出条件的噪音。无状态架构下,模型没有持久身份和固定基线,优化无法确认完成。作者提出,唯一的出路是停止询问模型“是否完成”,而是告诉它“完成的标准是什么”。该架构旨在为AI应用建立持久身份与固定标准,解决跨会话、跨模型的一致性断裂问题。 #AI架构 #无状态模型 #审计螺旋 #确定性核心 #设计模式 #人工智能 #技术论文 #LLM
一篇论文定义了AI增强应用的确定性核心架构,指出当前大语言模型部署为无状态模式是审计螺旋的根本原因。工程师修复缺陷后,不同模型给出的评分互相矛盾,标准不透明且无法检查,导致“改进永不终止”的循环。论文通过六个工件的生产参考实现证明,该模式并非理论而是已交付的方案。作者在论文评审中发现,五款独立审计模型依据固定标准评判时,约83%反馈属于无退出条件的噪音。无状态架构下,模型没有持久身份和固定基线,优化无法确认完成。作者提出,唯一的出路是停止询问模型“是否完成”,而是告诉它“完成的标准是什么”。该架构旨在为AI应用建立持久身份与固定标准,解决跨会话、跨模型的一致性断裂问题。 #AI架构 #无状态模型 #审计螺旋 #确定性核心 #设计模式 #人工智能 #技术论文 #LLM
英伟达发布RTX Spark超级芯片,正式进军消费PC市场
在GTC Taipei 2026大会上,英伟达CEO黄仁勋宣布推出RTX Spark超级芯片,首次进入消费级PC市场。该芯片集成20核Arm Grace CPU和Blackwell RTX GPU,AI算力达1 petaflop,可本地运行1200亿参数模型,定位为“代理式AI操作系统”的承载平台。同时,英伟达自研Vera CPU进入全面量产,并获得Anthropic、OpenAI、xAI等前沿模型公司的早期支持。Adobe宣布将重写Photoshop和Premiere Pro以原生适配该架构,解决了Windows on Arm生态的软件痛点。此举标志着英伟达完成从数据中心到消费PC的AI栈纵向一体化,对Intel、AMD、Qualcomm形成直接竞争。RTX Spark预计2026年秋季上市,首批面向创作者、AI开发者和玩家。 #英伟达 #RTXSpark #AI芯片 #消费PC #黄仁勋 #代理式AI #ArmCPU #科技新闻
在GTC Taipei 2026大会上,英伟达CEO黄仁勋宣布推出RTX Spark超级芯片,首次进入消费级PC市场。该芯片集成20核Arm Grace CPU和Blackwell RTX GPU,AI算力达1 petaflop,可本地运行1200亿参数模型,定位为“代理式AI操作系统”的承载平台。同时,英伟达自研Vera CPU进入全面量产,并获得Anthropic、OpenAI、xAI等前沿模型公司的早期支持。Adobe宣布将重写Photoshop和Premiere Pro以原生适配该架构,解决了Windows on Arm生态的软件痛点。此举标志着英伟达完成从数据中心到消费PC的AI栈纵向一体化,对Intel、AMD、Qualcomm形成直接竞争。RTX Spark预计2026年秋季上市,首批面向创作者、AI开发者和玩家。 #英伟达 #RTXSpark #AI芯片 #消费PC #黄仁勋 #代理式AI #ArmCPU #科技新闻
类别特定分支注意力
近日,一篇题为《Class-Specific Branch Attention for Mitigating Gradient Interference under Class Imbalance》的学术论文在arXiv预印本平台发布。该论文由Arush Singhal和Umang Soni共同撰写,针对深度学习在类别不平衡场景下常见的梯度干扰问题,提出了一种新颖的类别特定分支注意力机制。该方法通过为每个类别设计独立的分支网络并引入注意力权重,有效减少了不同类别间梯度更新时的相互干扰,从而提升模型在少数类上的学习能力。实验结果表明,该机制在多个标准不平衡数据集上显著优于现有基线方法,为处理长尾分布等现实数据挑战提供了新思路。论文已提交DataCite进行DOI注册,目前处于待处理状态。 #深度学习 #类别不平衡 #梯度干扰 #注意力机制 #神经网络 #机器学习 #论文 #arXiv #AI研究
近日,一篇题为《Class-Specific Branch Attention for Mitigating Gradient Interference under Class Imbalance》的学术论文在arXiv预印本平台发布。该论文由Arush Singhal和Umang Soni共同撰写,针对深度学习在类别不平衡场景下常见的梯度干扰问题,提出了一种新颖的类别特定分支注意力机制。该方法通过为每个类别设计独立的分支网络并引入注意力权重,有效减少了不同类别间梯度更新时的相互干扰,从而提升模型在少数类上的学习能力。实验结果表明,该机制在多个标准不平衡数据集上显著优于现有基线方法,为处理长尾分布等现实数据挑战提供了新思路。论文已提交DataCite进行DOI注册,目前处于待处理状态。 #深度学习 #类别不平衡 #梯度干扰 #注意力机制 #神经网络 #机器学习 #论文 #arXiv #AI研究
Jürgen Schmidhuber
本期播客邀请了现代AI奠基人之一Jürgen Schmidhuber。他回顾了90年代初其团队在算力昂贵百万倍的时代,如何提出LSTM、世界模型、人工好奇心、Transformer变体等如今价值千亿美元的核心思想。他强调,当前大语言模型只是优秀的预测机器,能模仿网络数据,但真正的智能需要“控制器”利用世界模型进行规划。他早在1990年就提出了世界模型和人工好奇心,其中控制器通过实验改进自身模型获得奖励,这种对抗性设置比GAN早多年。他还指出,毫秒级规划不可扩展,需要子目标;压缩是理解的核心,从苹果落地到爱因斯坦公式皆如此。他批评了当前的奖励机制和学术评审体系,并预测未来将有自我复制机器人在太空中工作。 #AI #JürgenSchmidhuber #世界模型 #强化学习 #大语言模型 #人工好奇心 #深度学习 #AGI
本期播客邀请了现代AI奠基人之一Jürgen Schmidhuber。他回顾了90年代初其团队在算力昂贵百万倍的时代,如何提出LSTM、世界模型、人工好奇心、Transformer变体等如今价值千亿美元的核心思想。他强调,当前大语言模型只是优秀的预测机器,能模仿网络数据,但真正的智能需要“控制器”利用世界模型进行规划。他早在1990年就提出了世界模型和人工好奇心,其中控制器通过实验改进自身模型获得奖励,这种对抗性设置比GAN早多年。他还指出,毫秒级规划不可扩展,需要子目标;压缩是理解的核心,从苹果落地到爱因斯坦公式皆如此。他批评了当前的奖励机制和学术评审体系,并预测未来将有自我复制机器人在太空中工作。 #AI #JürgenSchmidhuber #世界模型 #强化学习 #大语言模型 #人工好奇心 #深度学习 #AGI