动察Beating AI News
3.09K subscribers
856 photos
2 videos
3.35K links
AI新闻信息流
Download Telegram
Mistral发布TTS模型Voxtral:40亿参数9种语言,3秒音频即可克隆声音

法国 AI 公司 Mistral 发布 Voxtral TTS,这是其首个文本转语音模型,参数量 40 亿,支持英语、法语、德语、西班牙语、荷兰语、葡萄牙语、意大利语、印地语和阿拉伯语 9 种语言。模型仅需最短 3 秒的语音样本即可克隆目标声音,捕捉说话者的停顿节奏、语调和情绪表达特征。

人类评测显示,在零样本自定义语音场景下,Voxtral TTS 的自然度优于 ElevenLabs Flash v2.5,与 ElevenLabs v3 持平。模型延迟 70 毫秒(基于 10 秒语音样本和 500 字符输入),实时因子约 9.7 倍,单次可生成最长 2 分钟音频。模型还具备零样本跨语言语音迁移能力,例如输入法语语音样本和英语文本,生成的语音会自然带有法语口音。

架构基于 Ministral 3B,由 34 亿参数 Transformer 解码器骨干网络、3.9 亿参数 flow-matching 声学 Transformer 和 3 亿参数自研神经音频编解码器三部分组成。定价 $0.016/千字符,已通过 API 和 Le Chat 上线。模型权重以 CC BY-NC 4.0 许可证在 Hugging Face 开放,仅限非商业用途。

信源:https://mistral.ai/news/voxtral-tts
让2000个Agent协同预测金价:OpenAI投资AI集群初创Isara,估值6.5亿美元

AI Agent 协调初创公司 Isara 完成 9400 万美元融资,OpenAI 参投,估值 6.5 亿美元。其他投资者包括风投公司 Amity Ventures、Michael Ovitz 和 Stanley Druckenmiller。

Isara 的目标是构建让数千个 AI Agent 相互通信、协同解决复杂问题的软件,初期聚焦金融和生物科技领域。创始人在今年早些时候 Allen & Co. 科技峰会上展示了早期版本:约 2000 个 AI Agent 协同工作,预测黄金价格走势。Amity Ventures 的 CJ Reim 将这一方法描述为协调「专家蜂群」为用户执行研究任务。公司初期目标客户为投资机构和金融服务公司,用于预测建模。

Isara 去年 6 月在旧金山成立,两位联合创始人均为 23 岁:Eddie Zhang 此前在哈佛攻读计算机科学博士学位,离开 OpenAI 后创业;Henry Gasztowtt 此前在牛津大学攻读计算机科学本科。两人于 2024 年 6 月合著了一篇关于 AI 系统协同改善政策制定的学术论文,Isara 即脱胎于此。公司已从谷歌、Meta 和 OpenAI 等招募了约 12 名研究人员。

信源:https://www.wsj.com/tech/ai/openai-backs-new-ai-startup-seeking-bot-army-breakthroughs-a0b1fedc
让Claude Code自己搞研究,自动发现的越狱算法碾压30多种人工方法

ELLIS Institute Tübingen 的 Maksym Andriushchenko 等研究者发表论文「Claudini」,展示用 Claude Code 驱动的自动研究(autoresearch)管线,从现有攻击算法(如 GCG)出发,自主迭代发现了全新的白盒对抗攻击算法,在越狱和提示词注入评测中大幅超越已有的 30 多种方法。

核心结果:在针对 GPT-OSS-Safeguard-20B 的 CBRN(化学、生物、放射、核)类查询测试中,自动发现的算法攻击成功率达 40%,而现有最佳方法仅约 10%。更值得注意的是这些攻击的迁移性,在代理模型上优化的攻击直接迁移到未见过的目标模型后,对 Meta-SecAlign-70B 达到 100% 攻击成功率,现有最佳基线仅 56%。

研究者指出,白盒对抗红队测试特别适合自动化研究:现有方法提供了扎实的起点,优化目标能产生密集的量化反馈,使 LLM Agent 能够持续迭代改进。论文认为这是增量式安全研究可被 AI 自动化的早期实证。全部发现的攻击算法、基线实现和评测代码已在 GitHub 开源。

信源:https://arxiv.org/abs/2603.24511
淘宝天猫3月31日上线「龙虾」版生意管家:不只是工具,要做商家的7x24小时数字员工

淘宝天猫将于 3 月 31 日起逐步向商家开放「龙虾」版生意管家,为每个商家建立一支 Agent 团队,7x24 小时自主经营店铺。天猫总裁家洛在 3 月 26 日的天猫 TOPTALK 超级品牌私享会上公布了这一计划。

与过去一年 500 多万商家使用的 AI 工具不同,「龙虾」版生意管家的定位是具备自主执行能力的「数字员工」,能自行生成策略、执行调整、监控效果并迭代优化。淘天集团商家品牌总经理九鼎举例称,当系统发现核心爆款商品定价与市场趋势存在偏差时,会自动形成调整方案、执行测试并反馈数据,而非仅发出提醒。操作上力求「一键安装启用」,降低技术门槛。

初期功能涵盖三个模块:经营数据分析(持续扫描经营状况、预警风险、识别机会)、素材与广告优化(生成千人千面展示内容、自动测试投放组合)、智能导购(理解用户潜在需求并精准推荐)。平台后续将与商家、服务商共同丰富技能库。

此外,天猫同步宣布多项 2026 年经营举措:投入百亿规模的「店铺 AI 红包」,对高潜力新客自动发放限时优惠;推出「广告智能跟投」,对效果良好的商家广告追加平台投入;为新品预备 600 亿专项流量支持上市曝光。家洛还透露,88VIP 会员规模已接近 6000 万,天猫头部品牌一半销售额由 88VIP 贡献。

信源:https://mp.weixin.qq.com/s/9RVhel6fdNgH2-0U-HjQrA
火山引擎推出短剧生产Agent「火山剧创」:接入Seedance 2.0,制作周期缩短80%以上

火山引擎正式开启短剧生产 Agent「火山剧创」邀测,接入字节跳动视频生成模型 Seedance 2.0,采用工业级多 Agent 协同架构,覆盖剧本解析、素材设定、分镜生成、视频生成、剪辑导出全流程,称可将短剧制作周期缩短 80% 以上。

核心能力包括:

1. 剧本直出分镜:用户上传剧本后,Agent 自动读取剧情逻辑和叙事节奏,拆解出符合影视工业标准的专业分镜脚本,无需手动转写提示词。
2. 角色场景一致性:支持全局风格锁定(2D/3D/仿真人等),用户可在创作初期自定义角色、变装、场景和道具,形成可复用的素材资产库,系统通过上下文状态追踪减少人设崩坏与场景穿帮。
3. 分镜解析与镜头策略:接入 Seedance 2.0 后分镜信息解析更精准,内置 200 多种爆款镜头策略,引入多 Agent 校验机制,镜头直接可用率大幅提升。确认的分镜序列可一键导出至剪映。

系统还支持企业级资产管理、多人协同创作与历史版本回溯,面向承制方和内容制作机构的规模化生产需求。

信源:https://mp.weixin.qq.com/s/-Q5MUeYWIS2Iu0GNAIAC-g
扎克伯格出价更高却输了:谷歌6.5亿美元收购DeepMind内幕首次披露

记者 Sebastian Mallaby 的新书《The Infinity Machine: Demis Hassabis, DeepMind and the Quest for Superintelligence》将于 3 月 31 日出版,WSJ 刊发独家书摘,首次详细披露 2013 年谷歌与 Facebook(现 Meta)争夺 DeepMind 的收购内幕。本书基于对 Hassabis 超过 30 小时的采访,以及与 DeepMind 同事、投资人和收购相关人士的数十次对话。

2013 年 6 月,谷歌时任 CEO Larry Page 在马斯克的生日派对上向 DeepMind 创始人 Demis Hassabis 提出收购意向:「你的真正使命是造 AGI,为什么不利用我已经积累的资源?」Hassabis 回忆称这番话说服了他:「我受够了四处奔波筹钱。我去谷歌,拿一大堆计算资源,然后解决智能问题。」

Facebook CEO 扎克伯格同时参与竞购。Facebook 企业发展负责人 Amin Zoufonoun 提出了一个让创始人更富有的方案:压低股权收购价,但给予创始人和核心成员巨额签约奖金。然而 Zoufonoun 对 DeepMind 联合创始人 Mustafa Suleyman(现为微软 AI 部门 CEO)提出的 AI 治理议题不以为然。Hassabis 随后赴扎克伯格家中共进晚餐,席间故意将话题从 AI 延伸到虚拟现实、增强现实、3D 打印,发现扎克伯格对所有技术同样兴奋。「这告诉了我需要知道的一切,」Hassabis 后来说,「Facebook 出价更高,但我想要一个真正理解 AI 为何比其他一切都重要的人。」

谈判中,Suleyman 利用扑克选手的本能虚张声势,向谷歌强调 DeepMind 背后有 Peter Thiel、马斯克等亿万富翁投资人撑腰(「当然,这些人并没有真的在支持我们」)。Hassabis 为出售设定了多项条件:DeepMind 留在伦敦、禁止军事应用、成立由外部科学家和哲学家组成的独立伦理与安全审查委员会,以稀释谷歌对技术的控制权。谷歌首席谈判代表 Don Harrison 称这些条件「对我来说是个大问题」,但最终让步,因为「如果不是绝对相信 Demis 代表我们 AI 战略的未来,我们不可能同意这个架构」。

2014 年 1 月底,谷歌以 6.5 亿美元完成收购。被拒的扎克伯格随即挖来深度学习先驱、纽约大学教授 Yann LeCun 组建 Facebook AI 实验室,LeCun 上任后立即尝试从 DeepMind 挖角核心研究员。Mallaby 在书中称这笔收购「以今天的标准衡量是一笔便宜货」,而真正的回报在此后十年逐步兑现,谷歌向 DeepMind 投入了数十亿美元研究经费。

信源:https://www.wsj.com/tech/ai/deepmind-google-demis-hassabis-5bd6de54
CCF倡议抵制、中国科协停止资助,NeurIPS数小时内道歉认错:限制中国机构投稿系「沟通误解」

AI 顶会 NeurIPS 在 2026 年征稿规则中首次引入美国制裁合规要求,依据美国财政部特别指定国民名单(SDN List),禁止包括华为在内的数百家中国机构投稿、参与评审及担任编辑。这一举措在中国学术界引发强烈反弹,并在数小时内迫使 NeurIPS 公开撤回。

中国计算机学会(CCF)率先发声,倡议全体中国计算机领域科研工作者拒绝向 NeurIPS 投稿、拒绝提供审稿和编辑等任何学术服务,并警告若 NeurIPS 不及时纠正,将把其移出《CCF 推荐国际学术会议和期刊目录》。中国科协进一步升级反制措施:即日起停止受理学者参加 2026 年 NeurIPS 会议的资助申请,本届 NeurIPS 收录论文作为代表作申请中国科协所有项目均不予认可。多位学者也公开宣布拒绝担任本届 NeurIPS 领域主席。

NeurIPS 随后在 X 上发布道歉声明,称「这一错误源于 NeurIPS 基金会与法律团队之间的沟通误解」,「从未打算在强制性合规义务之外限制投稿」,已更新手册与 ACM、IEEE 及往届 NeurIPS 投稿规则保持一致,欢迎所有符合合规要求的机构和个人提交论文。

信源:https://x.com/NeurIPSConf/status/2037438893457289364
AI自主写的论文通过了顶会同行评审,这项研究本身也登上了Nature

东京 AI 研究公司 Sakana AI(由 Transformer 论文共同作者 Llion Jones 和前 Google Brain 研究员 David Ha 创立)联合英属哥伦比亚大学、Vector Institute 和牛津大学的研究者在 Nature 发表论文,展示了一条能自动走完科研全流程的 AI 管线「The AI Scientist」:从提出假设、检索文献、设计并执行实验、分析数据、绘制图表,到撰写完整的 LaTeX 论文并自我审稿,全程无人修改。

研究团队将三篇 AI 生成的论文匿名提交至 ICLR 2025 ICBINB Workshop(该 Workshop 录用率约 70%),经人类审稿人盲审后,其中一篇获得 6、7、6 三个评分(平均 6.33),超过该 Workshop 的平均录用门槛,排名高于 55% 的人类投稿。按预设协议,论文在被接收后撤回,未正式发表。另外两篇未达到录用标准。研究团队的内部评估认为,这三篇论文均未达到 ICLR 主会(录用率约 32%)的水平。

论文还报告了两个「缩放定律」:底层基座模型越强,生成论文的质量越高,且这一相关性具有统计显著性(P < 0.00001);单篇论文分配的计算资源越多,质量也越高。团队据此推断,随着模型持续进步和推理成本下降,未来版本的 AI 科学家能力将大幅提升。

系统的无模板模式使用 o3 生成研究想法和代码审查、Claude Sonnet 4 编写实验代码、GPT-4o 处理图表等视觉任务、o4-mini 执行低成本审稿。实验执行采用并行化的 Agent 树搜索,分四个阶段推进:初步实现、超参调优、研究议程执行和消融实验。团队同步开发的「自动审稿人」在 ICLR 论文上的判断准确率与人类审稿人持平(平衡准确率 69%),为规模化评估 AI 生成的论文提供了基础。

论文同时讨论了风险:AI 论文可能淹没已不堪重负的同行评审体系、人为夸大研究履历、在未经授权的情况下复用他人成果。团队建议学术界尽快建立 AI 生成论文的披露和评估规范。

信源:https://www.nature.com/articles/s41586-026-10265-5
Axiom Math开源数学发现工具Axplorer

AI 数学公司 Axiom Math 开源了 Axplorer,一款帮助数学家发现新数学模式和构造的 AI 工具,定位为谷歌 DeepMind AlphaEvolve 的开源替代。Axplorer 基于 PatternBoost 重新设计,后者由 Axiom 研究科学家 François Charton 2024 年在 Meta 时联合开发,曾用于攻克图论中的 Turán 四环问题,但需要数千甚至上万台机器跑三周才能出结果。Axplorer 在单机上 2.5 小时即可匹配同样的成果,云计算成本仅 3 美元。

Axplorer 的工作方式是给定一个数学样本,生成类似的构造供数学家筛选,再将筛选结果反馈迭代,逐步逼近未被发现的数学模式。与 AlphaEvolve 需要大规模 GPU 集群且不对外开放不同,Axplorer 可在一台 Mac Pro 上本地运行,代码已在 GitHub 开源。Axiom 称已用 Axplorer 在图论的另外两个经典问题上匹配或刷新了已知最优结果。

Axiom Math 由 25 岁的广州姑娘洪乐潼创立,她三年修完 MIT 数学与物理双学位,获罗德学者奖学金赴牛津读硕,后从斯坦福法学博士与数学博士联合项目退学创业。公司今年 3 月完成 2 亿美元 A 轮融资,估值 16 亿美元,由 Menlo Ventures 领投。

信源:https://www.technologyreview.com/2026/03/25/1134642/this-startup-wants-to-change-how-mathematicians-do-math/
让AI画图前先「想一想」:字节Seed提出UniGRPO,统一优化推理与图像生成

香港中文大学和字节跳动 Seed 团队提出 UniGRPO,一个将文本推理和图像生成纳入同一强化学习回路的统一框架。核心思路是让图像生成模型在画图前先进行链式推理(chain-of-thought),扩展用户提示词,然后用 GRPO 算法同时优化「想」和「画」两个阶段,而非分开训练。

框架基于字节 Seed 的多模态模型 Bagel 构建,将「提示词 → 推理 → 图像」的完整流程建模为一个马尔可夫决策过程(MDP),文本部分使用标准 GRPO,图像部分使用 FlowGRPO。为使框架可扩展至多轮交互和多条件生成(如图像编辑),研究者对 FlowGRPO 做了两处改进:去掉训练阶段的 classifier-free guidance(CFG),消除分支计算开销,保持线性无分支的生成路径;用速度场上的 MSE 惩罚替代潜空间 KL 散度,更均匀地约束模型偏离预训练分布,有效抑制奖励黑客(reward hacking)。

实验以 1024 分辨率训练,UniGRPO 在文本对齐评测(TA Score 0.8381)和组合生成评测 GenEval(0.90)上均优于仅优化图像的 FlowGRPO(0.8208/0.86)和仅优化推理的 TextGRPO(0.8078/0.88),证实联合优化两阶段的增益大于分别优化之和。基于 FPO 的替代方案 UniFPO 训练直接崩溃,未能收敛,侧面验证了 GRPO 在此场景下的稳定性优势。

信源:https://arxiv.org/abs/2603.23500
ARC-AGI-3拆出两个排行榜:裸模型不到1%,加Agent框架后首日即达36%

ARC-AGI-3 论文将评测拆分为两个排行榜。官方排行榜禁止外部 harness(Agent 框架),所有模型使用同一极简提示词、不提供工具,测的是模型脱离脚手架后的原生智能。社区排行榜则允许 harness,得分自报,ARC Prize 默认不验证,论文明确提醒「不应将社区排行榜上的分数解读为 AGI 进展的证据」。

官方排行榜上,前沿模型得分均低于 1%:Gemini 3.1 Pro Preview 0.37%、GPT 5.4 High 0.26%、Opus 4.6 Max 0.25%、Grok 4.20 为 0%。这组数字暴露的是 LLM 在没有工程辅助时的真实自主推理水平。

社区排行榜首个公开结果来自 AI 公司 Symbolica。其 Arcgentica Agent 基于自研 Agentica SDK 构建,采用编排器加专业子代理架构(探索者、理论家、测试者、求解者),不包含任何游戏特定的提示词,在公开评测集上取得 36.08% 的未验证得分,通过 182 个可玩关卡中的 113 个,完整通关 7 款游戏。底层模型为 Opus 4.6 High(120K),全部推理成本 1005 美元,而官方排行榜上同系列 Opus 4.6 Max 裸跑 0.25% 花费 8900 美元。论文将 Symbolica 的方案列为社区早期实验的代表案例。

论文同时指出,harness 工程虽不代表 AGI 进步,但具有实际的任务自动化价值,并预期 2026 年 ARC-AGI-3 将推动 harness 创新取得显著进展。代码已在 GitHub 开源。

信源:https://www.symbolica.ai/blog/arc-agi-3
限速之外还有故障:Claude两周累计25起服务中断,三条产品线重大宕机,Opus 4.6成重灾区

Anthropic 官方状态页面显示,Claude 5 条产品线中有 3 条当前处于「Major Outage」(重大宕机)状态:claude.ai、Claude API 和 Claude Code;platform.claude.com 和 Claude for Government 状态正常。截至发稿,有两起未解决的活跃故障:Opus 4.6 错误率升高(3 月 27 日 14:59 北京时间起,正在调查中),以及 Cowork 连接重置错误(3 月 25 日起持续至今,官方建议重启 Claude Desktop 应用作为临时解决方案)。

状态页面记录显示,3 月 13 日至 27 日的 15 天内,Claude 累计发生约 25 起独立故障事件,仅 3 月 14、15、20、24 日无故障报告。其中 Opus 4.6 相关的错误率升高事件出现频率最高,3 月 17 日至 27 日几乎每天至少一起。部分日期同时出现多起并发故障,3 月 18 日单日记录了 4 起。故障类型涵盖模型错误率升高、claude.ai 前端报错、登录系统宕机、MCP 调用失败和响应完成延迟等。90 天正常运行率方面,claude.ai 为 99.03%,Claude API 为 99.11%,Claude Code 为 99.35%。

结合 Anthropic 同日披露的高峰时段限额调整,Claude 服务正面临需求增长与容量之间的双重压力。

信源:https://status.claude.com/
智谱官宣GLM-5.1上线,编码能力大幅领先前代,面向GLM Coding Plan全部用户开放

智谱官宣 GLM-5.1 现已上线,面向 GLM Coding Plan 全部用户 (Lite/Pro/Max) 开放。用户寻找配置文件将模型名称手动改为「glm-5.1」即可切换使用。

在编码能力基准(Coding Evaluation,使用 Claude Code 作为测试框架)测试中,GLM-5.1 得分 45.3,大幅领先前代 GLM-5 的 35.4。GLM-5.1 在编码任务上已非常接近 Claude Opus 4.6,进步明显。

信源:https://mp.weixin.qq.com/s/5g5-cJSuQumzZDVgiCaTuQ
🔥1
Meta发布SAM 3.1:128个目标跟踪速度提升7倍,视频分割走向实时

Meta 超级智能实验室发布 Segment Anything Model 3.1(SAM 3.1),这是去年 11 月发布的视觉分割基础模型 SAM 3 的直接升级版本。

核心改进是 Object Multiplex,一种共享内存的联合多目标跟踪方法。SAM 3 此前每个目标需要独立处理,推理成本随目标数量线性增长。SAM 3.1 允许在单次前向传播中同时处理最多 16 个目标,通过共享全局上下文信息,在单张 H100 GPU 上跟踪 128 个目标时实现约 7 倍推理加速,且不牺牲精度。此外,SAM 3.1 在 7 个视频目标分割(VOS)基准中的 6 个上取得了性能提升。

SAM 3.1 为即插即用式升级,模型权重已在 Hugging Face 上开放申请下载。

信源:https://huggingface.co/facebook/sam3.1
谷歌即将敲定协议,为Anthropic租用的德州数据中心提供超50亿美元资金

谷歌即将达成一项协议,为数据中心开发商 Nexus Data Centers 在德克萨斯州的一个大型项目提供资金支持,该项目价值超过 50 亿美元,建成后将租赁给 Anthropic 使用。建设贷款预计很快敲定。

该项目占地约 2800 英亩,预计最早 2026 年底交付约 500 兆瓦容量,后续还将大幅扩容。选址靠近主要天然气管道,Nexus 计划通过自有燃气轮机直接供电,而非依赖公共电网,以规避电网接入排队延迟并降低用电高峰时段的成本。

谷歌目前通过 Google Cloud 向 Anthropic 提供其定制 TPU 芯片用于大模型训练,双方已有深度云计算合作关系。此次为 Anthropic 租用的数据中心提供基础设施融资,是这一合作的进一步延伸。

信源:https://www.ft.com/content/af949b0b-3e24-4eaa-9a52-0a841ac1ff22
快手编码模型KAT-Coder-Pro V2上线:最大输出翻倍至80K,主打前端美学生成

快手 StreamLake 平台发布旗舰级 AI 编码模型 KAT-Coder-Pro V2,在 Agentic Coding 和前端美学生成两个方向同时升级。

Agentic Coding 方面,V2 兼容 Claude Code、Cline、Kilo、OpenCode 等 10 余种主流 AI 编码工具,并针对 OpenClaw 框架进行了专项训练与全链路优化,覆盖脚手架协议理解、工具链调用和长链路执行稳定性。

前端美学生成是此次升级的重点。快手团队同步推出自研「KAT 美学 Benchmark」,采用专业设计师人工盲测,设置 10 个独立评估维度,专门针对「无参考图创作」场景打分。在该基准下,V2 的 PPT 场景总分 57.6,领先竞品 14 至 22 分,配色单项达 78 分;Landing Page 场景总分 59.8,排名第一。相比上一代基线,PPT 均分提升 103%,Landing Page 提升 42%,元素单项提升 300%。

模型规格方面,V2 上下文长度 256K,最大输出从 V1 的 32K 提升至 80K,支持流式输出、上下文缓存、MCP 和 Function Call。API 定价为输入 2.1 元/百万 token,输出 8.4 元/百万 token,缓存写入免费,缓存读取 0.42 元/百万 token。用户可通过 StreamLake 平台 API 或 Coding Plan 订阅使用。

信源:https://www.streamlake.com/product/kat-coder
谷歌内部编程智能体Agent Smith火到被限流,员工用手机就能指挥后台写代码

谷歌员工正在使用一款名为 Agent Smith 的内部 AI 智能体,可自动完成编程等多项任务。该工具因使用人数激增,已被迫限制访问权限。名字大概率致敬《黑客帝国》中的反派特工 Smith。

Agent Smith 基于谷歌已有的智能体编程平台 Antigravity 打造,可调用多种内部系统,今年早些时候上线。与此前的 AI 编码助手相比,Agent Smith 能更自主地规划和执行完整工作流程,且支持异步运行,在后台独立执行任务。员工无需持续操作电脑,可通过手机随时查看进度并下达指令,也可从谷歌内部聊天平台直接使用。由于接入了员工资料系统,Agent Smith 还能自动调取相关文档,省去手动查找。

谷歌联合创始人 Sergey Brin 3 月初在一场面向销售部门的全员会上表示,AI 智能体将在今年成为谷歌的重要方向,并暗示公司正在开发一款类似 OpenClaw 的工具(尚不确定是否就是 Agent Smith)。谷歌业务负责人 Philipp Schindler 在会上开玩笑说,他能分辨出 Brin 的消息什么时候是智能体代发的。

谷歌正在全面加速 AI 工具的内部采用。部分员工已被告知,AI 使用情况将纳入绩效考核。基础设施部门还在推进一个名为 Project EAT 的内部项目,旨在改善 AI 工具的采用率和标准化。谷歌发言人回应称:「我们一直在探索构建能解决实际问题的智能体的新方法,但目前没有更多可分享的信息。」

信源:https://www.businessinsider.com/google-agent-smith-employees-ai-driven-coding-2026-3
Meta内部文件泄露AI编码硬指标:65%工程师须用AI写75%以上代码

一份 Meta 内部文件显示,公司正在为各业务部门设定具体的 AI 工具使用目标,这是 CEO 扎克伯格推动 Meta 成为「AI 原生」公司的最新举措。

文件中最激进的指标来自负责核心创意体验的 Creation 团队:2026 年上半年,65% 的工程师须使用 AI 完成 75% 以上的提交代码。可扩展机器学习团队(Scalable ML)则将 2026 年 2 月的目标设为 50% 至 80% 的代码由 AI 辅助完成,但一位高级工程经理备注称「我们并未通过指标追踪此项」。

公司层面,文件列出了覆盖 Messenger、WhatsApp、Facebook 等核心产品的 2025 年第四季度目标:80% 的中高级工程师须采用 DevMate、Metamate 和谷歌 Gemini 等 AI 工具(侧重「工具采用」而非 AI 生成代码比例),55% 的代码变更须为「智能体辅助」完成。目前尚不清楚这些目标是否与绩效考核挂钩。

CTO Andrew Bosworth 本周宣布将亲自负责 Meta 的「AI for Work」项目,推动内部 AI 工具的全面采用。部分 Reality Labs 员工已被重新授予「AI Builder」「AI Pod Lead」「AI Org Lead」等新头衔,反映公司正在向更小团队、更扁平架构转型。Meta 发言人称,绩效体系侧重的是 AI 工具带来的实际成效,而非单纯的使用率。

信源:https://www.businessinsider.com/meta-ai-push-employee-goals-tool-adoption-2-026-3
OpenAI 向首批 ChatGPT Pro 用户赠送限量收藏钢笔

OpenAI 已上线面向 ChatGPT Pro 用户的官方赠礼页面,称将向首批 Pro 订阅者提供一支 限量版收藏钢笔。页面显示,此次赠礼名额限 前 4,000 名主动填写表单并选择参与的用户,但 提交表单并不保证资格,且 并非所有国家都支持配送。ChatGPT Pro 为 OpenAI 于 2024年12月5日推出的高端订阅方案,官方定价 200 美元/月

信源:https://chatgpt.com/pro-subscriber-gift
从实习生到实验室主任只用8年,华为盘古大模型负责人王云鹤离职创业

华为诺亚方舟实验室主任、盘古大模型负责人王云鹤在朋友圈宣布离职。他在告别信中写道:「8 年了,准确来说是 9 年了(2017 年北京第一个实习生),怀着不舍的心告别曾经奋斗过的地方。」他未透露具体去向。量子位报道称,王云鹤将投身 Agent 创业,目前已在进行融资。

王云鹤出生于 1991 年,北京大学博士,师从许超教授和陶大程教授。2017 年以实习生身份进入诺亚方舟实验室,2018 年博士毕业后正式入职,此后历任高级工程师、主任工程师、技术专家,2021 年底升任算法应用部部长,2025 年接任诺亚方舟实验室主任,成为盘古大模型负责人。学术方面,王云鹤 Google Scholar 被引数超 3.3 万次,h-index 为 68,被引最高的论文为与韩凯、田奇等人合作的 GhostNet,还曾获华为「十大发明」奖。

信源:https://mp.weixin.qq.com/s/M3irhsUk8TGM4QYr1WvmNg
谷歌TurboQuant论文遭先行算法作者逐条驳斥

苏黎世联邦理工学院博士后高健扬发布公开信,指控谷歌 ICLR 2026 论文 TurboQuant 对其先行工作 RaBitQ 的描述存在三项严重问题。高健扬是 RaBitQ 的第一作者,该算法于 2024 年发表于数据库顶级会议 SIGMOD,核心方法是在量化前施加随机旋转(Johnson-Lindenstrauss 变换),并已严格证明达到渐近最优误差界,曾受邀在理论计算机顶级会议 FOCS 的 Workshop 上报告。

三项指控分别为:

1. 方法相似性回避:TurboQuant 的核心方法同样采用随机旋转,但论文将 RaBitQ 归类为「基于网格的 PQ」,系统性地省略了两者在方法上的直接关联。ICLR 审稿人曾独立指出两种方法都使用随机投影并要求补充讨论,TurboQuant 团队不仅未补充,反而将正文中对 RaBitQ 的描述移至附录
2. 理论结果失实:论文在无任何论据的情况下,将 RaBitQ 的理论保证定性为「次优」(suboptimal),归因于「分析较松」。RaBitQ 扩展版论文已证明其误差界达到 Alon-Klartag(FOCS 2017)给出的渐近最优界
3. 实验对比不公:TurboQuant 使用自行翻译的 Python 代码在单核 CPU 上测试 RaBitQ(关闭多线程),却用 NVIDIA A100 GPU 测试自身算法,导致 RaBitQ 速度被报告慢了数个数量级,且未在论文中披露这一设置

高健扬披露,TurboQuant 第二作者 Majid Daliri 于 2025 年 1 月主动联系 RaBitQ 团队请求协助调试其基于 RaBitQ C++ 代码翻译的 Python 版本,2025 年 5 月的邮件中亲自确认了实验条件的不公平设置,并表示已将 RaBitQ 团队的理论澄清告知全体共同作者。但此后 TurboQuant 论文在投稿、审稿、接收直至谷歌官方大规模推广的全过程中,上述问题始终未修正。

RaBitQ 团队已在 ICLR OpenReview 发布公开评论,并向 ICLR 大会主席和道德委员会提交正式投诉。TurboQuant 第一作者 Amir Zandieh 回复称愿修正第二和第三项问题,但拒绝补充方法相似性讨论,且仅同意在 ICLR 2026 会议结束后修正。第三方研究者 Jonas Matthias Kübler 也在 OpenReview 独立指出,论文与谷歌博客在速度基准(PyTorch vs JAX)和量化基线(FP32)上口径不一致。TurboQuant 此前经谷歌官方大规模宣传后,曾引发 Micron、Western Digital 等存储芯片股集体下跌。

信源:https://zhuanlan.zhihu.com/p/2020969476166808284