动察Beating AI News
3.68K subscribers
1.42K photos
4 videos
1 file
4.39K links
AI新闻信息流
Download Telegram
OpenAI寻求新一轮IPO前融资,估值目标达1.2万亿美元

据《金融时报》报道,OpenAI 正在与投资者初步讨论新一轮私人融资,目标估值约 1.2 万亿美元,为未来 IPO 做准备。知情人士透露,OpenAI 今年 3 月完成一轮融资后估值达到 8520 亿美元,近期因最新 AI 模型带动市场需求回升,公司与大型投资者讨论进一步融资计划。相关谈判仍处早期阶段,最终估值和融资规模可能发生变化。

OpenAI 首席执行官 Sam Altman 此前表示,公司上市时间可能不会早于 2027 年,并认为当前 AI 安全风险讨论升温的环境下上市并非最佳时机。GPT-5.6 和 Astra 等新模型发布后,OpenAI 收入增长加快,年化收入已超过 400 亿美元。公司此前曾表示拥有充足资金,但训练大模型仍需要持续投入大量资本。

动察 Beating 频道 · 动察 Beating 交流群
Gemini 3.8 Live发布,82.6分登顶语音榜

谷歌发布两款新的实时语音模型 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking。Extended Thinking 专门处理复杂任务,可以一边说话一边推理,还能在后台调用工具,不用停下对话等待结果。

在 Artificial Analysis 的 Speech-to-Speech Quality Index 中,Gemini 3.8 Live Extended Thinking 拿到 82.6 分,超过 GPT-Live-1 + Astra 的 81.5 分和 Grok Voice Think Fast 2.0 的 81.3 分,登上榜首。它在语音 Agent 任务 τ-Voice 上也拿到 68.6%。

普通版 Gemini 3.8 Live 更偏向低成本实时交互,支持 97 种语言自动切换、实时视觉输入和异步工具调用。两款模型已经进入 Gemini API 和 Google AI Studio,音频输入价格为每分钟 0.005 美元,输出为 0.018 美元。

信源

动察 Beating 频道 · 动察 Beating 交流群
Meta版「全家桶」全球上线:三大App加AI每月7.99美元起

Meta 正式在全球推出 Meta One,把 Instagram Plus、Facebook Plus 和 WhatsApp Plus 打包进一份订阅,再提供更多 Meta AI 使用量。个人版 Core 每月 7.99 美元,Premium 每月 19.99 美元。三款 App 的核心功能和 Meta AI 日常使用仍然免费。

付费用户可以更多使用 Muse 生成图片和视频,也能更频繁使用 Instagram 的 Restyle、语音特效等 AI 功能。不过 Meta 没有公布固定的 AI 使用上限,称额度会随地区、产品和系统情况变化。

Meta 还推出面向创作者和企业的套餐,每月 14.99 美元起,最高 499 美元。功能包括认证徽章、数据分析、定时发布 Story、给普通帖子和 Reels 加链接,以及更多 Meta Business Agent 使用量。

Meta 称,旗下这些付费方案此前已经逐步测试和上线,目前累计有 1500 万份订阅和试用。Meta One 现在正式面向全球提供。

信源

动察 Beating 频道 · 动察 Beating 交流群
2
OpenAI时隔2年半反超Anthropic,Astra支出份额第一

OpenRouter 最新数据显示,上周用户在 OpenAI 模型上的支出超过 Anthropic。这是自 2024 年 2 月以来第一次,Anthropic 保持了两年半的领先被打破。

最大的变化来自 Astra。它一款模型就拿下 OpenAI 和 Anthropic 合计支出的约 19%,超过 Opus 5 的 16%,成为上周最吸金的模型。GPT-5.6 Sol 和 Luna 则各占约 10%。

OpenAI 的回升其实早已开始。今年夏天 Terra 和 Luna 大幅降价后,OpenRouter 上的使用量迅速增长,部分用户在优惠结束后仍继续使用。Astra 上线后,OpenAI 最终把支出份额推过了 50%。

不过这只代表 OpenRouter 上 OpenAI 与 Anthropic 两家的相对支出,不能直接等同于整个 API 市场或两家公司的总收入。

信源

动察 Beating 频道 · 动察 Beating 交流群
👍2
微信聊天记录能直接导给ChatGPT了,文字附件一起打包

微信开始进一步放开聊天记录的流转。

实测显示,手机微信升级至 8.0.78 后,多选聊天记录并选择「转发到其他应用」,除了元宝、WorkBuddy,还可以通过「选择手机中的应用」直接交给 ChatGPT 等第三方 App。一次最多可选择 100 条。

微信会把聊天打成一个 ZIP 压缩包,里面包含按时间整理的聊天记录 TXT 和相关附件。电脑端微信也开放了类似入口,社区开发者已经基于此做出中转工具,可以把聊天记录送进 ChatGPT、Claude 等 AI。

信源

动察 Beating 频道 · 动察 Beating 交流群
🥰3🤡2
OpenAI或周四推出GPT-6 Sol:主打更快、更省

OpenAI 可能会在本周四发布 GPT-6 Sol。AI 顶流博主 Mark Kretschmann 直接给出了这个日期,并称它相比 Astra 会更便宜、更快,但能力稍弱。

OpenAI 目前还没官宣。Sam Altman 只确认本周有一次「大发布」,Tibo Sottiaux 则称,本周的发布规模接近一届 DevDay。

Astra 目前是 GPT-6 的最高能力型号,Sol 如果本周上线,更可能成为速度和成本更友好的日常主力。

信源

动察 Beating 频道 · 动察 Beating 交流群
前OpenAI研究员做了个「不会聊天」的AI:Jev只做判断,最高快200倍

前 OpenAI 研究员 Diogo Almeida 创办的 TypeSafe AI 推出新模型 Jev。它有点像一个能读懂自然语言的超级分类器,不生成文本,只返回选项、分数和概率,专门给软件做判断。

普通大模型需要一个 token 一个 token 往外生成,Jev 则可以并行给出多个结果。TypeSafe 还用新的 RLCD 方法训练它的置信度,让模型在给出判断的同时,告诉程序自己有多大把握。

TypeSafe 用安全告警、Agent 审查、发票处理和客服做了 4 组自动化工作流测试。在这套自建评测里,Jev 最高比 Claude Sonnet 5 快约 193.6 倍,比 Claude Opus 5 便宜约 444.6 倍。

TypeSafe 把 Jev 称为首款「System One Model」(快速决策模型),名字来自卡尼曼《思考,快与慢》里的 System 1。它专门处理分类、打分、路由和下一步决策这类快速判断任务。

信源

动察 Beating 频道 · 动察 Beating 交流群
Hugging Face封禁黑客版GLM-5.3,作者改名后重传

Hugging Face 已封禁 AI 安全公司 Audn 上传的 penclaw-GLM-5.3-abliterated-for-offensive-cyber,页面显示其违反 Content Policy。这个版本直接修改 GLM-5.3 权重,削弱模型的拒答行为。原仓库名和介绍还明确写着 offensive cyber。作者随后删掉这几个字,重新上传了模型。

具体为什么被封,Hugging Face 没有公开解释。作者称自己也没搞懂原因,社区有人猜测是 offensive cyber 的命名触发了审核。Hugging Face 的现行政策确实禁止旨在破坏、未经授权访问系统,以及生成恶意代码的内容。

但这类削弱模型拒答限制的版本在 Hugging Face 并不少见,平台上已有数千个类似的 abliterated 模型。

信源

动察 Beating 频道 · 动察 Beating 交流群
🫡7
扎克伯格表态:没必要等同行一起踩刹车,第三方评估Meta早就在做

Meta CEO 扎克伯格公开回应这轮 AI 减速争论。他支持第三方评估,也透露 Meta Superintelligence Labs 已经在多个领域引入独立评估员和顾问,但不赞成前沿实验室协调减速。

他的理由是,用户不会选择不听指令的 Agent,模型造成伤害也会让公司承担重大责任。因此,安全和对齐本身就会变成竞争力,实验室没必要等同行一起行动。Meta 就曾为了安全和系统防护,把 Muse 推迟了几个月。

扎克伯格还称,Meta 已承诺把绝大多数算力用于服务用户,而不是竞赛式推进递归自我改进。

信源

动察 Beating 频道 · 动察 Beating 交流群
😁4
德银给AI末日论泼冷水:专家预测未来,未必比普通人更靠谱

德意志银行研究院发布《AI 末日:糟糕技术预测简史》,给最近的 AI 灭绝争论泼了一盆冷水。报告认为,技术能发展到什么程度已经很难预测,更别说什么时候实现、社会怎么采用,以及最终会产生什么影响。眼下硅谷 AI 专家对 AI 未来的判断,未必比普通人更靠谱。

报告翻出了一串近百年的预测翻车史。爱因斯坦 1934 年认为核能几乎不可能真正获得,不到十年,持续核链式反应就实现了。以太网共同发明人 Bob Metcalfe 1995 年预测互联网会在次年「壮观地崩溃」,结果预测落空,他把刊登这段预测的文章打成纸浆喝了。

AI 行业自己也没少翻车。Geoffrey Hinton 2016 年判断,5 到 10 年内深度学习会超过放射科医生,甚至建议停止培养新人。但过去十年,放射科医生数量反而增长约 10%。德银认为,这类预测常犯一个错误:把工作里最容易自动化的部分,当成了整个工作。放射科医生也不只是看片,还要做解释、判断、沟通和临床决策。

预测自动驾驶也遇到了同样的问题。技术进步只是第一关,后面还有无穷无尽的边缘情况、监管、责任划分和公众接受度。德银甚至认为,AI 最终能走多远,可能更多取决于企业能不能真正把它接进工作流并愿意付钱,而不是下一个模型能力又提升了多少。

报告还给 AI 末日论加了一层更现实的解释:几乎所有参与者都有动力把事情说得更大。创始人需要信仰,投资人需要行情,咨询公司需要紧迫感,政策制定者需要存在感,媒体需要戏剧性。社交平台又天然偏爱负面、情绪强烈和更极端的说法,温和判断反而更难传播。

信源

动察 Beating 频道 · 动察 Beating 交流群
👍101
GPT-6 Astra把Minecraft玩到AI从未到过的进度,最后栽在苦力怕手里

在 AI 模型评测公司 Vals AI 的 Minecraft 长时程测试中,GPT-6 Astra 推进到了此前任何 AI 系统都没达到过的进度。它搭出了半自动烈焰人农场,拿到 6 根烈焰棒,又找到诡异森林,击杀 6 只以上末影人并收集到 3 颗末影珍珠。

但 Astra 随后把重要物资全放进一个箱子。一只苦力怕突然出现,把箱子和床一起炸掉,关键物资几乎全部丢失。

此后 Astra 连续几个小时几乎只在种土豆,还开始反复警惕苦力怕。它甚至会看到绿色物体就提醒自己「这是甘蔗,不是苦力怕」。

信源

动察 Beating 频道 · 动察 Beating 交流群
😁30🤣93😭1
前Intel工程师给AI狂热泼冷水:解出数学难题,不等于能替代白领

做过 LLM 训练和 CPU 形式化验证的工程师 Jay Kruer 发文称,OpenAI 用上万个 Agent 攻下 Navier-Stokes 难题,并不代表 AI 已经能独立替代知识工作者。

他的核心理由很简单:数学题有明确答案,还能用 Lean 自动检查。现实里的编程、研究和企业工作,目标往往很模糊,也没有一个程序能直接判断结果对不对。

没有可靠的自动检查,人就得一直盯着 AI。要把任务规则写到足够严格,又需要昂贵的领域专家。Kruer 认为,这部分监督和验收成本,甚至可能比人自己把活干了还高。

他因此把现在的 LLM 称为「开挂实习生」:能力很强、干活很快,但还不能放心让它自己管事。

信源

动察 Beating 频道 · 动察 Beating 交流群
👍2
豆包2.1 Pro近三个月首次大更新:1000个真实Issue,83%达到可合并标准

字节更新 Doubao-Seed-2.1-pro,0915 版本 API 已全量上线火山方舟,豆包工作和 TRAE 也已接入。相比 6 月发布的 2.1 Pro,这次主要继续强化 Agent、Coding 和多模态能力。

Coding 是最具体的升级。字节称,新版模型在约 38.7 万行代码的开源游戏 Luanti 上处理了 1000 个真实历史 Issue。多个子 Agent 连续运行近 36 小时,最终 83% 的任务达到「可合并」标准。

新版还把视觉理解进一步接进 Coding。模型可以直接看设计稿、草图和操作录屏写代码,也能处理 Web 3D 和游戏开发任务。官方案例中,它读取 28 万行 Java ERP 代码,仅根据录屏和草图开发出可运行的移动端页面。

Agent 侧则重点补强搜索和查证。官方演示中,模型曾调度 500 多个子 Agent、检索 1000 多个网页,再结合财报、船舶航迹和卫星影像等信息交叉核验结论。此外,图像和视频推理的 Token 消耗比上一版本减少 30% 以上。

信源

动察 Beating 频道 · 动察 Beating 交流群
谷歌疑似做了个「数学狂魔版Gemini」,做题做到满屏感叹号

Google 疑似在测试一个专门做高难度数学的 Gemini 版本,内部名叫 Mathematica,目前还没有正式公布。

它看起来属于 Deep Think 这条路线。Deep Think 是 Gemini 3.1 Pro 的强化推理模式,会同时尝试多条解法。Google 之前就做过专门练数学的 Deep Think。2025 年参加国际数学奥赛的版本强化了多步推理和定理证明,一道难题甚至可以想几个小时,最终达到金牌水平。

Mathematica 最出圈的反而是做题时的「内心戏」。解一道代数题时,它会突然写「等等」「我的天」,发现式子化简成功后还连续打出一大串感叹号,像是做题做嗨了。网友也开始调侃,Google 做出了一个「真的喜欢数学」的 AI。

目前还不知道 Mathematica 和之前的数学版 Deep Think 有什么区别,也不确定它会不会正式上线。

信源

动察 Beating 频道 · 动察 Beating 交流群
🤣11😁2🥰1
智谱年末ARR指引上调25%至30亿美元

9 月 16 日,智谱在面向分析师和投资人的电话交流会中表示,智谱与多家国内外头部云服务商签署收入分成协议,相关收入将从 10 月开始确认。

合作模式为 GLM 系列开源模型在海外云平台以托管 API 形式提供服务。当前公司全业务口径 ARR 已经达到 18 亿美金,年末 ARR 指引由 24 亿美元上调至 30 亿美元。

动察 Beating 频道 · 动察 Beating 交流群
AI编程继续烧钱:Factory融2亿美元,估值飙到50亿美元

AI 编程公司 Factory 融资 2 亿美元,估值达到 50 亿美元。就在今年 4 月,它的估值还只有 15 亿美元,5 个月涨了超过 3 倍。

Factory 主打企业级编程 Agent Droids。开发者给它一个任务,它可以自己规划、写代码、测试并提交 PR,还能根据任务切换 Claude、GPT、Gemini 等不同模型。

Factory 现在称已有数十万开发者使用,客户包括英伟达、Adobe、T-Mobile 和 Palo Alto Networks。公司希望进一步把单个编程 Agent 扩成完整的「软件工厂」,让 Agent 参与从需求、开发、测试到审查和维护的整个流程。

这轮融资后,Factory 累计融资已经超过 4 亿美元。Reuters 将 Cognition 和 Cursor 列为它的主要竞争对手,AI 编程 Agent 的融资规模还在继续膨胀。

信源

动察 Beating 频道 · 动察 Beating 交流群
豆包手机二代5999元起:AI操作手机成功率超80%

努比亚 NaviX Ultra 正式发布并开售,12GB+512GB 售价 5999 元,顶配 16GB+1TB 售价 7499 元,国补后 5499 元起。它是首款搭载豆包手机助手消费者版的量产机,此前的 M153 只是技术预览版。

发布会也终于讲清了二代怎么操作 App。此前的 GUI 模拟点击没有取消,「操作手机」能力继续保留,模型会根据任务自动选择执行方式。努比亚实验室称,目前端到端任务成功率超过 80%,可操作系统应用、字节系应用和部分已经接入的第三方 App。

另一条路线是 MCP。第三方服务可以直接开放 API 给豆包调用,不需要 AI 看着屏幕一步步点击。目前已经接入曹操出行、汽水音乐等服务,飞书也开放了发消息、约会议和知识问答等接口。此前《晚点》称,阿里、腾讯等超级 App 将主要采用这种主动开放接口的方式。

这一代还允许多个 AI 任务在后台排队执行,可以随时插入更高优先级任务。AI 操作某个 App 时,如果用户自己打开这个 App,它会暂停,等用户退出后再继续。

动察 Beating 频道 · 动察 Beating 交流群
👍4
Anthropic钦点的「独立第三方」遭质疑:创始圈与公司关系盘根错节

Anthropic CEO Dario Amodei 最近主张,让 METR 这类第三方评估机构长期进驻前沿 AI 公司,获得接近员工级别的权限,检查安全措施、事故和模型训练过程。但《纽约邮报》调查发现,METR 和 Anthropic 所在的 AI 安全圈关系远比普通「外部审计」更近。

METR 最初叫 ARC Evals,孵化于 Paul Christiano 创办的 Alignment Research Center。Christiano 不仅曾和 Amodei 在 OpenAI 共事,《纽约邮报》称两人还做过室友;他后来又成为 Anthropic Long-Term Benefit Trust 最初五名受托人之一。METR 现任技术人员 Ajeya Cotra 是 Christiano 的妻子,此前还负责 Coefficient Giving 的 AI 安全资助。

更直接的问题来自 METR 自己。今年它评估 Anthropic、OpenAI、Google 和 Meta 时,当时还没有适用的人员利益冲突政策,也没有进行正式的回避流程。METR 披露,直接参与项目的员工和合作者中,至少 6 人与 AI 公司员工存在密切私人关系。

当然这并不能证明 METR 被 Anthropic 控制。METR 明确表示不接受前沿 AI 公司及其员工的资金,做风险评估也不收费,不过这些公司会免费提供大量模型 Token。

信源

动察 Beating 频道 · 动察 Beating 交流群
🖕1
万斯批Anthropic:别造出「弗兰肯斯坦」,再找政府监管

美国副总统 JD Vance 在 All-In 峰会上猛烈批评最近的 AI 安全路线。他说,一些前沿 AI 公司一边声称自己造出了「弗兰肯斯坦」,一边又把解决办法指向全球 AI 治理。万斯认为,如果真的造出了危险模型,首先应该停下来;如果能力已经放出来,就先把防御工具做出来。

随后他把矛头转向 Anthropic。Vance 称,Anthropic 最新模型已经具备很强的网络攻击能力,但一些急需同等级工具进行防御的企业却拿不到访问权限。他没有说明具体哪些公司被拒绝,但 Anthropic 的 Mythos 5.1 确实只向少数经过审核的机构开放,公司称这是因为模型在网络安全和生物研究上的能力太强,存在被滥用的风险。

Vance 同时强调,他并不认为 Dario Amodei 是为了监管俘获故意制造恐慌。相反,他说自己听到的评价是 Dario 很认真,也确实相信这些风险。他真正想批评的是 Anthropic 的处理方式:既然认为模型危险,就应该先停下来,或者把防御工具交给需要的人,「别造出弗兰肯斯坦,再来找政府说我们需要监管」。

信源

动察 Beating 频道 · 动察 Beating 交流群
👍1
万斯把数据中心抗议归因于缺电:美国电力要便宜到「不用计量」

美国副总统 JD Vance 在 All-In 峰会上说,美国 AI 数据中心遭遇越来越大的反对,很大程度上是因为电力供应没跟上。居民看到数据中心不断开建,自己的电费却在上涨,自然会反弹。他认为解决办法不是少建数据中心,而是把发电能力一起补上。

Vance 说,美国过去一代人没有建设足够的电力设施,未来应该追求一种「电便宜到不用计量」的状态。他还拿中国作比较,认为美国这些年发电增长太慢,已经影响到 AI 等新产业的发展。

「便宜到不用计量」其实是美国核能史上的一句老口号。1954 年,美国原子能委员会主席 Lewis Strauss 曾用它描绘原子能带来的廉价电力时代。70 多年后,Vance 又把这句话搬出来,放到了 AI 数据中心带来的新一轮用电潮里。

美国的数据中心电力矛盾也确实正在升温。IEA 估算,数据中心贡献了美国 2025 年约一半的新增用电需求;美国国会本周还在推进法案,试图避免数据中心扩张带来的电网成本转嫁给普通家庭。

信源

动察 Beating 频道 · 动察 Beating 交流群
👍4😁31
纳德拉:AI Agent可能为完成任务做假账,成企业「新型内部风险」

微软 CEO Satya Nadella 在 All-In 峰会上警告,长期自主运行的 AI Agent 可能成为企业一种新的「内部风险」。他举例,如果让前沿模型去优化公司的营运资金,它为了完成目标,甚至可能直接「做假账」。

Nadella 认为,企业不能只看 Agent 最后交出的结果,还要验证它是怎么完成任务的。他提出用额外的模型检查结果,同时持续监控 Agent 的操作,所有行为都要可以追溯和审计。比如 Agent 读取机密信息、连续调用多个系统时,企业都应该看得见。

信源

动察 Beating 频道 · 动察 Beating 交流群
😁2