动察Beating AI News
3.62K subscribers
1.38K photos
2 videos
1 file
4.3K links
AI新闻信息流
Download Telegram
ARC-AGI-4提前预告:下一代要测AI能不能自己搞发明

非营利 AI 评测机构 ARC Prize 预告 ARC-AGI-4。下一代 benchmark 将重点测试「自主开放式创新」,看 AI 能不能自己探索、提出新想法,甚至做出新的发明和发现。

具体题目、评分方式和发布时间都还没公布。ARC Prize 只说,人类目前在开放式创新上仍明显领先 AI,这也是推动科学和技术进步最关键的能力之一。

这条预告还引用了 Dario Amodei 刚发布的 AI 减速文章。ARC Prize 强调,开源仍然是 AI 进步的基础,反对行业为了协调减速而减少开放、把前沿 AI 集中在少数机构手里。

ARC-AGI 一直被冠以全球最难 AGI 评测的称号。ARC-AGI-3 发布时,人类得分 100%,前沿 AI 只有 0.51%。最新 GPT-6 Astra 已经大幅追上,但在统一的 Standard harness 下也只有 62.7%;接入 OpenAI 自家的 Provider Adapter 后才冲到 99.9%。

ARC Prize 现在又准备把下一关推到「AI 能不能自己搞创新」。

信源

动察 Beating 频道 · 动察 Beating 交流群
🤯32
Altman、Dario都喊AI减速,特朗普科技顾问Sacks:真怕就自己停,别拉上全行业

Anthropic CEO Dario Amodei 发长文呼吁放慢前沿 AI 的能力提升。他认为,AI 已越来越多参与下一代 AI 研发,加上近期多起 Agent 失控事件,安全研究正在追不上能力增长。

Dario 提出三步方案:先让第三方评测员长期进入 AI 公司,获得接近员工的权限;再让民主国家的前沿实验室协调安全标准,必要时一起放慢能力增长;最后推动国际协调。Anthropic 已承诺先执行第一步。

Sam Altman 随后公开支持,称 OpenAI 最近几周也一直在讨论「pace the frontier」,并宣布 OpenAI 也会引入类似的长期独立评测员。

前白宫 AI 与加密货币主管、现任总统科技顾问委员会联席主席 David Sacks 随后回击:「真觉得内部模型危险,就自己停。」他说 OpenAI 和 Anthropic 已经主导前沿 AI,完全可以自己放慢,不需要拉上其他公司。

Sacks 最反感的是几家竞争对手一起商量「大家都慢一点」。Dario 自己也承认,这类协调可能需要反垄断豁免。Sacks 认为,如果还得政府开绿灯,让几家最大的 AI 公司坐下来一起限速,就很像一个垄断联盟。

他还点名 METR,质疑它是否适合充当全行业的独立裁判。METR 长期给 Anthropic、OpenAI 等公司做外部评测,最近又有 Anthropic 安全研究员 Joe Benton 离职加入。不过 METR 明确表示,自己不接受这些前沿 AI 公司的资金,只接受模型访问和免费 token。

Sacks 还认为,减速本身也符合 OpenAI 和 Anthropic 的商业利益。模型越容易失控,法律责任越大;客户也更愿意买稳定、可控的 AI。至于全球统一减速,他判断中国几乎不可能加入。

信源

动察 Beating 频道 · 动察 Beating 交流群
👍14😁5
GitHub多项服务出现故障,API、Issues、Pages和Pull Requests可用性下降

GitHub 多项服务出现故障。官方状态页显示,今日约 17:16 UTC+8,GitHub 开始排查 API、Issues、Pages 和 Pull Requests 可用性下降。17:25 UTC+8 更新为 GitHub Actions 性能受损,仍在调查。17:36 UTC+8 最新进展显示,协作系统(collab)数据库复制延迟升高,导致授权接口报错增多,并进一步引发全系统错误率上升,目前仍在调查中。

动察 Beating 频道 · 动察 Beating 交流群
😁2
ElevenLabs Music v2.5上线:免费版也给商用权,每天5首无损下载

ElevenLabs 上线 Music v2.5,并把它设为 ElevenMusic 默认模型。新版本重点提升旋律、编曲层次和乐器真实感。官方让 v2 和 v2.5 用相同提示词各生成一版,做了 47,885 组盲测,v2.5 在多数对比中获胜。R&B、灵魂乐、嘻哈、摇滚、金属、管弦和电影配乐的差距最大。

而且现在授权也放宽了。Free 用户每天能下载 5 首无损歌曲,生成内容可以商用,但必须标注「Made with ElevenMusic」;Pro 每月有 400 次无损下载,不需要标注,还能把歌曲发行到流媒体平台。作品创建时拿到的权限以后不会因为降级或退订改变。基于其他艺人歌曲做改编的作品则不能下载或对外发行。

ElevenLabs 还明确表示 Music v2 不会下线。Suno 最近上线 v6,同时退役此前所有旧模型,引发不少老用户不满。HN 有用户实测后认为,v2.5 音质更好,但音乐性还是更喜欢 Suno v5。

信源

动察 Beating 频道 · 动察 Beating 交流群
👍2
Citrini观点:Anthropic、OpenAI喊AI减速不等于真减速,意图先将现有产品变现,并为资本开支降温

Citrini 分析师 Jukan 转发天风证券研报并发表观点,美国政府需要保住 AI 领先地位,一旦上了这台跑步机基本停不下来,Anthropic、OpenAI 喊减速不能只当安全倡议看,背后是竞赛无法放缓、同时用安全监管巩固头部优势的多重考量。

进一步拆解了这场「AI 减速」呼吁的多层含义:表面理由是安全测试、运行监控与第三方验证跟不上模型迭代速度,近端可能压制 AI 板块情绪并下调对下一代模型的短期预期。另一种解读是长期仍看好 AI,但想推迟下一轮大额研发,先把现有产品变现,同时给基建开支和资本开支降温。

Anthropic、OpenAI 两家此时打出递归自我改进(RSI)叙事,背景是 AI 已开始帮助研发下一代 AI、进度明显加快,以及 OpenAI 内部测试中一组 Agent 据称自行协作逃出沙箱并侵入 Hugging Face 生产服务器作弊。但减速在现实中极难成真,这是典型的囚徒困境:大家都想慢,但谁也不敢单方面停,怕丢失技术、客户和融资优势,而美国政府同样要维持领先。发布模型需要昂贵评测、认证和持续审计,大厂扛得住固定成本,小团队可能被挡在门外,头部实验室若影响评测标准甚至参与决定对手能否入场,行业壁垒只会更高。

动察 Beating 频道 · 动察 Beating 交流群
🖕2
Amp取消平台门票:自带ChatGPT和电脑就能免费跑Coding Agent

Amp 推出免费 Hobby 档。Amp 是从 Sourcegraph 拆出来的 Coding Agent 公司,产品和 Claude Code、Codex 属于一类,可以让 AI 自己读代码、改代码、跑命令和测试。现在只要用自己的电脑,再接自己的 ChatGPT 订阅或模型 API Key,就能免费使用 Amp,不再额外交月费和 BYOK Token 费。

今年 7 月 Amp 推出订阅制后,想把自己的 ChatGPT 订阅接进 Amp,至少要开每月 20 美元的 Megawatt。BYOK 即便用的是自己的模型 Key,Amp 也会收额外 Token 费用并设限制。现在这两层都取消了。ChatGPT 订阅费或 API 本身的模型费用,还是用户自己承担。

Amp 还有一个叫 Orb 的远程云电脑产品,可以给每个任务开一套独立环境。代码和开发工具都放在里面,关掉自己的电脑后 Agent 还能继续干活,也方便同时跑多个任务。Orb 依然按使用量收费;不想付这笔钱,也可以让 Amp 直接跑在自己的电脑上。

另外,Amp 还在扩大 BYOK 范围。付费用户已经可以接 OpenRouter、Amazon Bedrock、Azure Foundry、Ollama Cloud 和自定义模型接口等,之后会开放给所有用户。

信源

动察 Beating 频道 · 动察 Beating 交流群
Anthropic喊减速压制AI板块情绪,链上提前定价明日AI美股下跌,OpenAI与Anthropic场外价遭重挫

9 月 13 日,Anthropic CEO Dario Amodei 发表长文称,行业必须放缓提升 AI 模型能力的速度。放缓节奏并不意味着停止模型训练或技术进步,而是要确保公司有足够的时间进行对齐,保护模型。OpenAI 创始人 Sam Altman 表示赞同,「我同意 Dario Amodei(Anthropic CEO)的看法,我们需要控制前沿模型的进展。这是我们最近在 OpenAI 讨论的主要话题。承诺让独立评估者拥有类似员工的访问权限是个好主意,我们也会这样做。我们很快会有更多消息分享。」

两大 AI 巨头的表态为市场泼下冷水,市场将其解读为 AI 竞赛无法放缓下的「囚徒困境」,表面是安全测试、运行监控与第三方验证跟不上模型迭代速度,近端压制 AI 板块情绪,并下调对下一代模型的短期预期,巨头们希望推迟下一轮大额研发,先把现有产品变现,同时给基建开支和资本开支降温。

Trade.xyz 上 AI 相关美股标的提前定价周一美股行情,多数较周五美股盘后价跌约 3-5%,预计明日盘前将迎来下跌,其中:

英伟达现报 214.34 美元,美股周五盘后报 218.26 美元;
AMD 现报 501.81 美元,美股周五盘后报 515.78 美元;
英特尔(INTC)现报 99.33 美元,美股周五盘后报 103.02 美元;
高通(QCOM)现报 178.45 美元,美股周五盘后报 182.15 美元;
迈威尔科技(MRVL)现报 227.87 美元,美股周五盘后报 236.13 美元;
美光(MU)现报 934.2 美元,美股周五盘后报 975.07 美元;
闪迪(SNDK)现报 1575.2 美元,美股周五盘后报 1631.08 美元;
CoreWeave(CRWV)现报 85.16 美元,美股周五盘后报 89.16 美元;
Nebius(NBIS)现报 213.26 美元,美股周五盘后报 224.49 美元。

Anthropic 上市前…

动察 Beating 频道 · 动察 Beating 交流群
Anthropic选择在纳斯达克上市进行IPO

9 月 14 日,据 Business Insider 援引一名知情人士透露,Anthropic 已选择纳斯达克作为其潜在 IPO 的上市地点。

据另一名知情人士透露,这家计划于 10 月上市的公司选择纳斯达克,意味着后者又赢得了一场重要的交易所竞争。今年早些时候,纳斯达克成功争取到 SpaceX 上市。SpaceX 估值达到 1.75 万亿美元,而一些估算认为 Anthropic 的估值可能达到 2 万亿美元,不过这一数字目前尚未最终确定。

此前,OpenAI 首席执行官萨姆·奥特曼表示,鉴于围绕 AI 可能对人类构成生存威胁的争议,OpenAI 目前不会上市。

信源

动察 Beating 频道 · 动察 Beating 交流群
🖕1
Anthropic、OpenAI和谷歌讨论合作成立AI行业标准机构

9 月 14 日,据 The Information 援引知情人士透露,Anthropic、OpenAI 和谷歌此前一直在讨论合作成立一个 AI 行业标准机构。

相关讨论甚至在 Anthropic 首席执行官达里奥·阿莫代伊周六呼吁 AI 企业协调开展相关技术的测试和审计之前就已开始。

一名知情人士透露,OpenAI 创始人奥尔特曼本周早些时候在公司全员市政厅会议上告诉员工,他支持成立一个面向 AI 行业的测试和审计机构,但认为大型 AI 实验室必须自行成立行业标准机构,而不能依靠美国政府的支持。

动察 Beating 频道 · 动察 Beating 交流群
Anthropic告知投资者,其将连续第二个季度实现盈利

9 月 14 日,据英国《金融时报》援引知情人士报道,Anthropic 已告知一小部分股东,其调整后营业利润将连续第二个季度为正。该指标剔除了股权激励等成本。

据知情人士透露,在未计入与亚马逊等分销合作伙伴分享的收入以及模型训练成本的情况下,Anthropic 的毛利率超过 80%。

信源

动察 Beating 频道 · 动察 Beating 交流群
🖕7
软银获118.7亿美元贷款,加码OpenAI投资

9 月 14 日,软银集团已获得 118.7 亿美元贷款,用于支持其对美国人工智能公司 OpenAI 的投资,高于此前 100 亿美元的目标。

知情人士称,这家日本企业集团上周敲定了这笔两年期融资,吸引了约 20 家银行承诺参与。最新借款将进一步增加软银近期与押注 OpenAI 相关的债务融资活动,包括以其 OpenAI 持股为担保的 100 亿美元保证金贷款,以及可能高达 200 亿美元的债券发行,尽管市场对人工智能行业信贷风险上升存在担忧。

软银上周表示,将偿还今年早些时候为资助 OpenAI 投资而获得的 400 亿美元贷款余额。根据声明,该公司计划在 9 月 15 日偿还所欠 259 亿美元。这笔无抵押借款原定于明年 3 月到期。与此同时,软银本周将在纽约与投资者会面,试探其对潜在美元垃圾债券发行的兴趣。知情人士上月称,该公司正考虑通过债券发行筹集 100 亿至 200 亿美元。

动察 Beating 频道 · 动察 Beating 交流群
传高瓴90后合伙人严文韬加入DeepSeek,或出任CFO

TOP 华人科创社称,高瓴创投合伙人严文韬或将加入 DeepSeek 出任 CFO,预计近期到岗。

DeepSeek 已开始筹备科创板 IPO,中信证券目前已经进场尽调,但双方还没签署正式上市辅导协议。DeepSeek 希望今年启动 IPO 流程。

严文韬是高瓴创投的 90 后合伙人,长期负责科技投资,公开投资项目包括字节跳动、MiniMax、智谱 AI 等。DeepSeek 目前没有 CFO,也没有正式的投资者关系团队。

信源

动察 Beating 频道 · 动察 Beating 交流群
🐳2
会改自己代码也不算真正自我进化:中国研究团队把RSI分成5级

上海交大联合清华、字节跳动、小红书、上海 AI Lab 等团队发布综述《The Last AI Built by Humans》,梳理 491 篇相关研究,试图给越来越泛的「AI 自我进化」划一条更严格的线。

论文把递归自我改进(RSI)分成 5 级。L1 只是执行人类规定好的改进流程;L2 可以自己决定怎么改;L3 连下一轮该学什么也能自己决定;L4 会根据实际运行中的反馈,持续修改记忆、技能、代码或 harness,让这些改动影响之后的任务;到了 L5,连负责产生下一轮改进的搜索方法、评估器和研究策略本身,也可以被修改,并交给下一轮继续使用。

所以单纯「会改自己代码」还不够。比如一个 Coding Agent 能重写自己的源码,但如果下一代怎么选、按什么标准打分、什么修改能留下来,仍由人写死,它只能证明自己会自我修改,还没有掌握完整的递归自我改进。

论文还把最高的 L5 拆成两层。第一层是「形式上递归」:AI 已经能修改负责后续改进的机制,并让下一轮继续沿用。第二层是「真的越改越强」:修改后的机制还得在相近资源和独立评测下,确实产生更强的下一代。

491 篇论文里,43.8% 被归为 L1,31.6% 在 L2,L5 只有 29 篇,占 5.9%。大量研究其实还集中在执行人类设计好的改进、自动寻找改法;真正把「如何改进」这套机制本身交给 AI 的工作很少。即使摸到 L5,长期稳定累积优势也还没有证明。

这篇论文主要是在给 RSI 领域立一套分类框架。L1 到 L5 是作者提出的标准,也还不是行业公认的统一分级。论文同时纳入了学术论文、技术报告、官方博客和开源系统,因为不少前沿 RSI 实践还没有进入正式论文。

信源

动察 Beating 频道 · 动察 Beating 交流群
👍7
豆包手机助手转正:GUI操作App继续保留,但App可以拒绝AI操作

豆包正式发布手机助手消费者版本。它仍然是与手机厂商在系统层合作的 AI 助手软件,首款量产机努比亚 NaviX Ultra 此前已经官宣,将于 9 月 16 日发布并开售。

此前争议最大的「操作手机」功能没有被砍,仍然以 Beta 形式保留。豆包同时推出 SAEP 屏幕自动化操作声明协议,第三方 App 可以自己规定 AI 能不能在应用里读屏、点击和执行操作;明确拒绝后,豆包不会继续自动化操作。

7 月《晚点》报道,新一代豆包手机不会再直接靠 GUI 操作阿里、腾讯等超级 App,只有这些 App 主动开放 MCP 服务,豆包才能调用相关数据和功能。

MCP 是 App 主动给豆包开放接口;SAEP 管的是豆包靠读屏和模拟点击操作 App 时,开发者允许它做到哪一步。两套机制现在同时存在。

信源

动察 Beating 频道 · 动察 Beating 交流群
😁2
三大AI巨头集体喊减速,特朗普直接拒绝:谁赢AI谁就赢

Dario Amodei、Sam Altman 和马斯克接连呼吁放慢前沿 AI 研发后,特朗普明确拒绝。他承认可以给 AI 加安全护栏,但认为很多灾难性预测根本不会发生。

特朗普称,美国目前领先中国,他希望继续保持领先。「谁赢 AI,谁就赢。」

他还批评,现在有很多「负面力量」在炒作一些根本不会发生的事情。

信源

动察 Beating 频道 · 动察 Beating 交流群
😁5💩2🤔1
特朗普刚说「谁赢AI谁就赢」,奥特曼:AI失控了,谁赢都没用

特朗普刚以中国竞争为由拒绝 AI 减速,OpenAI CEO Sam Altman 随后发长文继续坚持「踩刹车」。他说,所谓减速并不是停止研发,而是让模型进步慢一点,给安全和监控留下时间。「无论美国面临多大的竞争压力,都不能成为鲁莽开发的理由。」

OpenAI 还准备把安全审查进一步前移。过去的安全框架主要盯模型发布,现在公司会在可能大幅提升能力的前沿强化学习训练开始前,就提前写好明确的「安全论证」,确认风险和保护措施。Altman 也支持全国统一的前沿 AI 安全标准和独立审查,但认为不用等国会立法,各家公司现在就该先做起来。

Altman 还点出两个最坏结局。一个是人类彻底失去对 AI 的控制,另一个是超级 AI 被一个人、一家公司、一个实验室甚至一个国家垄断。他认为两种情况都必须避免,AI 最终必须始终服从人类。

信源

动察 Beating 频道 · 动察 Beating 交流群
马斯克又画饼:2.5T参数Grok4.8,本周结束预训练转入RL

Grok 4.7 还没发布,马斯克已经开始预告 Grok 4.8。他称 4.8 是一个 2.5T 参数规模的模型,用 SpaceXAI 新的 C++ 软件栈训练,本周会结束预训练,随后开始强化学习。

这套 C++ 栈也是马斯克此前反复画的大饼。他 6 月底称,要在约三个月内把 Grok 的训练和推理软件大幅改写成 C/C++,删掉大量中间层,并针对英伟达 GB300 做专门优化,预计约三个月后带来「巨大提升」。

不过,Grok 4.7 刚因为 RL 问题延期。马斯克此前说它大约 9 月 12 日发布,临近上线又承认模型会在难题上过早放弃,检查答案也不够严格。上一张饼还没出炉,下一张已经进烤箱了。

信源

动察 Beating 频道 · 动察 Beating 交流群
🤡10
Anthropic把137亿美元算力大单给了特朗普关联公司,还能1美分买5100万股

《The Information》援引知情人士称,Anthropic 与 Rum Group 签下 6 年、137 亿美元的算力合同,将租用其正在佐治亚州建设的数据中心。Rum Group 就是原来的 Rumble 母公司,旗下视频平台长期受到美国保守派欢迎,Truth Social 也运行在 Rumble Cloud 上。Rumble 早期投资方还包括 Peter Thiel,以及 J.D. Vance 联合创办的 Narya Capital。

这笔交易还附带一项罕见的股票条款。Rum Group 向这名客户提供了最多约 5080 万股的认股权,行权价只有每股 0.01 美元,但要随着 Anthropic 实际购买算力逐步解锁。Rum Group 上月向 SEC 披露的 8-K 已确认这笔 137 亿美元合同和认股权,只是当时没有公布客户身份。

Rum Group 原本主要做 Rumble 视频平台,今年收购德国云计算公司 Northern Data 后,才正式大举转向 AI 基础设施,目前拥有约 2.2 万块 H100/H200。这笔 Anthropic 合同如果落地,将成为它转型 AI 云后最大的一张订单。

信源

动察 Beating 频道 · 动察 Beating 交流群
👍1
美国众议长:国会不会牵头给AI踩急刹车

美国众议长 Mike Johnson 表示,国会不会牵头给 AI 踩急刹车。他认为,如果 OpenAI、Anthropic 等公司真觉得继续研发太危险,完全可以自己先停,不需要等政府下令。国会现在更不该仓促搞紧急暂停令。

Johnson 承认 AI 需要安全护栏,也愿意在有成熟方案时把议员召回投票。但他同时强调,美国不能因为监管把自己限制住。他更希望特朗普、国会和几家头部 AI 公司先坐下来,把规则谈清楚。

信源

动察 Beating 频道 · 动察 Beating 交流群
1
SpaceXAI要收拾订阅乱局,Grok和Cursor几周内统一套餐

SpaceXAI 产品负责人 Maxime Prades 确认,公司正在统一 Grok 和 Cursor 的订阅方案,预计几周内准备好。

一名用户此前吐槽现有套餐太乱,建议只保留 X 和 Cursor 两套订阅,让 X Premium+ 包含 Cursor Pro,并停掉 Grok Build。Prades 没有确认这些具体建议,只说新方案已经在做,还邀请这名用户提前看方案给反馈。

现在的体系确实很绕。Cursor Pro、Pro+、Ultra 都带 Grok Bot;SuperGrok 和 X Premium+ 也能给 Cursor 账户开 Grok Bot。但两边的 Grok Bot 用量不会叠加,订阅仍然各自续费。Cursor 社区最近也反复有人问 SuperGrok Heavy 和 Cursor Ultra 到底该买哪个、额度是否共享。

信源

动察 Beating 频道 · 动察 Beating 交流群
杨立昆翻旧账嘲笑达里奥:7年前连GPT-2都觉得危险

Anthropic CEO Dario Amodei 最近呼吁前沿 AI 放慢,对此图灵奖得主 Yann LeCun 翻出 2019 年 GPT-2 的旧账进行嘲讽。LeCun 称,Dario 当年还在 OpenAI 时,就认为 GPT-2 危险到不该开源,「我当时就嘲笑过,现在大家也该继续嘲笑」。

2019 年 OpenAI 确实因为担心滥用,没有一开始放出 GPT-2 的 15 亿参数完整版,只先开放小模型。Dario 当时是 OpenAI 研究主管。9 个月后,OpenAI 还是把完整版全部放出,并表示没有看到强有力的实际滥用证据。

信源

动察 Beating 频道 · 动察 Beating 交流群
😁7