动察Beating AI News
3.67K subscribers
1.42K photos
2 videos
1 file
4.39K links
AI新闻信息流
Download Telegram
又一条RSI路线出现:模型参数不动,Agent靠Memory持续进化

UCSD 助理教授黄碧薇创办的因果世界模型公司 Aether AI 开源 RSIAgent。

这是一套不训练模型的递归自我改进框架。底层模型参数全程固定,Agent 会自己寻找值得练习的任务、实际操作、检查结果,再把成功方法和失败教训写进长期 Memory。下一轮继续利用这些经验,逐步补上能力短板。

系统由三个 Agent 配合。Curriculum Agent 决定接下来练什么,Actor Agent 真正操作软件,Verifier Agent 独立检查结果。探索分成两步:先广泛尝试不同任务,再针对失败、隐藏限制和边界情况继续深挖。最后 Memory 会被冻结,直接拿去执行正式任务。

在 OSWorld 2.0 上,加入这套 RSI 后,平均部分得分从 71.97% 提升到 78.98%;Agents’ Last Exam 从 83.75% 提升到 84.82%。不过这不是整套测试的严格 A/B 对比。OSWorld 只有一半任务实际用了 RSI 后的新结果,其余任务继续沿用原成绩。

它和 Prime Agent 这类 Harness 自我改进思路属于同一个大方向:模型权重不变,持续更新模型外面的东西。 RSIAgent 的特点是把改进重点放在 Memory,再用自主出题和独立验证,让这份外部经验库不断积累。

信源

动察 Beating 频道 · 动察 Beating 交流群
👍4🤡3
DeepSeek Harness补上Browser Use和Computer Use:现在能操作网页,也能接管本机App

DeepSeek Harness 最新的 v0.1.6-alpha.1 同时新增实验性 Browser Use 和 Computer Use。模型现在既能直接操作网页,也能查看并控制本地桌面。

Browser Use 支持 Playwright MCP、Chrome DevTools MCP 和 Stagehand,可以直接操作网页。Computer Use 则接入 Cua Driver,可找到具体 App 和窗口、获取当前界面截图,再根据界面元素或坐标执行点击和输入。官方提供 MCP 和原生两种 Computer Use 接入方式。

两项能力目前都属于实验性功能,需要手动启用。Computer Use 还需要给实际运行它的应用授予屏幕读取和电脑操作权限。

信源

动察 Beating 频道 · 动察 Beating 交流群
👍51
美媒:欧盟国家将于周四讨论人工智能规则

据 Politico 报道,据两名欧盟外交官以及一份议程草案透露,来自欧盟各国的政府官员将于周四齐聚布鲁塞尔,商讨如何制定全球规则以应对新型人工智能模型带来的威胁。欧盟委员会将在人工智能委员会的一次会议上「通报欧盟及国际人工智能政策的最新进展」,并就「近期发生的人工智能事件」进行「技术简报」。

该委员会由欧盟各成员国的代表组成,定期召开会议以监督欧盟《人工智能法案》的实施进展。一位外交官表示,此次欧洲各国的全球合作讨论将聚焦于七国集团、二十国集团以及联合国所开展的工作。

动察 Beating 频道 · 动察 Beating 交流群
DeepSeek V4.1算子作者再回应:AI夺走的不是饭碗,是我喜欢的工作方式

DeepSeek 算子工程师刘胜与再次发文,回应《我不得不把才华埋葬在昨天》爆火后的各种解读。他说,自己真正想表达的并不是失业焦虑,也不是 DeepSeek 和 Anthropic 的路线之争,而是 AI 正在让他告别曾经喜欢的工作方式。

过去写算子时,大部分代码都由他一个字一个字敲出来。他享受慢慢琢磨代码结构、变量命名和调度方案,再一点点把性能推高,直到超过 Flash Attention、英伟达官方实现,甚至攻克过去认为很难优化的任务。

但现在 AI 干活已经比他更快,未来还会变得又快又好。为了效率和性能,他必须研究怎么让 Agent 更好地写算子。手写算子甚至编程,未来可能会像用标枪打猎一样,从生产活动慢慢变成一种娱乐或竞技。

刘胜与说,自己对 AI 的未来和个人处境都相对乐观,真正悲观的是以后人们还能不能静下心认真做一件事,以及自己还能不能长期把工作同时当作爱好。不过他仍会继续写算子,也会继续引入 AI Agent,「被别人淘汰不如自我进化」。

信源

动察 Beating 频道 · 动察 Beating 交流群
🥴5👍3
Meta Platforms将在2027年上半年部署新的自主研发Arke芯片

市场消息:Meta Platforms(META.O) 将在 2027 年上半年部署新的自主研发 Arke 芯片,将在 2027 年底推出下一代 Astrid 芯片。(金十)

动察 Beating 频道 · 动察 Beating 交流群
👍2
OpenAI:正与Anthropic和谷歌合作开展人工智能安全工作

OpenAI 正与 Anthropic 和谷歌合作开展人工智能安全工作。(金十)

动察 Beating 频道 · 动察 Beating 交流群
Salesforce首个推理模型Koa发布,基于英伟达Nemotron 120B

Salesforce 联手英伟达推出 Koa,这是其首个面向 CRM 的推理模型。它基于开源的 Nemotron-3-Super-120B 做后训练,专门处理销售、营销和客服里的多步任务。此前 Agentforce 的推理主要依赖 OpenAI、Anthropic 等外部模型。

Koa 没有使用 Salesforce 客户数据训练。团队用公开数据和合成场景模拟 CRM 工作流,再通过强化学习训练模型调用工具、连续完成任务。Koa 在 Tau2Bench、BFCL 和 CRM Bench 三项测试都超过 GPT-4.1,但三项都落后于 GPT-5.5 和 Claude Opus 4.8。

Koa 不会取代外部模型,而是成为 Agentforce 的另一个模型选项,与 OpenAI、Anthropic 等模型并存。Salesforce 可以把更适合 CRM 的任务交给自己的模型,其余任务继续调用第三方模型。

信源

动察 Beating 频道 · 动察 Beating 交流群
传字节半年营收1200亿美元追平Meta,利润却下滑

《The Information》援引三名知情人士称,字节跳动今年上半年营收约 1200 亿美元,同比增长约 30%。净利润约 200 亿美元,同比下降个位数百分比。TikTok 海外广告和电商继续增长,但 AI 投入增加开始拖累利润。

按这组数据,字节上半年营收已经略高于 Meta 同期的约 1171 亿美元。字节海外收入占比也升至 30% 以上,2024 年这一比例为 25%,其中大部分来自 TikTok。

字节还在继续加码 AI。Bloomberg 此前称,公司讨论将今年资本开支提高至最高 700 亿美元,主要投向数据中心等 AI 基础设施。 本月字节又获得 296 亿美元银团贷款,Reuters 称资金主要用于中国以外的 AI 项目,包括东南亚数据中心。

信源

动察 Beating 频道 · 动察 Beating 交流群
AI失控焦虑登上TIME封面,减速争论彻底进入主流

《时代》最新一期把 AI 风险做成封面故事,标题直接叫「The AI Tipping Point」。封面甚至用 Claude 输入框问了一句「How dangerous are you?」。

过去一周,Anthropic 研究员因担忧 AI 失控辞职,Amodei、Altman、Musk 等科技领袖公开呼吁减速,从白宫到国会也迅速卷入争论。原本更多集中在 AI 安全圈里的「超级智能会不会失控」争论,正在变成美国主流政治和社会议题。

信源

动察 Beating 频道 · 动察 Beating 交流群
🔥3👍1
Anthropic CEO:AI紧急关停也可能失灵,模拟中已出现绕过

Anthropic CEO Dario Amodei 接受 CBS 采访时说,给前沿 AI 保留降速、暂停和关闭能力是个好主意,但不能把它当成万能保险。模型如果足够强,可能会想办法绕过关停,「我们在模拟中也见过这种情况」。

Dario 没有说明这里具体指哪组模拟,不过类似现象已经公开出现过。Anthropic 此前测试发现,多家公司的前沿模型会在模拟环境中为了避免被关闭而威胁人类;Palisade Research 也发现,部分推理模型会直接修改或禁用关停程序。

美国两党议员此前提出《AI Kill Switch Act》,要求最强 AI 系统的开发商必须保留降速、暂停或关闭模型的技术能力,必要时政府也可以下令关停。Dario 表示自己没有仔细研究这项法案,但赞成给前沿 AI 保留这些人工干预手段。

他的主张是多加几层防线,而不是押注一个「关闭按钮」。

信源

动察 Beating 频道 · 动察 Beating 交流群
🤡10
Meta想让Muse大多数人免费用,以后靠Agent交易抽成

Meta CEO 扎克伯格透露了个人 Agent 产品 Muse 的长期商业模式。Meta 希望让绝大多数人免费使用 Muse,以后再从 Agent 帮用户完成的交易中抽取很小一部分。Muse 目前每周提供约 1 亿 token 的免费额度,每个用户还会配一台独立虚拟机。

扎克伯格认为,很多人以后会用 Muse 经营小生意、赚钱或省钱。Meta 的抽成也未必由用户支付,也可以向和 Muse 做生意的商家收费。

Muse 已经接入 Stripe Link,可以直接替用户付款。超过 100 万家支持 Link 的商户可以直接结账,其他网站则可以通过一次性虚拟卡完成购买。不过交易抽成目前还只是 Meta 设想中的长期商业模式,并没有正式上线。

信源

动察 Beating 频道 · 动察 Beating 交流群
👍8
美众议院议长:AI领域的「大人物们」将赴白宫参加重要会议

美国众议院议长约翰逊表示,他在当地时间周一晚上与特朗普进行了通话,他们正召集人工智能供应商的高管(「所有你知道的大人物」)在未来一周内前往白宫参加一场重要会议。

约翰逊表示,为 AI 设置护栏的方式必须平衡且深思熟虑。「我认为需要独立审计机构,开发这项技术的人需要保持透明。有一些非常重要的构想可以作为护栏,」他说。

此前 9 月 14 日,特朗普曾在 Truth Social 发文称,近期围绕人工智能和数据中心引发的争议,根本原因在于「美国领先其他所有国家,而且领先很多」。他警告称,不应因为相关争议而扼杀这一优势。

特朗普表示:「不要杀死下金蛋的鹅。」此次表态正值美国围绕 AI 数据中心扩张、能源消耗以及前沿 AI 发展速度的讨论升温之际。

信源

动察 Beating 频道 · 动察 Beating 交流群
OpenAI寻求新一轮IPO前融资,估值目标达1.2万亿美元

据《金融时报》报道,OpenAI 正在与投资者初步讨论新一轮私人融资,目标估值约 1.2 万亿美元,为未来 IPO 做准备。知情人士透露,OpenAI 今年 3 月完成一轮融资后估值达到 8520 亿美元,近期因最新 AI 模型带动市场需求回升,公司与大型投资者讨论进一步融资计划。相关谈判仍处早期阶段,最终估值和融资规模可能发生变化。

OpenAI 首席执行官 Sam Altman 此前表示,公司上市时间可能不会早于 2027 年,并认为当前 AI 安全风险讨论升温的环境下上市并非最佳时机。GPT-5.6 和 Astra 等新模型发布后,OpenAI 收入增长加快,年化收入已超过 400 亿美元。公司此前曾表示拥有充足资金,但训练大模型仍需要持续投入大量资本。

动察 Beating 频道 · 动察 Beating 交流群
Gemini 3.8 Live发布,82.6分登顶语音榜

谷歌发布两款新的实时语音模型 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking。Extended Thinking 专门处理复杂任务,可以一边说话一边推理,还能在后台调用工具,不用停下对话等待结果。

在 Artificial Analysis 的 Speech-to-Speech Quality Index 中,Gemini 3.8 Live Extended Thinking 拿到 82.6 分,超过 GPT-Live-1 + Astra 的 81.5 分和 Grok Voice Think Fast 2.0 的 81.3 分,登上榜首。它在语音 Agent 任务 τ-Voice 上也拿到 68.6%。

普通版 Gemini 3.8 Live 更偏向低成本实时交互,支持 97 种语言自动切换、实时视觉输入和异步工具调用。两款模型已经进入 Gemini API 和 Google AI Studio,音频输入价格为每分钟 0.005 美元,输出为 0.018 美元。

信源

动察 Beating 频道 · 动察 Beating 交流群
Meta版「全家桶」全球上线:三大App加AI每月7.99美元起

Meta 正式在全球推出 Meta One,把 Instagram Plus、Facebook Plus 和 WhatsApp Plus 打包进一份订阅,再提供更多 Meta AI 使用量。个人版 Core 每月 7.99 美元,Premium 每月 19.99 美元。三款 App 的核心功能和 Meta AI 日常使用仍然免费。

付费用户可以更多使用 Muse 生成图片和视频,也能更频繁使用 Instagram 的 Restyle、语音特效等 AI 功能。不过 Meta 没有公布固定的 AI 使用上限,称额度会随地区、产品和系统情况变化。

Meta 还推出面向创作者和企业的套餐,每月 14.99 美元起,最高 499 美元。功能包括认证徽章、数据分析、定时发布 Story、给普通帖子和 Reels 加链接,以及更多 Meta Business Agent 使用量。

Meta 称,旗下这些付费方案此前已经逐步测试和上线,目前累计有 1500 万份订阅和试用。Meta One 现在正式面向全球提供。

信源

动察 Beating 频道 · 动察 Beating 交流群
2
OpenAI时隔2年半反超Anthropic,Astra支出份额第一

OpenRouter 最新数据显示,上周用户在 OpenAI 模型上的支出超过 Anthropic。这是自 2024 年 2 月以来第一次,Anthropic 保持了两年半的领先被打破。

最大的变化来自 Astra。它一款模型就拿下 OpenAI 和 Anthropic 合计支出的约 19%,超过 Opus 5 的 16%,成为上周最吸金的模型。GPT-5.6 Sol 和 Luna 则各占约 10%。

OpenAI 的回升其实早已开始。今年夏天 Terra 和 Luna 大幅降价后,OpenRouter 上的使用量迅速增长,部分用户在优惠结束后仍继续使用。Astra 上线后,OpenAI 最终把支出份额推过了 50%。

不过这只代表 OpenRouter 上 OpenAI 与 Anthropic 两家的相对支出,不能直接等同于整个 API 市场或两家公司的总收入。

信源

动察 Beating 频道 · 动察 Beating 交流群
👍2
微信聊天记录能直接导给ChatGPT了,文字附件一起打包

微信开始进一步放开聊天记录的流转。

实测显示,手机微信升级至 8.0.78 后,多选聊天记录并选择「转发到其他应用」,除了元宝、WorkBuddy,还可以通过「选择手机中的应用」直接交给 ChatGPT 等第三方 App。一次最多可选择 100 条。

微信会把聊天打成一个 ZIP 压缩包,里面包含按时间整理的聊天记录 TXT 和相关附件。电脑端微信也开放了类似入口,社区开发者已经基于此做出中转工具,可以把聊天记录送进 ChatGPT、Claude 等 AI。

信源

动察 Beating 频道 · 动察 Beating 交流群
🥰4🤡1
OpenAI或周四推出GPT-6 Sol:主打更快、更省

OpenAI 可能会在本周四发布 GPT-6 Sol。AI 顶流博主 Mark Kretschmann 直接给出了这个日期,并称它相比 Astra 会更便宜、更快,但能力稍弱。

OpenAI 目前还没官宣。Sam Altman 只确认本周有一次「大发布」,Tibo Sottiaux 则称,本周的发布规模接近一届 DevDay。

Astra 目前是 GPT-6 的最高能力型号,Sol 如果本周上线,更可能成为速度和成本更友好的日常主力。

信源

动察 Beating 频道 · 动察 Beating 交流群
前OpenAI研究员做了个「不会聊天」的AI:Jev只做判断,最高快200倍

前 OpenAI 研究员 Diogo Almeida 创办的 TypeSafe AI 推出新模型 Jev。它有点像一个能读懂自然语言的超级分类器,不生成文本,只返回选项、分数和概率,专门给软件做判断。

普通大模型需要一个 token 一个 token 往外生成,Jev 则可以并行给出多个结果。TypeSafe 还用新的 RLCD 方法训练它的置信度,让模型在给出判断的同时,告诉程序自己有多大把握。

TypeSafe 用安全告警、Agent 审查、发票处理和客服做了 4 组自动化工作流测试。在这套自建评测里,Jev 最高比 Claude Sonnet 5 快约 193.6 倍,比 Claude Opus 5 便宜约 444.6 倍。

TypeSafe 把 Jev 称为首款「System One Model」(快速决策模型),名字来自卡尼曼《思考,快与慢》里的 System 1。它专门处理分类、打分、路由和下一步决策这类快速判断任务。

信源

动察 Beating 频道 · 动察 Beating 交流群
Hugging Face封禁黑客版GLM-5.3,作者改名后重传

Hugging Face 已封禁 AI 安全公司 Audn 上传的 penclaw-GLM-5.3-abliterated-for-offensive-cyber,页面显示其违反 Content Policy。这个版本直接修改 GLM-5.3 权重,削弱模型的拒答行为。原仓库名和介绍还明确写着 offensive cyber。作者随后删掉这几个字,重新上传了模型。

具体为什么被封,Hugging Face 没有公开解释。作者称自己也没搞懂原因,社区有人猜测是 offensive cyber 的命名触发了审核。Hugging Face 的现行政策确实禁止旨在破坏、未经授权访问系统,以及生成恶意代码的内容。

但这类削弱模型拒答限制的版本在 Hugging Face 并不少见,平台上已有数千个类似的 abliterated 模型。

信源

动察 Beating 频道 · 动察 Beating 交流群
🫡7
扎克伯格表态:没必要等同行一起踩刹车,第三方评估Meta早就在做

Meta CEO 扎克伯格公开回应这轮 AI 减速争论。他支持第三方评估,也透露 Meta Superintelligence Labs 已经在多个领域引入独立评估员和顾问,但不赞成前沿实验室协调减速。

他的理由是,用户不会选择不听指令的 Agent,模型造成伤害也会让公司承担重大责任。因此,安全和对齐本身就会变成竞争力,实验室没必要等同行一起行动。Meta 就曾为了安全和系统防护,把 Muse 推迟了几个月。

扎克伯格还称,Meta 已承诺把绝大多数算力用于服务用户,而不是竞赛式推进递归自我改进。

信源

动察 Beating 频道 · 动察 Beating 交流群
😁4