动察Beating AI News
3.71K subscribers
1.45K photos
4 videos
1 file
4.43K links
AI新闻信息流
Download Telegram
华为下一代芯片昇腾960发布时间提前9个月,4096卡超节点首上NPO

华为把下一代昇腾960的发布时间提前了9个月。去年官方计划还是2027年Q4推出,今天华为宣布,昇腾960DT将在2027年Q1就绪,提前三个季度;960PR将在Q3跟进。

960DT单芯片提供2 PFLOPS FP8、4 PFLOPS FP4算力,最高搭载288GB HBM,带宽9.6TB/s。

华为同时发布新的昇腾960超节点,单个系统可连接4096张NPU,提供8 EFLOPS FP8算力和1PB HBM。它首次采用NPO(把光引擎放到芯片附近)技术,用5500个Hi-ONE替代原方案约4.8万个800G光模块。华为称,这可以减少超过550千瓦功耗。

华为接下来仍会保持昇腾一年一代,同时用灵衢和光互联继续做大超节点,把单芯片之外的系统算力也往上推。

信源

动察 Beating 频道 · 动察 Beating 交流群
👍2
Grok 4.7最快今晚发布?Google Cloud后台已出现模型名

Grok 4.7 疑似已经进入发布前最后阶段。社区发现 Google Cloud Console 的模型配额页面突然出现了 grok-4.7。

Grok 4.7 原计划更早上线。马斯克上周临时宣布再推迟几天,原因是模型面对困难任务时容易过早放弃,对自己的答案检查得也不够严格。他随后还表示,Grok 4.7 大致会达到 Claude Opus 5 水平,但多模态能力还需要改进;Grok 4.8 会有明显提升,Grok 4.9 才可能达到 Astra 和 Fable 级别。

社区之所以盯着 Google Cloud 配额页,是因为过去一些新模型会在正式上线前后先出现在这里。

信源

动察 Beating 频道 · 动察 Beating 交流群
GLM-5.3开始优化自己的系统,智谱唐杰:RSI最小闭环已经出现

智谱披露,GLM-5.3 驱动的 Infra Agent 已经参与优化 GLM-5.3-Flash 的推理系统。从首次跑通到承接全部生产流量不到两周,端到端吞吐提升到最初的 3.2 倍。

联合创始人兼首席科学家唐杰在复盘中提到,Agent 现在最容易卡住的地方,往往不是不会写代码,而是不知道问题出在哪。比如一次修改让吞吐下降 20%,它知道自己改坏了,却不知道是哪一层出了问题,下一步该查什么。

于是智谱把资深工程师平时的排查方法做成一套 Agent 可以直接使用的工具。Agent 改完代码后,可以自己检查结果对不对、时间耗在哪里、哪种方案更快,再根据结果继续修改。

靠这套方法,Agent 找出了长上下文计算误差、KV 传输阻塞和解码 kernel 重复计算等问题。其中一个 kernel 重写后提速 1.71 倍。

唐杰判断,工程师的角色会越来越像「设计反馈的人」。人负责定目标、设边界和审核高风险修改,Agent 自己提假设、改代码、跑实验。离完整的 RSI 还很远,但「模型优化系统,系统再服务模型」这个最小闭环已经出现。

信源

动察 Beating 频道 · 动察 Beating 交流群
👍4
被指和Anthropic关系太近,METR总裁回应:我们没拿AI公司的钱

这几天,Anthropic 推荐的第三方评估机构 METR 接连遭到质疑。外界发现,它的不少核心成员和 Anthropic、OpenAI 等 AI 公司关系密切。METR 自己也承认,此前一次评估中至少 6 名参与者与 AI 公司员工有密切私人关系,当时甚至还没有正式的利益冲突政策。

METR 总裁 Chris Painter 现在正面回应。他称 METR 靠捐款运营,从未接受前沿 AI 公司及其员工的钱,给 Anthropic、OpenAI 等公司做评估也不收费。这些公司会免费开放模型和 Token,让 METR 做测试。

Painter 强调,METR 的目标不是替 AI 公司证明模型「安全」,而是在发现模型可能失控时,把证据公开给政府和公众。

信源

动察 Beating 频道 · 动察 Beating 交流群
😁1
传OpenAI下周发Codex Bot,直接对标Grok Bot

AI 博主 Mark Kretschmann 爆料,OpenAI 正准备推出一款暂称 Codex Bot 的新产品,基于 OpenClaw 开发。原计划本周发布,目前已推迟到下周。

Sam Altman 今天刚表示,原定本周发布的「主要新东西」延至下周;而 OpenAI 今年 2 月招募 OpenClaw 创始人 Peter Steinberger 时,也称他将负责开发「下一代个人 Agent」。

Mark 称,Codex Bot 会比现有 ChatGPT Work 更像 Grok Bot。后者相当于一组长期在线的「AI 同事」,可以使用自己的工作环境,跨网站和 App 持续干活。

信源

动察 Beating 频道 · 动察 Beating 交流群
🤨2👎1
给Claude Code装上「剪映」,Hypit让Agent直接做完整视频

开源项目 Hypit 最近在 GitHub 快速走红,目前已有约 8300 Star。它相当于给 Claude Code、Codex 这类 Coding Agent 加上一套视频制作工具,让原本主要写代码的 Agent,也能开始做视频。

用户丢进去一条参考视频后,Hypit 会把台词、镜头、字幕、B-roll 和特效拆成一套可以反复修改的制作流程。Agent 再调用 Seedance 等视频模型、图片模型、WhisperX 和 FFmpeg,替换人物、台词和素材,重新生成整条视频。

这套方法特别适合批量做相似视频。比如一条广告效果不错,可以保留原来的节奏和结构,只换产品、人物或文案,再快速做出几十个不同版本。一条视频跑通后,后面主要就是换内容,不用每次从头做一遍。

Hypit 本身免费使用,也不强制绑定某个生成模型。不过它采用带额外限制的开源协议,企业内部可以商用;如果拿它做面向多个客户的 SaaS,则需要另行取得商业授权。

信源

动察 Beating 频道 · 动察 Beating 交流群
🤨2
OpenAI推出法律版GPT-6 Astra,法律研究正确率提升40%

OpenAI 推出 Astra for Law,把 GPT-6 Astra 做成专门面向法律工作的版本。它加入法律检索、分析和写作能力,可以帮律师查判例、分析案件、起草文件,也能接入律所现有的工作流。

OpenAI 还新建了一套法律搜索索引,可以查询美国判例、法规、法院规则等超过 2.3 亿个 URL,覆盖 99.9% 以上已公开的美国先例判决。

在 200 道美国法律研究题中,Astra for Law 的整体正确率达到 54.0%,普通 GPT-6 Astra 加网页搜索为 38.7%,相对提升约 40%。在判例题上,它找到的参考案例也多了 24%。

Astra for Law 会先向部分美国律所开放,在 ChatGPT 和 Codex 中显示为 GPT-6 Astra Law,随后开放 API。Harvey、Legora 等法律 AI 公司也可以把它接进自己的产品。OpenAI 还推出 26 个法律行业插件,可以调用 Thomson Reuters、Relativity、Clio 等专业法律数据和工具。

信源

动察 Beating 频道 · 动察 Beating 交流群
Claude Code像素级抄袭Cursor,连Projects都懒得改名

Anthropic 重做 Claude Projects,结果和 Cursor 一周前推出的同名功能几乎一个模子。

Cursor 让一个总控 Agent 当项目经理,自己不写代码,只负责拆任务、定计划,再把活分给多个 Agent 并行完成。任务长期跑在云端,关电脑也不停;所有 Agent 共享项目上下文,需要时还能自动拉起本地 Agent。

Claude 新 Projects 基本照着这套来。也是总控 Agent 拆任务、验结果,下面同时跑多个 Claude Code 会话;每个会话独立改代码、跑测试、提交 PR,共享项目记忆,电脑关了照样干。

Cursor Projects 9 月 10 日上线,Claude Projects 9 月 17 日才发布。现在甚至还是 Cursor 功能更多,看来 7 天只够 Claude 抄个七七八八。

信源

动察 Beating 频道 · 动察 Beating 交流群
😁15
85年没解开的德军恩尼格玛密电,GPT-6 Astra用10小时破了

彭博一名产品开发人员 Carter Leffen 用 GPT-6 Astra,破解了一条 1941 年的德军恩尼格玛密电。他本人并不是密码学家。

这条密文只有 82 个字母,此前一直被密码史料网站 CryptoCellar 列为尚未破解。Astra Extra High 大约花了 10 小时找到答案。

关键线索来自当天另一封已经破译的电报。Astra 发现里面连续出现两次地名「ROSENOW」,随后猜测这个词也藏在目标密文里。它接着写恩尼格玛模拟器和搜索程序,并行测试不同密钥,再用原始电报头和剩余文字验证。

最终还原出的内容很简单:「请告知行军路线。我在 Rosenow。请立即通过无线电回复。」

不过这次也不是完全只靠 Astra。Leffen 负责提出目标和推进调查,Astra 则完成了大量查资料、写代码、跑搜索和验证工作。

信源

动察 Beating 频道 · 动察 Beating 交流群
👍13
Qwen3.8-Omni-Flash上线:自己看视频、调工具、交成片

阿里千问上线原生全模态模型 Qwen3.8-Omni-Flash,支持文本、图片、音频、视频和 1M 上下文。

这代明显加强了音视频 Agent 能力。模型可以自己从视频里找信息、规划任务,再调用外部工具完成剪辑、配音和渲染。官方展示了长会议处理、短剧翻译、电影解说、MV 制作和视频转图文笔记等场景。

面对几小时的长视频,它也不用从头到尾全部处理。模型会先判断答案可能在哪,再逐步定位关键片段。OmniVideoBench 上,准确率从 63.4 提到 67.8,Token 消耗从 145,736 降到 79,117,少了 45.7%。

千问称,Qwen3.8-Omni-Flash 在 30 项评测上的平均成绩比 Qwen3.5-Omni-Plus 提升超过 26%,音视频能力接近 Gemini 3.8 Flash,音频能力整体超过后者。音频输入成本下降超过 98%,音视频输入下降超过 93%。

目前 Qwen3.8-Omni-Flash 模型权重尚未公开,只开放了 API。千问同时开源了 Qwen-MM-Plugins,可以装进 Claude Code、Codex、Gemini CLI、Qwen Code 等 Agent,给它们补上图片、音频、长视频处理和视频剪辑能力。

另一套 Qwen-Live Harness 更像实时调度层。用户可以直接和实时全模态模型说话,再把复杂任务交给 Gemini CLI、Claude Code、Codex 等后台 Agent 持续执行。它会跟踪任务进度,做完后再主动回来告诉你结果。

信源

动察 Beating 频道 · 动察 Beating 交流群
智谱GLM-5.3-FlashX上线,最高200tokens/s

智谱上线 GLM-5.3-FlashX,可以理解为 GLM-5.3-Flash 的高速版本,最高输出速度达到 200 tokens/s。官方这次没有公布新的能力跑分或架构变化,更新重点就是继续提高推理速度。

这次发布正好接在昨天的推理系统优化之后。智谱刚披露,GLM-5.3 驱动的 Infra Agent 参与优化 Flash 的推理基础设施。不到两周,端到端吞吐提高到最初约 3 倍,整套服务运行在超过 10 万张国产 AI 芯片上。

信源

动察 Beating 频道 · 动察 Beating 交流群
👍3
Muse上线Mac,把手伸进用户本机文件和App

Meta 上线 Muse for Mac,这是 Muse 第一个能直接在用户电脑上干活的版本。它可以处理本地文件,也能读取 Mail、Messages、Calendar、Notes 等 App。比如整理文件夹、汇总邮件和聊天,或者调用本机文件继续填表。

Muse 之前跑在 Meta 提供的云端虚拟机里,通过浏览器和连接器替用户购物、发邮件、订餐。现在 Mac 版进一步拿到了本机文件和系统 App 的操作能力。

完整磁盘访问由用户决定是否开放。删除文件、发送消息等敏感操作,Muse 仍要先让用户确认。目前 Mac 版仍只在美国开放。

Meta 上个月其实已经推出过 Meta AI for Mac,但那款更偏看屏问答和全局语音输入。Muse for Mac 更像真正的桌面 Agent,可以直接替用户动手。

信源

动察 Beating 频道 · 动察 Beating 交流群
三个人+Claude黑进OpenAI内部代码库,OpenAI还给了6500美元

安全公司 Hacktron 的 3 名白帽研究员,用 Claude 不到 72 小时一路摸到了 OpenAI 内部代码库。三人随后主动上报漏洞,OpenAI 修复后按漏洞赏金计划给了他们 6500 美元。

攻击入口只是 OpenAI 的社区论坛。研究员发现,上传一张特制 HEIF 图片,就能利用论坛软件 Discourse 的漏洞,让服务器执行他们写的代码。随后,他们拿到了论坛用户的登录令牌,相当于一张「已经登录过的通行证」。

更大的问题出在 OpenAI 自己。论坛的登录令牌权限开得太大,竟然还能进入同一用户的 ChatGPT 和 Codex 账号,部分令牌又属于 OpenAI 员工。研究员借其中一个员工账号进入 Codex,而这个 Codex 连着公司的 GitHub。最终,他们让 Codex 在内部 openai/openai 代码库提交了一次无害的文档修改,证明自己已经碰到了内部仓库。随后立即停止测试并上报。

Claude 主要负责最难的一步:把图片漏洞变成真正能跑起来的攻击代码。Opus 4.8 一直没跑稳;Opus 5 上线后几小时就取得突破。Hacktron 称,从最初发现问题到进入 OpenAI 内部仓库,整个过程不到 72 小时,人实际只投入了几个小时。

信源

动察 Beating 频道 · 动察 Beating 交流群
😁5🤔2
智谱ZCode被曝后台整库上传,连Git历史也不放过

智谱 AI 编程工具 ZCode 被曝会在后台给整个项目做快照,连 .git 一起打包加密,并上传到阿里云 OSS。

技术博客作者 ferstar 逆向客户端后称,只要用户处于登录状态,这套机制就会运行,界面里也没有关闭上传的开关。

作者找到的一个商业项目快照约 313MB,文件清单里有 4.2 万个文件。其中 .git 占了 86.6%,包括 Git 历史对象、LFS 大文件缓存和 reflog。也就是说,打包的不只是当前代码,旧提交、曾下载的大文件和本地分支操作也可能一起进去。这个快照当时上传失败了 564 次,一直留在本地等待重试。

ZCode 官方隐私政策目前只明确写了会收集用户「在对话中提交」的文本、文件和代码,没有明确提到整个仓库和 Git 历史。官方「优化计划」默认关闭,但它只控制数据是否用于模型训练;ferstar 称,关掉这个选项仍不会停止快照打包和上传。

信源

动察 Beating 频道 · 动察 Beating 交流群
💩14
Exa给AI搜索装上时光机:4000亿网页快照,防止Agent偷看未来

Exa 上线 Snapshot,可以让搜索直接「回到过去」。它收录了超过 4000 亿份网页快照,跨度约 20 年。开发者指定一个时间,Exa 的搜索和网页读取 API 就会返回当时已经保存下来的网页版本。

最直接的用途是防止 AI 评测「偷看答案」。比如一道题 6 月设计、9 月才拿给 Agent 做,答案可能早已出现在论文、GitHub PR 或博客里。现在可以把搜索时间锁在 5 月,Agent 就看不到后来才公开的答案。金融团队也能用同样的方法做历史回测,只给模型看当时已经存在的信息。

不过这个「时光机」目前还有限制。它能保证你看到的是当时版本的网页,但搜索结果不一定和当年一模一样。普通付费用户目前也只能往前查最近 5 个月,想查更早的历史需要联系 Exa。

信源

动察 Beating 频道 · 动察 Beating 交流群
👍1
Zed给AI编程装上「行车记录仪」,直接关掉GitHub PR

AI Agent 写代码越来越快,代码评审反而成了新的瓶颈。

过去,一个 Pull Request 通常对应开发者几小时甚至几天的工作。现在 Agent 可以一次改几十个文件,但评审者最后看到的,往往只有一份巨大的代码差异,很难知道这些修改是在什么要求下产生,又经过了哪些尝试。

Zed 新开放公测的 Delta,想把这部分过程重新补回来。它会把 Agent 对话、每一次代码修改和后续评论放进同一份历史里。看到一段有问题的代码,可以直接往前追,看看当时提了什么需求,Agent 又是怎么一步步改到这里。

评审也不再等到开发结束才开始。开发者可以随时另开一个线程,让人或另一个 Agent 检查当前代码,并在独立副本里继续修改。

Zed 已经先在自己身上试了。Delta 仓库关闭了 GitHub Pull Request,33 名成员已经通过 Delta 向主分支合入 570 次改动。

Git 仍然保留,commit、push 和构建流程都不受影响。Zed 真正想改的是代码评审这一层:当越来越多代码由 Agent 生成,只看最终 diff,可能已经不够了。

Delta 目前支持 macOS、Linux、Windows 和网页端,公测期间免费。MCP 和远程运行环境等功能还在开发。

信源

动察 Beating 频道 · 动察 Beating 交流群
Claude帮Anthropic研发下一代Claude,半年从不到1%飙到26%

Anthropic 最新披露,Claude 已经能主导 26% 的 AI 研发工作,2 月还不到 1%。超过 90% 的研发任务,现在至少已经有人和 Claude 一起完成。

这里的「主导」有明确标准:人只需要告诉 Claude 最终要解决什么问题,它就能自己完成大部分过程,最后由人检查结果。目前还没有任何一类研发工作可以完全交给 Claude。

这个数字比 Anthropic 之前公布的「80% 生产代码由 Claude 编写」更进一步。代码只是研发的一部分,这次统计还覆盖模型训练、实验、评测、基础设施等整个研发流程。Anthropic 最常用的内部平台上,任一时刻大约有 3 万个 Agent 同时做研究和工程。

信源

动察 Beating 频道 · 动察 Beating 交流群
👍2
智谱ZCode回应整库上传:Repo Wiki默认开启惹祸,承诺开源客户端

智谱回应 ZCode 仓库数据上传争议,称问题来自「代码库索引」里的 Repo Wiki 功能。Repo Wiki 生成 Wiki 页面时,可能会把仓库数据上传到云端;页面生成后,相关数据会立即销毁,不会保存。

官方称,这项功能上线初期默认开启,因此影响了部分用户,目前相关问题已经修复。ZCode 现在的官方文档已经明确写出,Repo Wiki 不会读取 .git、依赖目录、构建产物和缓存,只会按需发送经过过滤的代码内容。

此前社区逆向发现,ZCode 会在后台给项目做快照,连 .git、Git 历史和 LFS 缓存都可能一起打包上传。

ZCode 还宣布近期将开源代码,并邀请第三方评估人员审查系统运行情况,后续公开审查进展。作为补偿,所有用户都会额外获得一次周额度重置,今天发放。

动察 Beating 频道 · 动察 Beating 交流群
🤡11
智谱ZCode回应整库上传:Repo Wiki默认开启惹祸,承诺开源客户端

智谱回应 ZCode 仓库数据上传争议,称问题来自「代码库索引」里的 Repo Wiki 功能。Repo Wiki 生成 Wiki 页面时,可能会把仓库数据上传到云端;页面生成后,相关数据会立即销毁,不会保存。

官方称,这项功能上线初期默认开启,因此影响了部分用户,目前相关问题已经修复。ZCode 现在的官方文档已经明确写出,Repo Wiki 不会读取 .git、依赖目录、构建产物和缓存,只会按需发送经过过滤的代码内容。

此前社区逆向发现,ZCode 会在后台给项目做快照,连 .git、Git 历史和 LFS 缓存都可能一起打包上传。

ZCode 还宣布近期将开源代码,并邀请第三方评估人员审查系统运行情况,后续公开审查进展。作为补偿,所有用户都会额外获得一次周额度重置,今天发放。

动察 Beating 频道 · 动察 Beating 交流群
💩18
Claude不到4周优化36款生物模型,平均提速约4倍

Anthropic 让 Claude 给 36 款开源生物模型做了一轮性能优化。不到 4 周,这些模型平均跑快约 4 倍,覆盖蛋白质结构预测、蛋白质设计和基因组分析等任务。相关优化代码已经全部开源。

Claude 做的也不只是改改 Python 代码,还自己写了 FlashPairformer 等 GPU kernel,直接从底层提高 GPU 计算效率。官方测试中,一些原本非常耗时的计算最多快了 3.2 倍。碰到不同模型,Claude 还会逐个找瓶颈,把重复计算删掉,或者把经常用到的数据提前缓存起来。

整个过程由两名 Anthropic 生物建模研究员监督,但两人此前都没有推理优化或 kernel 工程经验。即使要求优化前后结果完全一致,这些模型平均也能提速约 1.6 倍;如果允许模型结果出现正常范围内的细微差异,平均提速能到约 4 倍。

Anthropic 之前做一次蛋白质设计实验,每个目标最多要用约 2500 个 H100 GPU 小时。经过优化后,一台 H200 跑 24 小时就能做到接近的效果,GPU 加 Claude 的成本合计约 150 美元。原来要烧上千个 GPU 小时的实验,现在一天左右就能跑完。

信源

动察 Beating 频道 · 动察 Beating 交流群
Anthropic悄悄建了个生物实验室,要让Claude指挥机器人做实验

Anthropic 已经在旧金山湾区建起自己的生物实验室,把 Claude 从电脑里的生物研究带到了真实实验。Anthropic 生命科学负责人 Eric Kauderer-Abrams 确认,公司现在既会自己做实验,也会把部分工作交给外部合作伙伴。

下一步是让 Claude 直接参与实验室自动化。Anthropic 希望 Claude 能指挥机械臂、移液机器人等设备,在人类监督下自己执行实验。公司上个月刚推出 Model Hardware Standard,让 AI 可以用统一接口控制显微镜、机械臂和实验仪器,已经能根据实验结果调整参数,甚至处理部分设备故障。

Anthropic 也开始自己做药物相关的前临床研究,重点盯着传统药企觉得太难、或者商业价值不够高的疾病。不过公司暂时不会做人体临床试验,也表示自己的实验室并非专门用于药物发现,希望避免直接和药企客户竞争。

生命科学已经是 Anthropic 投入人力和资源最多的方向之一。今年 6 月,公司还推出了 Claude Science,把论文数据库、代码、计算资源等科研工具放到一个工作台里。现在再加上真实实验室,Claude 做科学研究正在从「分析数据」继续往「动手做实验」推进。

信源

动察 Beating 频道 · 动察 Beating 交流群
🤡2