动察Beating AI News
3.72K subscribers
1.45K photos
4 videos
1 file
4.44K links
AI新闻信息流
Download Telegram
智谱ZCode被曝后台整库上传,连Git历史也不放过

智谱 AI 编程工具 ZCode 被曝会在后台给整个项目做快照,连 .git 一起打包加密,并上传到阿里云 OSS。

技术博客作者 ferstar 逆向客户端后称,只要用户处于登录状态,这套机制就会运行,界面里也没有关闭上传的开关。

作者找到的一个商业项目快照约 313MB,文件清单里有 4.2 万个文件。其中 .git 占了 86.6%,包括 Git 历史对象、LFS 大文件缓存和 reflog。也就是说,打包的不只是当前代码,旧提交、曾下载的大文件和本地分支操作也可能一起进去。这个快照当时上传失败了 564 次,一直留在本地等待重试。

ZCode 官方隐私政策目前只明确写了会收集用户「在对话中提交」的文本、文件和代码,没有明确提到整个仓库和 Git 历史。官方「优化计划」默认关闭,但它只控制数据是否用于模型训练;ferstar 称,关掉这个选项仍不会停止快照打包和上传。

信源

动察 Beating 频道 · 动察 Beating 交流群
💩16
Exa给AI搜索装上时光机:4000亿网页快照,防止Agent偷看未来

Exa 上线 Snapshot,可以让搜索直接「回到过去」。它收录了超过 4000 亿份网页快照,跨度约 20 年。开发者指定一个时间,Exa 的搜索和网页读取 API 就会返回当时已经保存下来的网页版本。

最直接的用途是防止 AI 评测「偷看答案」。比如一道题 6 月设计、9 月才拿给 Agent 做,答案可能早已出现在论文、GitHub PR 或博客里。现在可以把搜索时间锁在 5 月,Agent 就看不到后来才公开的答案。金融团队也能用同样的方法做历史回测,只给模型看当时已经存在的信息。

不过这个「时光机」目前还有限制。它能保证你看到的是当时版本的网页,但搜索结果不一定和当年一模一样。普通付费用户目前也只能往前查最近 5 个月,想查更早的历史需要联系 Exa。

信源

动察 Beating 频道 · 动察 Beating 交流群
👍2👎1
Zed给AI编程装上「行车记录仪」,直接关掉GitHub PR

AI Agent 写代码越来越快,代码评审反而成了新的瓶颈。

过去,一个 Pull Request 通常对应开发者几小时甚至几天的工作。现在 Agent 可以一次改几十个文件,但评审者最后看到的,往往只有一份巨大的代码差异,很难知道这些修改是在什么要求下产生,又经过了哪些尝试。

Zed 新开放公测的 Delta,想把这部分过程重新补回来。它会把 Agent 对话、每一次代码修改和后续评论放进同一份历史里。看到一段有问题的代码,可以直接往前追,看看当时提了什么需求,Agent 又是怎么一步步改到这里。

评审也不再等到开发结束才开始。开发者可以随时另开一个线程,让人或另一个 Agent 检查当前代码,并在独立副本里继续修改。

Zed 已经先在自己身上试了。Delta 仓库关闭了 GitHub Pull Request,33 名成员已经通过 Delta 向主分支合入 570 次改动。

Git 仍然保留,commit、push 和构建流程都不受影响。Zed 真正想改的是代码评审这一层:当越来越多代码由 Agent 生成,只看最终 diff,可能已经不够了。

Delta 目前支持 macOS、Linux、Windows 和网页端,公测期间免费。MCP 和远程运行环境等功能还在开发。

信源

动察 Beating 频道 · 动察 Beating 交流群
Claude帮Anthropic研发下一代Claude,半年从不到1%飙到26%

Anthropic 最新披露,Claude 已经能主导 26% 的 AI 研发工作,2 月还不到 1%。超过 90% 的研发任务,现在至少已经有人和 Claude 一起完成。

这里的「主导」有明确标准:人只需要告诉 Claude 最终要解决什么问题,它就能自己完成大部分过程,最后由人检查结果。目前还没有任何一类研发工作可以完全交给 Claude。

这个数字比 Anthropic 之前公布的「80% 生产代码由 Claude 编写」更进一步。代码只是研发的一部分,这次统计还覆盖模型训练、实验、评测、基础设施等整个研发流程。Anthropic 最常用的内部平台上,任一时刻大约有 3 万个 Agent 同时做研究和工程。

信源

动察 Beating 频道 · 动察 Beating 交流群
👍4
智谱ZCode回应整库上传:Repo Wiki默认开启惹祸,承诺开源客户端

智谱回应 ZCode 仓库数据上传争议,称问题来自「代码库索引」里的 Repo Wiki 功能。Repo Wiki 生成 Wiki 页面时,可能会把仓库数据上传到云端;页面生成后,相关数据会立即销毁,不会保存。

官方称,这项功能上线初期默认开启,因此影响了部分用户,目前相关问题已经修复。ZCode 现在的官方文档已经明确写出,Repo Wiki 不会读取 .git、依赖目录、构建产物和缓存,只会按需发送经过过滤的代码内容。

此前社区逆向发现,ZCode 会在后台给项目做快照,连 .git、Git 历史和 LFS 缓存都可能一起打包上传。

ZCode 还宣布近期将开源代码,并邀请第三方评估人员审查系统运行情况,后续公开审查进展。作为补偿,所有用户都会额外获得一次周额度重置,今天发放。

动察 Beating 频道 · 动察 Beating 交流群
🤡15
智谱ZCode回应整库上传:Repo Wiki默认开启惹祸,承诺开源客户端

智谱回应 ZCode 仓库数据上传争议,称问题来自「代码库索引」里的 Repo Wiki 功能。Repo Wiki 生成 Wiki 页面时,可能会把仓库数据上传到云端;页面生成后,相关数据会立即销毁,不会保存。

官方称,这项功能上线初期默认开启,因此影响了部分用户,目前相关问题已经修复。ZCode 现在的官方文档已经明确写出,Repo Wiki 不会读取 .git、依赖目录、构建产物和缓存,只会按需发送经过过滤的代码内容。

此前社区逆向发现,ZCode 会在后台给项目做快照,连 .git、Git 历史和 LFS 缓存都可能一起打包上传。

ZCode 还宣布近期将开源代码,并邀请第三方评估人员审查系统运行情况,后续公开审查进展。作为补偿,所有用户都会额外获得一次周额度重置,今天发放。

动察 Beating 频道 · 动察 Beating 交流群
💩19
Claude不到4周优化36款生物模型,平均提速约4倍

Anthropic 让 Claude 给 36 款开源生物模型做了一轮性能优化。不到 4 周,这些模型平均跑快约 4 倍,覆盖蛋白质结构预测、蛋白质设计和基因组分析等任务。相关优化代码已经全部开源。

Claude 做的也不只是改改 Python 代码,还自己写了 FlashPairformer 等 GPU kernel,直接从底层提高 GPU 计算效率。官方测试中,一些原本非常耗时的计算最多快了 3.2 倍。碰到不同模型,Claude 还会逐个找瓶颈,把重复计算删掉,或者把经常用到的数据提前缓存起来。

整个过程由两名 Anthropic 生物建模研究员监督,但两人此前都没有推理优化或 kernel 工程经验。即使要求优化前后结果完全一致,这些模型平均也能提速约 1.6 倍;如果允许模型结果出现正常范围内的细微差异,平均提速能到约 4 倍。

Anthropic 之前做一次蛋白质设计实验,每个目标最多要用约 2500 个 H100 GPU 小时。经过优化后,一台 H200 跑 24 小时就能做到接近的效果,GPU 加 Claude 的成本合计约 150 美元。原来要烧上千个 GPU 小时的实验,现在一天左右就能跑完。

信源

动察 Beating 频道 · 动察 Beating 交流群
Anthropic悄悄建了个生物实验室,要让Claude指挥机器人做实验

Anthropic 已经在旧金山湾区建起自己的生物实验室,把 Claude 从电脑里的生物研究带到了真实实验。Anthropic 生命科学负责人 Eric Kauderer-Abrams 确认,公司现在既会自己做实验,也会把部分工作交给外部合作伙伴。

下一步是让 Claude 直接参与实验室自动化。Anthropic 希望 Claude 能指挥机械臂、移液机器人等设备,在人类监督下自己执行实验。公司上个月刚推出 Model Hardware Standard,让 AI 可以用统一接口控制显微镜、机械臂和实验仪器,已经能根据实验结果调整参数,甚至处理部分设备故障。

Anthropic 也开始自己做药物相关的前临床研究,重点盯着传统药企觉得太难、或者商业价值不够高的疾病。不过公司暂时不会做人体临床试验,也表示自己的实验室并非专门用于药物发现,希望避免直接和药企客户竞争。

生命科学已经是 Anthropic 投入人力和资源最多的方向之一。今年 6 月,公司还推出了 Claude Science,把论文数据库、代码、计算资源等科研工具放到一个工作台里。现在再加上真实实验室,Claude 做科学研究正在从「分析数据」继续往「动手做实验」推进。

信源

动察 Beating 频道 · 动察 Beating 交流群
🤡5
MiniMax Code突然宣布今晚开源,源码即将上GitHub

MiniMax Code 突然宣布将在今晚开源。

MiniMax Code 是 MiniMax 的桌面 AI 编程 Agent,可以直接改项目文件、运行命令和审查代码,也支持多个 Agent 分工协作。用户还可以通过手机远程查看任务进度和批准操作。

MiniMax 早已建好 minimax-code GitHub 仓库,但此前主要用来收集 Bug 和功能建议。目前仓库里仍只有 README 和 Issue 模板,还没有客户端源码。

动察 Beating 频道 · 动察 Beating 交流群
Kimi Code桌面端上线:浏览器、终端、多Agent塞进一个窗口

月之暗面正式上线 Kimi Code Desktop,把原本偏终端的 Kimi Code 做成了独立桌面应用。用户可以直接打开本地项目,让 Agent 读写代码、跑命令、查看 Git 改动,目前支持 macOS 和 Windows。

桌面版直接内置了浏览器和终端。做网页时,Agent 可以读取右侧网页的页面信息,用户也能直接点选元素、框出区域或者截图批注,告诉它具体哪里要改。改代码、看网页效果、跑测试都不用再切窗口。

它还支持计划、目标和 Swarm 三种任务模式。Swarm 可以把任务拆给多个子 Agent 并行处理,长任务也能放到后台继续跑。除了 Kimi 自家的模型,用户还可以自己填 API Key 和 Base URL,接入其他模型供应商。

信源

动察 Beating 频道 · 动察 Beating 交流群
AI初创公司Mantic完成2500万美元融资,开发超人类预测能力

9 月 18 日,人工智能开发商 Mantic 周五宣布完成 2500 万美元种子轮融资。该公司近期在一项预测赛事中击败人类选手。伦敦在线预测平台 Metaculus 本月结束的 2026 年夏季杯结果显示,Mantic 对政治、经济和文化事件的概率预测准确度超过人类参赛者。Mantic 及其他 AI 参赛者取得的高分也创下 AI 技术首次主导该赛事的记录。

本轮融资由 Radical Ventures 领投,微软旗下风投基金 M12、AI 初创公司 Thinking Machines Lab、Balderton Capital 等参与,具体估值未披露。Mantic 首席执行官 Toby Shevlane 表示,公司正致力于提升人类理解未来的能力。

Mantic 成立于 2024 年,由 Shevlane 与 Ben Day 共同创办。公司通过针对预测任务优化其他 AI 实验室开发的前沿模型,并利用历史数据测试预测系统、评估表现后持续改进,以提升预测能力。(路透社)

信源

动察 Beating 频道 · 动察 Beating 交流群
MiniMax Code核心CLI正式开源,桌面端暂不在内

MiniMax 正式开源 MiniMax Code CLI v0.4.12,采用 MIT 协议。它是 MiniMax Code 的核心命令行工具,负责读代码、改文件、调用工具和执行任务。桌面端这次没有开源。

MiniMax 还公布了一组测试结果。MiniMax Code 0.3.2 搭配 Kimi K3,在 30 道编程任务里完成了 23 道,通过率 76.7%,成功任务耗时中位数为 4 分 33 秒,胜过 Codex、Claude Code 等公开基线。

信源

动察 Beating 频道 · 动察 Beating 交流群
🤡61
Muse干掉ChatGPT,登顶美国App Store免费榜

Meta 的个人 AI Agent 产品 Muse 上线十天,终于登上美国 App Store 免费应用榜第 1,超过 ChatGPT、Gemini、Claude 等老牌 AI 应用。

Muse 主打帮用户直接完成任务,不只是聊天。它可以代用户处理邮件、填写表格、购物、预约等日常事务,并通过虚拟环境执行操作,涉及敏感操作时会要求用户确认。

Muse 上线后一直稳居美国 App Store 免费榜前列,如今进一步升到榜首。AI Agent 正从开发者工具进入普通消费者应用市场,AI 应用也将迎来范式革命。

信源

动察 Beating 频道 · 动察 Beating 交流群
🤷‍♀8
Google也试水个人Agent:给AI单独开账号,全家一起使唤

Google Labs 把实验性 AI Agent CC 改成了家庭版。CC 现在有自己的 Google 账号,最多 6 个人一起用。每个人把愿意共享的邮件、日历和 Drive 文件交给它,CC 再统一整理每日简报、家庭日程和任务清单。

CC 也能直接干活。它运行在独立云电脑上,由 Google 的 Antigravity Agent 系统和 Gemini 模型驱动,可以填写报名 PDF、整理购物清单、查实时车程,还能创建共享 Docs 和 Sheets。涉及向群组外发送信息或执行操作时,仍需要用户授权。

CC 去年最初只是一个个人效率 Agent,今年 5 月,它的 Daily Brief 能力被放进 Gemini App。现在 Google 又把 CC 单独拿出来,改造成多人共享的 Agent。目前仍是早期实验,仅面向美国 18 岁以上个人 Google 账号。老用户会陆续收到升级,新用户需要加入 waitlist。

最近个人 AI Agent 明显热了起来。xAI 上个月推出 Grok Bot,Meta 本月上线 Muse,Instinct 也在争夺类似场景。相比这些主要服务一个人的 Agent,Google 这次直接把 CC 做成了「全家共用一个 AI」。

信源

动察 Beating 频道 · 动察 Beating 交流群
👍1
PrismML把Qwen3.8 27B压到5.9GB,自测保留98.2%性能

加州理工学院数学家 Babak Hassibi 联合创立的 AI 实验室 PrismML 发布 Ternary Bonsai 2 27B,把 Qwen3.8 27B 的 270 亿参数模型压到 5.9GB。它把权重压成 -1、0、+1 三种值,体积只有 FP16 原版约九分之一。模型支持 26.2 万 Token 上下文、图文输入和 Agent 工具调用,并以 Apache 2.0 许可开放权重。

相比两个月前的第一代 Bonsai 27B,新版体积基本没变,但底模从 Qwen3.6 换成了 Qwen3.8。PrismML 自测称,综合基准成绩相对完整版的保留率从约 95% 提到 98.2%,其中数学和代码成绩已经非常接近原版。官方还演示了它在 RTX 5090 上直接跑 Cline 编程 Agent 和 Computer Use。

信源

动察 Beating 频道 · 动察 Beating 交流群
👍5
清华大学副教授代季峰创办的Naive AI估值冲到14亿美元

清华大学副教授代季峰创办的 AI 公司 Naive AI,估值已超过 14 亿美元。公司成立仅数月,准备发布首个大语言模型,并采用开放权重模式,用户可以免费下载和修改模型。

Naive AI 近期完成 3 轮融资,累计融资约 4 亿美元,投资方包括腾讯、IDG Capital、MPCi 和 HSG。公司目前不到 100 人,但正在开发自己的大模型和 AI Agent。

Naive AI 没有选择从零训练模型,而是在已有开源模型基础上继续优化,通过中训练、后训练和强化学习提升能力。代季峰认为,未来大模型竞争不一定只看谁投入更多算力,也可以通过模型优化和训练方法取得突破。

代季峰是计算机视觉领域知名学者,代表作包括可变形卷积网络和多模态基础模型 InternVL,论文总引用超 5 万次。他曾在微软亚洲研究院任首席研究员,后转任商汤执行研究总监,2022 年回清华任教。2025 年加入陈天桥旗下盛大网络孵化的 AI 公司 MiroMind,任联合发起人。

今年 1 月离职后,代季峰就知识产权使用权和骨干带走问题与 MiroMind 公司谈崩,4 月双方通过《华盛顿邮报》和内部通报公开互相指责,MiroMind 称其「商业诚信违约」并保留法律追诉权。

目前 Naive AI 仍处于低调阶段,官网没有公布具体模型、参数和测试成绩。

信源

动察 Beating 频道 · 动察 Beating 交流群
Kimi暂停订阅两个月后上线新套餐,Code没有拆出去单卖

月之暗面上线新版 Kimi 会员。四档套餐改名为 Go、Plus、Pro 和 Max,年付分别为 468、948、1908 和 6708 元,折合每月 39、79、159 和 559 元。

Kimi Code 没有按照最早公布的方案拆出去单独收费。新版 Plus、Pro 和 Max 仍然包含 Kimi Code,只有最低档 Go 不支持。

Kimi 7 月因 K3 上线后算力紧张暂停新用户订阅,并宣布后续会将 Kimi 主会员和 Kimi Code 分开收费。随后在用户压力下,拆分收费方案基本撤回。

新四档年费与旧 Andante、Moderato、Allegretto、Allegro 完全一致。不过旧套餐的最低档还能用 Kimi Code,现在同价位的 Go 已经取消了这项权益;要用 Code,年付门槛从 468 元升到了 948 元。

动察 Beating 频道 · 动察 Beating 交流群
💩8😁1
阿里Qoder宣布Qwen3.8-Flash模型限时免费用

阿里 Qoder 面向个人用户限时免费开放 Qwen3.8-Flash。模型计费系数从 0.1× 降到 0,活动持续到 9 月 30 日。免费、试用和付费用户都能参加,账号就算没有 Credits,也可以直接选择模型使用,不需要另外领取资格。

免费范围覆盖 Qoder CN、IDE、CLI、JetBrains 插件、Cloud Agents、移动端和网页版,企业订阅暂不参与。活动期间用 Qwen3.8-Flash 不会消耗任何 Credits。

Qoder 同时恢复了每天领取 100 通用 Credits 的活动,每笔额度 30 天有效,结束时间暂未公布。

信源

动察 Beating 频道 · 动察 Beating 交流群
💩5👍2