动察Beating AI News
3.72K subscribers
1.45K photos
4 videos
1 file
4.44K links
AI新闻信息流
Download Telegram
给Claude Code装上「剪映」,Hypit让Agent直接做完整视频

开源项目 Hypit 最近在 GitHub 快速走红,目前已有约 8300 Star。它相当于给 Claude Code、Codex 这类 Coding Agent 加上一套视频制作工具,让原本主要写代码的 Agent,也能开始做视频。

用户丢进去一条参考视频后,Hypit 会把台词、镜头、字幕、B-roll 和特效拆成一套可以反复修改的制作流程。Agent 再调用 Seedance 等视频模型、图片模型、WhisperX 和 FFmpeg,替换人物、台词和素材,重新生成整条视频。

这套方法特别适合批量做相似视频。比如一条广告效果不错,可以保留原来的节奏和结构,只换产品、人物或文案,再快速做出几十个不同版本。一条视频跑通后,后面主要就是换内容,不用每次从头做一遍。

Hypit 本身免费使用,也不强制绑定某个生成模型。不过它采用带额外限制的开源协议,企业内部可以商用;如果拿它做面向多个客户的 SaaS,则需要另行取得商业授权。

信源

动察 Beating 频道 · 动察 Beating 交流群
🤨3
OpenAI推出法律版GPT-6 Astra,法律研究正确率提升40%

OpenAI 推出 Astra for Law,把 GPT-6 Astra 做成专门面向法律工作的版本。它加入法律检索、分析和写作能力,可以帮律师查判例、分析案件、起草文件,也能接入律所现有的工作流。

OpenAI 还新建了一套法律搜索索引,可以查询美国判例、法规、法院规则等超过 2.3 亿个 URL,覆盖 99.9% 以上已公开的美国先例判决。

在 200 道美国法律研究题中,Astra for Law 的整体正确率达到 54.0%,普通 GPT-6 Astra 加网页搜索为 38.7%,相对提升约 40%。在判例题上,它找到的参考案例也多了 24%。

Astra for Law 会先向部分美国律所开放,在 ChatGPT 和 Codex 中显示为 GPT-6 Astra Law,随后开放 API。Harvey、Legora 等法律 AI 公司也可以把它接进自己的产品。OpenAI 还推出 26 个法律行业插件,可以调用 Thomson Reuters、Relativity、Clio 等专业法律数据和工具。

信源

动察 Beating 频道 · 动察 Beating 交流群
Claude Code像素级抄袭Cursor,连Projects都懒得改名

Anthropic 重做 Claude Projects,结果和 Cursor 一周前推出的同名功能几乎一个模子。

Cursor 让一个总控 Agent 当项目经理,自己不写代码,只负责拆任务、定计划,再把活分给多个 Agent 并行完成。任务长期跑在云端,关电脑也不停;所有 Agent 共享项目上下文,需要时还能自动拉起本地 Agent。

Claude 新 Projects 基本照着这套来。也是总控 Agent 拆任务、验结果,下面同时跑多个 Claude Code 会话;每个会话独立改代码、跑测试、提交 PR,共享项目记忆,电脑关了照样干。

Cursor Projects 9 月 10 日上线,Claude Projects 9 月 17 日才发布。现在甚至还是 Cursor 功能更多,看来 7 天只够 Claude 抄个七七八八。

信源

动察 Beating 频道 · 动察 Beating 交流群
😁16
85年没解开的德军恩尼格玛密电,GPT-6 Astra用10小时破了

彭博一名产品开发人员 Carter Leffen 用 GPT-6 Astra,破解了一条 1941 年的德军恩尼格玛密电。他本人并不是密码学家。

这条密文只有 82 个字母,此前一直被密码史料网站 CryptoCellar 列为尚未破解。Astra Extra High 大约花了 10 小时找到答案。

关键线索来自当天另一封已经破译的电报。Astra 发现里面连续出现两次地名「ROSENOW」,随后猜测这个词也藏在目标密文里。它接着写恩尼格玛模拟器和搜索程序,并行测试不同密钥,再用原始电报头和剩余文字验证。

最终还原出的内容很简单:「请告知行军路线。我在 Rosenow。请立即通过无线电回复。」

不过这次也不是完全只靠 Astra。Leffen 负责提出目标和推进调查,Astra 则完成了大量查资料、写代码、跑搜索和验证工作。

信源

动察 Beating 频道 · 动察 Beating 交流群
👍14
Qwen3.8-Omni-Flash上线:自己看视频、调工具、交成片

阿里千问上线原生全模态模型 Qwen3.8-Omni-Flash,支持文本、图片、音频、视频和 1M 上下文。

这代明显加强了音视频 Agent 能力。模型可以自己从视频里找信息、规划任务,再调用外部工具完成剪辑、配音和渲染。官方展示了长会议处理、短剧翻译、电影解说、MV 制作和视频转图文笔记等场景。

面对几小时的长视频,它也不用从头到尾全部处理。模型会先判断答案可能在哪,再逐步定位关键片段。OmniVideoBench 上,准确率从 63.4 提到 67.8,Token 消耗从 145,736 降到 79,117,少了 45.7%。

千问称,Qwen3.8-Omni-Flash 在 30 项评测上的平均成绩比 Qwen3.5-Omni-Plus 提升超过 26%,音视频能力接近 Gemini 3.8 Flash,音频能力整体超过后者。音频输入成本下降超过 98%,音视频输入下降超过 93%。

目前 Qwen3.8-Omni-Flash 模型权重尚未公开,只开放了 API。千问同时开源了 Qwen-MM-Plugins,可以装进 Claude Code、Codex、Gemini CLI、Qwen Code 等 Agent,给它们补上图片、音频、长视频处理和视频剪辑能力。

另一套 Qwen-Live Harness 更像实时调度层。用户可以直接和实时全模态模型说话,再把复杂任务交给 Gemini CLI、Claude Code、Codex 等后台 Agent 持续执行。它会跟踪任务进度,做完后再主动回来告诉你结果。

信源

动察 Beating 频道 · 动察 Beating 交流群
智谱GLM-5.3-FlashX上线,最高200tokens/s

智谱上线 GLM-5.3-FlashX,可以理解为 GLM-5.3-Flash 的高速版本,最高输出速度达到 200 tokens/s。官方这次没有公布新的能力跑分或架构变化,更新重点就是继续提高推理速度。

这次发布正好接在昨天的推理系统优化之后。智谱刚披露,GLM-5.3 驱动的 Infra Agent 参与优化 Flash 的推理基础设施。不到两周,端到端吞吐提高到最初约 3 倍,整套服务运行在超过 10 万张国产 AI 芯片上。

信源

动察 Beating 频道 · 动察 Beating 交流群
👍41
Muse上线Mac,把手伸进用户本机文件和App

Meta 上线 Muse for Mac,这是 Muse 第一个能直接在用户电脑上干活的版本。它可以处理本地文件,也能读取 Mail、Messages、Calendar、Notes 等 App。比如整理文件夹、汇总邮件和聊天,或者调用本机文件继续填表。

Muse 之前跑在 Meta 提供的云端虚拟机里,通过浏览器和连接器替用户购物、发邮件、订餐。现在 Mac 版进一步拿到了本机文件和系统 App 的操作能力。

完整磁盘访问由用户决定是否开放。删除文件、发送消息等敏感操作,Muse 仍要先让用户确认。目前 Mac 版仍只在美国开放。

Meta 上个月其实已经推出过 Meta AI for Mac,但那款更偏看屏问答和全局语音输入。Muse for Mac 更像真正的桌面 Agent,可以直接替用户动手。

信源

动察 Beating 频道 · 动察 Beating 交流群
三个人+Claude黑进OpenAI内部代码库,OpenAI还给了6500美元

安全公司 Hacktron 的 3 名白帽研究员,用 Claude 不到 72 小时一路摸到了 OpenAI 内部代码库。三人随后主动上报漏洞,OpenAI 修复后按漏洞赏金计划给了他们 6500 美元。

攻击入口只是 OpenAI 的社区论坛。研究员发现,上传一张特制 HEIF 图片,就能利用论坛软件 Discourse 的漏洞,让服务器执行他们写的代码。随后,他们拿到了论坛用户的登录令牌,相当于一张「已经登录过的通行证」。

更大的问题出在 OpenAI 自己。论坛的登录令牌权限开得太大,竟然还能进入同一用户的 ChatGPT 和 Codex 账号,部分令牌又属于 OpenAI 员工。研究员借其中一个员工账号进入 Codex,而这个 Codex 连着公司的 GitHub。最终,他们让 Codex 在内部 openai/openai 代码库提交了一次无害的文档修改,证明自己已经碰到了内部仓库。随后立即停止测试并上报。

Claude 主要负责最难的一步:把图片漏洞变成真正能跑起来的攻击代码。Opus 4.8 一直没跑稳;Opus 5 上线后几小时就取得突破。Hacktron 称,从最初发现问题到进入 OpenAI 内部仓库,整个过程不到 72 小时,人实际只投入了几个小时。

信源

动察 Beating 频道 · 动察 Beating 交流群
😁8🤔2
智谱ZCode被曝后台整库上传,连Git历史也不放过

智谱 AI 编程工具 ZCode 被曝会在后台给整个项目做快照,连 .git 一起打包加密,并上传到阿里云 OSS。

技术博客作者 ferstar 逆向客户端后称,只要用户处于登录状态,这套机制就会运行,界面里也没有关闭上传的开关。

作者找到的一个商业项目快照约 313MB,文件清单里有 4.2 万个文件。其中 .git 占了 86.6%,包括 Git 历史对象、LFS 大文件缓存和 reflog。也就是说,打包的不只是当前代码,旧提交、曾下载的大文件和本地分支操作也可能一起进去。这个快照当时上传失败了 564 次,一直留在本地等待重试。

ZCode 官方隐私政策目前只明确写了会收集用户「在对话中提交」的文本、文件和代码,没有明确提到整个仓库和 Git 历史。官方「优化计划」默认关闭,但它只控制数据是否用于模型训练;ferstar 称,关掉这个选项仍不会停止快照打包和上传。

信源

动察 Beating 频道 · 动察 Beating 交流群
💩16
Exa给AI搜索装上时光机:4000亿网页快照,防止Agent偷看未来

Exa 上线 Snapshot,可以让搜索直接「回到过去」。它收录了超过 4000 亿份网页快照,跨度约 20 年。开发者指定一个时间,Exa 的搜索和网页读取 API 就会返回当时已经保存下来的网页版本。

最直接的用途是防止 AI 评测「偷看答案」。比如一道题 6 月设计、9 月才拿给 Agent 做,答案可能早已出现在论文、GitHub PR 或博客里。现在可以把搜索时间锁在 5 月,Agent 就看不到后来才公开的答案。金融团队也能用同样的方法做历史回测,只给模型看当时已经存在的信息。

不过这个「时光机」目前还有限制。它能保证你看到的是当时版本的网页,但搜索结果不一定和当年一模一样。普通付费用户目前也只能往前查最近 5 个月,想查更早的历史需要联系 Exa。

信源

动察 Beating 频道 · 动察 Beating 交流群
👍2👎1
Zed给AI编程装上「行车记录仪」,直接关掉GitHub PR

AI Agent 写代码越来越快,代码评审反而成了新的瓶颈。

过去,一个 Pull Request 通常对应开发者几小时甚至几天的工作。现在 Agent 可以一次改几十个文件,但评审者最后看到的,往往只有一份巨大的代码差异,很难知道这些修改是在什么要求下产生,又经过了哪些尝试。

Zed 新开放公测的 Delta,想把这部分过程重新补回来。它会把 Agent 对话、每一次代码修改和后续评论放进同一份历史里。看到一段有问题的代码,可以直接往前追,看看当时提了什么需求,Agent 又是怎么一步步改到这里。

评审也不再等到开发结束才开始。开发者可以随时另开一个线程,让人或另一个 Agent 检查当前代码,并在独立副本里继续修改。

Zed 已经先在自己身上试了。Delta 仓库关闭了 GitHub Pull Request,33 名成员已经通过 Delta 向主分支合入 570 次改动。

Git 仍然保留,commit、push 和构建流程都不受影响。Zed 真正想改的是代码评审这一层:当越来越多代码由 Agent 生成,只看最终 diff,可能已经不够了。

Delta 目前支持 macOS、Linux、Windows 和网页端,公测期间免费。MCP 和远程运行环境等功能还在开发。

信源

动察 Beating 频道 · 动察 Beating 交流群
Claude帮Anthropic研发下一代Claude,半年从不到1%飙到26%

Anthropic 最新披露,Claude 已经能主导 26% 的 AI 研发工作,2 月还不到 1%。超过 90% 的研发任务,现在至少已经有人和 Claude 一起完成。

这里的「主导」有明确标准:人只需要告诉 Claude 最终要解决什么问题,它就能自己完成大部分过程,最后由人检查结果。目前还没有任何一类研发工作可以完全交给 Claude。

这个数字比 Anthropic 之前公布的「80% 生产代码由 Claude 编写」更进一步。代码只是研发的一部分,这次统计还覆盖模型训练、实验、评测、基础设施等整个研发流程。Anthropic 最常用的内部平台上,任一时刻大约有 3 万个 Agent 同时做研究和工程。

信源

动察 Beating 频道 · 动察 Beating 交流群
👍4
智谱ZCode回应整库上传:Repo Wiki默认开启惹祸,承诺开源客户端

智谱回应 ZCode 仓库数据上传争议,称问题来自「代码库索引」里的 Repo Wiki 功能。Repo Wiki 生成 Wiki 页面时,可能会把仓库数据上传到云端;页面生成后,相关数据会立即销毁,不会保存。

官方称,这项功能上线初期默认开启,因此影响了部分用户,目前相关问题已经修复。ZCode 现在的官方文档已经明确写出,Repo Wiki 不会读取 .git、依赖目录、构建产物和缓存,只会按需发送经过过滤的代码内容。

此前社区逆向发现,ZCode 会在后台给项目做快照,连 .git、Git 历史和 LFS 缓存都可能一起打包上传。

ZCode 还宣布近期将开源代码,并邀请第三方评估人员审查系统运行情况,后续公开审查进展。作为补偿,所有用户都会额外获得一次周额度重置,今天发放。

动察 Beating 频道 · 动察 Beating 交流群
🤡14
智谱ZCode回应整库上传:Repo Wiki默认开启惹祸,承诺开源客户端

智谱回应 ZCode 仓库数据上传争议,称问题来自「代码库索引」里的 Repo Wiki 功能。Repo Wiki 生成 Wiki 页面时,可能会把仓库数据上传到云端;页面生成后,相关数据会立即销毁,不会保存。

官方称,这项功能上线初期默认开启,因此影响了部分用户,目前相关问题已经修复。ZCode 现在的官方文档已经明确写出,Repo Wiki 不会读取 .git、依赖目录、构建产物和缓存,只会按需发送经过过滤的代码内容。

此前社区逆向发现,ZCode 会在后台给项目做快照,连 .git、Git 历史和 LFS 缓存都可能一起打包上传。

ZCode 还宣布近期将开源代码,并邀请第三方评估人员审查系统运行情况,后续公开审查进展。作为补偿,所有用户都会额外获得一次周额度重置,今天发放。

动察 Beating 频道 · 动察 Beating 交流群
💩19
Claude不到4周优化36款生物模型,平均提速约4倍

Anthropic 让 Claude 给 36 款开源生物模型做了一轮性能优化。不到 4 周,这些模型平均跑快约 4 倍,覆盖蛋白质结构预测、蛋白质设计和基因组分析等任务。相关优化代码已经全部开源。

Claude 做的也不只是改改 Python 代码,还自己写了 FlashPairformer 等 GPU kernel,直接从底层提高 GPU 计算效率。官方测试中,一些原本非常耗时的计算最多快了 3.2 倍。碰到不同模型,Claude 还会逐个找瓶颈,把重复计算删掉,或者把经常用到的数据提前缓存起来。

整个过程由两名 Anthropic 生物建模研究员监督,但两人此前都没有推理优化或 kernel 工程经验。即使要求优化前后结果完全一致,这些模型平均也能提速约 1.6 倍;如果允许模型结果出现正常范围内的细微差异,平均提速能到约 4 倍。

Anthropic 之前做一次蛋白质设计实验,每个目标最多要用约 2500 个 H100 GPU 小时。经过优化后,一台 H200 跑 24 小时就能做到接近的效果,GPU 加 Claude 的成本合计约 150 美元。原来要烧上千个 GPU 小时的实验,现在一天左右就能跑完。

信源

动察 Beating 频道 · 动察 Beating 交流群
Anthropic悄悄建了个生物实验室,要让Claude指挥机器人做实验

Anthropic 已经在旧金山湾区建起自己的生物实验室,把 Claude 从电脑里的生物研究带到了真实实验。Anthropic 生命科学负责人 Eric Kauderer-Abrams 确认,公司现在既会自己做实验,也会把部分工作交给外部合作伙伴。

下一步是让 Claude 直接参与实验室自动化。Anthropic 希望 Claude 能指挥机械臂、移液机器人等设备,在人类监督下自己执行实验。公司上个月刚推出 Model Hardware Standard,让 AI 可以用统一接口控制显微镜、机械臂和实验仪器,已经能根据实验结果调整参数,甚至处理部分设备故障。

Anthropic 也开始自己做药物相关的前临床研究,重点盯着传统药企觉得太难、或者商业价值不够高的疾病。不过公司暂时不会做人体临床试验,也表示自己的实验室并非专门用于药物发现,希望避免直接和药企客户竞争。

生命科学已经是 Anthropic 投入人力和资源最多的方向之一。今年 6 月,公司还推出了 Claude Science,把论文数据库、代码、计算资源等科研工具放到一个工作台里。现在再加上真实实验室,Claude 做科学研究正在从「分析数据」继续往「动手做实验」推进。

信源

动察 Beating 频道 · 动察 Beating 交流群
🤡5
MiniMax Code突然宣布今晚开源,源码即将上GitHub

MiniMax Code 突然宣布将在今晚开源。

MiniMax Code 是 MiniMax 的桌面 AI 编程 Agent,可以直接改项目文件、运行命令和审查代码,也支持多个 Agent 分工协作。用户还可以通过手机远程查看任务进度和批准操作。

MiniMax 早已建好 minimax-code GitHub 仓库,但此前主要用来收集 Bug 和功能建议。目前仓库里仍只有 README 和 Issue 模板,还没有客户端源码。

动察 Beating 频道 · 动察 Beating 交流群
Kimi Code桌面端上线:浏览器、终端、多Agent塞进一个窗口

月之暗面正式上线 Kimi Code Desktop,把原本偏终端的 Kimi Code 做成了独立桌面应用。用户可以直接打开本地项目,让 Agent 读写代码、跑命令、查看 Git 改动,目前支持 macOS 和 Windows。

桌面版直接内置了浏览器和终端。做网页时,Agent 可以读取右侧网页的页面信息,用户也能直接点选元素、框出区域或者截图批注,告诉它具体哪里要改。改代码、看网页效果、跑测试都不用再切窗口。

它还支持计划、目标和 Swarm 三种任务模式。Swarm 可以把任务拆给多个子 Agent 并行处理,长任务也能放到后台继续跑。除了 Kimi 自家的模型,用户还可以自己填 API Key 和 Base URL,接入其他模型供应商。

信源

动察 Beating 频道 · 动察 Beating 交流群
AI初创公司Mantic完成2500万美元融资,开发超人类预测能力

9 月 18 日,人工智能开发商 Mantic 周五宣布完成 2500 万美元种子轮融资。该公司近期在一项预测赛事中击败人类选手。伦敦在线预测平台 Metaculus 本月结束的 2026 年夏季杯结果显示,Mantic 对政治、经济和文化事件的概率预测准确度超过人类参赛者。Mantic 及其他 AI 参赛者取得的高分也创下 AI 技术首次主导该赛事的记录。

本轮融资由 Radical Ventures 领投,微软旗下风投基金 M12、AI 初创公司 Thinking Machines Lab、Balderton Capital 等参与,具体估值未披露。Mantic 首席执行官 Toby Shevlane 表示,公司正致力于提升人类理解未来的能力。

Mantic 成立于 2024 年,由 Shevlane 与 Ben Day 共同创办。公司通过针对预测任务优化其他 AI 实验室开发的前沿模型,并利用历史数据测试预测系统、评估表现后持续改进,以提升预测能力。(路透社)

信源

动察 Beating 频道 · 动察 Beating 交流群
MiniMax Code核心CLI正式开源,桌面端暂不在内

MiniMax 正式开源 MiniMax Code CLI v0.4.12,采用 MIT 协议。它是 MiniMax Code 的核心命令行工具,负责读代码、改文件、调用工具和执行任务。桌面端这次没有开源。

MiniMax 还公布了一组测试结果。MiniMax Code 0.3.2 搭配 Kimi K3,在 30 道编程任务里完成了 23 道,通过率 76.7%,成功任务耗时中位数为 4 分 33 秒,胜过 Codex、Claude Code 等公开基线。

信源

动察 Beating 频道 · 动察 Beating 交流群
🤡51
Muse干掉ChatGPT,登顶美国App Store免费榜

Meta 的个人 AI Agent 产品 Muse 上线十天,终于登上美国 App Store 免费应用榜第 1,超过 ChatGPT、Gemini、Claude 等老牌 AI 应用。

Muse 主打帮用户直接完成任务,不只是聊天。它可以代用户处理邮件、填写表格、购物、预约等日常事务,并通过虚拟环境执行操作,涉及敏感操作时会要求用户确认。

Muse 上线后一直稳居美国 App Store 免费榜前列,如今进一步升到榜首。AI Agent 正从开发者工具进入普通消费者应用市场,AI 应用也将迎来范式革命。

信源

动察 Beating 频道 · 动察 Beating 交流群
🤷‍♀8