动察Beating AI News
3.15K subscribers
883 photos
2 videos
3.4K links
AI新闻信息流
Download Telegram
动察Beating AI News
Claude做安全测试误黑3家公司,还把恶意软件上传到公共软件库PyPI Anthropic 披露,Claude 在网络安全测试中意外连上公网,并侵入三家真实公司的生产系统。事故涉及 Claude Opus 4.7、Mythos 5 和一款内部研究模型,最早发生在 4 月。 最严重的一次,Opus 4.7 把一家同名真实公司当成虚构目标。它拿到应用和基础设施凭证,还进入了一个存有数百行生产数据的数据库。模型后来发现目标可能是真实系统,但仍继续攻击。 Mythos 5 则自行制作恶意 Python 包,并上传到公共软件库…
BitGo CEO给自家钱包打广告:拿100枚比特币叫板Claude

Anthropic 披露 Claude 在安全测试中误入侵三家真实公司后,BitGo CEO Mike Belshe 质疑公司借事故炒作模型能力。

他把 100 枚比特币存入 BitGo 钱包,公开地址并喊话 Claude「来拿走它」,试图用这笔价值 630 万美元的悬赏证明 Claude 没有 Anthropic 说得那么危险。

但 Anthropic 并没有宣称 Claude 攻破了严密防守的系统。三起事故中,模型在收到明确攻击任务后,利用弱密码、暴露接口和泄漏凭证进入真实系统。Anthropic 也把问题归因于测试环境意外连上公网和监控失效。

Belshe 的挑战则换了一个完全不同的题目。他只公开了钱包地址,没有提供账户、设备或密钥等攻击入口。Claude 若要转走资金,必须攻破 BitGo 的密钥管理和审批系统。

这场挑战无法反驳 Anthropic 披露的事故,却把注意力引向了 BitGo 最想宣传的产品能力:只要钱没有被转走,100 枚比特币就会一直替它证明钱包安全。

Mike Belshe
😁4🤡311
马斯克转发AI圈自嘲图:以前证明理论,现在只管堆GPU

马斯克转发了一张「AI then / AI now」对比图,只评价了一个词:「Accurate 😂」。

图中,过去的机器学习研究要设计核方法、证明模型为何有效、搭建概率模型。到了大模型时代,方法只剩下三步:把 Transformer 做大、喂更多数据、再加更多 GPU,模型就又双叒叕变强了。

这就是大模型行业的现实窘境:过去先研究原理,再设计模型;现在往往先扩大规模,再研究能力为什么出现。

马斯克
😁31
蚂蚁灵波计划年内连融两轮,首轮拟募15亿元

蚂蚁集团旗下具身智能公司灵波科技已启动首轮融资,拟募资 15 亿元,并计划在今年年底前完成第二轮。

灵波主要做机器人的「通用大脑」,希望用一套模型适配不同品牌和形态的机器人。其 LingBot 系列覆盖视觉感知、三维建图、世界预测和动作控制,让机器人从看懂环境一路做到执行任务。最新版 LingBot-VLA 2.0 使用约 6 万小时预训练数据,覆盖 20 种机器人构型。

灵波此前由蚂蚁全资孵化,现在开始引入外部资本。首轮尚未完成,第二轮已经排到年底,融资节奏比金额更激进。

晚点LatePost
2
动察Beating AI News
Claude新广告开场烧房子,网友以为在看AI末日片 Anthropic 新广告《希望存在于难题中》发布后,惹出很大争议。 广告本来想说明 Anthropic 愿意正视 AI 风险,却用燃烧的房屋、人脸监控、露宿者和大片墓碑开场。旁白还问:「AI 能被信任吗?」「失控时谁来踩刹车?」 不少网友认为,整条广告更像 AI 末日预告。OpenAI CEO Sam Altman 称,他一度以为这是讽刺账号。还有人说,亲属看完电视广告后专门打电话询问:「AI 公司为什么在威胁我们?」 墓地画面争议最大。画面出现时,旁白正好询问谁来给…
同样是AI广告:阿里千问许诺自由,Anthropic传递恐慌

Qwen3.8 的宣传片得到 All-In Podcast 主播、硅谷投资人 Jason Calacanis 公开称赞。他说,中国不仅在做更有竞争力的模型,也开始输出更积极的 AI 叙事。

片中,芯片工程师在钓鱼,Qwen3.8 连续设计芯片 12 小时;生物学教授在打网球,模型核验蛋白质资料;CFO 去攀岩,模型实时对账;律师在户外休息,模型自动生成合同;数字艺术家在读书,模型继续修改设计方案。阿里千问传递的愿景是:「机器负责加班,人类负责生活。」

Anthropic 7 月推出的广告《There’s hope in hard questions》却像一支 AI 末日预告片。视频从燃烧的房屋开始,随后出现人脸监控、露宿者、矿工和大片墓地,不断追问:AI 能相信吗?失控时谁来踩刹车?如果 AI 拿走大部分工作,人为什么还要工作?后半段虽然转向医疗、家庭和希望,前面的恐慌已经深入人心。

同样卖 AI,千问劝人去钓鱼,Anthropic 则把房子烧给你看。一个让人期待 AI 上班,一个让人担心 AI 失控。

Jason
🤡6👎2
智谱下一代模型露头:ZCode搜索结果出现GLM-5.3

智谱下一代模型 GLM-5.3 疑似被提前曝光。必应搜索结果一度把 ZCode 页面标题收录为「GLM-5.3 官方 Harness」。ZCode 是智谱为 GLM 配套的编程工具,用于规划、写代码、评审和执行开发任务。

但打开官网后,页面目前仍写着「GLM-5.2 官方 Harness」。智谱的模型发布记录、开发文档和 API 列表也只更新到 GLM-5.2,没有出现 GLM-5.3。

现有信息只能证明「GLM-5.3」曾进入 ZCode 页面的搜索索引,可能是测试标题或提前配置。

昨日,智谱 Z.ai 全球负责人李子玄公开询问用户,GLM-5.2 在新模型频出的情况下是否还够用,疑似是在为新模型发布造势。

Zixuan Li
👍2
动察Beating AI News
DeepSeek没把新版能力锁在API,V4-Flash正式版权重开源 DeepSeek 已在 Hugging Face 放出 V4-Flash-0731 正式版权重,并继续采用 MIT 许可证。开发者可以自行部署、微调和商用,不必只能通过 DeepSeek 官方 API 使用。 这次开放的是刚完成后训练升级的正式版。它在多项 Agent 测试中超过 V4-Pro-Preview,相关能力现在也能由第三方独立部署和复测。 Hugging Face
DeepSeek V4 Flash在OpenCode爆量:单日跑掉8万亿Token

AI 编程工具 OpenCode 披露,接入 DeepSeek V4 Flash 当天,OpenCode 用户跑了 8 万亿个 Token,其中 5 万亿来自免费计划,3 万亿来自付费订阅 OpenCode Go。

过去一周,它已占 OpenCode 全部 Token 用量的 55%,排名第一。

OpenCode
👍6
动察Beating AI News
阿里三款Agent合一,千问办公上线Beta版 阿里办公 Agent「千问办公」已上线官网,并开放个人用户登录。它整合了 QoderWork、悟空和 MuleRun,是一款独立产品,也能直接在钉钉内使用。 千问办公可以读取消息、群聊、日程、待办、文档、知识库、考勤和审批等企业信息。用户还能设置定时任务,让 Agent 自动生成日报、周报或调研简报,再推送到钉钉。 它还支持生成和编辑 PPT、Word、Excel、网页,以及图片、音频和视频。生成的网站可以直接发布,还能绑定域名、接入数据库。产品内也提…
阿里把千问办公升为一级事业部,「AI办公」成为战略方向

阿里已把「AI 办公」列为公司在 AI 领域的战略方向之一。原悟空事业部已升级为千问办公事业部,成为 ATH 事业群下属的一级事业部,由陈宇森负责。

千问办公事业部将同时负责千问办公和钉钉。阿里的目标不是再做一款面向个人的办公助手,而是进入企业组织,连接消息、审批、文档、数据库和工作流,成为企业级 AI 生产力平台。

虎嗅
字节OpenViking核心贡献者开源LoopX:让Agent连续跑200小时也不失忆、不跑偏

字节跳动 AML 高级机器学习工程师、OpenViking 核心贡献者黄瑞腾开源了 LoopX。它是一套面向长程 Agent 的控制系统,让 Codex、Claude Code 等 Agent 在任务跨越多天、多次中断后,仍能接着原来的目标往下做。

LoopX 已公开两条跨越 220.7 和 272.9 小时的真实任务轨迹。期间经历多轮执行、等待、人工判断、模型切换和任务恢复,Agent 仍能找回当前目标、已有证据和下一步。

它把目标、待办、权限、证据和等待条件放到模型上下文之外。Agent 每次只做一小步,验证结果后再写回状态。换会话、换模型或程序重启,都能从最新进度继续。

黄瑞腾参与开发的 OpenViking 负责保存和检索 Agent 的记忆、资料与技能;LoopX 则管理任务做到哪里、下一步做什么、何时需要人来判断。前者像长期记忆,后者更像项目经理和可执行看板。目前,LoopX 已用于自动修复代码问题、AutoML 实验和长期研究。

黄瑞腾
👍32
Genspark开源免费Office:文档、表格、PPT都能直接让AI改

Genspark 发布 GenOffice Alpha,一款面向 Mac 和 Windows 的本地办公软件。它支持文档、表格、PPT 和 PDF,并把 AI 写作、数据分析和演示文稿生成直接放进编辑器。

软件免费、无广告,代码已经开源。AI 功能可以登录 Genspark 按 credits 使用,也支持接入自己的 OpenAI、Claude、Gemini、DeepSeek 或兼容 API。

Genspark 称,Alpha 版由一名工程师用一周完成,花费约 1 万美元 AI Token。

Genspark
1
华为香港AI实验室开源Boogu:40万美元练出2K生图模型

由华为香港人工智能实验室主导、多所高校研究者参与的 Boogu 团队,开源了 Boogu-Image-0.1。它是一套 100 亿参数的图像生成与编辑模型,包含 Base、Turbo、Edit 和 Edit-Turbo,支持中英文文字生成。

基础模型从零训练只用了 2.0862 亿张去重图片,理论训练成本约 40 万美元。论文称,它在多项标准评测中达到开源第一梯队,部分结果接近领先闭源模型。

Base 和 Edit 最高支持 2K,Turbo 用 3 至 4 步快速生成 1K 图片。系统还会先理解并改写用户的提示词,再按任务难度选择模型,减少不必要的推理成本。

模型权重、推理代码和部分训练方法采用 Apache 2.0 协议开放。

GitHub 仓库
🔥1
AI用量还能用来选股?美股回测高低组每周相差0.64%

三名经济学者把真实 AI 用量和美股行情放在一起回测。研究覆盖 2024 年 1 月至 2026 年 4 月,使用了 OpenRouter 上约 380 万亿个 Token。OpenRouter 是一个 AI 模型聚合平台,用户可以通过同一接口调用 400 多个模型。

研究者把每周的 Token 用量、消费金额和活跃用户增速合成一个「AI 使用指数」,再观察每只美股过去 13 周的股价反应。AI 使用加快时更容易跑赢大盘、放缓时更容易跑输大盘的股票,被划入高暴露组。

他们每周买入高暴露组,同时做空低暴露组。回测显示,高低两组平均每周相差 0.641 个百分点;控制公司规模、估值、盈利和股价动量等因素后,仍相差约 0.56 个百分点。

不过样本只有 28 个月,OpenRouter 只覆盖全球一小部分 AI 用量,用户也更偏开发者。这套方法能否长期有效仍待验证。

论文
🔥2