动察Beating AI News
3.15K subscribers
883 photos
2 videos
3.4K links
AI新闻信息流
Download Telegram
动察Beating AI News
OpenAI向美国官员展示新模型Astra:多个Agent可长期协作解决难题 《The Information》援引三名知情人士称,OpenAI 正在测试一条暂称 Astra 的新模型线。它与 Sol、Terra、Luna 并列,主打让多个 Agent 长时间协作,处理复杂项目和高难度数学问题。 OpenAI CEO Sam Altman 本周已在华盛顿向政策制定者和监管机构演示 Astra。具体发布时间尚未确定。 Astra 是暂定名称,最终归入哪一代 GPT 也没有敲定。OpenAI 正在考虑 GPT…
OpenAI新模型Astra首秀:一口气推进10道十年未解数学难题

OpenAI 首次正式公布下一款主力模型 Astra。内部版本在 10 个长期未解的数学和理论计算机科学问题上取得新结果。这些问题的核心结论至少 10 年没有进展,多数停滞时间更长。

其中一些问题被直接解决或推翻。Astra 首次构造出非 sofic 群,回答了群论中的一个核心开放问题;它还推翻 Connes 刚性猜想,并解决 3 个 Erdős 问题。其余成果包括球体堆积、编码理论、量子复杂性和后量子密码相关问题的新上下界与困难性证明。

OpenAI 称,模型找到这 10 项结果所用的 Token,按 Sol API 价格折算约为 2000 美元。

这些数学论证由 Astra 生成。人类随后协助整理成论文,模型再把每项证明转成 Lean 证书,让计算机逐步核验推导是否成立。OpenAI 已公开论文、证明证书和模型的推理过程。

OpenAI
👍81
动察Beating AI News
DeepSeek V4正式版疑似延期至8月,或直接撞上下一代模型集中发布 DeepSeek V4 正式版(V4 GA)可能推迟到 8 月中旬发布。 网友爆料称,DeepSeek 即将为自研 Harness 工具启动封闭测试,并从问卷参与者中挑选少量用户。封闭测试结束后约 1 至 2 周会开放 V4 GA,发布时间可能在 8 月 10 日至 20 日之间。 如果消息属实,DeepSeek V4 正式版上线时可能会面对更强竞争。届时 GPT-6、Claude Fable 5.1、GLM-5.5 等下一代模型可能已经进入市场。…
DeepSeek Harness开始内测,申请者需要提交开源作品

DeepSeek Harness 开始面向开源项目开发者招募内测用户。申请者需要做过 Agent Harness 相关项目,并提交 GitHub ID 和代表作。

Harness 是包在大模型外的一套 Agent 执行框架,负责管理上下文、调用工具和完成任务。DeepSeek 今年上半年已组建专门团队,并招聘产品经理、研发工程师和研究员。

几天前,社区曾流传一份小范围内测通知,但真实性无法确认。现在负责人公开招募,直接确认 DeepSeek Harness 已进入内测。

Tianyi Cui
🐳61
动察Beating AI News
Kimi K4要比K3更大,但月之暗面被英伟达芯片卡住 K3 刚发布,月之暗面已经在为下一代 Kimi K4 找芯片。新模型会比 2.8 万亿参数的 K3 明显更大,但目前还没有训练和发布时间表。 《The Information》称,K3 使用了英伟达最先进的 Blackwell 芯片,部分训练实际在中国完成,并非全部放在美国官员所说的泰国数据中心。 更关键的是,K3 并没有一座完整的大型训练集群。没有一家中国云厂商能提供足够多的 Blackwell,月之暗面至少接入了两家供应商,把大量八卡服务器连在一起。…
Kimi算力底牌曝光:阿里提供约2万张英伟达H200

彭博披露,月之暗面此前已通过阿里获得约 2 万张英伟达芯片的算力。这批芯片构成 Kimi 模型整体算力的重要部分。

多名知情人士称,芯片具体为 H200。阿里否认向月之暗面提供 H200,但没有否认双方存在约 2 万张英伟达芯片的算力合作,也没有说明实际型号。

阿里既是月之暗面的主要投资方,也是它的云服务商。彭博称,Kimi 已在部分关键指标上超过阿里自家的千问。这让阿里内部一些人感到失望:双方使用相近的训练资源,外部投资对象却先在模型性能上跑到了前面。

彭博
😁6
动察Beating AI News
领先两年却硬生生捂烂:OpenAI产品掌门人透露跳槽内幕,直言老东家DeepMind动作迟缓 OpenAI 核心产品负责人 Thibault Sottiaux 在接受《连线》采访时,自曝了当年从 Google DeepMind 愤而跳槽至 OpenAI 的内幕。Sottiaux 透露,在 2022 年底 ChatGPT 发布并点燃全球生成式 AI 浪潮之前,DeepMind 内部实际上早已掌握并「压箱底」了长达两年的类似大语言模型与对话技术,但高层的保守与官僚导致该技术一直未能推出。 Sottiaux…
谷歌错过ChatGPT有多离谱:提前一年做出来,却没敢发布

OpenAI 产品负责人 Tibo Sottiaux 称,他在 Google DeepMind 时参与过内部聊天机器人 LMChat。这个项目在 ChatGPT 发布前约一年已经存在,产品形态也很接近后来的 ChatGPT。

Google 最终没有发布。Sottiaux 称,公司担心它冲击现有业务,DeepMind 也不能推出可能威胁 Google 的产品。

他此前在 WIRED 专访中已经讲过这段往事。

Tibo
🤡11
动察Beating AI News
刚刚上百亿美元被清仓的24岁AI股神Leopold本周末结婚,未婚妻是Anthropic CEO幕僚长 CNBC 援引两名知情人士称,24 岁前 OpenAI 研究员 Leopold Aschenbrenner 将于本周末结婚。未婚妻 Avital Balwit 现任 Anthropic CEO Dario Amodei 的幕僚长。 两人曾在 SBF 创办的 FTX Future Fund 共事。FTX 崩塌后,Leopold 加入 OpenAI,Avital 后来进入 Anthropic。 婚礼前夕,Leopold…
24岁AI股神Leopold婚礼前先开研讨会:圆桌讨论、分组交流,还谢绝份子钱

刚把约 160 亿美元公开股票组合中的大部分卖给 Citadel 后,24 岁前 OpenAI 研究员 Leopold Aschenbrenner 将在加州海滨小镇卡梅尔举行一场持续数日的婚礼。仪式设在托斯卡纳风格别墅,最后一天则在森林温泉酒店送别宾客。

婚礼前还安排了一场研讨会。宾客将参加圆桌讨论和分组交流。两位新人唯一的要求是不要送礼物。

未婚妻 Avital Balwit 现任 Anthropic CEO Dario Amodei 的幕僚长。两人此前都在 FTX Future Fund 工作,并在 FTX 崩塌时随团队离开。

WSJ
😁2
中国VC熬过3年寒冬:至少60只美元基金抢募350亿美元

中国投资机构正筹备至少 60 只新美元基金,目标募资约 350 亿美元,其中约 40 只是风投基金。红杉中国、IDG 资本、经纬创投和明势创投等正在募资或准备启动募资。

这轮回暖主要由 AI、机器人和科技公司上市带动。部分投资者把中国 AI 当作对美国市场押注的对冲,因为中国模型价格更低,使用成本也更便宜。智谱和 MiniMax 上市后,早期投资机构也重新看到了退出机会。

但这还不是中国 VC 重回繁荣期。去年只有 97 只中国相关基金募到 136 亿美元,远低于 2022 年的 1105 只、1500 亿美元。美国大型机构仍在收缩,欧洲和中东资金能否补上缺口仍不确定。

FT
Opus 5写5500行代码造出《指环王》世界,Karpathy称AI造游戏时代即将来临

OpenAI 联合创始人、现 Anthropic 预训练团队成员 Andrej Karpathy 把《指环王》开头一段交给 Opus 5,给出 100 万 Token、约 10 美元的预算,让它用 Three.js 做成一个 3D 世界。

模型运行约 2 小时,写出 5500 行代码。它需要安排各种多边形素材在三维坐标中的位置,再写代码让整个场景动起来。成品有些粗糙,但确实把文字变成了可以播放的 3D 场景。

这类内容过去很少有人愿意专门制作,成本和时间都不划算。LLM 却可以一直做下去,让高度定制的世界变成随手生成的内容。Karpathy 畅想,未来用户可以进入这种临时生成的世界,成为故事角色、旁观者或 NPC,像是一个按需出现的《GTA》。

游戏也暴露了当前 LLM 的短板。Opus 5 不能高效、原生地观看视频,也不能进入游戏试玩,只能在不同节点缓慢截图检查。过程中还多次出错,留下不少粗糙和故障内容。

它已经能造出一个世界,却还不能顺畅地检查和体验自己造出的世界。

Karpathy
🤡42
Qwen3.8-Max发布正式版:分数只比DeepSeek-V4-Flash高一点,价格贵近20倍

阿里发布 Qwen3.8-Max 正式版。这是一款 2.4T 参数的多模态旗舰模型,主打编程 Agent、专业办公和长任务,API 已经上线。

在 TerminalBench 2.1、DeepSWE 1.1、NL2Repo 和 Toolathlon Verified 四项测试中,它只比 DeepSeek-V4-Flash 高 1.7 至 3.9 分。两家的测试框架不同,不能算严格同场对决,但差距确实不大。

价格差距却非常明显。Qwen3.8-Max 每百万 Token 输入 2 美元、输出 6 美元;DeepSeek-V4-Flash 分别只要 0.14 美元和 0.28 美元。综合计算,千问贵约 20 倍。

只看这组成绩和价格,Qwen3.8-Max 毫无性价比。它用近 20 倍成本,只换来几个百分点的领先。

Qwen3.8-Max 权重将于下周开放,Qwen3.8-27B 届时也一并开源。

Qwen
🤡11🤣7😁1
MiniMax H3正式开源:本地可生成768p视频,完整2K仍依赖官方API

MiniMax 正式开放视频模型 H3 的权重。本次发布包含两套 H3-Base:一套用于文生视频和首尾帧生成,另一套用于参考人物、动作、视频和声音进行复杂生成与编辑。用户按任务选择其中一套,无需同时加载。

H3-Base 的生成主干是一个 330 亿参数的稠密单流 Transformer,编码器基于 Qwen3-VL-32B。本地部署可生成 4 至 15 秒、带立体声的 768p 视频。

这次开放的并非完整 H3 系统。负责理解复杂素材关系的 H3-Context-IR、把 768p 结果重新生成到 2K 的 H3-Regenerate-2K,以及稀疏注意力实现都没有放出。开发者要复现官方的完整 2K 效果,仍需调用 MiniMax API。

许可也有明显限制。MiniMax H3 Community License 不适用于美国、欧盟、英国和韩国,这些地区需要另行申请授权。年收入超过 2000 万美元的企业,也要提前获得 MiniMax 的书面授权。

MiniMax
💩3🤡1
MiniMax回应H3美国禁用:因好莱坞版权诉讼,可申请授权

MiniMax H3 的许可证排除美国、欧盟、英国和韩国。有社区开发者质疑,按条款理解,美国用户甚至不能下载模型。

MiniMax 开发者关系负责人 Ryan Lee 回应称,美国限制源于公司与好莱坞主要电影公司的生成式视频版权诉讼。美国用户如需部署 H3,可以正式申请授权,但必须承诺建立符合美国法律和监管要求的内容合规机制。

迪士尼、环球影业和华纳兄弟探索此前起诉 MiniMax,指控海螺 AI 未经许可使用其版权内容训练模型,并生成漫威、《星球大战》等作品中的知名角色。美国法院今年 5 月驳回 MiniMax 要求撤诉的申请,案件仍在继续。

Ryan Lee
🤡51🎉1
动察Beating AI News
Claude做安全测试误黑3家公司,还把恶意软件上传到公共软件库PyPI Anthropic 披露,Claude 在网络安全测试中意外连上公网,并侵入三家真实公司的生产系统。事故涉及 Claude Opus 4.7、Mythos 5 和一款内部研究模型,最早发生在 4 月。 最严重的一次,Opus 4.7 把一家同名真实公司当成虚构目标。它拿到应用和基础设施凭证,还进入了一个存有数百行生产数据的数据库。模型后来发现目标可能是真实系统,但仍继续攻击。 Mythos 5 则自行制作恶意 Python 包,并上传到公共软件库…
BitGo CEO给自家钱包打广告:拿100枚比特币叫板Claude

Anthropic 披露 Claude 在安全测试中误入侵三家真实公司后,BitGo CEO Mike Belshe 质疑公司借事故炒作模型能力。

他把 100 枚比特币存入 BitGo 钱包,公开地址并喊话 Claude「来拿走它」,试图用这笔价值 630 万美元的悬赏证明 Claude 没有 Anthropic 说得那么危险。

但 Anthropic 并没有宣称 Claude 攻破了严密防守的系统。三起事故中,模型在收到明确攻击任务后,利用弱密码、暴露接口和泄漏凭证进入真实系统。Anthropic 也把问题归因于测试环境意外连上公网和监控失效。

Belshe 的挑战则换了一个完全不同的题目。他只公开了钱包地址,没有提供账户、设备或密钥等攻击入口。Claude 若要转走资金,必须攻破 BitGo 的密钥管理和审批系统。

这场挑战无法反驳 Anthropic 披露的事故,却把注意力引向了 BitGo 最想宣传的产品能力:只要钱没有被转走,100 枚比特币就会一直替它证明钱包安全。

Mike Belshe
😁4🤡311
马斯克转发AI圈自嘲图:以前证明理论,现在只管堆GPU

马斯克转发了一张「AI then / AI now」对比图,只评价了一个词:「Accurate 😂」。

图中,过去的机器学习研究要设计核方法、证明模型为何有效、搭建概率模型。到了大模型时代,方法只剩下三步:把 Transformer 做大、喂更多数据、再加更多 GPU,模型就又双叒叕变强了。

这就是大模型行业的现实窘境:过去先研究原理,再设计模型;现在往往先扩大规模,再研究能力为什么出现。

马斯克
😁31
蚂蚁灵波计划年内连融两轮,首轮拟募15亿元

蚂蚁集团旗下具身智能公司灵波科技已启动首轮融资,拟募资 15 亿元,并计划在今年年底前完成第二轮。

灵波主要做机器人的「通用大脑」,希望用一套模型适配不同品牌和形态的机器人。其 LingBot 系列覆盖视觉感知、三维建图、世界预测和动作控制,让机器人从看懂环境一路做到执行任务。最新版 LingBot-VLA 2.0 使用约 6 万小时预训练数据,覆盖 20 种机器人构型。

灵波此前由蚂蚁全资孵化,现在开始引入外部资本。首轮尚未完成,第二轮已经排到年底,融资节奏比金额更激进。

晚点LatePost
1
动察Beating AI News
Claude新广告开场烧房子,网友以为在看AI末日片 Anthropic 新广告《希望存在于难题中》发布后,惹出很大争议。 广告本来想说明 Anthropic 愿意正视 AI 风险,却用燃烧的房屋、人脸监控、露宿者和大片墓碑开场。旁白还问:「AI 能被信任吗?」「失控时谁来踩刹车?」 不少网友认为,整条广告更像 AI 末日预告。OpenAI CEO Sam Altman 称,他一度以为这是讽刺账号。还有人说,亲属看完电视广告后专门打电话询问:「AI 公司为什么在威胁我们?」 墓地画面争议最大。画面出现时,旁白正好询问谁来给…
同样是AI广告:阿里千问许诺自由,Anthropic传递恐慌

Qwen3.8 的宣传片得到 All-In Podcast 主播、硅谷投资人 Jason Calacanis 公开称赞。他说,中国不仅在做更有竞争力的模型,也开始输出更积极的 AI 叙事。

片中,芯片工程师在钓鱼,Qwen3.8 连续设计芯片 12 小时;生物学教授在打网球,模型核验蛋白质资料;CFO 去攀岩,模型实时对账;律师在户外休息,模型自动生成合同;数字艺术家在读书,模型继续修改设计方案。阿里千问传递的愿景是:「机器负责加班,人类负责生活。」

Anthropic 7 月推出的广告《There’s hope in hard questions》却像一支 AI 末日预告片。视频从燃烧的房屋开始,随后出现人脸监控、露宿者、矿工和大片墓地,不断追问:AI 能相信吗?失控时谁来踩刹车?如果 AI 拿走大部分工作,人为什么还要工作?后半段虽然转向医疗、家庭和希望,前面的恐慌已经深入人心。

同样卖 AI,千问劝人去钓鱼,Anthropic 则把房子烧给你看。一个让人期待 AI 上班,一个让人担心 AI 失控。

Jason
🤡6👎2
智谱下一代模型露头:ZCode搜索结果出现GLM-5.3

智谱下一代模型 GLM-5.3 疑似被提前曝光。必应搜索结果一度把 ZCode 页面标题收录为「GLM-5.3 官方 Harness」。ZCode 是智谱为 GLM 配套的编程工具,用于规划、写代码、评审和执行开发任务。

但打开官网后,页面目前仍写着「GLM-5.2 官方 Harness」。智谱的模型发布记录、开发文档和 API 列表也只更新到 GLM-5.2,没有出现 GLM-5.3。

现有信息只能证明「GLM-5.3」曾进入 ZCode 页面的搜索索引,可能是测试标题或提前配置。

昨日,智谱 Z.ai 全球负责人李子玄公开询问用户,GLM-5.2 在新模型频出的情况下是否还够用,疑似是在为新模型发布造势。

Zixuan Li
👍2
动察Beating AI News
DeepSeek没把新版能力锁在API,V4-Flash正式版权重开源 DeepSeek 已在 Hugging Face 放出 V4-Flash-0731 正式版权重,并继续采用 MIT 许可证。开发者可以自行部署、微调和商用,不必只能通过 DeepSeek 官方 API 使用。 这次开放的是刚完成后训练升级的正式版。它在多项 Agent 测试中超过 V4-Pro-Preview,相关能力现在也能由第三方独立部署和复测。 Hugging Face
DeepSeek V4 Flash在OpenCode爆量:单日跑掉8万亿Token

AI 编程工具 OpenCode 披露,接入 DeepSeek V4 Flash 当天,OpenCode 用户跑了 8 万亿个 Token,其中 5 万亿来自免费计划,3 万亿来自付费订阅 OpenCode Go。

过去一周,它已占 OpenCode 全部 Token 用量的 55%,排名第一。

OpenCode
👍5
动察Beating AI News
阿里三款Agent合一,千问办公上线Beta版 阿里办公 Agent「千问办公」已上线官网,并开放个人用户登录。它整合了 QoderWork、悟空和 MuleRun,是一款独立产品,也能直接在钉钉内使用。 千问办公可以读取消息、群聊、日程、待办、文档、知识库、考勤和审批等企业信息。用户还能设置定时任务,让 Agent 自动生成日报、周报或调研简报,再推送到钉钉。 它还支持生成和编辑 PPT、Word、Excel、网页,以及图片、音频和视频。生成的网站可以直接发布,还能绑定域名、接入数据库。产品内也提…
阿里把千问办公升为一级事业部,「AI办公」成为战略方向

阿里已把「AI 办公」列为公司在 AI 领域的战略方向之一。原悟空事业部已升级为千问办公事业部,成为 ATH 事业群下属的一级事业部,由陈宇森负责。

千问办公事业部将同时负责千问办公和钉钉。阿里的目标不是再做一款面向个人的办公助手,而是进入企业组织,连接消息、审批、文档、数据库和工作流,成为企业级 AI 生产力平台。

虎嗅
字节OpenViking核心贡献者开源LoopX:让Agent连续跑200小时也不失忆、不跑偏

字节跳动 AML 高级机器学习工程师、OpenViking 核心贡献者黄瑞腾开源了 LoopX。它是一套面向长程 Agent 的控制系统,让 Codex、Claude Code 等 Agent 在任务跨越多天、多次中断后,仍能接着原来的目标往下做。

LoopX 已公开两条跨越 220.7 和 272.9 小时的真实任务轨迹。期间经历多轮执行、等待、人工判断、模型切换和任务恢复,Agent 仍能找回当前目标、已有证据和下一步。

它把目标、待办、权限、证据和等待条件放到模型上下文之外。Agent 每次只做一小步,验证结果后再写回状态。换会话、换模型或程序重启,都能从最新进度继续。

黄瑞腾参与开发的 OpenViking 负责保存和检索 Agent 的记忆、资料与技能;LoopX 则管理任务做到哪里、下一步做什么、何时需要人来判断。前者像长期记忆,后者更像项目经理和可执行看板。目前,LoopX 已用于自动修复代码问题、AutoML 实验和长期研究。

黄瑞腾
👍31