动察Beating AI News
3K subscribers
797 photos
2 videos
3.25K links
AI新闻信息流
Download Telegram
梁文锋四小时会议内容流出:DeepSeek不做超级App,只押AGI

媒体「elsewhere」整理出梁文锋在一场四小时投资人会议上的 52 条发言。梁文锋称,DeepSeek 只沿 AGI 一条主线推进。今年重点是通用 Agent,下一步是持续学习,再往后才是 AI 自我迭代和具身智能。

他明确排除 3D、视频生成和世界模型,也不想做下一个超级 App。多模态、幻觉治理和行业 Agent 会继续做,但都不是当前重点。产品只是通往 AGI 的一个台阶。

商业上,DeepSeek 不追求用户量或利润最大化,将继续开源和低价。梁文锋认为,大模型竞争首先拼成本,其次拼时间,最后才是用户体验。团队稳定则是唯一不能退让的问题。

elsewhere
🐳4
OpenAI总裁承认Kimi K3「相当不错」,是否蒸馏GPT仍不清楚

OpenAI 总裁兼联合创始人 Greg Brockman 承认,月之暗面新模型 Kimi K3「相当不错」。但他称,目前判断 Kimi 是否通过蒸馏 OpenAI 模型提升能力还太早,OpenAI 会持续监测。

此前,白宫官员指控月之暗面不当使用美国 AI 模型。Anthropic 也提出过类似质疑。月之暗面尚未回应。

Brockman 还引用估算称,中国模型与美国的差距可能只剩 4 个月。他认为,未来竞争的关键不是模型是否开源,而是谁能用更低成本完成任务。

彭博社
1👎1
动察Beating AI News
美国指控Kimi K3蒸馏Fable,月之暗面或遭制裁 美国白宫科技政策负责人 Michael Kratsios 指控,月之暗面通过蒸馏 Anthropic 的 Fable,训练 Kimi K3。蒸馏就是用强模型的输出训练另一个模型。美国财政部长 Scott Bessent 随后表示,制裁和列入实体清单都在考虑范围内。 Kratsios 称,月之暗面搭建了内部平台,可切换多种访问渠道躲避检测。他还称月之暗面购入搭载英伟达 GB300 的服务器,并在泰国使用相关芯片。Kratsios 没有公开证据。 Anthropic…
YC等美国AI初创联名反对封杀Kimi、Qwen:封禁只会养肥Anthropic

美国创业组织 Little Tech Association 联合 Y Combinator 等 179 个签署方致信特朗普政府,反对全面禁止中国开放权重模型。

信中点名 Kimi K3 和 Qwen3.8 Max。开放权重模型可以下载到本地部署和修改,不必把数据交给模型厂商。

联署方称,不少美国初创已经把中国开放模型用于正式业务。全面封禁不会阻止这些模型在海外传播,只会抬高美国企业的成本。

Particle 创始人 Suhail Doshi 警告,禁令可能让数百家依赖开放模型的公司陷入危机,Anthropic 等闭源模型厂商反而会受益。

目前,特朗普政府尚未提出正式禁令。白宫正在调查中国模型是否通过蒸馏复制美国模型,但内部并未认真讨论全面封杀,商务部也没有起草实体清单方案。

Politico
😁5🤩1
Cursor自动挑模型:满意度接近Fable,成本低60%

Cursor 推出 Cursor Router,面向 Teams 和 Enterprise 自动选择编程模型。它会先判断任务类型和难度,再决定调用便宜模型还是前沿模型。

Router 使用超过 60 万次真实请求训练,并在数百万次请求中测试。Auto Intelligence 的用户满意度接近 Fable,成本低约 60%。Auto Balance 的满意度高于 Opus 4.8,成本低约 36%。

Cursor 没有公布完整模型池,也不会默认显示每次调用了哪个模型。官方只确认,Router 会按任务类型分配模型,例如把界面设计交给更擅长视觉的模型,把复杂长任务交给推理能力更强的模型。

Cursor
🎉41
Kimi被指蒸馏Fable,Hermes Agent创始人反讽:Anthropic先蒸馏了全人类

白宫科技政策办公室主任 Michael Kratsios 指控,月之暗面用 Anthropic 的 Fable 训练 Kimi K3。其称月之暗面还搭建内部平台,批量调用美国模型并规避检测。帖文没有公开证据,月之暗面暂未回应。

Hermes Agent 开发商 Nous Research 联合创始人 Teknium 随后照抄这段句式。他称 Anthropic 为训练 Fable,抓取了自己的 GitHub、X、Reddit、Discord 和 Facebook 帖子。随后补充:「他们其实是在蒸馏地球上的所有人。」

Teknium 显然是在反讽。网页抓取和模型蒸馏不是一回事。Anthropic 公开承认,其模型训练数据包括公开互联网信息。Teknium 质疑的是:美国模型吸收全网内容时叫训练,中国模型学习美国模型时却被定性为偷窃。

Teknium
😁3
动察Beating AI News
拿了6亿美元闷头做3年,Poolside首次公开编程模型 编程 AI 公司 Poolside 发布 Laguna 系列首批两款模型。Poolside 2023 年成立,累计融资 6.26 亿美元,估值 30 亿美元,投资方包括 Bain Capital Ventures、NVIDIA 和 eBay Ventures,此前只面向政府和公共部门客户,这是首次向公众发布模型。 旗舰 Laguna M.1 是 225B 参数 MoE 模型(激活 23B),在 6144 块 NVIDIA Hopper GPU 上从零训练…
Poolside开源1180亿参数代码模型,自测压过1.6万亿参数DeepSeek

专做编程 Agent 的 Poolside 开源 MoE 代码模型 Laguna S 2.1。模型总参数 1180 亿,每次仅激活 80 亿,支持 100 万 Token 上下文。量化后可在一台 NVIDIA DGX Spark 上运行。

Poolside 自测中,Laguna S 2.1 在 Terminal-Bench 2.1 得 70.2%,高于总参数 1.6 万亿、激活参数 490 亿的 DeepSeek-V4-Pro-Max 的 64.0%。SWE-Bench Multilingual、SWE-Bench Pro 和 DeepSWE 也更高。

但它与 Kimi K3 仍有明显差距。Kimi K3 总参数 2.8 万亿、激活参数 500 亿,在 Terminal-Bench 2.1 得 88.3%,DeepSWE 得 69%。Laguna S 2.1 分别为 70.2% 和 40.4%。

这些分数不是同一环境重测。Poolside 使用自有 Agent 框架,竞品取公开最高成绩。Laguna S 2.1 的特点,是用更少的激活参数,把长程编程能力做到本地单机可跑。

Poolside
1
字节Seed招募100名学者:给算力和薪酬,用AI做真实科研

字节跳动 Seed 启动 STEM 科学家计划,拟邀请 100 位前沿科学领域学者。参与者将与 Seed 团队合作约 6 个月,用 AI 解决真实科研问题。

参与方式分为科学家顾问和博士实习生。前者面向高校学者和行业专家,后者面向 STEM 领域在读博士。申请者需在科研中深度使用 AI,熟练编程者优先。

Seed 将提供算力、AI 团队协作和薪酬。项目需到北京海淀现场参与,申请截至 2026 年 9 月 30 日。

字节跳动
🔥4
北京发布智能体新政,想把AI创业者和订单都留在本地

北京四部门发布智能体新政。相比此前的算力、模型和创业补贴,这次把技术研发、产品落地和商业模式放进了同一套政策。

最直接的支持是帮企业找订单。北京将面向科研、医疗、教育、政务、制造和文化,发布真实业务需求清单。模型厂商还可以派前沿部署工程师驻场,与客户共同开发智能体。

新政还提出发展「Token经济」。北京将支持Token即服务、智能体即服务和结果即服务,探索从按Token收费转向按实际价值收费。各区还可发放Token券和智能体服务券。

个人和小团队也是重点争取对象。北京将建设OPC社区,简化「一人公司」注册,并帮助创业者对接头部企业。公共算力也将向中小企业低价开放。

消费端同样有补贴。符合条件的智能手机、眼镜、耳机、机器人和汽车,可纳入数码产品购新和以旧换新范围。

北京想让创业者在本地用算力、接订单、卖产品,把模型能力变成真实营收。

政策原文
👍2
Kimi K3用27分钟复现Redis高危漏洞,研究员称此前没有模型做到

此前发现 Claude Code 源码意外泄露的安全研究员 Chaofan Shou 称,他让 Kimi K3 对 Redis 8.6.x 做授权安全测试。模型调动 32 个 Agent,只用 27 分钟就写出可运行的攻击程序。

他的提示词允许模型最多调用 64 个子 Agent。任务包括克隆 Redis 源码,寻找缓冲区溢出、内存释放后继续使用等漏洞。模型还可以自己写模糊测试工具、加入监控代码,再用 GDB 调试。

Shou 称,Kimi K3 是第一个「既有能力,也愿意写漏洞利用程序」的大模型。这里的「愿意」,指模型没有因为安全限制直接拒绝,而是在明确属于授权测试的前提下继续执行。

Kimi 最终写出了完整攻击代码,可以让 Redis 所在的服务器执行指定命令。公开 PoC 已适配 Redis 6.2.22、7.4.9 和 8.6.4。

不过,这不是一次与公开信息隔离的盲测。Shou 后来确认,Agent 可以访问网页、PR 和代码历史。Redis 在今年 4 月已经公开合并 PR #15081,其中直接写明了同一条漏洞路径和修复方法。

因此,更合理的解释是:Kimi 可能先从公开补丁中找到漏洞线索,再反推旧版代码并写成完整利用程序。

Chaofan Shou
😱3
开发者把ChatGPT Work玩成临时VPS:9核云环境可SSH接入

ChatGPT Work 是 OpenAI 新推出的通用 Agent,可在云端连续数小时处理文件和执行任务。有开发者发现,它背后运行着 Linux 云环境,并成功从本地电脑远程接入。

Pro 会员的云环境有 9 个 CPU 核心、约 21GB 内存和 63GB 磁盘。接入后,用户可用终端、VS Code 和 Cursor 直接编辑文件或安装软件。

不过,这不是一台固定分配的服务器。OpenAI 没有公布环境存活时间、文件保留规则或服务保障。会话结束或环境被替换后,进程可能消失,文件也无法保证完整保留。

Maximilian Jendrall
😁31
动察Beating AI News
前OpenAI华人研究员田永龙加入腾讯混元团队 前 OpenAI 技术团队成员田永龙已确认加入腾讯混元团队,未来将参与视觉语言模型相关研发。 田永龙本科毕业于清华大学,在麻省理工学院(MIT)获得博士学位,曾先后在谷歌研究院(Google Research)、Google DeepMind 担任高级研究科学家,主要研究计算机视觉与生成式模型。 这是腾讯混元继去年十二月招募首席 AI 科学家姚顺雨后,引入的又一位顶尖华人 AI 研究员。 腾讯近日刚刚落地由姚顺雨主导的混元 Hy3 正式版模型,并采用…
腾讯混元多模态换帅:胡瀚离职创业,田永龙接手VLM

腾讯混元多模态理解负责人胡瀚已提出离职,准备创业。前 OpenAI 研究员田永龙将接手视觉语言模型(VLM)研发,继续向姚顺雨汇报。

胡瀚 2025 年初从微软亚洲研究院加入腾讯。此后,他进入大语言模型部的 Frontier 前沿研究组,并参与世界模型研发。随着田永龙接管 VLM,胡瀚原团队或将把重点转向世界模型。

智能涌现
2
月之暗面在Hugging Face上线Kimi K3权重开源倒计时

月之暗面已在 Hugging Face 官方账号建立 Kimi K3 模型页面,并开启权重发布倒计时。页面显示,模型将在 7 月 27 日上线,目前可以提前订阅发布提醒。

Kimi K3 是月之暗面最新的旗舰模型,总参数达到 2.8 万亿,主要面向长时间编程和 Agent 任务。权重开放后,开发者将可以自行下载、部署和测试。

Hugging Face
🔥4
Claude Security下放Claude Code:个人付费用户也能查全仓库漏洞

Anthropic 将 Claude Security 的深度扫描能力做成 Claude Code 插件。插件现已开放 beta,Claude Code 付费用户均可安装。托管版 Claude Security 仍只面向 Enterprise 客户。

用户可扫描整个代码库,也能只查分支差异、PR 差异或单次提交。发现漏洞后,用户可以选择让它生成补丁,再自行审核和应用。

Claude Security 本身不是新产品。它在 2026 年 4 月 30 日面向 Enterprise 客户进入公开测试,此前以 Claude Code Security 名义进行有限研究预览。

新插件在 Claude Code 会话内运行。多个 Claude Agent 会梳理架构、建立威胁模型并查找漏洞。每条发现和补丁都会经过独立 Agent 复核。扫描消耗计入 Claude Code 用量。

Claude
🥴2
Codex要变语音助理:前台陪聊,后台继续干活

OpenAI 正在为 Codex 准备实时语音模式。用户可以持续与它对话,同时把耗时任务交给后台 Agent 执行。

Codex 公开代码显示,相关功能已经开发数月。语音会话可以绑定现有任务线程,并通过 WebRTC 或 WebSocket 连接。后台任务运行期间,用户还能继续补充要求或调整方向。

最新曝光的 Codex 客户端资源字符串显示,实时语音界面将展示命令执行、文件修改、MCP 调用和权限审批等状态。曝光的协调提示词还提到浏览、应用、文档、购物和点餐等任务。OpenAI 尚未正式确认这些功能。

OpenAI 产品负责人 Tibo 今日发文称,「明天很有 Codex 的感觉」。社区因此猜测,这项功能最快可能在 7 月 24 日发布。

M1
👍41
Anthropic年化收入估算已接近OpenAI的1.8倍

另类数据平台 TickerTrends 估算,Anthropic 当前年化收入达到 741 亿美元,OpenAI 为 413 亿美元。Anthropic 领先 328 亿美元,规模约为 OpenAI 的 1.79 倍。

OpenAI 近期也在加速。其估算值从 5 月的 330 亿美元升至 7 月的 413 亿美元,两个月增长约 25%。

不过,这不是两家公司披露的官方收入数据。TickerTrends 主要基于购买意向等另类数据建模推算。

TickerTrends
1
Vals-Smith用你的代码库考模型:谁更适合一测便知

AI 评测平台 Vals 推出 Vals-Smith。它会读取 GitHub 代码库,从已经合并的 PR 中提取真实开发任务,生成一套专属编程评测。

每道题包含问题描述、隐藏测试和可复现环境。被测模型只能看到修复前的代码,无法查看原始补丁。只有通过隐藏测试,同时不破坏原有功能,任务才算完成。

团队可以让不同模型和 Coding Agent 跑同一套题,直接比较通过率。公共榜单看谁整体更强,Vals-Smith 测的是谁更适合自己的代码库。

目前支持公开和私有仓库,但产品仍需申请候补。官网已经放出了 Linux、Next.js、Bun、Spark 等开源项目的评测结果。

Vals
👍2
动察Beating AI News
传Claude Opus 5最快本周发布,填补Fable 5退场空档 爆料账号 leo 称,Anthropic 正在为 Claude Opus 5 做最后准备。模型最快本周发布,也可能推迟到下周。其能力预计接近 Fable 5,但运行成本更低。 Anthropic 已把 Fable 5 的订阅内使用期延长至 7 月 19 日,但暂不准备再次延期。 信源:https://x.com/synthwavedd/status/2077085180175544375
传Claude Opus 5最快今晚发布,多家供应商开始上线准备

Anthropic 可能在今晚至明晨发布 Claude Opus 5。相关模型似乎已开始在第三方供应商侧准备上线。

此前,代号「Honeycomb EAP」的未发布模型曾短暂出现在 Cursor。页面显示它支持「extra high」推理强度、逐轮控制和安全回退,随后很快下线。社区普遍猜测 Honeycomb 就是 Opus 5,但 Anthropic 没有确认。

新模型会重点提升编程、Agent、工具调用和多步推理,能力可能接近 Fable 5,同时更快、更便宜。
🥰3
动察Beating AI News
Codex要变语音助理:前台陪聊,后台继续干活 OpenAI 正在为 Codex 准备实时语音模式。用户可以持续与它对话,同时把耗时任务交给后台 Agent 执行。 Codex 公开代码显示,相关功能已经开发数月。语音会话可以绑定现有任务线程,并通过 WebRTC 或 WebSocket 连接。后台任务运行期间,用户还能继续补充要求或调整方向。 最新曝光的 Codex 客户端资源字符串显示,实时语音界面将展示命令执行、文件修改、MCP 调用和权限审批等状态。曝光的协调提示词还提到浏览、应用、文档、购物和点餐等任务。OpenAI…
ChatGPT Voice接管桌面:说话就能控制电脑和Agent干活

OpenAI 正式把 ChatGPT Voice 接入桌面版 Work 和 Codex。用户可以用语音启动任务、查看进度,并在一场对话里协调多个 Agent。

新功能由 GPT-Live 驱动。它可以一边与用户持续对话,一边协调 App 内的后台工作。此前曝光的「前台聊天、后台干活」,今天终于正式上线。

功能已在 macOS 和 Windows 桌面 App 推出。iOS 支持配对远程接入,用户可以在手机上继续语音指挥桌面端任务。网页和手机端暂时不能独立使用 Work 或 Codex 语音。

OpenAI
😁2
TYLsemi完成4300万美元融资,要把定制AI芯片成本砍半

芯片初创 TYLsemi 完成 4300 万美元早期融资,并正式结束隐身模式。公司由两名前 Alphawave 高管创立,Matter Venture Partners 领投。

TYLsemi 想把定制 AI 芯片变成「拼积木」。客户只需开发核心计算模块,连接、供电和内存等芯粒由 TYLsemi 提供,后续从封装到量产也由其包办。

TYLsemi 称,这套方案最多可将开发成本和周期降低 50%。不过产品仍未出货,首批样品计划在 2027 年交付,客户芯片预计要到 2029 至 2030 年上市。

TYLsemi
微软自研模型落地Bing、Office,GPU成本最高降89%

微软 AI 开放 MAI-Image-2.5-Pro 和 MAI-Voice-2-Flash。前者主打高质量生图和图片编辑,后者面向客服和语音 Agent,速度提升 1 倍,价格低 32%。

普通版 MAI-Image-2.5 已全面接管 Bing Image Creator,并进入 PowerPoint 和 OneDrive。PowerPoint 的 GPU 成本较 GPT-Image-2 最多降低 84%。

MAI-Voice-2-Flash 已用于 Dynamics 365 Contact Center,GPU 成本最多降低 89%。微软没有公布这项数据的对照模型。

微软 AI
微软用自研模型接管Excel:常见任务效果近GPT-5.6,成本更低

微软 AI 公布两款产品专用语言模型的进展。MAI-Code-1-Flash 已用于 GitHub Copilot,另一款未命名模型已在 Excel 中运行。

微软称,Excel 模型在常见任务上的效果接近 GPT-5.6。它体积更小,可部署在 H100 和 A100 上,运行成本更低。

MAI-Code-1-Flash 已有数百万名开发者使用。其代码接受率比 GPT-5.4 Mini 和 Claude Haiku 4.5 高约 10%,Token 消耗低 10%。

微软还在用同样的方法训练 Copilot Chat、Outlook 和 PowerPoint 专用模型。

微软 AI