梁文锋四小时会议内容流出:DeepSeek不做超级App,只押AGI
媒体「elsewhere」整理出梁文锋在一场四小时投资人会议上的 52 条发言。梁文锋称,DeepSeek 只沿 AGI 一条主线推进。今年重点是通用 Agent,下一步是持续学习,再往后才是 AI 自我迭代和具身智能。
他明确排除 3D、视频生成和世界模型,也不想做下一个超级 App。多模态、幻觉治理和行业 Agent 会继续做,但都不是当前重点。产品只是通往 AGI 的一个台阶。
商业上,DeepSeek 不追求用户量或利润最大化,将继续开源和低价。梁文锋认为,大模型竞争首先拼成本,其次拼时间,最后才是用户体验。团队稳定则是唯一不能退让的问题。
elsewhere
媒体「elsewhere」整理出梁文锋在一场四小时投资人会议上的 52 条发言。梁文锋称,DeepSeek 只沿 AGI 一条主线推进。今年重点是通用 Agent,下一步是持续学习,再往后才是 AI 自我迭代和具身智能。
他明确排除 3D、视频生成和世界模型,也不想做下一个超级 App。多模态、幻觉治理和行业 Agent 会继续做,但都不是当前重点。产品只是通往 AGI 的一个台阶。
商业上,DeepSeek 不追求用户量或利润最大化,将继续开源和低价。梁文锋认为,大模型竞争首先拼成本,其次拼时间,最后才是用户体验。团队稳定则是唯一不能退让的问题。
elsewhere
🐳4
OpenAI总裁承认Kimi K3「相当不错」,是否蒸馏GPT仍不清楚
OpenAI 总裁兼联合创始人 Greg Brockman 承认,月之暗面新模型 Kimi K3「相当不错」。但他称,目前判断 Kimi 是否通过蒸馏 OpenAI 模型提升能力还太早,OpenAI 会持续监测。
此前,白宫官员指控月之暗面不当使用美国 AI 模型。Anthropic 也提出过类似质疑。月之暗面尚未回应。
Brockman 还引用估算称,中国模型与美国的差距可能只剩 4 个月。他认为,未来竞争的关键不是模型是否开源,而是谁能用更低成本完成任务。
彭博社
OpenAI 总裁兼联合创始人 Greg Brockman 承认,月之暗面新模型 Kimi K3「相当不错」。但他称,目前判断 Kimi 是否通过蒸馏 OpenAI 模型提升能力还太早,OpenAI 会持续监测。
此前,白宫官员指控月之暗面不当使用美国 AI 模型。Anthropic 也提出过类似质疑。月之暗面尚未回应。
Brockman 还引用估算称,中国模型与美国的差距可能只剩 4 个月。他认为,未来竞争的关键不是模型是否开源,而是谁能用更低成本完成任务。
彭博社
Bloomberg.com
OpenAI President Says Kimi K3 ‘Pretty Good,’ Unsure If Distilled From GPT Models
OpenAI President Greg Brockman acknowledged that Moonshot AI had developed a competitive new artificial intelligence model and said he wasn’t sure whether the Chinese firm had piggybacked on the ChatGPT maker’s technology.
❤1👎1
动察Beating AI News
美国指控Kimi K3蒸馏Fable,月之暗面或遭制裁 美国白宫科技政策负责人 Michael Kratsios 指控,月之暗面通过蒸馏 Anthropic 的 Fable,训练 Kimi K3。蒸馏就是用强模型的输出训练另一个模型。美国财政部长 Scott Bessent 随后表示,制裁和列入实体清单都在考虑范围内。 Kratsios 称,月之暗面搭建了内部平台,可切换多种访问渠道躲避检测。他还称月之暗面购入搭载英伟达 GB300 的服务器,并在泰国使用相关芯片。Kratsios 没有公开证据。 Anthropic…
YC等美国AI初创联名反对封杀Kimi、Qwen:封禁只会养肥Anthropic
美国创业组织 Little Tech Association 联合 Y Combinator 等 179 个签署方致信特朗普政府,反对全面禁止中国开放权重模型。
信中点名 Kimi K3 和 Qwen3.8 Max。开放权重模型可以下载到本地部署和修改,不必把数据交给模型厂商。
联署方称,不少美国初创已经把中国开放模型用于正式业务。全面封禁不会阻止这些模型在海外传播,只会抬高美国企业的成本。
Particle 创始人 Suhail Doshi 警告,禁令可能让数百家依赖开放模型的公司陷入危机,Anthropic 等闭源模型厂商反而会受益。
目前,特朗普政府尚未提出正式禁令。白宫正在调查中国模型是否通过蒸馏复制美国模型,但内部并未认真讨论全面封杀,商务部也没有起草实体清单方案。
Politico
美国创业组织 Little Tech Association 联合 Y Combinator 等 179 个签署方致信特朗普政府,反对全面禁止中国开放权重模型。
信中点名 Kimi K3 和 Qwen3.8 Max。开放权重模型可以下载到本地部署和修改,不必把数据交给模型厂商。
联署方称,不少美国初创已经把中国开放模型用于正式业务。全面封禁不会阻止这些模型在海外传播,只会抬高美国企业的成本。
Particle 创始人 Suhail Doshi 警告,禁令可能让数百家依赖开放模型的公司陷入危机,Anthropic 等闭源模型厂商反而会受益。
目前,特朗普政府尚未提出正式禁令。白宫正在调查中国模型是否通过蒸馏复制美国模型,但内部并未认真讨论全面封杀,商务部也没有起草实体清单方案。
Politico
POLITICO
Startup founders urge Trump not to shut off Chinese open weight AI
As the Trump administration escalates its scrutiny of Chinese AI companies, startup founders are urging officials not to block access to the open weight models many young companies depend on.
😁5🤩1
Cursor自动挑模型:满意度接近Fable,成本低60%
Cursor 推出 Cursor Router,面向 Teams 和 Enterprise 自动选择编程模型。它会先判断任务类型和难度,再决定调用便宜模型还是前沿模型。
Router 使用超过 60 万次真实请求训练,并在数百万次请求中测试。Auto Intelligence 的用户满意度接近 Fable,成本低约 60%。Auto Balance 的满意度高于 Opus 4.8,成本低约 36%。
Cursor 没有公布完整模型池,也不会默认显示每次调用了哪个模型。官方只确认,Router 会按任务类型分配模型,例如把界面设计交给更擅长视觉的模型,把复杂长任务交给推理能力更强的模型。
Cursor
Cursor 推出 Cursor Router,面向 Teams 和 Enterprise 自动选择编程模型。它会先判断任务类型和难度,再决定调用便宜模型还是前沿模型。
Router 使用超过 60 万次真实请求训练,并在数百万次请求中测试。Auto Intelligence 的用户满意度接近 Fable,成本低约 60%。Auto Balance 的满意度高于 Opus 4.8,成本低约 36%。
Cursor 没有公布完整模型池,也不会默认显示每次调用了哪个模型。官方只确认,Router 会按任务类型分配模型,例如把界面设计交给更擅长视觉的模型,把复杂长任务交给推理能力更强的模型。
Cursor
🎉4❤1
Kimi被指蒸馏Fable,Hermes Agent创始人反讽:Anthropic先蒸馏了全人类
白宫科技政策办公室主任 Michael Kratsios 指控,月之暗面用 Anthropic 的 Fable 训练 Kimi K3。其称月之暗面还搭建内部平台,批量调用美国模型并规避检测。帖文没有公开证据,月之暗面暂未回应。
Hermes Agent 开发商 Nous Research 联合创始人 Teknium 随后照抄这段句式。他称 Anthropic 为训练 Fable,抓取了自己的 GitHub、X、Reddit、Discord 和 Facebook 帖子。随后补充:「他们其实是在蒸馏地球上的所有人。」
Teknium 显然是在反讽。网页抓取和模型蒸馏不是一回事。Anthropic 公开承认,其模型训练数据包括公开互联网信息。Teknium 质疑的是:美国模型吸收全网内容时叫训练,中国模型学习美国模型时却被定性为偷窃。
Teknium
白宫科技政策办公室主任 Michael Kratsios 指控,月之暗面用 Anthropic 的 Fable 训练 Kimi K3。其称月之暗面还搭建内部平台,批量调用美国模型并规避检测。帖文没有公开证据,月之暗面暂未回应。
Hermes Agent 开发商 Nous Research 联合创始人 Teknium 随后照抄这段句式。他称 Anthropic 为训练 Fable,抓取了自己的 GitHub、X、Reddit、Discord 和 Facebook 帖子。随后补充:「他们其实是在蒸馏地球上的所有人。」
Teknium 显然是在反讽。网页抓取和模型蒸馏不是一回事。Anthropic 公开承认,其模型训练数据包括公开互联网信息。Teknium 质疑的是:美国模型吸收全网内容时叫训练,中国模型学习美国模型时却被定性为偷窃。
Teknium
😁3
动察Beating AI News
拿了6亿美元闷头做3年,Poolside首次公开编程模型 编程 AI 公司 Poolside 发布 Laguna 系列首批两款模型。Poolside 2023 年成立,累计融资 6.26 亿美元,估值 30 亿美元,投资方包括 Bain Capital Ventures、NVIDIA 和 eBay Ventures,此前只面向政府和公共部门客户,这是首次向公众发布模型。 旗舰 Laguna M.1 是 225B 参数 MoE 模型(激活 23B),在 6144 块 NVIDIA Hopper GPU 上从零训练…
Poolside开源1180亿参数代码模型,自测压过1.6万亿参数DeepSeek
专做编程 Agent 的 Poolside 开源 MoE 代码模型 Laguna S 2.1。模型总参数 1180 亿,每次仅激活 80 亿,支持 100 万 Token 上下文。量化后可在一台 NVIDIA DGX Spark 上运行。
Poolside 自测中,Laguna S 2.1 在 Terminal-Bench 2.1 得 70.2%,高于总参数 1.6 万亿、激活参数 490 亿的 DeepSeek-V4-Pro-Max 的 64.0%。SWE-Bench Multilingual、SWE-Bench Pro 和 DeepSWE 也更高。
但它与 Kimi K3 仍有明显差距。Kimi K3 总参数 2.8 万亿、激活参数 500 亿,在 Terminal-Bench 2.1 得 88.3%,DeepSWE 得 69%。Laguna S 2.1 分别为 70.2% 和 40.4%。
这些分数不是同一环境重测。Poolside 使用自有 Agent 框架,竞品取公开最高成绩。Laguna S 2.1 的特点,是用更少的激活参数,把长程编程能力做到本地单机可跑。
Poolside
专做编程 Agent 的 Poolside 开源 MoE 代码模型 Laguna S 2.1。模型总参数 1180 亿,每次仅激活 80 亿,支持 100 万 Token 上下文。量化后可在一台 NVIDIA DGX Spark 上运行。
Poolside 自测中,Laguna S 2.1 在 Terminal-Bench 2.1 得 70.2%,高于总参数 1.6 万亿、激活参数 490 亿的 DeepSeek-V4-Pro-Max 的 64.0%。SWE-Bench Multilingual、SWE-Bench Pro 和 DeepSWE 也更高。
但它与 Kimi K3 仍有明显差距。Kimi K3 总参数 2.8 万亿、激活参数 500 亿,在 Terminal-Bench 2.1 得 88.3%,DeepSWE 得 69%。Laguna S 2.1 分别为 70.2% 和 40.4%。
这些分数不是同一环境重测。Poolside 使用自有 Agent 框架,竞品取公开最高成绩。Laguna S 2.1 的特点,是用更少的激活参数,把长程编程能力做到本地单机可跑。
Poolside
Poolside
Introducing Laguna S 2.1
Today we’re releasing Laguna S 2.1, a significant step forward in our development of models that pursue longer horizon work and make effective use of reasoning.
❤1
字节Seed招募100名学者:给算力和薪酬,用AI做真实科研
字节跳动 Seed 启动 STEM 科学家计划,拟邀请 100 位前沿科学领域学者。参与者将与 Seed 团队合作约 6 个月,用 AI 解决真实科研问题。
参与方式分为科学家顾问和博士实习生。前者面向高校学者和行业专家,后者面向 STEM 领域在读博士。申请者需在科研中深度使用 AI,熟练编程者优先。
Seed 将提供算力、AI 团队协作和薪酬。项目需到北京海淀现场参与,申请截至 2026 年 9 月 30 日。
字节跳动
字节跳动 Seed 启动 STEM 科学家计划,拟邀请 100 位前沿科学领域学者。参与者将与 Seed 团队合作约 6 个月,用 AI 解决真实科研问题。
参与方式分为科学家顾问和博士实习生。前者面向高校学者和行业专家,后者面向 STEM 领域在读博士。申请者需在科研中深度使用 AI,熟练编程者优先。
Seed 将提供算力、AI 团队协作和薪酬。项目需到北京海淀现场参与,申请截至 2026 年 9 月 30 日。
字节跳动
🔥4
北京发布智能体新政,想把AI创业者和订单都留在本地
北京四部门发布智能体新政。相比此前的算力、模型和创业补贴,这次把技术研发、产品落地和商业模式放进了同一套政策。
最直接的支持是帮企业找订单。北京将面向科研、医疗、教育、政务、制造和文化,发布真实业务需求清单。模型厂商还可以派前沿部署工程师驻场,与客户共同开发智能体。
新政还提出发展「Token经济」。北京将支持Token即服务、智能体即服务和结果即服务,探索从按Token收费转向按实际价值收费。各区还可发放Token券和智能体服务券。
个人和小团队也是重点争取对象。北京将建设OPC社区,简化「一人公司」注册,并帮助创业者对接头部企业。公共算力也将向中小企业低价开放。
消费端同样有补贴。符合条件的智能手机、眼镜、耳机、机器人和汽车,可纳入数码产品购新和以旧换新范围。
北京想让创业者在本地用算力、接订单、卖产品,把模型能力变成真实营收。
政策原文
北京四部门发布智能体新政。相比此前的算力、模型和创业补贴,这次把技术研发、产品落地和商业模式放进了同一套政策。
最直接的支持是帮企业找订单。北京将面向科研、医疗、教育、政务、制造和文化,发布真实业务需求清单。模型厂商还可以派前沿部署工程师驻场,与客户共同开发智能体。
新政还提出发展「Token经济」。北京将支持Token即服务、智能体即服务和结果即服务,探索从按Token收费转向按实际价值收费。各区还可发放Token券和智能体服务券。
个人和小团队也是重点争取对象。北京将建设OPC社区,简化「一人公司」注册,并帮助创业者对接头部企业。公共算力也将向中小企业低价开放。
消费端同样有补贴。符合条件的智能手机、眼镜、耳机、机器人和汽车,可纳入数码产品购新和以旧换新范围。
北京想让创业者在本地用算力、接订单、卖产品,把模型能力变成真实营收。
政策原文
fgw.beijing.gov.cn
北京市发展和改革委员会 中共北京市委网络安全和信息化委员会办公室 北京市科学技术委员会、中关村科技园区管理委员会 北京市经济和信息化局 关于印发北京市加快智能体引领发展若干措施的通知-本委其他文件-北京市发展和改革委员会
北京市发展和改革委员会 中共北京市委网络安全和信...
👍2
Kimi K3用27分钟复现Redis高危漏洞,研究员称此前没有模型做到
此前发现 Claude Code 源码意外泄露的安全研究员 Chaofan Shou 称,他让 Kimi K3 对 Redis 8.6.x 做授权安全测试。模型调动 32 个 Agent,只用 27 分钟就写出可运行的攻击程序。
他的提示词允许模型最多调用 64 个子 Agent。任务包括克隆 Redis 源码,寻找缓冲区溢出、内存释放后继续使用等漏洞。模型还可以自己写模糊测试工具、加入监控代码,再用 GDB 调试。
Shou 称,Kimi K3 是第一个「既有能力,也愿意写漏洞利用程序」的大模型。这里的「愿意」,指模型没有因为安全限制直接拒绝,而是在明确属于授权测试的前提下继续执行。
Kimi 最终写出了完整攻击代码,可以让 Redis 所在的服务器执行指定命令。公开 PoC 已适配 Redis 6.2.22、7.4.9 和 8.6.4。
不过,这不是一次与公开信息隔离的盲测。Shou 后来确认,Agent 可以访问网页、PR 和代码历史。Redis 在今年 4 月已经公开合并 PR #15081,其中直接写明了同一条漏洞路径和修复方法。
因此,更合理的解释是:Kimi 可能先从公开补丁中找到漏洞线索,再反推旧版代码并写成完整利用程序。
Chaofan Shou
此前发现 Claude Code 源码意外泄露的安全研究员 Chaofan Shou 称,他让 Kimi K3 对 Redis 8.6.x 做授权安全测试。模型调动 32 个 Agent,只用 27 分钟就写出可运行的攻击程序。
他的提示词允许模型最多调用 64 个子 Agent。任务包括克隆 Redis 源码,寻找缓冲区溢出、内存释放后继续使用等漏洞。模型还可以自己写模糊测试工具、加入监控代码,再用 GDB 调试。
Shou 称,Kimi K3 是第一个「既有能力,也愿意写漏洞利用程序」的大模型。这里的「愿意」,指模型没有因为安全限制直接拒绝,而是在明确属于授权测试的前提下继续执行。
Kimi 最终写出了完整攻击代码,可以让 Redis 所在的服务器执行指定命令。公开 PoC 已适配 Redis 6.2.22、7.4.9 和 8.6.4。
不过,这不是一次与公开信息隔离的盲测。Shou 后来确认,Agent 可以访问网页、PR 和代码历史。Redis 在今年 4 月已经公开合并 PR #15081,其中直接写明了同一条漏洞路径和修复方法。
因此,更合理的解释是:Kimi 可能先从公开补丁中找到漏洞线索,再反推旧版代码并写成完整利用程序。
Chaofan Shou
😱3
开发者把ChatGPT Work玩成临时VPS:9核云环境可SSH接入
ChatGPT Work 是 OpenAI 新推出的通用 Agent,可在云端连续数小时处理文件和执行任务。有开发者发现,它背后运行着 Linux 云环境,并成功从本地电脑远程接入。
Pro 会员的云环境有 9 个 CPU 核心、约 21GB 内存和 63GB 磁盘。接入后,用户可用终端、VS Code 和 Cursor 直接编辑文件或安装软件。
不过,这不是一台固定分配的服务器。OpenAI 没有公布环境存活时间、文件保留规则或服务保障。会话结束或环境被替换后,进程可能消失,文件也无法保证完整保留。
Maximilian Jendrall
ChatGPT Work 是 OpenAI 新推出的通用 Agent,可在云端连续数小时处理文件和执行任务。有开发者发现,它背后运行着 Linux 云环境,并成功从本地电脑远程接入。
Pro 会员的云环境有 9 个 CPU 核心、约 21GB 内存和 63GB 磁盘。接入后,用户可用终端、VS Code 和 Cursor 直接编辑文件或安装软件。
不过,这不是一台固定分配的服务器。OpenAI 没有公布环境存活时间、文件保留规则或服务保障。会话结束或环境被替换后,进程可能消失,文件也无法保证完整保留。
Maximilian Jendrall
😁3❤1
动察Beating AI News
前OpenAI华人研究员田永龙加入腾讯混元团队 前 OpenAI 技术团队成员田永龙已确认加入腾讯混元团队,未来将参与视觉语言模型相关研发。 田永龙本科毕业于清华大学,在麻省理工学院(MIT)获得博士学位,曾先后在谷歌研究院(Google Research)、Google DeepMind 担任高级研究科学家,主要研究计算机视觉与生成式模型。 这是腾讯混元继去年十二月招募首席 AI 科学家姚顺雨后,引入的又一位顶尖华人 AI 研究员。 腾讯近日刚刚落地由姚顺雨主导的混元 Hy3 正式版模型,并采用…
腾讯混元多模态换帅:胡瀚离职创业,田永龙接手VLM
腾讯混元多模态理解负责人胡瀚已提出离职,准备创业。前 OpenAI 研究员田永龙将接手视觉语言模型(VLM)研发,继续向姚顺雨汇报。
胡瀚 2025 年初从微软亚洲研究院加入腾讯。此后,他进入大语言模型部的 Frontier 前沿研究组,并参与世界模型研发。随着田永龙接管 VLM,胡瀚原团队或将把重点转向世界模型。
智能涌现
腾讯混元多模态理解负责人胡瀚已提出离职,准备创业。前 OpenAI 研究员田永龙将接手视觉语言模型(VLM)研发,继续向姚顺雨汇报。
胡瀚 2025 年初从微软亚洲研究院加入腾讯。此后,他进入大语言模型部的 Frontier 前沿研究组,并参与世界模型研发。随着田永龙接管 VLM,胡瀚原团队或将把重点转向世界模型。
智能涌现
❤2
月之暗面在Hugging Face上线Kimi K3权重开源倒计时
月之暗面已在 Hugging Face 官方账号建立 Kimi K3 模型页面,并开启权重发布倒计时。页面显示,模型将在 7 月 27 日上线,目前可以提前订阅发布提醒。
Kimi K3 是月之暗面最新的旗舰模型,总参数达到 2.8 万亿,主要面向长时间编程和 Agent 任务。权重开放后,开发者将可以自行下载、部署和测试。
Hugging Face
月之暗面已在 Hugging Face 官方账号建立 Kimi K3 模型页面,并开启权重发布倒计时。页面显示,模型将在 7 月 27 日上线,目前可以提前订阅发布提醒。
Kimi K3 是月之暗面最新的旗舰模型,总参数达到 2.8 万亿,主要面向长时间编程和 Agent 任务。权重开放后,开发者将可以自行下载、部署和测试。
Hugging Face
🔥4
Claude Security下放Claude Code:个人付费用户也能查全仓库漏洞
Anthropic 将 Claude Security 的深度扫描能力做成 Claude Code 插件。插件现已开放 beta,Claude Code 付费用户均可安装。托管版 Claude Security 仍只面向 Enterprise 客户。
用户可扫描整个代码库,也能只查分支差异、PR 差异或单次提交。发现漏洞后,用户可以选择让它生成补丁,再自行审核和应用。
Claude Security 本身不是新产品。它在 2026 年 4 月 30 日面向 Enterprise 客户进入公开测试,此前以 Claude Code Security 名义进行有限研究预览。
新插件在 Claude Code 会话内运行。多个 Claude Agent 会梳理架构、建立威胁模型并查找漏洞。每条发现和补丁都会经过独立 Agent 复核。扫描消耗计入 Claude Code 用量。
Claude
Anthropic 将 Claude Security 的深度扫描能力做成 Claude Code 插件。插件现已开放 beta,Claude Code 付费用户均可安装。托管版 Claude Security 仍只面向 Enterprise 客户。
用户可扫描整个代码库,也能只查分支差异、PR 差异或单次提交。发现漏洞后,用户可以选择让它生成补丁,再自行审核和应用。
Claude Security 本身不是新产品。它在 2026 年 4 月 30 日面向 Enterprise 客户进入公开测试,此前以 Claude Code Security 名义进行有限研究预览。
新插件在 Claude Code 会话内运行。多个 Claude Agent 会梳理架构、建立威胁模型并查找漏洞。每条发现和补丁都会经过独立 Agent 复核。扫描消耗计入 Claude Code 用量。
Claude
Claude
Claude Security | Claude by Anthropic
From scan to fix, seamlessly. Claude scans your codebase for vulnerabilities, validates findings, and recommends patches you can review and approve.
🥴2
Codex要变语音助理:前台陪聊,后台继续干活
OpenAI 正在为 Codex 准备实时语音模式。用户可以持续与它对话,同时把耗时任务交给后台 Agent 执行。
Codex 公开代码显示,相关功能已经开发数月。语音会话可以绑定现有任务线程,并通过 WebRTC 或 WebSocket 连接。后台任务运行期间,用户还能继续补充要求或调整方向。
最新曝光的 Codex 客户端资源字符串显示,实时语音界面将展示命令执行、文件修改、MCP 调用和权限审批等状态。曝光的协调提示词还提到浏览、应用、文档、购物和点餐等任务。OpenAI 尚未正式确认这些功能。
OpenAI 产品负责人 Tibo 今日发文称,「明天很有 Codex 的感觉」。社区因此猜测,这项功能最快可能在 7 月 24 日发布。
M1
OpenAI 正在为 Codex 准备实时语音模式。用户可以持续与它对话,同时把耗时任务交给后台 Agent 执行。
Codex 公开代码显示,相关功能已经开发数月。语音会话可以绑定现有任务线程,并通过 WebRTC 或 WebSocket 连接。后台任务运行期间,用户还能继续补充要求或调整方向。
最新曝光的 Codex 客户端资源字符串显示,实时语音界面将展示命令执行、文件修改、MCP 调用和权限审批等状态。曝光的协调提示词还提到浏览、应用、文档、购物和点餐等任务。OpenAI 尚未正式确认这些功能。
OpenAI 产品负责人 Tibo 今日发文称,「明天很有 Codex 的感觉」。社区因此猜测,这项功能最快可能在 7 月 24 日发布。
M1
👍4❤1
Anthropic年化收入估算已接近OpenAI的1.8倍
另类数据平台 TickerTrends 估算,Anthropic 当前年化收入达到 741 亿美元,OpenAI 为 413 亿美元。Anthropic 领先 328 亿美元,规模约为 OpenAI 的 1.79 倍。
OpenAI 近期也在加速。其估算值从 5 月的 330 亿美元升至 7 月的 413 亿美元,两个月增长约 25%。
不过,这不是两家公司披露的官方收入数据。TickerTrends 主要基于购买意向等另类数据建模推算。
TickerTrends
另类数据平台 TickerTrends 估算,Anthropic 当前年化收入达到 741 亿美元,OpenAI 为 413 亿美元。Anthropic 领先 328 亿美元,规模约为 OpenAI 的 1.79 倍。
OpenAI 近期也在加速。其估算值从 5 月的 330 亿美元升至 7 月的 413 亿美元,两个月增长约 25%。
不过,这不是两家公司披露的官方收入数据。TickerTrends 主要基于购买意向等另类数据建模推算。
TickerTrends
❤1
Vals-Smith用你的代码库考模型:谁更适合一测便知
AI 评测平台 Vals 推出 Vals-Smith。它会读取 GitHub 代码库,从已经合并的 PR 中提取真实开发任务,生成一套专属编程评测。
每道题包含问题描述、隐藏测试和可复现环境。被测模型只能看到修复前的代码,无法查看原始补丁。只有通过隐藏测试,同时不破坏原有功能,任务才算完成。
团队可以让不同模型和 Coding Agent 跑同一套题,直接比较通过率。公共榜单看谁整体更强,Vals-Smith 测的是谁更适合自己的代码库。
目前支持公开和私有仓库,但产品仍需申请候补。官网已经放出了 Linux、Next.js、Bun、Spark 等开源项目的评测结果。
Vals
AI 评测平台 Vals 推出 Vals-Smith。它会读取 GitHub 代码库,从已经合并的 PR 中提取真实开发任务,生成一套专属编程评测。
每道题包含问题描述、隐藏测试和可复现环境。被测模型只能看到修复前的代码,无法查看原始补丁。只有通过隐藏测试,同时不破坏原有功能,任务才算完成。
团队可以让不同模型和 Coding Agent 跑同一套题,直接比较通过率。公共榜单看谁整体更强,Vals-Smith 测的是谁更适合自己的代码库。
目前支持公开和私有仓库,但产品仍需申请候补。官网已经放出了 Linux、Next.js、Bun、Spark 等开源项目的评测结果。
Vals
www.vals.ai
Vals AI
Private, domain-specific benchmarks in legal, tax, and finance.
👍2
动察Beating AI News
传Claude Opus 5最快本周发布,填补Fable 5退场空档 爆料账号 leo 称,Anthropic 正在为 Claude Opus 5 做最后准备。模型最快本周发布,也可能推迟到下周。其能力预计接近 Fable 5,但运行成本更低。 Anthropic 已把 Fable 5 的订阅内使用期延长至 7 月 19 日,但暂不准备再次延期。 信源:https://x.com/synthwavedd/status/2077085180175544375
传Claude Opus 5最快今晚发布,多家供应商开始上线准备
Anthropic 可能在今晚至明晨发布 Claude Opus 5。相关模型似乎已开始在第三方供应商侧准备上线。
此前,代号「Honeycomb EAP」的未发布模型曾短暂出现在 Cursor。页面显示它支持「extra high」推理强度、逐轮控制和安全回退,随后很快下线。社区普遍猜测 Honeycomb 就是 Opus 5,但 Anthropic 没有确认。
新模型会重点提升编程、Agent、工具调用和多步推理,能力可能接近 Fable 5,同时更快、更便宜。
Anthropic 可能在今晚至明晨发布 Claude Opus 5。相关模型似乎已开始在第三方供应商侧准备上线。
此前,代号「Honeycomb EAP」的未发布模型曾短暂出现在 Cursor。页面显示它支持「extra high」推理强度、逐轮控制和安全回退,随后很快下线。社区普遍猜测 Honeycomb 就是 Opus 5,但 Anthropic 没有确认。
新模型会重点提升编程、Agent、工具调用和多步推理,能力可能接近 Fable 5,同时更快、更便宜。
🥰3
动察Beating AI News
Codex要变语音助理:前台陪聊,后台继续干活 OpenAI 正在为 Codex 准备实时语音模式。用户可以持续与它对话,同时把耗时任务交给后台 Agent 执行。 Codex 公开代码显示,相关功能已经开发数月。语音会话可以绑定现有任务线程,并通过 WebRTC 或 WebSocket 连接。后台任务运行期间,用户还能继续补充要求或调整方向。 最新曝光的 Codex 客户端资源字符串显示,实时语音界面将展示命令执行、文件修改、MCP 调用和权限审批等状态。曝光的协调提示词还提到浏览、应用、文档、购物和点餐等任务。OpenAI…
ChatGPT Voice接管桌面:说话就能控制电脑和Agent干活
OpenAI 正式把 ChatGPT Voice 接入桌面版 Work 和 Codex。用户可以用语音启动任务、查看进度,并在一场对话里协调多个 Agent。
新功能由 GPT-Live 驱动。它可以一边与用户持续对话,一边协调 App 内的后台工作。此前曝光的「前台聊天、后台干活」,今天终于正式上线。
功能已在 macOS 和 Windows 桌面 App 推出。iOS 支持配对远程接入,用户可以在手机上继续语音指挥桌面端任务。网页和手机端暂时不能独立使用 Work 或 Codex 语音。
OpenAI
OpenAI 正式把 ChatGPT Voice 接入桌面版 Work 和 Codex。用户可以用语音启动任务、查看进度,并在一场对话里协调多个 Agent。
新功能由 GPT-Live 驱动。它可以一边与用户持续对话,一边协调 App 内的后台工作。此前曝光的「前台聊天、后台干活」,今天终于正式上线。
功能已在 macOS 和 Windows 桌面 App 推出。iOS 支持配对远程接入,用户可以在手机上继续语音指挥桌面端任务。网页和手机端暂时不能独立使用 Work 或 Codex 语音。
OpenAI
😁2
TYLsemi完成4300万美元融资,要把定制AI芯片成本砍半
芯片初创 TYLsemi 完成 4300 万美元早期融资,并正式结束隐身模式。公司由两名前 Alphawave 高管创立,Matter Venture Partners 领投。
TYLsemi 想把定制 AI 芯片变成「拼积木」。客户只需开发核心计算模块,连接、供电和内存等芯粒由 TYLsemi 提供,后续从封装到量产也由其包办。
TYLsemi 称,这套方案最多可将开发成本和周期降低 50%。不过产品仍未出货,首批样品计划在 2027 年交付,客户芯片预计要到 2029 至 2030 年上市。
TYLsemi
芯片初创 TYLsemi 完成 4300 万美元早期融资,并正式结束隐身模式。公司由两名前 Alphawave 高管创立,Matter Venture Partners 领投。
TYLsemi 想把定制 AI 芯片变成「拼积木」。客户只需开发核心计算模块,连接、供电和内存等芯粒由 TYLsemi 提供,后续从封装到量产也由其包办。
TYLsemi 称,这套方案最多可将开发成本和周期降低 50%。不过产品仍未出货,首批样品计划在 2027 年交付,客户芯片预计要到 2029 至 2030 年上市。
TYLsemi
TYLsemi
TYLsemi Raises $43 Million to Launch First Full-Stack Chiplet Platform for Custom AI Silicon - TYLsemi
First production-ready chiplet portfolio spanning connectivity, power, and memory for XPUs Reduces custom AI silicon development time and cost by up to 50% from architecture to high-volume manufacturing Tier-1 customer engagements validate technology readiness…
微软自研模型落地Bing、Office,GPU成本最高降89%
微软 AI 开放 MAI-Image-2.5-Pro 和 MAI-Voice-2-Flash。前者主打高质量生图和图片编辑,后者面向客服和语音 Agent,速度提升 1 倍,价格低 32%。
普通版 MAI-Image-2.5 已全面接管 Bing Image Creator,并进入 PowerPoint 和 OneDrive。PowerPoint 的 GPU 成本较 GPT-Image-2 最多降低 84%。
MAI-Voice-2-Flash 已用于 Dynamics 365 Contact Center,GPU 成本最多降低 89%。微软没有公布这项数据的对照模型。
微软 AI
微软 AI 开放 MAI-Image-2.5-Pro 和 MAI-Voice-2-Flash。前者主打高质量生图和图片编辑,后者面向客服和语音 Agent,速度提升 1 倍,价格低 32%。
普通版 MAI-Image-2.5 已全面接管 Bing Image Creator,并进入 PowerPoint 和 OneDrive。PowerPoint 的 GPU 成本较 GPT-Image-2 最多降低 84%。
MAI-Voice-2-Flash 已用于 Dynamics 365 Contact Center,GPU 成本最多降低 89%。微软没有公布这项数据的对照模型。
微软 AI
Microsoft AI
Introducing MAI-Image-2.5-Pro and MAI-Voice-2-Flash | Microsoft AI
微软用自研模型接管Excel:常见任务效果近GPT-5.6,成本更低
微软 AI 公布两款产品专用语言模型的进展。MAI-Code-1-Flash 已用于 GitHub Copilot,另一款未命名模型已在 Excel 中运行。
微软称,Excel 模型在常见任务上的效果接近 GPT-5.6。它体积更小,可部署在 H100 和 A100 上,运行成本更低。
MAI-Code-1-Flash 已有数百万名开发者使用。其代码接受率比 GPT-5.4 Mini 和 Claude Haiku 4.5 高约 10%,Token 消耗低 10%。
微软还在用同样的方法训练 Copilot Chat、Outlook 和 PowerPoint 专用模型。
微软 AI
微软 AI 公布两款产品专用语言模型的进展。MAI-Code-1-Flash 已用于 GitHub Copilot,另一款未命名模型已在 Excel 中运行。
微软称,Excel 模型在常见任务上的效果接近 GPT-5.6。它体积更小,可部署在 H100 和 A100 上,运行成本更低。
MAI-Code-1-Flash 已有数百万名开发者使用。其代码接受率比 GPT-5.4 Mini 和 Claude Haiku 4.5 高约 10%,Token 消耗低 10%。
微软还在用同样的方法训练 Copilot Chat、Outlook 和 PowerPoint 专用模型。
微软 AI
Microsoft AI
Hill-Climbing MAI models for GitHub Copilot and Excel | Microsoft AI