Instinct 创始人什么来头?23 岁,Reflexion 一作、Sierra 早期员工
估值 25 亿美元的个人 AI 助手 Instinct,背后的创始人 Noah Shinn 今年只有 23 岁。
《华尔街日报》称,他 2023 年从 Northeastern University 退学,此前曾在 Northeastern 和 MIT 从事机器学习、编程语言研究。
Shinn 最知名的研究是 Reflexion。他是这篇 NeurIPS 2023 论文的第一作者,提出让 Agent 在失败后总结错误、形成记忆,再用于下一轮任务。论文当时在 HumanEval 上做到 91% pass@1,高于论文报告中的 GPT-4 结果 80%。
他后来又参与开发 Agent 评测 τ-bench,测试模型能否同时和用户交流、调用工具、遵守业务规则,并在多次运行中保持稳定。之后 Shinn 加入企业 AI Agent 公司 Sierra,成为最早一批员工之一,并担任 Research Scientist。
这条经历几乎一路指向今天的 Instinct:Agent 反思、工具调用、真实任务评测、企业 Agent,最后自己做个人 Agent。
Instinct 官宣后,Conviction 创始人 Sarah Guo、Altimeter 创始人 Brad Gerstner,以及前 Yandex 搜索、AI 和云业务负责人 Andrey Styskin 等人也在评论区祝贺。
信源
动察 Beating 频道 · 动察 Beating 交流群
估值 25 亿美元的个人 AI 助手 Instinct,背后的创始人 Noah Shinn 今年只有 23 岁。
《华尔街日报》称,他 2023 年从 Northeastern University 退学,此前曾在 Northeastern 和 MIT 从事机器学习、编程语言研究。
Shinn 最知名的研究是 Reflexion。他是这篇 NeurIPS 2023 论文的第一作者,提出让 Agent 在失败后总结错误、形成记忆,再用于下一轮任务。论文当时在 HumanEval 上做到 91% pass@1,高于论文报告中的 GPT-4 结果 80%。
他后来又参与开发 Agent 评测 τ-bench,测试模型能否同时和用户交流、调用工具、遵守业务规则,并在多次运行中保持稳定。之后 Shinn 加入企业 AI Agent 公司 Sierra,成为最早一批员工之一,并担任 Research Scientist。
这条经历几乎一路指向今天的 Instinct:Agent 反思、工具调用、真实任务评测、企业 Agent,最后自己做个人 Agent。
Instinct 官宣后,Conviction 创始人 Sarah Guo、Altimeter 创始人 Brad Gerstner,以及前 Yandex 搜索、AI 和云业务负责人 Andrey Styskin 等人也在评论区祝贺。
信源
动察 Beating 频道 · 动察 Beating 交流群
👍1
IBM开源Granite 4.2:3B小模型独立评测同级第2
IBM 开源新一代语言模型 Granite 4.2,一共 3B、8B 和 30B 三档。三款模型都加入原生推理,可以选择完整思考、低强度思考或直接回答,也都支持工具调用。模型权重采用 Apache 2.0 许可开放。
这次重点升级是 Agent。8B 和 30B 专门加入 Agent 强化学习,不只在数据集里做题,而是直接进入真实代码仓库、终端和网页搜索环境执行任务。写代码就看测试能不能通过,操作终端就看任务有没有真正完成,再根据结果给模型奖励。3B 没有经过这一阶段。
小模型的独立成绩反而最亮眼。Artificial Analysis 给 Granite 4.2 3B 的 Intelligence Index 打出 14 分,在 46 款同级开放权重模型中排名第 2,同级中位数只有 4 分。8B 得到 20 分,也明显高于同级中位数 9 分。
IBM 自测中,30B 在 SWE-Bench Verified 达到 57%,AIME25 为 89.17%。相比 Granite 4.1,这一代最明确的新增点不是继续堆基础能力,而是让小模型正式拥有推理,并让 8B、30B 直接在真实环境里学习怎么当 Agent。
信源
动察 Beating 频道 · 动察 Beating 交流群
IBM 开源新一代语言模型 Granite 4.2,一共 3B、8B 和 30B 三档。三款模型都加入原生推理,可以选择完整思考、低强度思考或直接回答,也都支持工具调用。模型权重采用 Apache 2.0 许可开放。
这次重点升级是 Agent。8B 和 30B 专门加入 Agent 强化学习,不只在数据集里做题,而是直接进入真实代码仓库、终端和网页搜索环境执行任务。写代码就看测试能不能通过,操作终端就看任务有没有真正完成,再根据结果给模型奖励。3B 没有经过这一阶段。
小模型的独立成绩反而最亮眼。Artificial Analysis 给 Granite 4.2 3B 的 Intelligence Index 打出 14 分,在 46 款同级开放权重模型中排名第 2,同级中位数只有 4 分。8B 得到 20 分,也明显高于同级中位数 9 分。
IBM 自测中,30B 在 SWE-Bench Verified 达到 57%,AIME25 为 89.17%。相比 Granite 4.1,这一代最明确的新增点不是继续堆基础能力,而是让小模型正式拥有推理,并让 8B、30B 直接在真实环境里学习怎么当 Agent。
信源
动察 Beating 频道 · 动察 Beating 交流群
Claude现在有两套浏览器:自己开网页,也能直接接管Chrome
Anthropic 一口气补齐了 Claude 的两套浏览器能力。Claude Cowork 桌面版现在自带独立浏览器,遇到网页任务会直接在侧边栏打开。Claude 可以自己翻网页、点击、输入和填表,不再需要安装 Chrome 插件。与此同时,Claude in Chrome 也结束测试,向所有付费套餐正式开放。
两者最大的区别是登录状态。Cowork 用的是 Claude 自己的浏览器,与用户平时的浏览器隔开,默认看不到你的标签页、书签和密码。用户可以按网站导入登录信息。Claude in Chrome 则直接操作你已经打开并登录的 Chrome,更适合处理邮箱、CRM 或正在编辑的网页。
Chrome 版这次还放开了自动操作。以前 Claude 每执行一步基本都要等用户批准,现在它会先扫描网页里有没有恶意指令,再检查准备执行的动作是否符合原任务。安全检查通过,就可以自己继续操作。Anthropic 最新红队测试中,Sonnet 5、Opus 5 都没有出现成功的提示词注入攻击,Fable 5 的成功率为 0.3%。不过官方也承认,这类风险无法彻底消除。
信源
动察 Beating 频道 · 动察 Beating 交流群
Anthropic 一口气补齐了 Claude 的两套浏览器能力。Claude Cowork 桌面版现在自带独立浏览器,遇到网页任务会直接在侧边栏打开。Claude 可以自己翻网页、点击、输入和填表,不再需要安装 Chrome 插件。与此同时,Claude in Chrome 也结束测试,向所有付费套餐正式开放。
两者最大的区别是登录状态。Cowork 用的是 Claude 自己的浏览器,与用户平时的浏览器隔开,默认看不到你的标签页、书签和密码。用户可以按网站导入登录信息。Claude in Chrome 则直接操作你已经打开并登录的 Chrome,更适合处理邮箱、CRM 或正在编辑的网页。
Chrome 版这次还放开了自动操作。以前 Claude 每执行一步基本都要等用户批准,现在它会先扫描网页里有没有恶意指令,再检查准备执行的动作是否符合原任务。安全检查通过,就可以自己继续操作。Anthropic 最新红队测试中,Sonnet 5、Opus 5 都没有出现成功的提示词注入攻击,Fable 5 的成功率为 0.3%。不过官方也承认,这类风险无法彻底消除。
信源
动察 Beating 频道 · 动察 Beating 交流群
🥰1
Anthropic训练AI查AI:不给正常案例,误报率直接冲到97%
Anthropic 研究人员尝试训练一种专门调查其他 AI 的 Agent。他们先给目标模型偷偷植入偏见、欺骗、伪造引用等隐藏行为,再让 Haiku 4.5 自己去查。Haiku 不知道答案,只能在最多 15 轮里换问题、改场景、反复测试。
训练时,研究人员也不会直接告诉 Haiku 抓对了没有。Haiku 每做完一次调查,系统就拿它和旧版 Haiku 留下的一份调查记录比较,再让提前知道答案的 Sonnet 4 判断哪一次查得更好。旧调查每 50 个训练步骤更新一次,相当于让 Haiku 不断挑战过去的自己。
但如果训练题里全是有问题的模型,Haiku 很快就会学歪。为了拿奖励,它开始默认所有模型都有问题,部分方案面对正常模型时,误报率接近 97%。后来研究人员把一半训练任务换成完全正常的模型,只有查完后正确判断目标模型没问题,才能拿到高奖励。
训练后的 Haiku 也确实开始换了一种查法。它会主动换场景、控制变量、比较前后回答,而不是一上来就逼模型认错。最终综合审计得分从 44.2 提高到 48.7,基本追平 Opus 4.6 的 48.4。换到更难、会主动隐藏异常行为的 AuditBench,检测率也从 11.5% 提高到最高 28.1%。
信源
动察 Beating 频道 · 动察 Beating 交流群
Anthropic 研究人员尝试训练一种专门调查其他 AI 的 Agent。他们先给目标模型偷偷植入偏见、欺骗、伪造引用等隐藏行为,再让 Haiku 4.5 自己去查。Haiku 不知道答案,只能在最多 15 轮里换问题、改场景、反复测试。
训练时,研究人员也不会直接告诉 Haiku 抓对了没有。Haiku 每做完一次调查,系统就拿它和旧版 Haiku 留下的一份调查记录比较,再让提前知道答案的 Sonnet 4 判断哪一次查得更好。旧调查每 50 个训练步骤更新一次,相当于让 Haiku 不断挑战过去的自己。
但如果训练题里全是有问题的模型,Haiku 很快就会学歪。为了拿奖励,它开始默认所有模型都有问题,部分方案面对正常模型时,误报率接近 97%。后来研究人员把一半训练任务换成完全正常的模型,只有查完后正确判断目标模型没问题,才能拿到高奖励。
训练后的 Haiku 也确实开始换了一种查法。它会主动换场景、控制变量、比较前后回答,而不是一上来就逼模型认错。最终综合审计得分从 44.2 提高到 48.7,基本追平 Opus 4.6 的 48.4。换到更难、会主动隐藏异常行为的 AuditBench,检测率也从 11.5% 提高到最高 28.1%。
信源
动察 Beating 频道 · 动察 Beating 交流群
给 Agent 克隆 Slack 和 GitHub,Arga Labs 融资 1000 万美元
Arga Labs 完成 1000 万美元种子轮融资,由 General Catalyst 领投,BoxGroup、Emergence、Gradient 和 SV Angel 等参投。这家只有 4 人的 YC 创业公司,专门给 AI Agent 搭测试沙盒(与真实系统隔开的测试环境)。它会复制 Slack、GitHub、Salesforce、Stripe 等软件,让 Agent 上线前先在里面反复操作。
传统测试通常只是伪造几个 API 返回结果,很多意外情况覆盖不到。Arga 则会连软件里的数据状态、账号权限、Webhook 和报错情况一起复制。比如销售 Agent 可以同时操作测试版 Salesforce 和 HubSpot,看它会不会认出两个联系人来自同一家公司,避免重复发邮件。
目前 Arga 已支持 30 多种软件。官方称,现在最快不到 12 小时就能复制一个 SaaS 的后端行为。过去 16 周,客户已经启动超过 10 万个测试环境,Slash、Monaco、Y Combinator 等团队都在使用。
新融资会继续砸在自动造环境上。Arga 正在开发新的生成系统,想把复制一个 SaaS 的时间从几小时压到几分钟。最终它希望做到,Agent 自己发现一个新 API 后,系统就能自动生成对应的测试环境,让 Agent 先在里面反复试错,再真正接触生产系统。
信源
动察 Beating 频道 · 动察 Beating 交流群
Arga Labs 完成 1000 万美元种子轮融资,由 General Catalyst 领投,BoxGroup、Emergence、Gradient 和 SV Angel 等参投。这家只有 4 人的 YC 创业公司,专门给 AI Agent 搭测试沙盒(与真实系统隔开的测试环境)。它会复制 Slack、GitHub、Salesforce、Stripe 等软件,让 Agent 上线前先在里面反复操作。
传统测试通常只是伪造几个 API 返回结果,很多意外情况覆盖不到。Arga 则会连软件里的数据状态、账号权限、Webhook 和报错情况一起复制。比如销售 Agent 可以同时操作测试版 Salesforce 和 HubSpot,看它会不会认出两个联系人来自同一家公司,避免重复发邮件。
目前 Arga 已支持 30 多种软件。官方称,现在最快不到 12 小时就能复制一个 SaaS 的后端行为。过去 16 周,客户已经启动超过 10 万个测试环境,Slash、Monaco、Y Combinator 等团队都在使用。
新融资会继续砸在自动造环境上。Arga 正在开发新的生成系统,想把复制一个 SaaS 的时间从几小时压到几分钟。最终它希望做到,Agent 自己发现一个新 API 后,系统就能自动生成对应的测试环境,让 Agent 先在里面反复试错,再真正接触生产系统。
信源
动察 Beating 频道 · 动察 Beating 交流群
Hugging Face开源399美元机器鸭:摔倒自己爬起,还能重新训练
Hugging Face 旗下开源机器人公司 Pollen Robotics 发布 Microduck,一台售价 399 美元的双足机器人。它只有 25 厘米高、约 800 克,却塞进了 15 个电机、摄像头、LiDAR 和两个 IMU。开箱就会走路、坐下、抓东西、踢球,摔倒后还能自己爬起来,装上滚轮甚至可以滑行。
Microduck 的动作可以自己重新训练。用户先在 MuJoCo 物理模拟器里用强化学习训练动作,再把训练好的策略放进真机。SDK、模拟器和完整强化学习训练栈都已经开源,整套软件采用 Apache 2.0 许可。
Microduck 现已开放预订,首批计划在 2026 年圣诞节前发货。
信源
动察 Beating 频道 · 动察 Beating 交流群
Hugging Face 旗下开源机器人公司 Pollen Robotics 发布 Microduck,一台售价 399 美元的双足机器人。它只有 25 厘米高、约 800 克,却塞进了 15 个电机、摄像头、LiDAR 和两个 IMU。开箱就会走路、坐下、抓东西、踢球,摔倒后还能自己爬起来,装上滚轮甚至可以滑行。
Microduck 的动作可以自己重新训练。用户先在 MuJoCo 物理模拟器里用强化学习训练动作,再把训练好的策略放进真机。SDK、模拟器和完整强化学习训练栈都已经开源,整套软件采用 Apache 2.0 许可。
Microduck 现已开放预订,首批计划在 2026 年圣诞节前发货。
信源
动察 Beating 频道 · 动察 Beating 交流群
美国拟向G20输出AI监管路线:马斯克、奥特曼、黄仁勋都来了
美国准备在下周的 G20 创新部长会上,把自己的「轻监管 AI」路线推向更多国家。马斯克、David Sacks、Sam Altman 和黄仁勋都将出席。会议将于 9 月 1 日至 2 日在美国北卡罗来纳州举行,20 多个国家的科技和贸易官员将参加。彭博称,马斯克和 Sacks 第一天线上发言,Altman 和黄仁勋第二天出场。
美国希望 G20 成员接受更宽松的科技监管:不要专门新建监管机构,尽量由现有行业监管部门负责,同时让政府和企业一起测试 AI 等新技术。这份名为「Carolina Principles」的框架没有法律约束力。如果成员国达成共识,这套原则会写进联合声明,再交给 12 月的 G20 领导人峰会讨论。
这套思路几乎就是特朗普政府国内 AI 政策的国际版。白宫今年 3 月已经明确提出,不新设联邦 AI 规则制定机构,改由现有行业监管部门和行业标准管理,同时尽量减少阻碍 AI 部署的监管。现在,美国准备把同一套规则推广到 G20。
信源
动察 Beating 频道 · 动察 Beating 交流群
美国准备在下周的 G20 创新部长会上,把自己的「轻监管 AI」路线推向更多国家。马斯克、David Sacks、Sam Altman 和黄仁勋都将出席。会议将于 9 月 1 日至 2 日在美国北卡罗来纳州举行,20 多个国家的科技和贸易官员将参加。彭博称,马斯克和 Sacks 第一天线上发言,Altman 和黄仁勋第二天出场。
美国希望 G20 成员接受更宽松的科技监管:不要专门新建监管机构,尽量由现有行业监管部门负责,同时让政府和企业一起测试 AI 等新技术。这份名为「Carolina Principles」的框架没有法律约束力。如果成员国达成共识,这套原则会写进联合声明,再交给 12 月的 G20 领导人峰会讨论。
这套思路几乎就是特朗普政府国内 AI 政策的国际版。白宫今年 3 月已经明确提出,不新设联邦 AI 规则制定机构,改由现有行业监管部门和行业标准管理,同时尽量减少阻碍 AI 部署的监管。现在,美国准备把同一套规则推广到 G20。
信源
动察 Beating 频道 · 动察 Beating 交流群
💩3❤1
美媒:特朗普政府关于新AI监管机构的行政命令停滞不前
据 The Information 报道,特朗普政府近期推动的、旨在成立新的人工智能自律监管组织的行政命令目前陷入停滞。知情人士称,白宫近几周已在内部流转相关行政命令草案,但该计划尚未取得进一步进展。
此前特朗普政府一直推动建立统一的 AI 监管框架,并限制各州制定相互冲突的 AI 监管规则。此次新监管机构计划若持续搁置,可能进一步延缓美国联邦层面的 AI 行业监管体系建设。
动察 Beating 频道 · 动察 Beating 交流群
据 The Information 报道,特朗普政府近期推动的、旨在成立新的人工智能自律监管组织的行政命令目前陷入停滞。知情人士称,白宫近几周已在内部流转相关行政命令草案,但该计划尚未取得进一步进展。
此前特朗普政府一直推动建立统一的 AI 监管框架,并限制各州制定相互冲突的 AI 监管规则。此次新监管机构计划若持续搁置,可能进一步延缓美国联邦层面的 AI 行业监管体系建设。
动察 Beating 频道 · 动察 Beating 交流群
Anthropic计划在9月7日后公开披露招股说明书
Anthropic 正考虑让部分现有股东直接在 IPO 中出售手里的老股。与此同时,公司还在考虑把至少一部分股东的锁定期拉到 180 天以上。锁定期就是公司上市后,老股东暂时不能卖股的一段时间。目前谁能卖、能卖多少,都还没有确定。
资本市场律师解释,这样可以让老股东先套现一部分,再把剩下的股份锁得更久。老股也可以直接在 IPO 里统一配售给机构投资者,减少上市后集中抛售的压力。但如果高管和早期投资者卖得太多,也可能被市场理解为内部人急着退出。
Anthropic 还在考虑更严格的员工卖股规则。普通员工上市后可能也要使用 10b5-1 交易计划,也就是提前定好什么时候卖、卖多少,不能再自己挑时间。这套制度通常主要用于高管和董事。
Anthropic 计划在美国劳动节后公开 IPO 招股书,9 月中旬举行投资者日,最早 9 月底或 10 月初上市。融资规模有望超过 SpaceX 今年 6 月 IPO 募得的 860 亿美元。
信源
动察 Beating 频道 · 动察 Beating 交流群
Anthropic 正考虑让部分现有股东直接在 IPO 中出售手里的老股。与此同时,公司还在考虑把至少一部分股东的锁定期拉到 180 天以上。锁定期就是公司上市后,老股东暂时不能卖股的一段时间。目前谁能卖、能卖多少,都还没有确定。
资本市场律师解释,这样可以让老股东先套现一部分,再把剩下的股份锁得更久。老股也可以直接在 IPO 里统一配售给机构投资者,减少上市后集中抛售的压力。但如果高管和早期投资者卖得太多,也可能被市场理解为内部人急着退出。
Anthropic 还在考虑更严格的员工卖股规则。普通员工上市后可能也要使用 10b5-1 交易计划,也就是提前定好什么时候卖、卖多少,不能再自己挑时间。这套制度通常主要用于高管和董事。
Anthropic 计划在美国劳动节后公开 IPO 招股书,9 月中旬举行投资者日,最早 9 月底或 10 月初上市。融资规模有望超过 SpaceX 今年 6 月 IPO 募得的 860 亿美元。
信源
动察 Beating 频道 · 动察 Beating 交流群
🙈3
Anthropic放弃70亿美元收购MatX,转而探索定制芯片合作方案
8 月 28 日,据路透社报道,Anthropic 曾计划以 70 亿美元收购 AI 芯片初创公司 MatX,但最终放弃了这一计划。
MatX 目前正寻求约 40 亿美元新融资。Anthropic 现正与多家芯片初创公司展开会谈,计划通过自研定制芯片加速旗下 AI 模型 Claude 的硬件开发进程,以降低对英伟达(Nvidia)芯片的依赖。
信源
动察 Beating 频道 · 动察 Beating 交流群
8 月 28 日,据路透社报道,Anthropic 曾计划以 70 亿美元收购 AI 芯片初创公司 MatX,但最终放弃了这一计划。
MatX 目前正寻求约 40 亿美元新融资。Anthropic 现正与多家芯片初创公司展开会谈,计划通过自研定制芯片加速旗下 AI 模型 Claude 的硬件开发进程,以降低对英伟达(Nvidia)芯片的依赖。
信源
动察 Beating 频道 · 动察 Beating 交流群
🤡5
OpenAI联合Anthropic等100多家公司警告:AI网络攻击未来几个月会明显升级
OpenAI、Anthropic、谷歌、微软、AWS 等 100 多家公司联合发出一封公开信,呼吁尽快加强网络防御。Cloudflare、CrowdStrike、Cisco、Visa、Oracle 等公司也在名单里。
这些公司判断,未来几个月,AI 会让网络攻击变得更多,也更难防。医院、水厂、互联网基础设施等系统风险尤其高。以前攻击者要自己花时间找漏洞、写攻击工具,现在很多工作可以交给 AI,发动攻击的门槛正在下降。
公开信也给出了几项具体建议。企业要尽快补高危漏洞,安全公司多共享攻击情报,政府给医院、水务等关键设施更多资金和技术支持。OpenAI、Anthropic 这类 AI 公司则要把模型、工具和培训开放给防守方,让安全人员也能用 AI 找漏洞、修漏洞。
信源
动察 Beating 频道 · 动察 Beating 交流群
OpenAI、Anthropic、谷歌、微软、AWS 等 100 多家公司联合发出一封公开信,呼吁尽快加强网络防御。Cloudflare、CrowdStrike、Cisco、Visa、Oracle 等公司也在名单里。
这些公司判断,未来几个月,AI 会让网络攻击变得更多,也更难防。医院、水厂、互联网基础设施等系统风险尤其高。以前攻击者要自己花时间找漏洞、写攻击工具,现在很多工作可以交给 AI,发动攻击的门槛正在下降。
公开信也给出了几项具体建议。企业要尽快补高危漏洞,安全公司多共享攻击情报,政府给医院、水务等关键设施更多资金和技术支持。OpenAI、Anthropic 这类 AI 公司则要把模型、工具和培训开放给防守方,让安全人员也能用 AI 找漏洞、修漏洞。
信源
动察 Beating 频道 · 动察 Beating 交流群
TIME评2026 AI百人:黄仁勋、梁文锋没上榜,杨植麟首次入选
《时代》公布 2026 年 TIME100 AI,这是这份 AI 百大人物榜的第四届。去年还在「领导者」里的英伟达 CEO 黄仁勋和 DeepSeek CEO 梁文锋,今年都没有上榜。
月之暗面杨植麟则首次进入「创新者」,《时代》总编辑 Sam Jacobs 还专门点名他,称月之暗面的模型过去一年获得了「非同寻常的关注」,有时甚至超过美国最先进的竞争对手。
今年「领导者」里,OpenAI 的 Sam Altman、Mark Chen 和 Greg Brockman 三人共同上榜,Anthropic 的 Dario 和 Daniela Amodei 也一起入选。中国公司方面,字节跳动、阿里、华为、中芯国际、月之暗面、智谱、Manus、智元机器人和比亚迪都有人上榜。
今年的新面孔里,Agent 和 AI 工具创业者很多。Cursor CEO Michael Truell、OpenClaw 作者 Peter Steinberger、Manus 创始人肖弘都进入「创新者」。
最意外的可能还是本·阿弗莱克。这个演过蝙蝠侠的好莱坞演员也被列入「创新者」。他创办的 InterPositive 用 AI 帮电影做后期制作。今年 3 月 Netflix 将其收购,后来披露现金收购价约 5.87 亿美元,阿弗莱克也加入 Netflix 担任高级顾问。
信源
动察 Beating 频道 · 动察 Beating 交流群
《时代》公布 2026 年 TIME100 AI,这是这份 AI 百大人物榜的第四届。去年还在「领导者」里的英伟达 CEO 黄仁勋和 DeepSeek CEO 梁文锋,今年都没有上榜。
月之暗面杨植麟则首次进入「创新者」,《时代》总编辑 Sam Jacobs 还专门点名他,称月之暗面的模型过去一年获得了「非同寻常的关注」,有时甚至超过美国最先进的竞争对手。
今年「领导者」里,OpenAI 的 Sam Altman、Mark Chen 和 Greg Brockman 三人共同上榜,Anthropic 的 Dario 和 Daniela Amodei 也一起入选。中国公司方面,字节跳动、阿里、华为、中芯国际、月之暗面、智谱、Manus、智元机器人和比亚迪都有人上榜。
今年的新面孔里,Agent 和 AI 工具创业者很多。Cursor CEO Michael Truell、OpenClaw 作者 Peter Steinberger、Manus 创始人肖弘都进入「创新者」。
最意外的可能还是本·阿弗莱克。这个演过蝙蝠侠的好莱坞演员也被列入「创新者」。他创办的 InterPositive 用 AI 帮电影做后期制作。今年 3 月 Netflix 将其收购,后来披露现金收购价约 5.87 亿美元,阿弗莱克也加入 Netflix 担任高级顾问。
信源
动察 Beating 频道 · 动察 Beating 交流群
👍3❤1😁1
Anthropic告赢五角大楼:封杀Claude被判「违法且毫无依据」
Anthropic 打赢了与五角大楼的这轮官司。美国联邦法官 Rita Lin 裁定,政府把 Anthropic 列为「供应链风险」、要求联邦机构停用 Claude,并限制国防承包商与其合作的做法违法。法院认定,这些措施是在报复 Anthropic 对政府 AI 政策的公开批评。
判决对政府提交的证据批得很重。整套措施的理由只有一份 4 页备忘录,而且这份文件晚于三项措施中的两项。政府此前还担心 Anthropic 部署模型后能通过「后门」修改它,但庭审材料确认 Anthropic 没有这种权限。法官认为,政府真正剩下的理由只是「不信任」Anthropic,并想拿它公开立威。
这场冲突最初来自 Claude 的军事使用限制。Anthropic 坚持不能把模型用于大规模监控美国人和全自主武器,五角大楼则要求能用于所有合法用途。法院同时明确,判决不强迫军方继续使用 Claude。五角大楼仍可以依法换供应商,只是不能再靠这套「供应链风险」理由封杀 Anthropic。
信源
动察 Beating 频道 · 动察 Beating 交流群
Anthropic 打赢了与五角大楼的这轮官司。美国联邦法官 Rita Lin 裁定,政府把 Anthropic 列为「供应链风险」、要求联邦机构停用 Claude,并限制国防承包商与其合作的做法违法。法院认定,这些措施是在报复 Anthropic 对政府 AI 政策的公开批评。
判决对政府提交的证据批得很重。整套措施的理由只有一份 4 页备忘录,而且这份文件晚于三项措施中的两项。政府此前还担心 Anthropic 部署模型后能通过「后门」修改它,但庭审材料确认 Anthropic 没有这种权限。法官认为,政府真正剩下的理由只是「不信任」Anthropic,并想拿它公开立威。
这场冲突最初来自 Claude 的军事使用限制。Anthropic 坚持不能把模型用于大规模监控美国人和全自主武器,五角大楼则要求能用于所有合法用途。法院同时明确,判决不强迫军方继续使用 Claude。五角大楼仍可以依法换供应商,只是不能再靠这套「供应链风险」理由封杀 Anthropic。
信源
动察 Beating 频道 · 动察 Beating 交流群
😁2
OpenAI开始自己当VC:4亿美元押注下一代AI公司
OpenAI 启动第二支 Startup Fund,规模 4 亿美元,这次全部由 OpenAI 自己出钱。
第一支基金 2021 年募得 1.75 亿美元,钱来自微软等外部投资者,OpenAI 自己没有出资。当时 OpenAI 可以分到部分投资利润,但大部分经济收益归出资的 LP(基金投资人)。现在 OpenAI 自己包下第二支基金,投资赚到的钱也不再主要流向外部 LP。
首期基金已经投了 24 家公司,包括 Cursor 和法律 AI 公司 Harvey,目前资金已经全部投完。Cursor 本月刚被 SpaceX 收购,交易对应 600 亿美元隐含股权价值。
新基金仍然主要投早期 AI 公司,计划每年投 8 到 10 家,目标是直接领投。单笔投资从几百万美元起,通常最高 5000 万美元,合适的项目可以投到 1 亿美元。
过去 OpenAI Startup Fund 虽然挂着 OpenAI 的名字,用的主要却是外部投资人的钱。现在第一支基金投出了成绩,OpenAI 干脆自己拿 4 亿美元继续投,风险自己扛,投资回报也更多留给自己。
信源
动察 Beating 频道 · 动察 Beating 交流群
OpenAI 启动第二支 Startup Fund,规模 4 亿美元,这次全部由 OpenAI 自己出钱。
第一支基金 2021 年募得 1.75 亿美元,钱来自微软等外部投资者,OpenAI 自己没有出资。当时 OpenAI 可以分到部分投资利润,但大部分经济收益归出资的 LP(基金投资人)。现在 OpenAI 自己包下第二支基金,投资赚到的钱也不再主要流向外部 LP。
首期基金已经投了 24 家公司,包括 Cursor 和法律 AI 公司 Harvey,目前资金已经全部投完。Cursor 本月刚被 SpaceX 收购,交易对应 600 亿美元隐含股权价值。
新基金仍然主要投早期 AI 公司,计划每年投 8 到 10 家,目标是直接领投。单笔投资从几百万美元起,通常最高 5000 万美元,合适的项目可以投到 1 亿美元。
过去 OpenAI Startup Fund 虽然挂着 OpenAI 的名字,用的主要却是外部投资人的钱。现在第一支基金投出了成绩,OpenAI 干脆自己拿 4 亿美元继续投,风险自己扛,投资回报也更多留给自己。
信源
动察 Beating 频道 · 动察 Beating 交流群
🥰1
OpenAI测试Codex持续运行模式:任务做完还能继续跟进
OpenAI 正在测试 Codex 的 Persistent mode,也就是持续运行模式。普通 Agent 完成一次任务后通常就会停止,而这个模式可以让 Codex 完成当前任务后,继续检查和处理后续事项。相关代码已经出现在 Codex 的公开仓库中,但 OpenAI 表示近期没有上线计划。
信源
动察 Beating 频道 · 动察 Beating 交流群
OpenAI 正在测试 Codex 的 Persistent mode,也就是持续运行模式。普通 Agent 完成一次任务后通常就会停止,而这个模式可以让 Codex 完成当前任务后,继续检查和处理后续事项。相关代码已经出现在 Codex 的公开仓库中,但 OpenAI 表示近期没有上线计划。
信源
动察 Beating 频道 · 动察 Beating 交流群
👍2
Devin年化收入9亿美元,Cognition今年可能烧掉8亿
AI 编程 Agent Devin 背后的 Cognition,年化收入已经达到约 9 亿美元。按现在每月约 7500 万美元的收入计算,比今年年初增长超过 3 倍。公司还在进行新一轮融资,估值可能达到约 450 亿美元。
增长速度还在加快。今年 5 月融资时,Cognition 公布的年化收入还是 4.92 亿美元,估值 260 亿美元。短短三个月,年化收入又涨了约 83%。
但 Cognition 也非常烧钱。《The Information》称,公司今年可能消耗约 8 亿美元现金,光第二季度就烧掉约 2 亿美元。很大一部分钱花在算力上。Cognition 租了大规模英伟达服务器,一边运行 Devin,一边训练自己的模型,这套服务器每年就要花数亿美元。
目前 Cognition 的企业业务毛利率接近 50%。如果不算自研模型的训练投入,公司已经接近不再烧钱。管理层预计,今年底年化收入会超过 15 亿美元,明年达到 40 亿至 50 亿美元。
信源
动察 Beating 频道 · 动察 Beating 交流群
AI 编程 Agent Devin 背后的 Cognition,年化收入已经达到约 9 亿美元。按现在每月约 7500 万美元的收入计算,比今年年初增长超过 3 倍。公司还在进行新一轮融资,估值可能达到约 450 亿美元。
增长速度还在加快。今年 5 月融资时,Cognition 公布的年化收入还是 4.92 亿美元,估值 260 亿美元。短短三个月,年化收入又涨了约 83%。
但 Cognition 也非常烧钱。《The Information》称,公司今年可能消耗约 8 亿美元现金,光第二季度就烧掉约 2 亿美元。很大一部分钱花在算力上。Cognition 租了大规模英伟达服务器,一边运行 Devin,一边训练自己的模型,这套服务器每年就要花数亿美元。
目前 Cognition 的企业业务毛利率接近 50%。如果不算自研模型的训练投入,公司已经接近不再烧钱。管理层预计,今年底年化收入会超过 15 亿美元,明年达到 40 亿至 50 亿美元。
信源
动察 Beating 频道 · 动察 Beating 交流群
腾讯混元Hy4开源:7700亿总参数、100万上下文
腾讯发布并开源 Hy4 preview,新模型采用 MoE 架构,总参数 770B,每次激活 49B,上下文扩到 1M。相比 Hy3 的 295B 总参数、21B 激活参数和 256K 上下文,这一代规模直接翻了两倍多,长上下文也扩大到约 4 倍。
腾讯这次没有只强调通用跑分,而是专门强化代码、办公、游戏和科研等真实任务。比如模型可以从零搭建 Three.js 3D 网站,在 Unity 里制作可玩的游戏 Demo,也能一次处理 72 份财务文件,检查重复报销、额度超限和预算异常。Hy4 还与 WorkBuddy、CodeBuddy 等腾讯产品一起训练和迭代。
更特别的一点是,Hy4 已经开始参与自己的研发。腾讯称,它会帮助优化训练方法、数据策略、评测体系和底层算子,自己提出方案、运行实验,再根据结果继续调整。实验产生的代码、日志和反馈又会进入下一轮研发,已经形成初步的自我改进循环。
Hy4 preview 已接入 WorkBuddy、CodeBuddy、元宝、ima、腾讯云 TokenHub 和 OpenRouter。腾讯此前在财报中就预告 Hy4 会比 Hy3 更大,并把真实产品反馈作为模型训练的重要来源。
信源
动察 Beating 频道 · 动察 Beating 交流群
腾讯发布并开源 Hy4 preview,新模型采用 MoE 架构,总参数 770B,每次激活 49B,上下文扩到 1M。相比 Hy3 的 295B 总参数、21B 激活参数和 256K 上下文,这一代规模直接翻了两倍多,长上下文也扩大到约 4 倍。
腾讯这次没有只强调通用跑分,而是专门强化代码、办公、游戏和科研等真实任务。比如模型可以从零搭建 Three.js 3D 网站,在 Unity 里制作可玩的游戏 Demo,也能一次处理 72 份财务文件,检查重复报销、额度超限和预算异常。Hy4 还与 WorkBuddy、CodeBuddy 等腾讯产品一起训练和迭代。
更特别的一点是,Hy4 已经开始参与自己的研发。腾讯称,它会帮助优化训练方法、数据策略、评测体系和底层算子,自己提出方案、运行实验,再根据结果继续调整。实验产生的代码、日志和反馈又会进入下一轮研发,已经形成初步的自我改进循环。
Hy4 preview 已接入 WorkBuddy、CodeBuddy、元宝、ima、腾讯云 TokenHub 和 OpenRouter。腾讯此前在财报中就预告 Hy4 会比 Hy3 更大,并把真实产品反馈作为模型训练的重要来源。
信源
动察 Beating 频道 · 动察 Beating 交流群
😁3
腾讯Hy4盲测压过GLM-5.3、Kimi K3,输出价最低便宜82%
腾讯还专门公布了一组 Hy4 preview 的真实工程盲测。163 名腾讯内部专家拿 203 个工程任务测试不同模型,Hy4 最终平均拿到 2.99/4,高于 GLM-5.3 的 2.92/4 和 Kimi K3 的 2.94/4。
具体来看,Hy4 对 GLM-5.3 的胜率为 46.8%,打平 12.8%,负率 40.4%;对 Kimi K3 的胜率为 51.2%,打平 7.9%,负率 40.9%。这些题目来自腾讯内部真实工程任务,不是传统的固定 Benchmark。
不过 Hy4 并没有在公开跑分中全面领先。从腾讯公布的评测结果看,它和 GLM-5.3、Kimi K3 等模型各有胜负,DeepSWE、CyberGym 等代码和网络安全测试仍落后 GLM-5.3。
价格是 Hy4 最明显的优势。每百万 Tokens 输入 6 元、输出 18 元,分别比 GLM-5.3 便宜 25% 和约 36%;相比 Kimi K3,更是便宜 70% 和 82%。缓存命中只要 0.3 元,也比 GLM-5.3 和 Kimi K3 的 2 元便宜 85%。
动察 Beating 频道 · 动察 Beating 交流群
腾讯还专门公布了一组 Hy4 preview 的真实工程盲测。163 名腾讯内部专家拿 203 个工程任务测试不同模型,Hy4 最终平均拿到 2.99/4,高于 GLM-5.3 的 2.92/4 和 Kimi K3 的 2.94/4。
具体来看,Hy4 对 GLM-5.3 的胜率为 46.8%,打平 12.8%,负率 40.4%;对 Kimi K3 的胜率为 51.2%,打平 7.9%,负率 40.9%。这些题目来自腾讯内部真实工程任务,不是传统的固定 Benchmark。
不过 Hy4 并没有在公开跑分中全面领先。从腾讯公布的评测结果看,它和 GLM-5.3、Kimi K3 等模型各有胜负,DeepSWE、CyberGym 等代码和网络安全测试仍落后 GLM-5.3。
价格是 Hy4 最明显的优势。每百万 Tokens 输入 6 元、输出 18 元,分别比 GLM-5.3 便宜 25% 和约 36%;相比 Kimi K3,更是便宜 70% 和 82%。缓存命中只要 0.3 元,也比 GLM-5.3 和 Kimi K3 的 2 元便宜 85%。
动察 Beating 频道 · 动察 Beating 交流群
💩8
软银寻求再获100亿美元贷款,用于OpenAI股权投资
软银集团正在寻求一笔 100 亿美元的贷款,以帮助为其投资的 OpenAI 所背负的债务进行再融资。该贷款将是软银近期围绕 OpenAI 投资展开的一系列债务融资活动之一,其中包括一项可能高达 200 亿美元的债券发行。贷款所得款项可能部分用于偿还今年早些时候为 OpenAI 投资获得的 400 亿美元过桥贷款。
动察 Beating 频道 · 动察 Beating 交流群
软银集团正在寻求一笔 100 亿美元的贷款,以帮助为其投资的 OpenAI 所背负的债务进行再融资。该贷款将是软银近期围绕 OpenAI 投资展开的一系列债务融资活动之一,其中包括一项可能高达 200 亿美元的债券发行。贷款所得款项可能部分用于偿还今年早些时候为 OpenAI 投资获得的 400 亿美元过桥贷款。
动察 Beating 频道 · 动察 Beating 交流群
🤡4👎2
腾讯混元Hy4重做底层:DeepSeek稀疏注意力+智谱IndexCache一起上
腾讯混元 Hy4 preview 这次除了把模型做大,底层架构也大改了一轮。上一代 Hy3 使用传统全注意力,Hy4 改成了 Gated DSA,也就是 DeepSeek Sparse Attention 的门控版本。模型面对超长文本时,不再把前面所有内容都重新算一遍,而是先挑出最相关的部分重点处理。
Hy4 还给 DSA 加上了 IndexCache。模型每一层原本都要重新判断「哪些内容最重要」,现在部分层可以直接复用前面已经挑好的结果,少做很多重复计算。
腾讯明确表示,这套设计受到 DeepSeek 和 GLM 启发。
另一处变化是残差结构。传统 Transformer 可以粗略理解成只有一条信息主干,Hy4 用 iHC 把它扩成了 4 条,让模型在很深的网络里能同时保留更多信息。MoE 专家数量也从 Hy3 的 192 个增加到 256 个路由专家 + 1 个共享专家,每个 Token 选择 8 个路由专家,同时始终经过共享专家。
信源
动察 Beating 频道 · 动察 Beating 交流群
腾讯混元 Hy4 preview 这次除了把模型做大,底层架构也大改了一轮。上一代 Hy3 使用传统全注意力,Hy4 改成了 Gated DSA,也就是 DeepSeek Sparse Attention 的门控版本。模型面对超长文本时,不再把前面所有内容都重新算一遍,而是先挑出最相关的部分重点处理。
Hy4 还给 DSA 加上了 IndexCache。模型每一层原本都要重新判断「哪些内容最重要」,现在部分层可以直接复用前面已经挑好的结果,少做很多重复计算。
腾讯明确表示,这套设计受到 DeepSeek 和 GLM 启发。
另一处变化是残差结构。传统 Transformer 可以粗略理解成只有一条信息主干,Hy4 用 iHC 把它扩成了 4 条,让模型在很深的网络里能同时保留更多信息。MoE 专家数量也从 Hy3 的 192 个增加到 256 个路由专家 + 1 个共享专家,每个 Token 选择 8 个路由专家,同时始终经过共享专家。
信源
动察 Beating 频道 · 动察 Beating 交流群
👍7🐳2
中国人民银行把AI铸进法定货币:首套人工智能金银币9月发行
中国人民银行将发行「科创未来(人工智能)」金银纪念币,一套共 3 枚,包括 1 枚金币和 2 枚银币,均为法定货币。金币重 5 克,做成 18 毫米见方,背面画有芯片、脑形电路和 0、1 等元素。两枚银币各重 15 克,分别采用人脸、电路、螺旋点阵,以及钥匙和人工智能符号等设计。
金币面额 80 元,最大发行 1 万枚;两枚银币面额均为 5 元,各最多发行 2 万枚。这里的面额并不是售价。贵金属纪念币的面额主要用于表明其法定货币身份,实际售价还要看金银原料和制作成本等。
今年 3 月征集币面设计稿时,主办方明确允许设计者使用 AI 工具辅助创作,但禁止直接拿 AI 生成内容投稿。当时给三枚币定下的方向,分别是人工智能基础研究、科技向善,以及「人工智能+」在各行业的应用。
信源
动察 Beating 频道 · 动察 Beating 交流群
中国人民银行将发行「科创未来(人工智能)」金银纪念币,一套共 3 枚,包括 1 枚金币和 2 枚银币,均为法定货币。金币重 5 克,做成 18 毫米见方,背面画有芯片、脑形电路和 0、1 等元素。两枚银币各重 15 克,分别采用人脸、电路、螺旋点阵,以及钥匙和人工智能符号等设计。
金币面额 80 元,最大发行 1 万枚;两枚银币面额均为 5 元,各最多发行 2 万枚。这里的面额并不是售价。贵金属纪念币的面额主要用于表明其法定货币身份,实际售价还要看金银原料和制作成本等。
今年 3 月征集币面设计稿时,主办方明确允许设计者使用 AI 工具辅助创作,但禁止直接拿 AI 生成内容投稿。当时给三枚币定下的方向,分别是人工智能基础研究、科技向善,以及「人工智能+」在各行业的应用。
信源
动察 Beating 频道 · 动察 Beating 交流群
🤡5😇4🥰1