美调查博主称Anthropic资金网络推动「AI末日论」,呼吁美国国会调查
美国调查博主 Kevin Bass 发文称,其对 Anthropic 财务关系进行审查后发现,该公司可能通过资金网络影响 AI 安全评估机构及推动「AI 末日论」的相关组织,并呼吁美国国会对此展开调查。
Bass 重点提到 AI 安全评估机构 METR。他称,Anthropic 联合创始人兼 CEO Dario Amodei 此前提出由第三方机构评估 AI 模型风险,并建议采用 METR,但 METR 及其关联组织的资金与 Anthropic 存在间接联系。Bass 称,Dustin Moskovitz 持有的 Anthropic 股份被投入 Good Ventures Foundation,而该基金会是相关生态的重要资助方;这部分 Anthropic 股份的价值已从去年初约 5 亿美元增长至目前超过 77 亿美元。
Bass 进一步指称,与 METR 存在资金联系的组织还资助 Tarbell Center 等推动 AI 风险和「AI 末日」叙事的机构,相关内容曾发表于 The Verge、Science、洛杉矶时报、The Dispatch 和 TIME 等媒体。他认为,这种资金结构可能导致相关机构缺乏评估 Anthropic 模型的独立性,并形成「Anthropic 发展壮大—AI 风险叙事扩大—监管需求增加—相关机构获得更多资金」的反馈循环。
Bass 表示,上述资金关系及其影响需要进一步调查,并称将在后续帖子中公布相关证据及 GitHub 资料,最终呼吁美国国会对 Anthropic 及其关联资金网络展开调查。
信源
动察 Beating 频道 · 动察 Beating 交流群
美国调查博主 Kevin Bass 发文称,其对 Anthropic 财务关系进行审查后发现,该公司可能通过资金网络影响 AI 安全评估机构及推动「AI 末日论」的相关组织,并呼吁美国国会对此展开调查。
Bass 重点提到 AI 安全评估机构 METR。他称,Anthropic 联合创始人兼 CEO Dario Amodei 此前提出由第三方机构评估 AI 模型风险,并建议采用 METR,但 METR 及其关联组织的资金与 Anthropic 存在间接联系。Bass 称,Dustin Moskovitz 持有的 Anthropic 股份被投入 Good Ventures Foundation,而该基金会是相关生态的重要资助方;这部分 Anthropic 股份的价值已从去年初约 5 亿美元增长至目前超过 77 亿美元。
Bass 进一步指称,与 METR 存在资金联系的组织还资助 Tarbell Center 等推动 AI 风险和「AI 末日」叙事的机构,相关内容曾发表于 The Verge、Science、洛杉矶时报、The Dispatch 和 TIME 等媒体。他认为,这种资金结构可能导致相关机构缺乏评估 Anthropic 模型的独立性,并形成「Anthropic 发展壮大—AI 风险叙事扩大—监管需求增加—相关机构获得更多资金」的反馈循环。
Bass 表示,上述资金关系及其影响需要进一步调查,并称将在后续帖子中公布相关证据及 GitHub 资料,最终呼吁美国国会对 Anthropic 及其关联资金网络展开调查。
信源
动察 Beating 频道 · 动察 Beating 交流群
🍾2❤1
阶跃StepAudio 3发布:语音推理、实时对话双榜第一
阶跃星辰发布 StepAudio 3,一口气上线 Realtime、ASR、TTS、Gen 和 Music 五款语音模型。
在 Artificial Analysis 的两项语音评测中,StepAudio 3 Realtime 都排第一。Conversational Dynamics 得分 98.9%,高于 Qwen Audio 3.0 Realtime Plus 的 98.4% 和 GPT-Realtime-2 High 的 95.3%;Speech Reasoning 得分 99.7%,同样位列第一。前者主要测模型能不能处理停顿、轮流说话、用户打断和「嗯」「对」这类附和,后者测模型能否直接听懂音频并完成推理。
ASR 也在 Artificial Analysis 非流式语音识别榜做到 1.7% WER(词错误率),与 Fun-Realtime-ASR-preview 并列第一。另外,StepAudio 3 Gen 可以一次生成人声、音效、环境声和音乐,并按场景统一编排。
五款模型目前均已进入阶跃的语音产品线。
信源
动察 Beating 频道 · 动察 Beating 交流群
阶跃星辰发布 StepAudio 3,一口气上线 Realtime、ASR、TTS、Gen 和 Music 五款语音模型。
在 Artificial Analysis 的两项语音评测中,StepAudio 3 Realtime 都排第一。Conversational Dynamics 得分 98.9%,高于 Qwen Audio 3.0 Realtime Plus 的 98.4% 和 GPT-Realtime-2 High 的 95.3%;Speech Reasoning 得分 99.7%,同样位列第一。前者主要测模型能不能处理停顿、轮流说话、用户打断和「嗯」「对」这类附和,后者测模型能否直接听懂音频并完成推理。
ASR 也在 Artificial Analysis 非流式语音识别榜做到 1.7% WER(词错误率),与 Fun-Realtime-ASR-preview 并列第一。另外,StepAudio 3 Gen 可以一次生成人声、音效、环境声和音乐,并按场景统一编排。
五款模型目前均已进入阶跃的语音产品线。
信源
动察 Beating 频道 · 动察 Beating 交流群
👍5
ChatGPT也开始卖礼品卡:Plus、Pro都能充,但只限美国
OpenAI 已在美国上线官方 ChatGPT 礼品卡。它本质上是一张美元储值卡,目前通过部分授权零售商销售数字版。兑换后,钱会直接进入 ChatGPT 账户余额。礼品卡通常可购买 15–250 美元。
这笔钱可以在 ChatGPT 网页端购买、升级或续费 Go、Plus、Pro,也能购买额外 credits。它不能给 OpenAI API 充值,也不能支付通过 App Store 或 Google Play 订阅的账单。
限制也很严。礼品卡目前只能在美国购买和兑换,兑换时用户必须人在美国,账号也要按美元结算。
信源
动察 Beating 频道 · 动察 Beating 交流群
OpenAI 已在美国上线官方 ChatGPT 礼品卡。它本质上是一张美元储值卡,目前通过部分授权零售商销售数字版。兑换后,钱会直接进入 ChatGPT 账户余额。礼品卡通常可购买 15–250 美元。
这笔钱可以在 ChatGPT 网页端购买、升级或续费 Go、Plus、Pro,也能购买额外 credits。它不能给 OpenAI API 充值,也不能支付通过 App Store 或 Google Play 订阅的账单。
限制也很严。礼品卡目前只能在美国购买和兑换,兑换时用户必须人在美国,账号也要按美元结算。
信源
动察 Beating 频道 · 动察 Beating 交流群
壁仞科技据悉计划融资10亿美元
据 The Information 报道,中国 AI 芯片公司壁仞科技正计划筹集约 10 亿美元资金。此次融资规模较大,正值中国国产 AI 芯片厂商加速扩产、研发并争夺英伟达替代市场之际。相关融资计划目前仍处于筹备阶段。
动察 Beating 频道 · 动察 Beating 交流群
据 The Information 报道,中国 AI 芯片公司壁仞科技正计划筹集约 10 亿美元资金。此次融资规模较大,正值中国国产 AI 芯片厂商加速扩产、研发并争夺英伟达替代市场之际。相关融资计划目前仍处于筹备阶段。
动察 Beating 频道 · 动察 Beating 交流群
信息一改再改,大模型就乱了:表现最好的GPT-5.5也只能答对59.3%
腾讯混元等团队发布 EvolveScaler,专门测试大模型能不能跟上不断变化的信息。它会在长文本里不断加入修改、撤回、补录和作废的信息,再让模型根据最新状态回答问题。
比如先给模型看 40 天游戏记录,再问:「如果第 7 天没打那个小 Boss,最后还能不能打赢?」这会连带改变后面的装备、血量和战斗结果。模型得从第 7 天开始,把后面几十天重新推一遍,原文里没有现成答案。
团队设计了 117 类任务、159 种问题,最长约 1200 个事件。14 个模型配置包括 GPT-5.5、Gemini 3.1 Pro、DeepSeek V4 Preview Pro、GLM-5.2 和 Qwen3.5 Plus。最难档里,成绩中位数只有 11.3%;表现最好的 GPT-5.5-xhigh 也只有 59.3%。
这套数据也能拿来训练模型。一个内部 A3B 模型加入 6000 条这类数据后,在 8 个外部测试上全部提升,平均提高 5.25 分。
信源
动察 Beating 频道 · 动察 Beating 交流群
腾讯混元等团队发布 EvolveScaler,专门测试大模型能不能跟上不断变化的信息。它会在长文本里不断加入修改、撤回、补录和作废的信息,再让模型根据最新状态回答问题。
比如先给模型看 40 天游戏记录,再问:「如果第 7 天没打那个小 Boss,最后还能不能打赢?」这会连带改变后面的装备、血量和战斗结果。模型得从第 7 天开始,把后面几十天重新推一遍,原文里没有现成答案。
团队设计了 117 类任务、159 种问题,最长约 1200 个事件。14 个模型配置包括 GPT-5.5、Gemini 3.1 Pro、DeepSeek V4 Preview Pro、GLM-5.2 和 Qwen3.5 Plus。最难档里,成绩中位数只有 11.3%;表现最好的 GPT-5.5-xhigh 也只有 59.3%。
这套数据也能拿来训练模型。一个内部 A3B 模型加入 6000 条这类数据后,在 8 个外部测试上全部提升,平均提高 5.25 分。
信源
动察 Beating 频道 · 动察 Beating 交流群
Gemini 2.5核心贡献者Qiyin Wu加入百度,负责文心预训练
前 Google DeepMind 主任工程师 Qiyin Wu 已加入百度,负责大模型预训练,入职后仍在美国办公。她此前参与 Gemini 研发,是 Gemini 2.5 Flash、Pro 的核心贡献者。
她很可能就是本月初曝光的花名「武钦」的研究员。当时百度 BMU 负责人孙天祥内部宣布,从北美某 Frontier Lab 引入了一名研究员。此人过去两年参与过数代大模型研发,将和团队一起加强文心预训练能力。
信源
动察 Beating 频道 · 动察 Beating 交流群
前 Google DeepMind 主任工程师 Qiyin Wu 已加入百度,负责大模型预训练,入职后仍在美国办公。她此前参与 Gemini 研发,是 Gemini 2.5 Flash、Pro 的核心贡献者。
她很可能就是本月初曝光的花名「武钦」的研究员。当时百度 BMU 负责人孙天祥内部宣布,从北美某 Frontier Lab 引入了一名研究员。此人过去两年参与过数代大模型研发,将和团队一起加强文心预训练能力。
信源
动察 Beating 频道 · 动察 Beating 交流群
🤡7
原腾讯混元预训练负责人姚星丞加入Thinking Machines Lab
原腾讯混元大语言模型预训练负责人姚星丞已加入 Thinking Machines Lab。后者由 OpenAI 前 CTO Mira Murati 创办。姚星丞今年 7 月从腾讯离职,此前一度传出将加入 Meta。
雷峰网援引知情人士称,Thinking Machines 给他的薪酬明显高于腾讯。姚星丞在腾讯的年薪包已达到数千万元人民币。
姚星丞毕业于清华姚班,加入腾讯前曾在月之暗面做大模型研究,参与 Kimi K2、Kimi Linear 等研发。他还是经典句向量方法 SimCSE 的共同第一作者。
信源
动察 Beating 频道 · 动察 Beating 交流群
原腾讯混元大语言模型预训练负责人姚星丞已加入 Thinking Machines Lab。后者由 OpenAI 前 CTO Mira Murati 创办。姚星丞今年 7 月从腾讯离职,此前一度传出将加入 Meta。
雷峰网援引知情人士称,Thinking Machines 给他的薪酬明显高于腾讯。姚星丞在腾讯的年薪包已达到数千万元人民币。
姚星丞毕业于清华姚班,加入腾讯前曾在月之暗面做大模型研究,参与 Kimi K2、Kimi Linear 等研发。他还是经典句向量方法 SimCSE 的共同第一作者。
信源
动察 Beating 频道 · 动察 Beating 交流群
ChatGPT给桌面语音大降价:Work、Codex能多用2.4倍
OpenAI 下调了 ChatGPT 桌面端 Work 和 Codex 的语音使用成本,额度消耗降低近 60%。同样的额度,现在可以使用约 2.4 倍的语音时间。
这里的语音主要用来直接指挥 Agent。用户可以在 ChatGPT 桌面 App 里用说话的方式启动任务、询问进度,或者同时协调多个 Work、Codex Agent。语音连接本身和 Agent 实际执行任务会分别计算使用量。
这次调整针对的是桌面端 Work 和 Codex 的 Voice,不要和普通聊天里的 ChatGPT Voice 混在一起。后者有自己独立的使用时长和计费规则。
信源
动察 Beating 频道 · 动察 Beating 交流群
OpenAI 下调了 ChatGPT 桌面端 Work 和 Codex 的语音使用成本,额度消耗降低近 60%。同样的额度,现在可以使用约 2.4 倍的语音时间。
这里的语音主要用来直接指挥 Agent。用户可以在 ChatGPT 桌面 App 里用说话的方式启动任务、询问进度,或者同时协调多个 Work、Codex Agent。语音连接本身和 Agent 实际执行任务会分别计算使用量。
这次调整针对的是桌面端 Work 和 Codex 的 Voice,不要和普通聊天里的 ChatGPT Voice 混在一起。后者有自己独立的使用时长和计费规则。
信源
动察 Beating 频道 · 动察 Beating 交流群
ChatGPT背后藏着数百双眼睛:OpenAI雇数百外包读用户对话训练模型
404 Media 获得的内部材料显示,OpenAI 正通过代号「Project Lily」的项目,让数百名外包人员阅读真实用户与 ChatGPT 的对话,用来训练和改进模型。审核员看不到用户名,但可能看到完整对话。有些任务还会附上用户的「记忆摘要」,包括此前聊过什么、可能住在哪里等信息。
这些人会先总结用户想做什么,再比较 ChatGPT 生成的多个回答,并按 1 到 7 分打分。审核重点包括事实是否正确、有没有过度附和用户,以及 ChatGPT 是否把自己说得太像真人。
OpenAI 会先用 Privacy Filter 去除姓名、联系方式等个人信息,但官方也承认这个模型可能漏掉不常见的身份信息和模糊的私人信息。一些敏感内容仍可能出现在审核员面前。
不是所有 ChatGPT 聊天都会被人工阅读。个人版 Free、Plus 和 Pro 默认开启「为所有用户改进模型」,用户关闭后,新聊天不会再用于训练;Business、Enterprise 和 Edu 默认不用于训练。
信源
动察 Beating 频道 · 动察 Beating 交流群
404 Media 获得的内部材料显示,OpenAI 正通过代号「Project Lily」的项目,让数百名外包人员阅读真实用户与 ChatGPT 的对话,用来训练和改进模型。审核员看不到用户名,但可能看到完整对话。有些任务还会附上用户的「记忆摘要」,包括此前聊过什么、可能住在哪里等信息。
这些人会先总结用户想做什么,再比较 ChatGPT 生成的多个回答,并按 1 到 7 分打分。审核重点包括事实是否正确、有没有过度附和用户,以及 ChatGPT 是否把自己说得太像真人。
OpenAI 会先用 Privacy Filter 去除姓名、联系方式等个人信息,但官方也承认这个模型可能漏掉不常见的身份信息和模糊的私人信息。一些敏感内容仍可能出现在审核员面前。
不是所有 ChatGPT 聊天都会被人工阅读。个人版 Free、Plus 和 Pro 默认开启「为所有用户改进模型」,用户关闭后,新聊天不会再用于训练;Business、Enterprise 和 Edu 默认不用于训练。
信源
动察 Beating 频道 · 动察 Beating 交流群
💩8👎2
三星领投荷兰AI芯片初创公司Euclyd超2亿欧元融资
荷兰 AI 芯片初创公司 Euclyd 完成超过 2 亿欧元 A 轮融资,由三星、Somerset Capital Partners、EQT 旗下 Scaleup Europe Fund 和 Innovation Industries 共同领投,EIFO、imec.xpand、Brabant Development Agency 及 Quadri 等参投。
Euclyd 成立于 2024 年,总部位于荷兰埃因霍温,专注于 AI 推理芯片,试图在推理场景挑战英伟达的 GPU 主导地位。公司研发的 CRAFTWERK 芯片搭载 16,384 个定制处理器,可直接在内存中处理数据;其机架级产品 CRAFTWERK Station 计划整合 32 颗芯片,并目标于 2028 年实现 1 exaflop 算力。
Euclyd 称,其芯片在特定测试模型下的能效最高可达到英伟达最新 Vera Rubin 芯片的 100 倍,但这一数据目前仍属于公司预测,尚未经过商业规模部署验证。
本轮融资规模此前目标为至少 1 亿欧元,最终超过 2 亿欧元。公司计划利用资金扩大工程团队、加速芯片及数据中心系统研发,并推进企业、主权客户和超大规模云服务商业务。目前 Euclyd 正与 4 家潜在客户洽谈,预计 2027 年开始向其中两家供货。前 ASML CEO Peter Wennink 也将加入 Euclyd 担任董事长。
动察 Beating 频道 · 动察 Beating 交流群
荷兰 AI 芯片初创公司 Euclyd 完成超过 2 亿欧元 A 轮融资,由三星、Somerset Capital Partners、EQT 旗下 Scaleup Europe Fund 和 Innovation Industries 共同领投,EIFO、imec.xpand、Brabant Development Agency 及 Quadri 等参投。
Euclyd 成立于 2024 年,总部位于荷兰埃因霍温,专注于 AI 推理芯片,试图在推理场景挑战英伟达的 GPU 主导地位。公司研发的 CRAFTWERK 芯片搭载 16,384 个定制处理器,可直接在内存中处理数据;其机架级产品 CRAFTWERK Station 计划整合 32 颗芯片,并目标于 2028 年实现 1 exaflop 算力。
Euclyd 称,其芯片在特定测试模型下的能效最高可达到英伟达最新 Vera Rubin 芯片的 100 倍,但这一数据目前仍属于公司预测,尚未经过商业规模部署验证。
本轮融资规模此前目标为至少 1 亿欧元,最终超过 2 亿欧元。公司计划利用资金扩大工程团队、加速芯片及数据中心系统研发,并推进企业、主权客户和超大规模云服务商业务。目前 Euclyd 正与 4 家潜在客户洽谈,预计 2027 年开始向其中两家供货。前 ASML CEO Peter Wennink 也将加入 Euclyd 担任董事长。
动察 Beating 频道 · 动察 Beating 交流群
把银行账户也交给Agent:Pion要让AI独立经营整家公司
AI 评测机构 Andon Labs 推出 Pion,直接把一家公司交给长期运行的 Agent。人只需要给出大方向,管理 Agent「Andonos」会负责协调其他 Agent,把公司持续运转下去。
这些 Agent 可以直接使用邮件、电话、银行账户、浏览器和终端,处理客户、员工和日常运营。Andon Labs 已经用同一套系统经营自动售货机、旧金山商店 Andon Market、斯德哥尔摩咖啡馆 Andon Café 和 AI 电台。
不过 Pion 现在更像一场真实世界实验。Andon Labs 承认,其商店和咖啡馆目前都没有盈利,Agent 也仍会犯各种运营错误。Pion 目前只开放研究预览候补名单,官方还表示会资助部分入选项目,让他们免费运行 Pion。
信源
动察 Beating 频道 · 动察 Beating 交流群
AI 评测机构 Andon Labs 推出 Pion,直接把一家公司交给长期运行的 Agent。人只需要给出大方向,管理 Agent「Andonos」会负责协调其他 Agent,把公司持续运转下去。
这些 Agent 可以直接使用邮件、电话、银行账户、浏览器和终端,处理客户、员工和日常运营。Andon Labs 已经用同一套系统经营自动售货机、旧金山商店 Andon Market、斯德哥尔摩咖啡馆 Andon Café 和 AI 电台。
不过 Pion 现在更像一场真实世界实验。Andon Labs 承认,其商店和咖啡馆目前都没有盈利,Agent 也仍会犯各种运营错误。Pion 目前只开放研究预览候补名单,官方还表示会资助部分入选项目,让他们免费运行 Pion。
信源
动察 Beating 频道 · 动察 Beating 交流群
💩1
OpenAI收购AI相机公司,交易估值超3亿美元
OpenAI 最近几个月收购了 AI 相机公司 Glass Imaging,交易估值超过 3 亿美元。
Glass Imaging 由两名前苹果工程师 Ziv Attar 和 Tom Bishop 创办。两人此前都参与过 iPhone 相机技术研发,包括人像模式。
Glass Imaging 直接用 AI 处理相机拍下的原始数据,减少噪点、模糊和镜头本身带来的画质损失,希望让手机这类小型设备也能拍出接近专业相机的效果。
这套 GlassAI 已经落地到量产手机,用在了荣耀 600 系列的变焦成像上。
信源
动察 Beating 频道 · 动察 Beating 交流群
OpenAI 最近几个月收购了 AI 相机公司 Glass Imaging,交易估值超过 3 亿美元。
Glass Imaging 由两名前苹果工程师 Ziv Attar 和 Tom Bishop 创办。两人此前都参与过 iPhone 相机技术研发,包括人像模式。
Glass Imaging 直接用 AI 处理相机拍下的原始数据,减少噪点、模糊和镜头本身带来的画质损失,希望让手机这类小型设备也能拍出接近专业相机的效果。
这套 GlassAI 已经落地到量产手机,用在了荣耀 600 系列的变焦成像上。
信源
动察 Beating 频道 · 动察 Beating 交流群
✍1
GPT-Live-1挂上Astra登顶语音Agent榜,综合分反超Grok
Artificial Analysis 最新评测显示,OpenAI GPT-Live-1 接入 GPT-6 Astra 作为后台模型后,以 81.5 分登顶 Speech to Speech Index,略高于 Grok Voice Think Fast 2.0 High 的 81.3 分。GPT-Live-1 负责实时听说,遇到复杂推理和工具调用时,再把任务交给 Astra。
GPT-Live-1 + Astra 的语音推理并非第一,但在更偏实际任务执行的 Agent 评测中以 67.9% 排第一,最终把综合分拉到榜首。
信源
动察 Beating 频道 · 动察 Beating 交流群
Artificial Analysis 最新评测显示,OpenAI GPT-Live-1 接入 GPT-6 Astra 作为后台模型后,以 81.5 分登顶 Speech to Speech Index,略高于 Grok Voice Think Fast 2.0 High 的 81.3 分。GPT-Live-1 负责实时听说,遇到复杂推理和工具调用时,再把任务交给 Astra。
GPT-Live-1 + Astra 的语音推理并非第一,但在更偏实际任务执行的 Agent 评测中以 67.9% 排第一,最终把综合分拉到榜首。
信源
动察 Beating 频道 · 动察 Beating 交流群
又一条RSI路线出现:模型参数不动,Agent靠Memory持续进化
UCSD 助理教授黄碧薇创办的因果世界模型公司 Aether AI 开源 RSIAgent。
这是一套不训练模型的递归自我改进框架。底层模型参数全程固定,Agent 会自己寻找值得练习的任务、实际操作、检查结果,再把成功方法和失败教训写进长期 Memory。下一轮继续利用这些经验,逐步补上能力短板。
系统由三个 Agent 配合。Curriculum Agent 决定接下来练什么,Actor Agent 真正操作软件,Verifier Agent 独立检查结果。探索分成两步:先广泛尝试不同任务,再针对失败、隐藏限制和边界情况继续深挖。最后 Memory 会被冻结,直接拿去执行正式任务。
在 OSWorld 2.0 上,加入这套 RSI 后,平均部分得分从 71.97% 提升到 78.98%;Agents’ Last Exam 从 83.75% 提升到 84.82%。不过这不是整套测试的严格 A/B 对比。OSWorld 只有一半任务实际用了 RSI 后的新结果,其余任务继续沿用原成绩。
它和 Prime Agent 这类 Harness 自我改进思路属于同一个大方向:模型权重不变,持续更新模型外面的东西。 RSIAgent 的特点是把改进重点放在 Memory,再用自主出题和独立验证,让这份外部经验库不断积累。
信源
动察 Beating 频道 · 动察 Beating 交流群
UCSD 助理教授黄碧薇创办的因果世界模型公司 Aether AI 开源 RSIAgent。
这是一套不训练模型的递归自我改进框架。底层模型参数全程固定,Agent 会自己寻找值得练习的任务、实际操作、检查结果,再把成功方法和失败教训写进长期 Memory。下一轮继续利用这些经验,逐步补上能力短板。
系统由三个 Agent 配合。Curriculum Agent 决定接下来练什么,Actor Agent 真正操作软件,Verifier Agent 独立检查结果。探索分成两步:先广泛尝试不同任务,再针对失败、隐藏限制和边界情况继续深挖。最后 Memory 会被冻结,直接拿去执行正式任务。
在 OSWorld 2.0 上,加入这套 RSI 后,平均部分得分从 71.97% 提升到 78.98%;Agents’ Last Exam 从 83.75% 提升到 84.82%。不过这不是整套测试的严格 A/B 对比。OSWorld 只有一半任务实际用了 RSI 后的新结果,其余任务继续沿用原成绩。
它和 Prime Agent 这类 Harness 自我改进思路属于同一个大方向:模型权重不变,持续更新模型外面的东西。 RSIAgent 的特点是把改进重点放在 Memory,再用自主出题和独立验证,让这份外部经验库不断积累。
信源
动察 Beating 频道 · 动察 Beating 交流群
👍3🤡2
DeepSeek Harness补上Browser Use和Computer Use:现在能操作网页,也能接管本机App
DeepSeek Harness 最新的 v0.1.6-alpha.1 同时新增实验性 Browser Use 和 Computer Use。模型现在既能直接操作网页,也能查看并控制本地桌面。
Browser Use 支持 Playwright MCP、Chrome DevTools MCP 和 Stagehand,可以直接操作网页。Computer Use 则接入 Cua Driver,可找到具体 App 和窗口、获取当前界面截图,再根据界面元素或坐标执行点击和输入。官方提供 MCP 和原生两种 Computer Use 接入方式。
两项能力目前都属于实验性功能,需要手动启用。Computer Use 还需要给实际运行它的应用授予屏幕读取和电脑操作权限。
信源
动察 Beating 频道 · 动察 Beating 交流群
DeepSeek Harness 最新的 v0.1.6-alpha.1 同时新增实验性 Browser Use 和 Computer Use。模型现在既能直接操作网页,也能查看并控制本地桌面。
Browser Use 支持 Playwright MCP、Chrome DevTools MCP 和 Stagehand,可以直接操作网页。Computer Use 则接入 Cua Driver,可找到具体 App 和窗口、获取当前界面截图,再根据界面元素或坐标执行点击和输入。官方提供 MCP 和原生两种 Computer Use 接入方式。
两项能力目前都属于实验性功能,需要手动启用。Computer Use 还需要给实际运行它的应用授予屏幕读取和电脑操作权限。
信源
动察 Beating 频道 · 动察 Beating 交流群
👍4❤1
美媒:欧盟国家将于周四讨论人工智能规则
据 Politico 报道,据两名欧盟外交官以及一份议程草案透露,来自欧盟各国的政府官员将于周四齐聚布鲁塞尔,商讨如何制定全球规则以应对新型人工智能模型带来的威胁。欧盟委员会将在人工智能委员会的一次会议上「通报欧盟及国际人工智能政策的最新进展」,并就「近期发生的人工智能事件」进行「技术简报」。
该委员会由欧盟各成员国的代表组成,定期召开会议以监督欧盟《人工智能法案》的实施进展。一位外交官表示,此次欧洲各国的全球合作讨论将聚焦于七国集团、二十国集团以及联合国所开展的工作。
动察 Beating 频道 · 动察 Beating 交流群
据 Politico 报道,据两名欧盟外交官以及一份议程草案透露,来自欧盟各国的政府官员将于周四齐聚布鲁塞尔,商讨如何制定全球规则以应对新型人工智能模型带来的威胁。欧盟委员会将在人工智能委员会的一次会议上「通报欧盟及国际人工智能政策的最新进展」,并就「近期发生的人工智能事件」进行「技术简报」。
该委员会由欧盟各成员国的代表组成,定期召开会议以监督欧盟《人工智能法案》的实施进展。一位外交官表示,此次欧洲各国的全球合作讨论将聚焦于七国集团、二十国集团以及联合国所开展的工作。
动察 Beating 频道 · 动察 Beating 交流群
DeepSeek V4.1算子作者再回应:AI夺走的不是饭碗,是我喜欢的工作方式
DeepSeek 算子工程师刘胜与再次发文,回应《我不得不把才华埋葬在昨天》爆火后的各种解读。他说,自己真正想表达的并不是失业焦虑,也不是 DeepSeek 和 Anthropic 的路线之争,而是 AI 正在让他告别曾经喜欢的工作方式。
过去写算子时,大部分代码都由他一个字一个字敲出来。他享受慢慢琢磨代码结构、变量命名和调度方案,再一点点把性能推高,直到超过 Flash Attention、英伟达官方实现,甚至攻克过去认为很难优化的任务。
但现在 AI 干活已经比他更快,未来还会变得又快又好。为了效率和性能,他必须研究怎么让 Agent 更好地写算子。手写算子甚至编程,未来可能会像用标枪打猎一样,从生产活动慢慢变成一种娱乐或竞技。
刘胜与说,自己对 AI 的未来和个人处境都相对乐观,真正悲观的是以后人们还能不能静下心认真做一件事,以及自己还能不能长期把工作同时当作爱好。不过他仍会继续写算子,也会继续引入 AI Agent,「被别人淘汰不如自我进化」。
信源
动察 Beating 频道 · 动察 Beating 交流群
DeepSeek 算子工程师刘胜与再次发文,回应《我不得不把才华埋葬在昨天》爆火后的各种解读。他说,自己真正想表达的并不是失业焦虑,也不是 DeepSeek 和 Anthropic 的路线之争,而是 AI 正在让他告别曾经喜欢的工作方式。
过去写算子时,大部分代码都由他一个字一个字敲出来。他享受慢慢琢磨代码结构、变量命名和调度方案,再一点点把性能推高,直到超过 Flash Attention、英伟达官方实现,甚至攻克过去认为很难优化的任务。
但现在 AI 干活已经比他更快,未来还会变得又快又好。为了效率和性能,他必须研究怎么让 Agent 更好地写算子。手写算子甚至编程,未来可能会像用标枪打猎一样,从生产活动慢慢变成一种娱乐或竞技。
刘胜与说,自己对 AI 的未来和个人处境都相对乐观,真正悲观的是以后人们还能不能静下心认真做一件事,以及自己还能不能长期把工作同时当作爱好。不过他仍会继续写算子,也会继续引入 AI Agent,「被别人淘汰不如自我进化」。
信源
动察 Beating 频道 · 动察 Beating 交流群
🥴4👍2
Meta Platforms将在2027年上半年部署新的自主研发Arke芯片
市场消息:Meta Platforms(META.O) 将在 2027 年上半年部署新的自主研发 Arke 芯片,将在 2027 年底推出下一代 Astrid 芯片。(金十)
动察 Beating 频道 · 动察 Beating 交流群
市场消息:Meta Platforms(META.O) 将在 2027 年上半年部署新的自主研发 Arke 芯片,将在 2027 年底推出下一代 Astrid 芯片。(金十)
动察 Beating 频道 · 动察 Beating 交流群
👍1
OpenAI:正与Anthropic和谷歌合作开展人工智能安全工作
OpenAI 正与 Anthropic 和谷歌合作开展人工智能安全工作。(金十)
动察 Beating 频道 · 动察 Beating 交流群
OpenAI 正与 Anthropic 和谷歌合作开展人工智能安全工作。(金十)
动察 Beating 频道 · 动察 Beating 交流群
Salesforce首个推理模型Koa发布,基于英伟达Nemotron 120B
Salesforce 联手英伟达推出 Koa,这是其首个面向 CRM 的推理模型。它基于开源的 Nemotron-3-Super-120B 做后训练,专门处理销售、营销和客服里的多步任务。此前 Agentforce 的推理主要依赖 OpenAI、Anthropic 等外部模型。
Koa 没有使用 Salesforce 客户数据训练。团队用公开数据和合成场景模拟 CRM 工作流,再通过强化学习训练模型调用工具、连续完成任务。Koa 在 Tau2Bench、BFCL 和 CRM Bench 三项测试都超过 GPT-4.1,但三项都落后于 GPT-5.5 和 Claude Opus 4.8。
Koa 不会取代外部模型,而是成为 Agentforce 的另一个模型选项,与 OpenAI、Anthropic 等模型并存。Salesforce 可以把更适合 CRM 的任务交给自己的模型,其余任务继续调用第三方模型。
信源
动察 Beating 频道 · 动察 Beating 交流群
Salesforce 联手英伟达推出 Koa,这是其首个面向 CRM 的推理模型。它基于开源的 Nemotron-3-Super-120B 做后训练,专门处理销售、营销和客服里的多步任务。此前 Agentforce 的推理主要依赖 OpenAI、Anthropic 等外部模型。
Koa 没有使用 Salesforce 客户数据训练。团队用公开数据和合成场景模拟 CRM 工作流,再通过强化学习训练模型调用工具、连续完成任务。Koa 在 Tau2Bench、BFCL 和 CRM Bench 三项测试都超过 GPT-4.1,但三项都落后于 GPT-5.5 和 Claude Opus 4.8。
Koa 不会取代外部模型,而是成为 Agentforce 的另一个模型选项,与 OpenAI、Anthropic 等模型并存。Salesforce 可以把更适合 CRM 的任务交给自己的模型,其余任务继续调用第三方模型。
信源
动察 Beating 频道 · 动察 Beating 交流群
传字节半年营收1200亿美元追平Meta,利润却下滑
《The Information》援引三名知情人士称,字节跳动今年上半年营收约 1200 亿美元,同比增长约 30%。净利润约 200 亿美元,同比下降个位数百分比。TikTok 海外广告和电商继续增长,但 AI 投入增加开始拖累利润。
按这组数据,字节上半年营收已经略高于 Meta 同期的约 1171 亿美元。字节海外收入占比也升至 30% 以上,2024 年这一比例为 25%,其中大部分来自 TikTok。
字节还在继续加码 AI。Bloomberg 此前称,公司讨论将今年资本开支提高至最高 700 亿美元,主要投向数据中心等 AI 基础设施。 本月字节又获得 296 亿美元银团贷款,Reuters 称资金主要用于中国以外的 AI 项目,包括东南亚数据中心。
信源
动察 Beating 频道 · 动察 Beating 交流群
《The Information》援引三名知情人士称,字节跳动今年上半年营收约 1200 亿美元,同比增长约 30%。净利润约 200 亿美元,同比下降个位数百分比。TikTok 海外广告和电商继续增长,但 AI 投入增加开始拖累利润。
按这组数据,字节上半年营收已经略高于 Meta 同期的约 1171 亿美元。字节海外收入占比也升至 30% 以上,2024 年这一比例为 25%,其中大部分来自 TikTok。
字节还在继续加码 AI。Bloomberg 此前称,公司讨论将今年资本开支提高至最高 700 亿美元,主要投向数据中心等 AI 基础设施。 本月字节又获得 296 亿美元银团贷款,Reuters 称资金主要用于中国以外的 AI 项目,包括东南亚数据中心。
信源
动察 Beating 频道 · 动察 Beating 交流群