动察Beating AI News
3.01K subscribers
807 photos
2 videos
3.26K links
AI新闻信息流
Download Telegram
黄仁勋首条推文:25家机构为开源AI站台

英伟达、微软、Meta、IBM、Hugging Face、Mistral、a16z 和 Y Combinator 等 25 家公司与机构发布公开信,为开源模型站台。英伟达 CEO 黄仁勋将其作为自己的首条 X 帖文分享。公开信称,美国既需要顶尖闭源模型,也需要顶尖开源模型,政府不应过早限制开源 AI。

开源模型允许用户下载、检查、修改,并部署在自己的服务器。联署方认为,这能降低使用成本、避免被单一供应商锁定,也让研究人员更容易测试漏洞和改进安全。

公开信还专门为模型蒸馏辩护。它称,用一个模型的输出训练或改进另一个模型,是行业常用技术,不能与盗取闭源模型一概而论。违法获取应通过法律和商业规则单独处理。

公开信没有点名中国。但黄仁勋两天前刚公开支持 Kimi 等中国开源模型,美国政府同时指控 Kimi K3 蒸馏 Anthropic 模型,并讨论制裁和使用限制。

黄仁勋
🔥2👍1
Claude Opus 5半价逼近Fable 5,多项测试反超

Anthropic 发布 Claude Opus 5。它以 Fable 5 一半的价格提供接近其总体能力,已成为 Claude Max 的默认模型,也是 Pro 套餐可用的最强模型。

Opus 5 在终端编程、知识工作、电脑操作和商业流程测试中超过 Fable 5。ARC-AGI 3 得分达到 30.2%,约为 GPT-5.6 Sol 的 4 倍。它还更擅长先验证方案,再反复执行和检查结果。

不过,Opus 5 尚未全面取代 Fable 5。它在部分 Agent 编程、法律和医疗测试中仍然落后。需要模型连续自主工作数天时,Fable 5 依然更合适。

API 价格为每百万输入 Token 5 美元、输出 25 美元。模型支持 100 万 Token 上下文和最多 12.8 万 Token 输出。Fast 模式速度约快 2.5 倍,价格翻倍。

Anthropic 称,Opus 5 是目前对齐度最高的 Claude 模型。它的安全拦截比 Fable 5 更少,也没有后者面向普通用户的 30 天数据保留要求。

Anthropic
👏3
Opus 5以微弱优势登顶智能榜,单任务成本比Fable 5低26%

第三方评测机构 Artificial Analysis 公布 Claude Opus 5 成绩。它在综合 9 项测试的智能指数中得 61 分,窄幅领先 Fable 5 的 60 分。GPT-5.6 Sol 得 59 分,Kimi K3 得 57 分。

Opus 5 每项任务平均成本为 2.03 美元,比 Fable 5 的 2.75 美元低 26%。它在 GDPval-AA v2 和 AA-Briefcase 两项知识工作评测中登顶,搭配 Claude Code 后也并列拿下编程 Agent 指数第一。Terminal-Bench v2.1 得分为 89%,大致追平 GPT-5.6 Sol。

模型提供 5 档推理强度。从 low 到 max,输出 Token 相差约 8 倍,GDPval-AA v2 成绩相差 407 Elo。用户可以用更多 Token 换取更强性能,也可以主动压低成本。

短板同样明显。Opus 5 的事实知识仍落后 Fable 5。在 AA-Omniscience 测试中,它的幻觉率升至 50%,比 Opus 4.8 高 14 个百分点。低推理档位的性价比也仍略逊于 GPT-5.6 系列。

Artificial Analysis
🥰1
旧提示词经验正在失效,Claude 5管得越少越好用

Claude Code 团队成员 Thariq Shihipar 发文称,团队为 Opus 5 和 Fable 5 删掉了超过 80% 的系统提示词,编程评测没有明显下降。

他表示,过去为了防止模型乱删文件、滥写注释,Claude Code 加入了大量禁令和示例。新模型已经能结合用户要求和代码风格自行判断。规则写得太多,反而容易互相冲突。

他的建议是精简 CLAUDE.md,只写项目简介和真正容易踩坑的地方。测试、代码审查等复杂流程拆成 Skills,需要时再加载。工具也应靠清晰的接口和参数引导模型,不必堆砌示例。

Claude Code 还加入了 /doctor 命令,用来检查 CLAUDE.md 和 Skills 是否过长。

Thariq Shihipar
🔥1
马斯克再放Grok路线图:4.6两周后、4.7四周后上线

马斯克表示,Grok 4.6 预计两周后发布,Grok 4.7 将在四周后推出。

此前马斯克曾多次提前透露 xAI 模型和产品发布时间,但实际节奏并不总与计划一致。

马斯克
💩4
动察Beating AI News
传DeepSeek最快年底递交IPO申请,目标2027年上市 彭博援引知情人士称,DeepSeek 已开始筹备在中国内地上市。公司最快今年底递交 IPO 申请,目标在 2027 年上市。 DeepSeek 正接触会计师事务所和投行顾问,并计划在 12 月底前完成财务报告。申请时间也可能推迟至 2027 年初。 上市前,DeepSeek 还计划再募至少 100 亿元。新一轮投前估值不低于 4800 亿元,约合 710 亿美元,与英国《金融时报》昨日披露的是同一轮融资。 相关计划仍可能调整。DeepSeek…
网传梁文锋讲话刷屏,DeepSeek暂停百亿融资

彭博援引知情人士称,DeepSeek 已通知部分潜在投资者,暂缓第二轮融资签约。交易仍可能重启,目前并未彻底取消。

暂停原因之一,是梁文锋不满首轮融资会议内容在网上流传。近 4 小时的会议记录近日刷屏,其中包括「中美 AI 最大差距是算力资源」等表述。DeepSeek 和梁文锋均未确认记录真伪。

DeepSeek 今年 6 月刚完成首轮融资,募资约 500 亿元。第二轮原计划至少再融 100 亿元,投前估值不低于 4800 亿元。The Information 同时称,融资上限可能达到 500 亿元,目标估值约 5000 亿元。

彭博
👏41
Kimi的人才战打法:不只给钱,还让研究员出名

中国 AI 公司正激烈争夺研究人才,资金雄厚的大厂不断从创业公司挖人。《金融时报》称,月之暗面却保住了国内实力较强且稳定的研究团队。

不少创始成员与杨植麟相识于清华大学或卡内基梅隆大学。长期共同学习和研究,让团队比临时招募的明星阵容更稳定。

DeepSeek R1 发布后,杨植麟认为公司过早投入商业化,决定重新集中资源训练模型,并将主力模型开源。研究员因此可以发表成果、获得个人署名和行业声誉。

月之暗面用前沿研究吸引人才,再用开源给研究员留下名字。对重视论文、技术影响力和个人声誉的研究者来说,这比单纯加入大厂做商业项目更有吸引力。

FT
🥰21
BOSS直聘开源3B Agent模型,官方测试超过Qwen3.5 9B和Gemma4 12B

BOSS 直聘旗下南北阁实验室开源 Nanbeige4.2-3B。它只有约 30 亿参数,却能同时修改代码、处理办公文件、调用复杂工具和操作终端。

官方测试显示,它在多项通用 Agent 和代码 Agent 评测中,超过参数更大的 Qwen3.5-9B 和 Gemma4-12B。在 SWE-Bench Verified 上,它获得 63.6 分,Qwen3.5-9B 为 53.1 分,Gemma4-12B 为 44.2 分。

Nanbeige4.2-3B 会让同一组模型层重复计算两遍,用更多计算换取更强能力。这样不用增加参数,也能让小模型处理更复杂的任务,但推理需要更多算力和时间。

南北阁希望用小模型降低 Agent 的连续调用成本。Nanbeige4.2-3B 已开放模型权重,支持 Transformers、SGLang、vLLM、llama.cpp 和 Ollama。

南北阁实验室
👍7
OpenAI宕机近两小时,给Codex和ChatGPT Work用户重置额度作为补偿

OpenAI 产品负责人 Tibo 表示,已重置所有 Codex 和 ChatGPT Work 用户的使用额度。

此前,OpenAI 出现接近全球范围的服务中断。API、ChatGPT 和 Codex 均大面积报错,主要故障持续近两小时后恢复。

Tibo
2
动察Beating AI News
黄仁勋首条推文:25家机构为开源AI站台 英伟达、微软、Meta、IBM、Hugging Face、Mistral、a16z 和 Y Combinator 等 25 家公司与机构发布公开信,为开源模型站台。英伟达 CEO 黄仁勋将其作为自己的首条 X 帖文分享。公开信称,美国既需要顶尖闭源模型,也需要顶尖开源模型,政府不应过早限制开源 AI。 开源模型允许用户下载、检查、修改,并部署在自己的服务器。联署方认为,这能降低使用成本、避免被单一供应商锁定,也让研究人员更容易测试漏洞和改进安全。 公开信还专…
开源AI联署两天翻倍:OpenAI、谷歌加入,Anthropic没签

美国正讨论是否限制可以下载和自行部署的开源模型。英伟达、微软等公司随后发布《开放权重与美国AI领导力》公开信,呼吁政府不要过早设限。签署名单已从首发的 25 家增至 50 家,OpenAI、Google、AMD、Cloudflare、GitHub 和 Cisco 等公司后来加入。

OpenAI 和 Google 虽然靠 GPT、Gemini 等闭源旗舰收费,也分别推出了 gpt-oss 和 Gemma 开源模型。签字不会影响它们继续卖闭源模型,却能保住开源模型这张牌。

Anthropic 没有签,也符合它现有的产品和政策路线。它没有 gpt-oss、Gemma 这类开源模型,近期又不断强调非法蒸馏和模型泄露风险。

此外,Amazon/AWS、Apple 和 xAI 也没有正式签署。马斯克只是在 X 上公开支持,xAI 并未出现在官方名单。

签署名单
👍4
奥特曼:人类已进入奇点,超级智能时代反而更忙

OpenAI CEO Sam Altman 在最新访谈中称,人类已经进入技术奇点。十年前,这还是他和同事在午餐桌上半开玩笑讨论的遥远设想。现在,人类已经真正身处其中。

他同时强调,技术进步仍是一条连续的指数曲线。未必存在某个清晰的「奇点时刻」。但当前又是决定曲线走向的关键阶段。

Altman 认为,眼下最重要的争夺是「AI 威权还是自由」。安全、对齐和就业问题都真实存在。但不能因此让一个模型或一家公司成为「机器之神」。AI 需要设置护栏,也应把强大能力交给更多人。

他还将 AI 产品分为三波。第一波是聊天机器人,第二波是编程 Agent。第三波是常驻 Agent,会像私人幕僚、同事或搭档一样持续工作。他预计,这一波很快就会到来。

更强的 AI 也不会让全社会进入「每周工作四小时」。人们会提高期待,创造更多事情,也会继续与他人比较。Altman 判断,超级智能时代的人类反而会更忙。大家嘴上会抱怨,心里却可能乐在其中。

Relentless
👍1
Kimi在北京「迈阿密」庆功,现场喊话「冲上月球」

Kimi 团队周五在北京一家名为「迈阿密」的夜店举行庆功活动。现场大屏写着「K3,把规模做上去」「K4,给我把规模狠狠干上去」「冲上月球」。有爆料称,他们包下多个卡座,月之暗面联合创始人、总裁张予彤疑似现身。

Kimi K3 发布之后,月之暗面成为继 DeepSeek、智谱之后又一当红 AI 炸子鸡。

Xinyu Yang
👏5🤡5🤮1💩1
动察Beating AI News
开源AI联署两天翻倍:OpenAI、谷歌加入,Anthropic没签 美国正讨论是否限制可以下载和自行部署的开源模型。英伟达、微软等公司随后发布《开放权重与美国AI领导力》公开信,呼吁政府不要过早设限。签署名单已从首发的 25 家增至 50 家,OpenAI、Google、AMD、Cloudflare、GitHub 和 Cisco 等公司后来加入。 OpenAI 和 Google 虽然靠 GPT、Gemini 等闭源旗舰收费,也分别推出了 gpt-oss 和 Gemma 开源模型。签字不会影响它们继续…
论Anthropic有多奇葩:拒签开源信,员工还阴阳签署者

Anthropic 技术成员 Julian Schrittwieser 在 X 上嘲讽英伟达和微软支持开放权重模型。他说,既然黄仁勋和纳德拉都开始谈开源,那就等着 CUDA、GPU 驱动、Windows 和 Office 一起开源。随后他又补充,自己不主张封禁开源模型,只是质疑这些巨头突然拥抱开源是否真诚。

帖子很快招来吴恩达、David Sacks 等一众 AI 行业知名人物的反击。吴恩达称这是偷换概念:你可以把自己的代码保持私有,但不应该阻止别人开源。Sacks 则更进一步指责 Anthropic 没完没了地搞小动作,一直试图打压开源模型。另有人反驳说,英伟达早已开源 Linux GPU 内核模块,微软也长期维护 .NET 等开源项目。

Anthropic 没有在公开信上签名已经很惹眼,员工这个莫名其妙的挖苦更是把这家价值观有点极端的 AI 巨头放在火上烤。

Julian Schrittwieser
👎5😁1