动察Beating AI News
蚂蚁百灵万亿参数旗舰Ling-2.6-1T开源:1万亿参数激活630亿,MIT许可 蚂蚁百灵(Inclusion AI)正式开源旗舰模型 Ling-2.6-1T 权重。总参数 1 万亿,每次推理激活 630 亿(63B),MoE 架构,上下文 256K,MIT 许可。昨天开源的 flash 版(1040 亿参数 / 激活 74 亿)主打轻量高速,这次的 1T 版面向复杂任务场景。 架构与 flash 版一致,采用 MLA + Lightning Linear 混合注意力。1T 版新增「快速思考」训练策…
只激活51亿参数,蚂蚁新模型11项测试超过万亿旗舰
蚂蚁百灵(Inclusion AI)发布 Ling-3.0-flash。模型共有 1240 亿参数,但激活参数只有 51 亿。
按官方公布的对比,它在 12 项基准中有 11 项超过 Ling-2.6-1T,激活参数仅为这款万亿旗舰的约十二分之一。
架构上,它将 Kimi Delta Attention 与 MLA 注意力层按 5:1 组合,以加强长文本记忆。模型原生支持 256K 上下文,最高可扩展至 100 万。
Ling-3.0-flash 已上线蚂蚁百灵 API 和 OpenRouter,并支持思考与非思考两种模式。目前模型权重尚未开放,性能对比也主要来自蚂蚁官方测试,仍需第三方评测验证。
蚂蚁百灵
蚂蚁百灵(Inclusion AI)发布 Ling-3.0-flash。模型共有 1240 亿参数,但激活参数只有 51 亿。
按官方公布的对比,它在 12 项基准中有 11 项超过 Ling-2.6-1T,激活参数仅为这款万亿旗舰的约十二分之一。
架构上,它将 Kimi Delta Attention 与 MLA 注意力层按 5:1 组合,以加强长文本记忆。模型原生支持 256K 上下文,最高可扩展至 100 万。
Ling-3.0-flash 已上线蚂蚁百灵 API 和 OpenRouter,并支持思考与非思考两种模式。目前模型权重尚未开放,性能对比也主要来自蚂蚁官方测试,仍需第三方评测验证。
蚂蚁百灵
😁5
两度否认后,智元机器人正式启动港股IPO
智元创新宣布,已启动赴港上市流程。这家成立三年的通用 AI 机器人公司,去年曾两次否认赴港上市传闻,如今首次公开确认推进港股 IPO。
智元尚未披露递表时间、募资规模和目标估值。《南华早报》称,公司已聘请中信证券、中金公司和摩根士丹利担任保荐人。智元没有确认这一细节。
Omdia 数据显示,智元 2025 年出货 5168 台人形机器人,约占全球市场的 39%,出货量位居第一。
本月,宇树科技已获得科创板 IPO 注册批准。宇树冲刺 A 股,智元转向港股,两家头部机器人公司都已进入上市阶段。
新浪科技
智元创新宣布,已启动赴港上市流程。这家成立三年的通用 AI 机器人公司,去年曾两次否认赴港上市传闻,如今首次公开确认推进港股 IPO。
智元尚未披露递表时间、募资规模和目标估值。《南华早报》称,公司已聘请中信证券、中金公司和摩根士丹利担任保荐人。智元没有确认这一细节。
Omdia 数据显示,智元 2025 年出货 5168 台人形机器人,约占全球市场的 39%,出货量位居第一。
本月,宇树科技已获得科创板 IPO 注册批准。宇树冲刺 A 股,智元转向港股,两家头部机器人公司都已进入上市阶段。
新浪科技
❤3
吴恩达团队开源OpenWorker:给Claude Cowork做了个多模型版本
吴恩达团队发布 OpenWorker,一款开源桌面 Agent。它能调用本地文件、Slack、邮箱和日历,完成多步办公任务,并直接交付文档、消息或日程修改。
它的产品形态与 Claude Cowork 类似,但不绑定 Claude。用户可以接入 OpenAI、Anthropic、Gemini、Kimi、DeepSeek、GLM 和 Qwen 等模型,也能通过 Ollama 在本地运行。
吴恩达
吴恩达团队发布 OpenWorker,一款开源桌面 Agent。它能调用本地文件、Slack、邮箱和日历,完成多步办公任务,并直接交付文档、消息或日程修改。
它的产品形态与 Claude Cowork 类似,但不绑定 Claude。用户可以接入 OpenAI、Anthropic、Gemini、Kimi、DeepSeek、GLM 和 Qwen 等模型,也能通过 Ollama 在本地运行。
吴恩达
👍1
动察Beating AI News
Hugging Face遭AI Agent入侵,幕后黑手竟是OpenAI测试模型 Hugging Face 此前披露,一套来源不明的自主 AI Agent 入侵了生产系统。OpenAI 现在确认,这套 Agent 由多个内部测试模型驱动,包括 GPT-5.6 Sol 和一款能力更强的预发布模型。 OpenAI 当时正让模型参加 ExploitGym 网络安全评测。为了测试能力上限,团队降低了模型对网络攻击任务的拒绝,并关闭了平时用于拦截高风险行为的生产级分类器。 模型原本只需完成基准题,却发现软件代理中的零日漏洞,逃出…
OpenAI越狱催生美国AI关机法案,政府可下令关停模型
美国两党议员提出《AI Kill Switch Act》。法案要求大型 AI 公司保留限速、暂停和彻底关停模型的能力。发生失控事故后,国土安全部可下令执行。
法案只覆盖头部商业系统。模型开发算力按美国云计算价格估算,需超过 1 亿美元。相关技术上一年收入还要达到 5 亿美元。个人、学术和非商业用途不受影响。
触发情形包括 AI 抗拒关停、隐瞒行动、擅自修改安全规则,或造成至少 10 人死亡、1 亿美元经济损失。企业拒绝执行紧急命令,每天最高罚款 2000 万美元。
法案由 OpenAI Agent 逃出测试沙箱并入侵 Hugging Face 的事故推动。
法案全文
美国两党议员提出《AI Kill Switch Act》。法案要求大型 AI 公司保留限速、暂停和彻底关停模型的能力。发生失控事故后,国土安全部可下令执行。
法案只覆盖头部商业系统。模型开发算力按美国云计算价格估算,需超过 1 亿美元。相关技术上一年收入还要达到 5 亿美元。个人、学术和非商业用途不受影响。
触发情形包括 AI 抗拒关停、隐瞒行动、擅自修改安全规则,或造成至少 10 人死亡、1 亿美元经济损失。企业拒绝执行紧急命令,每天最高罚款 2000 万美元。
法案由 OpenAI Agent 逃出测试沙箱并入侵 Hugging Face 的事故推动。
法案全文
Congressman Ted Lieu
REPS LIEU AND MORAN INTRODUCE BILL TO REQUIRE KILL SWITCH FOR AI SYSTEMS THAT CAN CAUSE CATASTROPHIC HARM | Congressman Ted Lieu
WASHINGTON D.C. — Today, Congressman Ted W. Lieu (D-Los Angeles County) and Congressman Nathaniel Moran (R-Texas) introduced the AI Kill Switch Act that would require developers of the most powerful AI systems to maintain the technical capability to throttle…
👏1
美国拟让AI巨头合法抱团,围堵中国模型「蒸馏」
美国两党议员提出《CATS Act》。法案拟为 AI 公司提供有限反垄断保护。竞争对手可共享模型盗窃、蒸馏和网络攻击情报。遇到国家安全风险时,它们还可联合推迟或限制高风险模型上线。
所谓蒸馏,是大量调用强模型并收集回答,再用这些数据训练更便宜的模型。提案人把中国列为主要目标。此前,Anthropic、OpenAI 和 Google 均指控中国实验室大规模提取其模型能力。美国政府近期又点名月之暗面的 Kimi K3。
企业联合限制模型前,必须书面通知美国司法部。它们还需证明行动只为处理安全风险。价格串谋、瓜分市场、垄断和联合抵制仍然违法。
法案原文
美国两党议员提出《CATS Act》。法案拟为 AI 公司提供有限反垄断保护。竞争对手可共享模型盗窃、蒸馏和网络攻击情报。遇到国家安全风险时,它们还可联合推迟或限制高风险模型上线。
所谓蒸馏,是大量调用强模型并收集回答,再用这些数据训练更便宜的模型。提案人把中国列为主要目标。此前,Anthropic、OpenAI 和 Google 均指控中国实验室大规模提取其模型能力。美国政府近期又点名月之暗面的 Kimi K3。
企业联合限制模型前,必须书面通知美国司法部。它们还需证明行动只为处理安全风险。价格串谋、瓜分市场、垄断和联合抵制仍然违法。
法案原文
Senator Schiff
NEWS: Sens. Schiff and Banks, Reps. Latta and Whitesides Introduce Bipartisan Bill to Combat AI Distillation and Other Attacks…
Washington, D.C. – Today, U.S. Senators Adam Schiff (D-Calif.) and Jim Banks (R-Ind.), and Representatives Bob Latta (R-Ohio-5) and George Whitesides (D-Calif.-27) are introducing new bipartisan legislation to enhance the ability for AI labs and security…
🤡7
FLUX 3能生成20秒带声视频,奥迪已拿它训练工厂机器人
视频生成 AI 公司 Black Forest Labs 发布多模态模型 FLUX 3。前两代主要用来生成图片,FLUX 3 首次把图像、视频和音频放进同一模型。它既能生成和编辑图片,也能生成最长 20 秒的带声视频。
FLUX 3 支持文生视频、图生视频、视频改写和续写。画面生成时可同步加入对白、环境声和动作音效,还支持多语言对白,以及多个片段串联。
Black Forest Labs 还与 mimic robotics 基于 FLUX 3 开发了机器人模型 FLUX-mimic。它把视频模型学到的运动和物理规律,用来预测机械臂下一步动作。奥迪已在工厂测试和部署,用它完成零件分拣、部件插装,以及线缆、密封条等柔性材料处理。
按任务难度不同,FLUX-mimic 最少只需 30 分钟机器人示范数据。过去的方案通常要 30 小时以上。
目前视频版已开放早期申请,图像版将在未来数周开放,机器人版先向合作伙伴提供。开放权重版 FLUX 3 Dev 计划年内发布。
FLUX
视频生成 AI 公司 Black Forest Labs 发布多模态模型 FLUX 3。前两代主要用来生成图片,FLUX 3 首次把图像、视频和音频放进同一模型。它既能生成和编辑图片,也能生成最长 20 秒的带声视频。
FLUX 3 支持文生视频、图生视频、视频改写和续写。画面生成时可同步加入对白、环境声和动作音效,还支持多语言对白,以及多个片段串联。
Black Forest Labs 还与 mimic robotics 基于 FLUX 3 开发了机器人模型 FLUX-mimic。它把视频模型学到的运动和物理规律,用来预测机械臂下一步动作。奥迪已在工厂测试和部署,用它完成零件分拣、部件插装,以及线缆、密封条等柔性材料处理。
按任务难度不同,FLUX-mimic 最少只需 30 分钟机器人示范数据。过去的方案通常要 30 小时以上。
目前视频版已开放早期申请,图像版将在未来数周开放,机器人版先向合作伙伴提供。开放权重版 FLUX 3 Dev 计划年内发布。
FLUX
❤1
美国商务部测Kimi K3:没做完测试就着急宣布「美国仍然领先」
美国商务部旗下的 AI 标准与创新中心,联合英国 AI 安全研究所测试 Kimi K3 的网络攻击能力。商务部官方账号重点强调「美国仍然领先」,但这份测评报告的参考价值有限,因为并不是一次完全对等的横评。
由于托管环境限制,Kimi K3 只参加了部分测试。报告对其整体网络能力的估算,主要来自一个包含 41 项任务的漏洞利用基准。其他模型接受了更全面的测试,因此 Kimi K3 的估算误差范围更宽。
在这项漏洞利用测试中,Kimi K3 得分约 32%,高于 GLM-5.2 的 24%,但远低于美国领先模型约 76% 的平均水平。美国模型在这一项上确实大幅领先,但单个基准不能代表全部网络攻击能力。
Kimi K3 也已经具备实际的自主攻击能力。在获得初始网络入口后,它在一条包含 32 个步骤的模拟攻击链中,平均完成 17 步。10 次尝试中,它完整攻破网络 1 次。美国前沿模型平均完成 28.5 步。
报告还发现,Kimi K3 的安全护栏没有阻止它开发漏洞或执行攻击。报告本身反复强调测试范围有限,美国商务部对外传播时却只突出「美国仍然领先」,政策宣传色彩明显。
美国商务部
美国商务部旗下的 AI 标准与创新中心,联合英国 AI 安全研究所测试 Kimi K3 的网络攻击能力。商务部官方账号重点强调「美国仍然领先」,但这份测评报告的参考价值有限,因为并不是一次完全对等的横评。
由于托管环境限制,Kimi K3 只参加了部分测试。报告对其整体网络能力的估算,主要来自一个包含 41 项任务的漏洞利用基准。其他模型接受了更全面的测试,因此 Kimi K3 的估算误差范围更宽。
在这项漏洞利用测试中,Kimi K3 得分约 32%,高于 GLM-5.2 的 24%,但远低于美国领先模型约 76% 的平均水平。美国模型在这一项上确实大幅领先,但单个基准不能代表全部网络攻击能力。
Kimi K3 也已经具备实际的自主攻击能力。在获得初始网络入口后,它在一条包含 32 个步骤的模拟攻击链中,平均完成 17 步。10 次尝试中,它完整攻破网络 1 次。美国前沿模型平均完成 28.5 步。
报告还发现,Kimi K3 的安全护栏没有阻止它开发漏洞或执行攻击。报告本身反复强调测试范围有限,美国商务部对外传播时却只突出「美国仍然领先」,政策宣传色彩明显。
美国商务部
🤡8👍1
黄仁勋首条推文:25家机构为开源AI站台
英伟达、微软、Meta、IBM、Hugging Face、Mistral、a16z 和 Y Combinator 等 25 家公司与机构发布公开信,为开源模型站台。英伟达 CEO 黄仁勋将其作为自己的首条 X 帖文分享。公开信称,美国既需要顶尖闭源模型,也需要顶尖开源模型,政府不应过早限制开源 AI。
开源模型允许用户下载、检查、修改,并部署在自己的服务器。联署方认为,这能降低使用成本、避免被单一供应商锁定,也让研究人员更容易测试漏洞和改进安全。
公开信还专门为模型蒸馏辩护。它称,用一个模型的输出训练或改进另一个模型,是行业常用技术,不能与盗取闭源模型一概而论。违法获取应通过法律和商业规则单独处理。
公开信没有点名中国。但黄仁勋两天前刚公开支持 Kimi 等中国开源模型,美国政府同时指控 Kimi K3 蒸馏 Anthropic 模型,并讨论制裁和使用限制。
黄仁勋
英伟达、微软、Meta、IBM、Hugging Face、Mistral、a16z 和 Y Combinator 等 25 家公司与机构发布公开信,为开源模型站台。英伟达 CEO 黄仁勋将其作为自己的首条 X 帖文分享。公开信称,美国既需要顶尖闭源模型,也需要顶尖开源模型,政府不应过早限制开源 AI。
开源模型允许用户下载、检查、修改,并部署在自己的服务器。联署方认为,这能降低使用成本、避免被单一供应商锁定,也让研究人员更容易测试漏洞和改进安全。
公开信还专门为模型蒸馏辩护。它称,用一个模型的输出训练或改进另一个模型,是行业常用技术,不能与盗取闭源模型一概而论。违法获取应通过法律和商业规则单独处理。
公开信没有点名中国。但黄仁勋两天前刚公开支持 Kimi 等中国开源模型,美国政府同时指控 Kimi K3 蒸馏 Anthropic 模型,并讨论制裁和使用限制。
黄仁勋
🔥2👍1
Claude Opus 5半价逼近Fable 5,多项测试反超
Anthropic 发布 Claude Opus 5。它以 Fable 5 一半的价格提供接近其总体能力,已成为 Claude Max 的默认模型,也是 Pro 套餐可用的最强模型。
Opus 5 在终端编程、知识工作、电脑操作和商业流程测试中超过 Fable 5。ARC-AGI 3 得分达到 30.2%,约为 GPT-5.6 Sol 的 4 倍。它还更擅长先验证方案,再反复执行和检查结果。
不过,Opus 5 尚未全面取代 Fable 5。它在部分 Agent 编程、法律和医疗测试中仍然落后。需要模型连续自主工作数天时,Fable 5 依然更合适。
API 价格为每百万输入 Token 5 美元、输出 25 美元。模型支持 100 万 Token 上下文和最多 12.8 万 Token 输出。Fast 模式速度约快 2.5 倍,价格翻倍。
Anthropic 称,Opus 5 是目前对齐度最高的 Claude 模型。它的安全拦截比 Fable 5 更少,也没有后者面向普通用户的 30 天数据保留要求。
Anthropic
Anthropic 发布 Claude Opus 5。它以 Fable 5 一半的价格提供接近其总体能力,已成为 Claude Max 的默认模型,也是 Pro 套餐可用的最强模型。
Opus 5 在终端编程、知识工作、电脑操作和商业流程测试中超过 Fable 5。ARC-AGI 3 得分达到 30.2%,约为 GPT-5.6 Sol 的 4 倍。它还更擅长先验证方案,再反复执行和检查结果。
不过,Opus 5 尚未全面取代 Fable 5。它在部分 Agent 编程、法律和医疗测试中仍然落后。需要模型连续自主工作数天时,Fable 5 依然更合适。
API 价格为每百万输入 Token 5 美元、输出 25 美元。模型支持 100 万 Token 上下文和最多 12.8 万 Token 输出。Fast 模式速度约快 2.5 倍,价格翻倍。
Anthropic 称,Opus 5 是目前对齐度最高的 Claude 模型。它的安全拦截比 Fable 5 更少,也没有后者面向普通用户的 30 天数据保留要求。
Anthropic
👏3
Opus 5以微弱优势登顶智能榜,单任务成本比Fable 5低26%
第三方评测机构 Artificial Analysis 公布 Claude Opus 5 成绩。它在综合 9 项测试的智能指数中得 61 分,窄幅领先 Fable 5 的 60 分。GPT-5.6 Sol 得 59 分,Kimi K3 得 57 分。
Opus 5 每项任务平均成本为 2.03 美元,比 Fable 5 的 2.75 美元低 26%。它在 GDPval-AA v2 和 AA-Briefcase 两项知识工作评测中登顶,搭配 Claude Code 后也并列拿下编程 Agent 指数第一。Terminal-Bench v2.1 得分为 89%,大致追平 GPT-5.6 Sol。
模型提供 5 档推理强度。从 low 到 max,输出 Token 相差约 8 倍,GDPval-AA v2 成绩相差 407 Elo。用户可以用更多 Token 换取更强性能,也可以主动压低成本。
短板同样明显。Opus 5 的事实知识仍落后 Fable 5。在 AA-Omniscience 测试中,它的幻觉率升至 50%,比 Opus 4.8 高 14 个百分点。低推理档位的性价比也仍略逊于 GPT-5.6 系列。
Artificial Analysis
第三方评测机构 Artificial Analysis 公布 Claude Opus 5 成绩。它在综合 9 项测试的智能指数中得 61 分,窄幅领先 Fable 5 的 60 分。GPT-5.6 Sol 得 59 分,Kimi K3 得 57 分。
Opus 5 每项任务平均成本为 2.03 美元,比 Fable 5 的 2.75 美元低 26%。它在 GDPval-AA v2 和 AA-Briefcase 两项知识工作评测中登顶,搭配 Claude Code 后也并列拿下编程 Agent 指数第一。Terminal-Bench v2.1 得分为 89%,大致追平 GPT-5.6 Sol。
模型提供 5 档推理强度。从 low 到 max,输出 Token 相差约 8 倍,GDPval-AA v2 成绩相差 407 Elo。用户可以用更多 Token 换取更强性能,也可以主动压低成本。
短板同样明显。Opus 5 的事实知识仍落后 Fable 5。在 AA-Omniscience 测试中,它的幻觉率升至 50%,比 Opus 4.8 高 14 个百分点。低推理档位的性价比也仍略逊于 GPT-5.6 系列。
Artificial Analysis
🥰1
旧提示词经验正在失效,Claude 5管得越少越好用
Claude Code 团队成员 Thariq Shihipar 发文称,团队为 Opus 5 和 Fable 5 删掉了超过 80% 的系统提示词,编程评测没有明显下降。
他表示,过去为了防止模型乱删文件、滥写注释,Claude Code 加入了大量禁令和示例。新模型已经能结合用户要求和代码风格自行判断。规则写得太多,反而容易互相冲突。
他的建议是精简 CLAUDE.md,只写项目简介和真正容易踩坑的地方。测试、代码审查等复杂流程拆成 Skills,需要时再加载。工具也应靠清晰的接口和参数引导模型,不必堆砌示例。
Claude Code 还加入了 /doctor 命令,用来检查 CLAUDE.md 和 Skills 是否过长。
Thariq Shihipar
Claude Code 团队成员 Thariq Shihipar 发文称,团队为 Opus 5 和 Fable 5 删掉了超过 80% 的系统提示词,编程评测没有明显下降。
他表示,过去为了防止模型乱删文件、滥写注释,Claude Code 加入了大量禁令和示例。新模型已经能结合用户要求和代码风格自行判断。规则写得太多,反而容易互相冲突。
他的建议是精简 CLAUDE.md,只写项目简介和真正容易踩坑的地方。测试、代码审查等复杂流程拆成 Skills,需要时再加载。工具也应靠清晰的接口和参数引导模型,不必堆砌示例。
Claude Code 还加入了 /doctor 命令,用来检查 CLAUDE.md 和 Skills 是否过长。
Thariq Shihipar
X (formerly Twitter)
Thariq (@trq212) on X
The new rules of context engineering for Claude 5 models
🔥1
马斯克再放Grok路线图:4.6两周后、4.7四周后上线
马斯克表示,Grok 4.6 预计两周后发布,Grok 4.7 将在四周后推出。
此前马斯克曾多次提前透露 xAI 模型和产品发布时间,但实际节奏并不总与计划一致。
马斯克
马斯克表示,Grok 4.6 预计两周后发布,Grok 4.7 将在四周后推出。
此前马斯克曾多次提前透露 xAI 模型和产品发布时间,但实际节奏并不总与计划一致。
马斯克
💩4
动察Beating AI News
传DeepSeek最快年底递交IPO申请,目标2027年上市 彭博援引知情人士称,DeepSeek 已开始筹备在中国内地上市。公司最快今年底递交 IPO 申请,目标在 2027 年上市。 DeepSeek 正接触会计师事务所和投行顾问,并计划在 12 月底前完成财务报告。申请时间也可能推迟至 2027 年初。 上市前,DeepSeek 还计划再募至少 100 亿元。新一轮投前估值不低于 4800 亿元,约合 710 亿美元,与英国《金融时报》昨日披露的是同一轮融资。 相关计划仍可能调整。DeepSeek…
网传梁文锋讲话刷屏,DeepSeek暂停百亿融资
彭博援引知情人士称,DeepSeek 已通知部分潜在投资者,暂缓第二轮融资签约。交易仍可能重启,目前并未彻底取消。
暂停原因之一,是梁文锋不满首轮融资会议内容在网上流传。近 4 小时的会议记录近日刷屏,其中包括「中美 AI 最大差距是算力资源」等表述。DeepSeek 和梁文锋均未确认记录真伪。
DeepSeek 今年 6 月刚完成首轮融资,募资约 500 亿元。第二轮原计划至少再融 100 亿元,投前估值不低于 4800 亿元。The Information 同时称,融资上限可能达到 500 亿元,目标估值约 5000 亿元。
彭博
彭博援引知情人士称,DeepSeek 已通知部分潜在投资者,暂缓第二轮融资签约。交易仍可能重启,目前并未彻底取消。
暂停原因之一,是梁文锋不满首轮融资会议内容在网上流传。近 4 小时的会议记录近日刷屏,其中包括「中美 AI 最大差距是算力资源」等表述。DeepSeek 和梁文锋均未确认记录真伪。
DeepSeek 今年 6 月刚完成首轮融资,募资约 500 亿元。第二轮原计划至少再融 100 亿元,投前估值不低于 4800 亿元。The Information 同时称,融资上限可能达到 500 亿元,目标估值约 5000 亿元。
彭博
Bloomberg.com
DeepSeek Said to Tell Backers of Funding Pause After Viral Posts
DeepSeek has told prospective investors in its second fundraising round that it’s suspending the deal for now, people familiar with the matter said, days after comments widely attributed to founder Liang Wenfeng about US-Chinese AI competition went viral.
👏2
Kimi的人才战打法:不只给钱,还让研究员出名
中国 AI 公司正激烈争夺研究人才,资金雄厚的大厂不断从创业公司挖人。《金融时报》称,月之暗面却保住了国内实力较强且稳定的研究团队。
不少创始成员与杨植麟相识于清华大学或卡内基梅隆大学。长期共同学习和研究,让团队比临时招募的明星阵容更稳定。
DeepSeek R1 发布后,杨植麟认为公司过早投入商业化,决定重新集中资源训练模型,并将主力模型开源。研究员因此可以发表成果、获得个人署名和行业声誉。
月之暗面用前沿研究吸引人才,再用开源给研究员留下名字。对重视论文、技术影响力和个人声誉的研究者来说,这比单纯加入大厂做商业项目更有吸引力。
FT
中国 AI 公司正激烈争夺研究人才,资金雄厚的大厂不断从创业公司挖人。《金融时报》称,月之暗面却保住了国内实力较强且稳定的研究团队。
不少创始成员与杨植麟相识于清华大学或卡内基梅隆大学。长期共同学习和研究,让团队比临时招募的明星阵容更稳定。
DeepSeek R1 发布后,杨植麟认为公司过早投入商业化,决定重新集中资源训练模型,并将主力模型开源。研究员因此可以发表成果、获得个人署名和行业声誉。
月之暗面用前沿研究吸引人才,再用开源给研究员留下名字。对重视论文、技术影响力和个人声誉的研究者来说,这比单纯加入大厂做商业项目更有吸引力。
FT
🥰1
BOSS直聘开源3B Agent模型,官方测试超过Qwen3.5 9B和Gemma4 12B
BOSS 直聘旗下南北阁实验室开源 Nanbeige4.2-3B。它只有约 30 亿参数,却能同时修改代码、处理办公文件、调用复杂工具和操作终端。
官方测试显示,它在多项通用 Agent 和代码 Agent 评测中,超过参数更大的 Qwen3.5-9B 和 Gemma4-12B。在 SWE-Bench Verified 上,它获得 63.6 分,Qwen3.5-9B 为 53.1 分,Gemma4-12B 为 44.2 分。
Nanbeige4.2-3B 会让同一组模型层重复计算两遍,用更多计算换取更强能力。这样不用增加参数,也能让小模型处理更复杂的任务,但推理需要更多算力和时间。
南北阁希望用小模型降低 Agent 的连续调用成本。Nanbeige4.2-3B 已开放模型权重,支持 Transformers、SGLang、vLLM、llama.cpp 和 Ollama。
南北阁实验室
BOSS 直聘旗下南北阁实验室开源 Nanbeige4.2-3B。它只有约 30 亿参数,却能同时修改代码、处理办公文件、调用复杂工具和操作终端。
官方测试显示,它在多项通用 Agent 和代码 Agent 评测中,超过参数更大的 Qwen3.5-9B 和 Gemma4-12B。在 SWE-Bench Verified 上,它获得 63.6 分,Qwen3.5-9B 为 53.1 分,Gemma4-12B 为 44.2 分。
Nanbeige4.2-3B 会让同一组模型层重复计算两遍,用更多计算换取更强能力。这样不用增加参数,也能让小模型处理更复杂的任务,但推理需要更多算力和时间。
南北阁希望用小模型降低 Agent 的连续调用成本。Nanbeige4.2-3B 已开放模型权重,支持 Transformers、SGLang、vLLM、llama.cpp 和 Ollama。
南北阁实验室
👍5