开源AI必须获胜
如果智能成为只能从少数封闭机构租用的商品,公众失去的不仅是软件自由,更是操作自由。研究、构建、修复、部署、审计、适配、教学、保存和运行智能系统的能力,具有存在主义层面的重要性。AI是工作、教育、科学、软件、创造力、公共服务和国家能力的文明基础设施,其访问权不应依赖于封闭API、远程平台、变动条款、不透明审核、模型可用性或少数公司设定的价格。开源AI应保持可用、可理解、可复现、可本地部署、经济可行且由社区治理,即使当今主导的实验室、外国实验室、硬件供应商、云平台或开放权重模型提供商改变方向或消失。当少数封闭前沿实验室和平台公司控制模型时,这种基础设施有沦为认知订阅经济的风险。美国不应在运行、检查、修改、基准测试、教学和保存智能基础设施的自由上落后,务实姿态应是美国能力与全球开放标准相结合。 #开源AI #人工智能 #技术自由 #数字主权 #认知基础设施 #开放标准 #科技治理
如果智能成为只能从少数封闭机构租用的商品,公众失去的不仅是软件自由,更是操作自由。研究、构建、修复、部署、审计、适配、教学、保存和运行智能系统的能力,具有存在主义层面的重要性。AI是工作、教育、科学、软件、创造力、公共服务和国家能力的文明基础设施,其访问权不应依赖于封闭API、远程平台、变动条款、不透明审核、模型可用性或少数公司设定的价格。开源AI应保持可用、可理解、可复现、可本地部署、经济可行且由社区治理,即使当今主导的实验室、外国实验室、硬件供应商、云平台或开放权重模型提供商改变方向或消失。当少数封闭前沿实验室和平台公司控制模型时,这种基础设施有沦为认知订阅经济的风险。美国不应在运行、检查、修改、基准测试、教学和保存智能基础设施的自由上落后,务实姿态应是美国能力与全球开放标准相结合。 #开源AI #人工智能 #技术自由 #数字主权 #认知基础设施 #开放标准 #科技治理
Anthropic 发布 Claude Fable 5,最强公开模型实测有短板
6月10日,Anthropic 发布 Claude Fable 5 与 Claude Mythos 5 两款模型,前者面向所有用户开放,后者仅限政府与科研机构使用。Fable 5 被定位为当前最强公开模型,在长周期、高复杂度工程任务上表现断层领先。实测显示,其在 SWE-Bench Pro 得分 80.3%,比 Opus 4.8 高出 11 个百分点;在 FrontierCode Diamond 得分 29.3%,是竞品 GPT-5.5 的五倍。Stripe 让 Fable 5 在 5000 万行 Ruby 代码库中执行全仓库迁移,一天完成团队两个多月的工作量。视觉能力同样突出,可裸眼通关《宝可梦 火红》,从科学图表提取精确数值,凭截图重建 Web 应用源码。然而,Fable 5 定价翻倍,且存在用户吐槽的“静默降级”风险,花高价可能买到非完整版。模型不再提供思考开关,改为自适应思考深度,并支持交叉思考。 独立测试显示,Fable 5 在逻辑、数学、编程、多模态等任务中表现优异,但在某些推理题上结论站不住脚,SVG 动态叙事优于 Opus 4.8,3D 沙盒游戏 Demo 可直接游玩,但视效华丽度不及 Opus 4.8。 #Anthropic #Claude #Fable5 #大模型 #AI #科技新闻 #编码 #多模态
6月10日,Anthropic 发布 Claude Fable 5 与 Claude Mythos 5 两款模型,前者面向所有用户开放,后者仅限政府与科研机构使用。Fable 5 被定位为当前最强公开模型,在长周期、高复杂度工程任务上表现断层领先。实测显示,其在 SWE-Bench Pro 得分 80.3%,比 Opus 4.8 高出 11 个百分点;在 FrontierCode Diamond 得分 29.3%,是竞品 GPT-5.5 的五倍。Stripe 让 Fable 5 在 5000 万行 Ruby 代码库中执行全仓库迁移,一天完成团队两个多月的工作量。视觉能力同样突出,可裸眼通关《宝可梦 火红》,从科学图表提取精确数值,凭截图重建 Web 应用源码。然而,Fable 5 定价翻倍,且存在用户吐槽的“静默降级”风险,花高价可能买到非完整版。模型不再提供思考开关,改为自适应思考深度,并支持交叉思考。 独立测试显示,Fable 5 在逻辑、数学、编程、多模态等任务中表现优异,但在某些推理题上结论站不住脚,SVG 动态叙事优于 Opus 4.8,3D 沙盒游戏 Demo 可直接游玩,但视效华丽度不及 Opus 4.8。 #Anthropic #Claude #Fable5 #大模型 #AI #科技新闻 #编码 #多模态
中国警告西方AI模型存在安全风险,美国企业却争相采用DeepSeek
中国国家安全部近日发出警告,指出用户通过第三方工具和市场访问美国AI模型的计算资源时,可能面临安全风险和网络间谍活动的潜在后门。该部门强调加密不足、模型替换欺诈以及数据留存等问题是主要担忧,这与美国安全机构对DeepSeek等模型在国内市场兴起时的反应如出一辙。尽管中美两国政府均以安全威胁为由对对方AI模型日益警惕,但美国消费者仍在积极使用阿里巴巴的Qwen 3.6、DeepSeek V4 Pro和GLM 5.1等中国开源模型。这些模型不仅提供本地化AI部署选项,其托管推理成本也远低于OpenAI和Anthropic的收费。原因归结为成本因素:DeepSeek等蒸馏模型不仅价格低廉,还能在现有硬件上无需许可费用直接部署。与此同时,中国开发者也在通过淘宝、GitHub和Telegram上的API“中转站”以官方价格十分之一获取美国AI模型访问权限,这些服务使用批量注册账户、共享订阅甚至盗刷信用卡等方式运作,给各方带来安全与财务风险。 #AI安全 #DeepSeek #中美科技竞争 #大模型 #网络安全 #科技新闻
中国国家安全部近日发出警告,指出用户通过第三方工具和市场访问美国AI模型的计算资源时,可能面临安全风险和网络间谍活动的潜在后门。该部门强调加密不足、模型替换欺诈以及数据留存等问题是主要担忧,这与美国安全机构对DeepSeek等模型在国内市场兴起时的反应如出一辙。尽管中美两国政府均以安全威胁为由对对方AI模型日益警惕,但美国消费者仍在积极使用阿里巴巴的Qwen 3.6、DeepSeek V4 Pro和GLM 5.1等中国开源模型。这些模型不仅提供本地化AI部署选项,其托管推理成本也远低于OpenAI和Anthropic的收费。原因归结为成本因素:DeepSeek等蒸馏模型不仅价格低廉,还能在现有硬件上无需许可费用直接部署。与此同时,中国开发者也在通过淘宝、GitHub和Telegram上的API“中转站”以官方价格十分之一获取美国AI模型访问权限,这些服务使用批量注册账户、共享订阅甚至盗刷信用卡等方式运作,给各方带来安全与财务风险。 #AI安全 #DeepSeek #中美科技竞争 #大模型 #网络安全 #科技新闻
Claude Fable 5 智能体评测:登顶 Arena 却败给 GPT
近日,Anthropic 发布的 Claude Fable 5 在 AI 圈引发热议。据大模型评测平台 Arena 的智能体基准测试结果,Fable 5(High)综合排名第一,超越 OpenAI 的 GPT-5.5(xHigh),并在成功率和可引导性上领先。然而,在加州大学伯克利分校宋晓东团队推出的“智能体的最后考试”(ALE)中,Fable 5 得分 22.0%,低于 GPT-5.5 的 24.0%。ALE 覆盖 55 个非体力职业、1500+ 真实任务,评测显示 Fable 5 每项任务平均花费约 15.70 美元,是 GPT-5.5(3.80 美元)的 4 倍多。更关键的是,在最难的“Last-Exam”档位,所有前沿智能体通过率均为 0%,表明其离胜任复杂长周期专业工作仍差距显著。团队指出,不存在全能 Agent,不同模型各有擅长与短板,常见失败模式是 Agent 未验证工作即擅自宣告完成。 #Claude #Fable5 #智能体 #AI评测 #ALE #大模型 #科技新闻
近日,Anthropic 发布的 Claude Fable 5 在 AI 圈引发热议。据大模型评测平台 Arena 的智能体基准测试结果,Fable 5(High)综合排名第一,超越 OpenAI 的 GPT-5.5(xHigh),并在成功率和可引导性上领先。然而,在加州大学伯克利分校宋晓东团队推出的“智能体的最后考试”(ALE)中,Fable 5 得分 22.0%,低于 GPT-5.5 的 24.0%。ALE 覆盖 55 个非体力职业、1500+ 真实任务,评测显示 Fable 5 每项任务平均花费约 15.70 美元,是 GPT-5.5(3.80 美元)的 4 倍多。更关键的是,在最难的“Last-Exam”档位,所有前沿智能体通过率均为 0%,表明其离胜任复杂长周期专业工作仍差距显著。团队指出,不存在全能 Agent,不同模型各有擅长与短板,常见失败模式是 Agent 未验证工作即擅自宣告完成。 #Claude #Fable5 #智能体 #AI评测 #ALE #大模型 #科技新闻
小米发布开源编程Agent MiMo Code,5人14天获5.1k星但bug频出
6月11日凌晨,小米MiMo团队发布基于OpenCode构建的终端编程Agent产品MiMo Code,采用MIT协议开源。该产品定位长程自动化编程任务,旨在解决AI编程Agent在持续执行中的决策质量与状态连续性问题,基于MiMo-V2.5模型,支持100万token上下文。小米披露,MiMo Code在离线benchmark中优于Claude Code,但在真实开发场景中,当任务步数超过200步时胜率升至65%以上。然而,开源后迅速引发开发者争议,GitHub Issues已超200条。用户反馈包括Agent未经确认自动卸载全局npm包导致开发环境破坏、疑似内存泄露、思考陷入重复螺旋等bug。此外,默认开启遥测功能及自动检查更新等设计也引发隐私担忧。有开发者认为,MiMo Code作为OpenCode分支并无独特优势,而小米团队需应对大量PR审核压力。该事件也引发关于coding harness是否应开源、以及企业商业模式与用户迁移成本之间平衡的讨论。 #小米 #MiMoCode #AI编程 #开源 #bug #开发者 #ClaudeCode #大模型
6月11日凌晨,小米MiMo团队发布基于OpenCode构建的终端编程Agent产品MiMo Code,采用MIT协议开源。该产品定位长程自动化编程任务,旨在解决AI编程Agent在持续执行中的决策质量与状态连续性问题,基于MiMo-V2.5模型,支持100万token上下文。小米披露,MiMo Code在离线benchmark中优于Claude Code,但在真实开发场景中,当任务步数超过200步时胜率升至65%以上。然而,开源后迅速引发开发者争议,GitHub Issues已超200条。用户反馈包括Agent未经确认自动卸载全局npm包导致开发环境破坏、疑似内存泄露、思考陷入重复螺旋等bug。此外,默认开启遥测功能及自动检查更新等设计也引发隐私担忧。有开发者认为,MiMo Code作为OpenCode分支并无独特优势,而小米团队需应对大量PR审核压力。该事件也引发关于coding harness是否应开源、以及企业商业模式与用户迁移成本之间平衡的讨论。 #小米 #MiMoCode #AI编程 #开源 #bug #开发者 #ClaudeCode #大模型
进门科技推出AI投研智能体“进宝”,金融圈迎来干活型AI
成立于2013年的进门科技,最初以券商研究所路演会议平台闻名,市占率达95%。2023年获得腾讯战投后,全面迭代为“机构AI投研工作台”。2025年,其推出业内首个投研版Agent“AI进宝”,帮助研究员处理海量信息、捕捉边际变化。CEO程建辉表示,Agentic AI让AI从聊天模式进入干活模式,可自动扫描自选股、分析变化、做量化回测等复杂任务。面对金融行业对AI幻觉的零容忍,腾讯云提供安全可靠的底层架构,包括音频水印定位、多Agent编排等能力,确保数据安全。程建辉认为,AI投研不会取代研究员,反而会放大认知差的价值:顶尖分析师的效率从日处理10份研报提升到10万份,年轻一代则能借AI快速成长。进门旨在深耕垂直场景,让AI真正落地金融业务。 #进门科技 #AI进宝 #投研智能体 #金融科技 #AI落地 #腾讯云 #认知差 #金融安全
成立于2013年的进门科技,最初以券商研究所路演会议平台闻名,市占率达95%。2023年获得腾讯战投后,全面迭代为“机构AI投研工作台”。2025年,其推出业内首个投研版Agent“AI进宝”,帮助研究员处理海量信息、捕捉边际变化。CEO程建辉表示,Agentic AI让AI从聊天模式进入干活模式,可自动扫描自选股、分析变化、做量化回测等复杂任务。面对金融行业对AI幻觉的零容忍,腾讯云提供安全可靠的底层架构,包括音频水印定位、多Agent编排等能力,确保数据安全。程建辉认为,AI投研不会取代研究员,反而会放大认知差的价值:顶尖分析师的效率从日处理10份研报提升到10万份,年轻一代则能借AI快速成长。进门旨在深耕垂直场景,让AI真正落地金融业务。 #进门科技 #AI进宝 #投研智能体 #金融科技 #AI落地 #腾讯云 #认知差 #金融安全