AI基础设施比AI模型更受企业重视
麦肯锡最新全球调查显示,88%的企业已在至少一个业务中常态化使用AI,但其中只有23%将智能体规模化,仅39%获得可衡量财务回报。高盛指出,超过40%的智能体项目可能因成本上升、价值不明和风险控制薄弱而于2027年底前被取消。企业正将投资从单一助理工具转向能自主执行工作流的智能体,但自愈型AI智能体的规模化离不开治理、可观测性和产品工程这三大支柱。治理设定智能体行为边界,可观测性提供运作证明,产品工程确保系统可靠可维护。缺乏这些要素,智能体即便能自我修复,仍会引入无法被追踪和解释的风险。专家建议,在部署前必须完成就绪评估,确认流程、数据和审批环节能支持智能体自主运行。 #AI基础设施 #智能体 #企业自动化 #治理 #可观测性 #产品工程 #人工智能 #数字化转型
麦肯锡最新全球调查显示,88%的企业已在至少一个业务中常态化使用AI,但其中只有23%将智能体规模化,仅39%获得可衡量财务回报。高盛指出,超过40%的智能体项目可能因成本上升、价值不明和风险控制薄弱而于2027年底前被取消。企业正将投资从单一助理工具转向能自主执行工作流的智能体,但自愈型AI智能体的规模化离不开治理、可观测性和产品工程这三大支柱。治理设定智能体行为边界,可观测性提供运作证明,产品工程确保系统可靠可维护。缺乏这些要素,智能体即便能自我修复,仍会引入无法被追踪和解释的风险。专家建议,在部署前必须完成就绪评估,确认流程、数据和审批环节能支持智能体自主运行。 #AI基础设施 #智能体 #企业自动化 #治理 #可观测性 #产品工程 #人工智能 #数字化转型
SpaceXAI发布Grok 4.5旗舰模型,多模态与编程能力显著提升
7月9日,SpaceXAI(原xAI)正式推出新一代旗舰模型Grok 4.5,定位为编码、智能体任务和知识工作而生的高性能大模型。在302.AI的独立评测中,Grok 4.5在逻辑数学、人类直觉、多模态和编程模拟等任务上表现突出,尤其在多模态细粒度感知上较前代大幅增强。与Claude Opus 4.8对比测试显示,Grok 4.5在SVG动态图绘制和视觉设计上更优,但动态实现略显虚浮;而Opus 4.8在功能型任务(如F1历史交互网页)中数据更真实丰富,技术实现更硬核。该模型目前在Artificial Analysis榜单中排名第8,旨在以极致性能、速度和成本平衡,抢占长链路Agent任务市场。 #Grok4.5 #SpaceXAI #大模型 #AI评测 #多模态 #编程 #智能体 #科技新闻
7月9日,SpaceXAI(原xAI)正式推出新一代旗舰模型Grok 4.5,定位为编码、智能体任务和知识工作而生的高性能大模型。在302.AI的独立评测中,Grok 4.5在逻辑数学、人类直觉、多模态和编程模拟等任务上表现突出,尤其在多模态细粒度感知上较前代大幅增强。与Claude Opus 4.8对比测试显示,Grok 4.5在SVG动态图绘制和视觉设计上更优,但动态实现略显虚浮;而Opus 4.8在功能型任务(如F1历史交互网页)中数据更真实丰富,技术实现更硬核。该模型目前在Artificial Analysis榜单中排名第8,旨在以极致性能、速度和成本平衡,抢占长链路Agent任务市场。 #Grok4.5 #SpaceXAI #大模型 #AI评测 #多模态 #编程 #智能体 #科技新闻
Agent跌跌撞撞闯入现实世界
2026年第二季度,AI Agent从聊天工具蜕变为能自主读文件、跑代码、操作软件的实体。OpenClaw、Codex、Claude Cowork等产品将其拉出对话框,企业迅速掀起Tokenmaxxing运动。然而,月烧25万美元Token的尝试仅两个月便告停,因为审核、判断等瓶颈卡死了提效环节。通用Agent成为新入口,浏览器从总入口降级为工具箱的一员。大模型公司依托统一框架杀入金融、法律等垂直行业,只需替换行业知识即可。但Agent产出与组织能力不匹配:代码提交量增120%,实际上线仅30%。Token消耗中仅10%算力有效影响下一步,大量浪费在重读和试错。下一阶段焦点转向Human in Loop体系与多Agent协作,以解决成本与审核难题。 #AI #Agent #Tokenmaxxing #通用入口 #行业应用 #2026趋势 #大模型
2026年第二季度,AI Agent从聊天工具蜕变为能自主读文件、跑代码、操作软件的实体。OpenClaw、Codex、Claude Cowork等产品将其拉出对话框,企业迅速掀起Tokenmaxxing运动。然而,月烧25万美元Token的尝试仅两个月便告停,因为审核、判断等瓶颈卡死了提效环节。通用Agent成为新入口,浏览器从总入口降级为工具箱的一员。大模型公司依托统一框架杀入金融、法律等垂直行业,只需替换行业知识即可。但Agent产出与组织能力不匹配:代码提交量增120%,实际上线仅30%。Token消耗中仅10%算力有效影响下一步,大量浪费在重读和试错。下一阶段焦点转向Human in Loop体系与多Agent协作,以解决成本与审核难题。 #AI #Agent #Tokenmaxxing #通用入口 #行业应用 #2026趋势 #大模型