全球AI模型审查差异显著,学者呼吁建立通用伦理标准
一项针对多国主流AI模型的测试显示,不同地区的AI在处理敏感话题时存在显著差异。印度Sarvam AI模型拒绝批评种姓制度,中国DeepSeek和Kimi K3 Max屏蔽了关于六四事件的事实性问题,欧洲Mistral AI则提供了包含犯罪数据在内的移民影响分析。研究者指出,当前AI审查主要源于法律恐惧和意识形态绑架,各模型为规避风险而回避直白问题或给出模棱两可的答案,降低用户信任。为解决这一碎片化局面,研究者提出建立由独立国际组织监督的通用AI伦理与透明度标准,基本原则包括:禁止政治审查、基于证据而非叙事、全球统一的诚实标准、明确的限制告知、共享行为准则以及国际审计机制。鉴于直接设立全球监管机构难度大,建议采用类似LEED或公平贸易的认证模式,通过市场力量推动企业遵守。 #AI #人工智能 #伦理 #审查 #全球标准 #技术治理 #透明度
一项针对多国主流AI模型的测试显示,不同地区的AI在处理敏感话题时存在显著差异。印度Sarvam AI模型拒绝批评种姓制度,中国DeepSeek和Kimi K3 Max屏蔽了关于六四事件的事实性问题,欧洲Mistral AI则提供了包含犯罪数据在内的移民影响分析。研究者指出,当前AI审查主要源于法律恐惧和意识形态绑架,各模型为规避风险而回避直白问题或给出模棱两可的答案,降低用户信任。为解决这一碎片化局面,研究者提出建立由独立国际组织监督的通用AI伦理与透明度标准,基本原则包括:禁止政治审查、基于证据而非叙事、全球统一的诚实标准、明确的限制告知、共享行为准则以及国际审计机制。鉴于直接设立全球监管机构难度大,建议采用类似LEED或公平贸易的认证模式,通过市场力量推动企业遵守。 #AI #人工智能 #伦理 #审查 #全球标准 #技术治理 #透明度
AI基础设施比AI模型更受企业重视
麦肯锡最新全球调查显示,88%的企业已在至少一个业务中常态化使用AI,但其中只有23%将智能体规模化,仅39%获得可衡量财务回报。高盛指出,超过40%的智能体项目可能因成本上升、价值不明和风险控制薄弱而于2027年底前被取消。企业正将投资从单一助理工具转向能自主执行工作流的智能体,但自愈型AI智能体的规模化离不开治理、可观测性和产品工程这三大支柱。治理设定智能体行为边界,可观测性提供运作证明,产品工程确保系统可靠可维护。缺乏这些要素,智能体即便能自我修复,仍会引入无法被追踪和解释的风险。专家建议,在部署前必须完成就绪评估,确认流程、数据和审批环节能支持智能体自主运行。 #AI基础设施 #智能体 #企业自动化 #治理 #可观测性 #产品工程 #人工智能 #数字化转型
麦肯锡最新全球调查显示,88%的企业已在至少一个业务中常态化使用AI,但其中只有23%将智能体规模化,仅39%获得可衡量财务回报。高盛指出,超过40%的智能体项目可能因成本上升、价值不明和风险控制薄弱而于2027年底前被取消。企业正将投资从单一助理工具转向能自主执行工作流的智能体,但自愈型AI智能体的规模化离不开治理、可观测性和产品工程这三大支柱。治理设定智能体行为边界,可观测性提供运作证明,产品工程确保系统可靠可维护。缺乏这些要素,智能体即便能自我修复,仍会引入无法被追踪和解释的风险。专家建议,在部署前必须完成就绪评估,确认流程、数据和审批环节能支持智能体自主运行。 #AI基础设施 #智能体 #企业自动化 #治理 #可观测性 #产品工程 #人工智能 #数字化转型
SpaceXAI发布Grok 4.5旗舰模型,多模态与编程能力显著提升
7月9日,SpaceXAI(原xAI)正式推出新一代旗舰模型Grok 4.5,定位为编码、智能体任务和知识工作而生的高性能大模型。在302.AI的独立评测中,Grok 4.5在逻辑数学、人类直觉、多模态和编程模拟等任务上表现突出,尤其在多模态细粒度感知上较前代大幅增强。与Claude Opus 4.8对比测试显示,Grok 4.5在SVG动态图绘制和视觉设计上更优,但动态实现略显虚浮;而Opus 4.8在功能型任务(如F1历史交互网页)中数据更真实丰富,技术实现更硬核。该模型目前在Artificial Analysis榜单中排名第8,旨在以极致性能、速度和成本平衡,抢占长链路Agent任务市场。 #Grok4.5 #SpaceXAI #大模型 #AI评测 #多模态 #编程 #智能体 #科技新闻
7月9日,SpaceXAI(原xAI)正式推出新一代旗舰模型Grok 4.5,定位为编码、智能体任务和知识工作而生的高性能大模型。在302.AI的独立评测中,Grok 4.5在逻辑数学、人类直觉、多模态和编程模拟等任务上表现突出,尤其在多模态细粒度感知上较前代大幅增强。与Claude Opus 4.8对比测试显示,Grok 4.5在SVG动态图绘制和视觉设计上更优,但动态实现略显虚浮;而Opus 4.8在功能型任务(如F1历史交互网页)中数据更真实丰富,技术实现更硬核。该模型目前在Artificial Analysis榜单中排名第8,旨在以极致性能、速度和成本平衡,抢占长链路Agent任务市场。 #Grok4.5 #SpaceXAI #大模型 #AI评测 #多模态 #编程 #智能体 #科技新闻