欧盟发布《云与AI发展法案》,开源优先条款引争议
欧盟委员会于6月3日发布技术主权一揽子计划,其中备受瞩目的《欧盟云与AI发展法案》(CADA)正式出台。该法案包含第41条“推广开源解决方案与开源优先”,要求欧盟及成员国采取必要措施,鼓励公共部门在构建云与AI生态系统时优先使用开源标准和组件。这是欧盟委员会迄今最雄心勃勃的开源承诺,被视为SUSE等企业主权愿景的重要验证。然而,分析人士指出,该条款仅将开源列为采购偏好,缺乏具有约束力和可执行性的程序性要求,未能从根本上确立开源作为实现欧洲主权的唯一架构条件。目前已有近百个组织联名致信欧盟委员会,要求完善立法框架。 #欧盟 #云与AI #开源 #技术主权 #立法 #数字主权
欧盟委员会于6月3日发布技术主权一揽子计划,其中备受瞩目的《欧盟云与AI发展法案》(CADA)正式出台。该法案包含第41条“推广开源解决方案与开源优先”,要求欧盟及成员国采取必要措施,鼓励公共部门在构建云与AI生态系统时优先使用开源标准和组件。这是欧盟委员会迄今最雄心勃勃的开源承诺,被视为SUSE等企业主权愿景的重要验证。然而,分析人士指出,该条款仅将开源列为采购偏好,缺乏具有约束力和可执行性的程序性要求,未能从根本上确立开源作为实现欧洲主权的唯一架构条件。目前已有近百个组织联名致信欧盟委员会,要求完善立法框架。 #欧盟 #云与AI #开源 #技术主权 #立法 #数字主权
高通CEO:Agent时代来临,设备将成为AI智能体的核心载体
在2026年台北国际电脑展(Computex)上,高通公司CEO克里斯蒂亚诺·阿蒙发表主题演讲,提出“AI智能体之年”的判断。他指出,AI智能体正成为数字世界的中心,而智能手机、PC、汽车等终端设备将成为这些智能体的硬件载体。阿蒙强调,从功耗仅2毫瓦的传感器到高性能计算设备,硬件必须为智能体的运行提供实时、低延迟的本地计算能力。这一观点标志着AI算力重心正从云端向终端转移,高通将凭借在连接、边缘计算和AI芯片领域的积累,推动设备成为计算的主角。 #高通 #Computex2026 #Agent时代 #AI智能体 #终端计算 #边缘AI #科技趋势
在2026年台北国际电脑展(Computex)上,高通公司CEO克里斯蒂亚诺·阿蒙发表主题演讲,提出“AI智能体之年”的判断。他指出,AI智能体正成为数字世界的中心,而智能手机、PC、汽车等终端设备将成为这些智能体的硬件载体。阿蒙强调,从功耗仅2毫瓦的传感器到高性能计算设备,硬件必须为智能体的运行提供实时、低延迟的本地计算能力。这一观点标志着AI算力重心正从云端向终端转移,高通将凭借在连接、边缘计算和AI芯片领域的积累,推动设备成为计算的主角。 #高通 #Computex2026 #Agent时代 #AI智能体 #终端计算 #边缘AI #科技趋势
OpenAI 升级 GPT-Rosalind,融合 GPT
OpenAI 于 2026 年 6 月 3 日宣布对其生命科学专用模型 GPT-Rosalind 进行重大升级,将 GPT-5.5 的代理式编码与工具使用能力整合其中。该模型针对药物发现、实验设计及高通量数据分析等环节优化,可提升蛋白质结构预测、化合物筛选和生物实验模拟的精度。通过代理能力,模型能基于模拟工具实时反馈自主迭代分子设计,并生成可重复的实验协议。制药公司有望借此更快识别候选药物,每年节省数十亿美元研发成本。OpenAI 表示,该模型可通过企业 API 与现有云基础设施集成,并提供本地部署选项以保障数据隐私。竞争格局方面,Google DeepMind 及多家专业初创公司也在争夺垂直 AI 解决方案市场。行业预测,到 2028 年生物技术领域将广泛采用此类专业 AI 模型,加速临床试验成功率提升。OpenAI 强调,企业需配合分阶段 API 集成、员工培训及数据治理框架,确保合规与可扩展性,同时通过透明度、偏见缓解和人工监督维护科学完整性与患者安全。 #OpenAI #GPTRosalind #药物研发 #AI #生命科学 #大模型 #生物技术 #临床试验
OpenAI 于 2026 年 6 月 3 日宣布对其生命科学专用模型 GPT-Rosalind 进行重大升级,将 GPT-5.5 的代理式编码与工具使用能力整合其中。该模型针对药物发现、实验设计及高通量数据分析等环节优化,可提升蛋白质结构预测、化合物筛选和生物实验模拟的精度。通过代理能力,模型能基于模拟工具实时反馈自主迭代分子设计,并生成可重复的实验协议。制药公司有望借此更快识别候选药物,每年节省数十亿美元研发成本。OpenAI 表示,该模型可通过企业 API 与现有云基础设施集成,并提供本地部署选项以保障数据隐私。竞争格局方面,Google DeepMind 及多家专业初创公司也在争夺垂直 AI 解决方案市场。行业预测,到 2028 年生物技术领域将广泛采用此类专业 AI 模型,加速临床试验成功率提升。OpenAI 强调,企业需配合分阶段 API 集成、员工培训及数据治理框架,确保合规与可扩展性,同时通过透明度、偏见缓解和人工监督维护科学完整性与患者安全。 #OpenAI #GPTRosalind #药物研发 #AI #生命科学 #大模型 #生物技术 #临床试验
Anthropic Mythos 提前半年达成 3 小时 METR 里程碑
据预测研究所报道,Anthropic 的 Mythos 模型预览版在 2026 年 5 月底实现了 METR 80% 任务时长达到 3 小时 6 分钟,匹配了超级预测者原定 2026 年底的中位数预期。METR 指标衡量 AI 系统在至少 80% 成功率下持续完成现实任务的最长时长。这一突破标志着代理 AI 在长上下文推理、错误恢复和工具集成等能力上的加速进步。专家指出,部署此类模型的企业可自动化高达 40% 的知识工作者任务,实现显著降本增效。同时,Anthropic 与 OpenAI 等公司的竞争加剧,推动市场估值上升,也促使监管关注反垄断与伦理合规。预测显示,2027 年有望实现多天任务时长,将对劳动力市场和安全咨询领域产生深远影响。 #AI #Anthropic #Mythos #METR #代理AI #自动化 #科技新闻 #行业趋势 #伦理合规 #监管
据预测研究所报道,Anthropic 的 Mythos 模型预览版在 2026 年 5 月底实现了 METR 80% 任务时长达到 3 小时 6 分钟,匹配了超级预测者原定 2026 年底的中位数预期。METR 指标衡量 AI 系统在至少 80% 成功率下持续完成现实任务的最长时长。这一突破标志着代理 AI 在长上下文推理、错误恢复和工具集成等能力上的加速进步。专家指出,部署此类模型的企业可自动化高达 40% 的知识工作者任务,实现显著降本增效。同时,Anthropic 与 OpenAI 等公司的竞争加剧,推动市场估值上升,也促使监管关注反垄断与伦理合规。预测显示,2027 年有望实现多天任务时长,将对劳动力市场和安全咨询领域产生深远影响。 #AI #Anthropic #Mythos #METR #代理AI #自动化 #科技新闻 #行业趋势 #伦理合规 #监管
MedCUA-Bench:专为临床计算机使用代理设计的纯截图基准测试
来自arXiv预印本的最新研究显示,研究人员提出了一项名为MedCUA-Bench的基准测试,旨在评估临床场景下计算机使用代理(Computer-Use Agents)的性能。该基准测试仅依赖截图作为输入,模拟医生在电子病历系统、影像工作站等临床软件中的操作流程,从而检验AI代理在真实医疗环境中的界面理解与任务执行能力。研究团队通过构建包含多种临床任务的截图数据集,为开发更安全、可靠的医疗AI助手提供了标准化评估工具。该工作已提交至arXiv,并附有论文全文及代码链接。 #MedCUA-Bench #临床AI #计算机使用代理 #基准测试 #医疗AI #arXiv #AI评估
来自arXiv预印本的最新研究显示,研究人员提出了一项名为MedCUA-Bench的基准测试,旨在评估临床场景下计算机使用代理(Computer-Use Agents)的性能。该基准测试仅依赖截图作为输入,模拟医生在电子病历系统、影像工作站等临床软件中的操作流程,从而检验AI代理在真实医疗环境中的界面理解与任务执行能力。研究团队通过构建包含多种临床任务的截图数据集,为开发更安全、可靠的医疗AI助手提供了标准化评估工具。该工作已提交至arXiv,并附有论文全文及代码链接。 #MedCUA-Bench #临床AI #计算机使用代理 #基准测试 #医疗AI #arXiv #AI评估
GTBench:基于课程的大语言模型图论数学研究助手评估基准
研究人员提出了一种名为GTBench的基准测试,该基准基于课程设计理念,专门用于评估大语言模型作为图论数学研究助手的能力。通过设置从基础到复杂的分层问题集,GTBench系统性地测试了LLM在图论领域的推理、证明和问题解决能力。研究团队利用该基准对多个主流大模型进行了评估,结果显示模型在基础概念理解上表现良好,但在复杂定理证明和创造性问题解决方面仍存在显著不足。这项工作为衡量和提升LLM在专业数学研究领域的应用提供了一个标准化的评估框架,有望推动AI辅助数学研究的发展。 #大语言模型 #图论 #数学研究 #基准测试 #AI #科研 #LLM #人工智能
研究人员提出了一种名为GTBench的基准测试,该基准基于课程设计理念,专门用于评估大语言模型作为图论数学研究助手的能力。通过设置从基础到复杂的分层问题集,GTBench系统性地测试了LLM在图论领域的推理、证明和问题解决能力。研究团队利用该基准对多个主流大模型进行了评估,结果显示模型在基础概念理解上表现良好,但在复杂定理证明和创造性问题解决方面仍存在显著不足。这项工作为衡量和提升LLM在专业数学研究领域的应用提供了一个标准化的评估框架,有望推动AI辅助数学研究的发展。 #大语言模型 #图论 #数学研究 #基准测试 #AI #科研 #LLM #人工智能
新研究提出“先思后语”多智能体社会模拟框架
近日,一篇提交至arXiv的论文《Think-Before-Speak: From Internal Evaluation to Public Expression in Multi-Agent Social Simulation》提出了一种新型多智能体社会模拟框架。该研究由Kaiqi Yang等人完成,核心思想是让智能体在公开发表言论前先进行内部评估,从而更真实地模拟人类社会的沟通与协作过程。传统多智能体系统往往让每个智能体直接输出回复,忽略了“思考后再表达”的认知环节。新方法引入内部评价机制,智能体在形成初步判断后,会进行自我审视和逻辑校验,再决定是否以及如何表达观点。实验表明,这一机制能显著提升模拟对话的合理性与推理深度,减少错误信息的传播,并增强群体决策的稳定性。该研究为人机协作、社交机器人及复杂系统仿真提供了新的设计思路,未来可望应用于在线讨论、民主协商模拟等领域。 #多智能体 #社会模拟 #先思后语 #AI推理 #arXiv #研究论文 #认知科学 #人机协作
近日,一篇提交至arXiv的论文《Think-Before-Speak: From Internal Evaluation to Public Expression in Multi-Agent Social Simulation》提出了一种新型多智能体社会模拟框架。该研究由Kaiqi Yang等人完成,核心思想是让智能体在公开发表言论前先进行内部评估,从而更真实地模拟人类社会的沟通与协作过程。传统多智能体系统往往让每个智能体直接输出回复,忽略了“思考后再表达”的认知环节。新方法引入内部评价机制,智能体在形成初步判断后,会进行自我审视和逻辑校验,再决定是否以及如何表达观点。实验表明,这一机制能显著提升模拟对话的合理性与推理深度,减少错误信息的传播,并增强群体决策的稳定性。该研究为人机协作、社交机器人及复杂系统仿真提供了新的设计思路,未来可望应用于在线讨论、民主协商模拟等领域。 #多智能体 #社会模拟 #先思后语 #AI推理 #arXiv #研究论文 #认知科学 #人机协作