高通CEO:Agent时代来临,设备将成为AI智能体的核心载体
在2026年台北国际电脑展(Computex)上,高通公司CEO克里斯蒂亚诺·阿蒙发表主题演讲,提出“AI智能体之年”的判断。他指出,AI智能体正成为数字世界的中心,而智能手机、PC、汽车等终端设备将成为这些智能体的硬件载体。阿蒙强调,从功耗仅2毫瓦的传感器到高性能计算设备,硬件必须为智能体的运行提供实时、低延迟的本地计算能力。这一观点标志着AI算力重心正从云端向终端转移,高通将凭借在连接、边缘计算和AI芯片领域的积累,推动设备成为计算的主角。 #高通 #Computex2026 #Agent时代 #AI智能体 #终端计算 #边缘AI #科技趋势
在2026年台北国际电脑展(Computex)上,高通公司CEO克里斯蒂亚诺·阿蒙发表主题演讲,提出“AI智能体之年”的判断。他指出,AI智能体正成为数字世界的中心,而智能手机、PC、汽车等终端设备将成为这些智能体的硬件载体。阿蒙强调,从功耗仅2毫瓦的传感器到高性能计算设备,硬件必须为智能体的运行提供实时、低延迟的本地计算能力。这一观点标志着AI算力重心正从云端向终端转移,高通将凭借在连接、边缘计算和AI芯片领域的积累,推动设备成为计算的主角。 #高通 #Computex2026 #Agent时代 #AI智能体 #终端计算 #边缘AI #科技趋势
OpenAI 升级 GPT-Rosalind,融合 GPT
OpenAI 于 2026 年 6 月 3 日宣布对其生命科学专用模型 GPT-Rosalind 进行重大升级,将 GPT-5.5 的代理式编码与工具使用能力整合其中。该模型针对药物发现、实验设计及高通量数据分析等环节优化,可提升蛋白质结构预测、化合物筛选和生物实验模拟的精度。通过代理能力,模型能基于模拟工具实时反馈自主迭代分子设计,并生成可重复的实验协议。制药公司有望借此更快识别候选药物,每年节省数十亿美元研发成本。OpenAI 表示,该模型可通过企业 API 与现有云基础设施集成,并提供本地部署选项以保障数据隐私。竞争格局方面,Google DeepMind 及多家专业初创公司也在争夺垂直 AI 解决方案市场。行业预测,到 2028 年生物技术领域将广泛采用此类专业 AI 模型,加速临床试验成功率提升。OpenAI 强调,企业需配合分阶段 API 集成、员工培训及数据治理框架,确保合规与可扩展性,同时通过透明度、偏见缓解和人工监督维护科学完整性与患者安全。 #OpenAI #GPTRosalind #药物研发 #AI #生命科学 #大模型 #生物技术 #临床试验
OpenAI 于 2026 年 6 月 3 日宣布对其生命科学专用模型 GPT-Rosalind 进行重大升级,将 GPT-5.5 的代理式编码与工具使用能力整合其中。该模型针对药物发现、实验设计及高通量数据分析等环节优化,可提升蛋白质结构预测、化合物筛选和生物实验模拟的精度。通过代理能力,模型能基于模拟工具实时反馈自主迭代分子设计,并生成可重复的实验协议。制药公司有望借此更快识别候选药物,每年节省数十亿美元研发成本。OpenAI 表示,该模型可通过企业 API 与现有云基础设施集成,并提供本地部署选项以保障数据隐私。竞争格局方面,Google DeepMind 及多家专业初创公司也在争夺垂直 AI 解决方案市场。行业预测,到 2028 年生物技术领域将广泛采用此类专业 AI 模型,加速临床试验成功率提升。OpenAI 强调,企业需配合分阶段 API 集成、员工培训及数据治理框架,确保合规与可扩展性,同时通过透明度、偏见缓解和人工监督维护科学完整性与患者安全。 #OpenAI #GPTRosalind #药物研发 #AI #生命科学 #大模型 #生物技术 #临床试验
Anthropic Mythos 提前半年达成 3 小时 METR 里程碑
据预测研究所报道,Anthropic 的 Mythos 模型预览版在 2026 年 5 月底实现了 METR 80% 任务时长达到 3 小时 6 分钟,匹配了超级预测者原定 2026 年底的中位数预期。METR 指标衡量 AI 系统在至少 80% 成功率下持续完成现实任务的最长时长。这一突破标志着代理 AI 在长上下文推理、错误恢复和工具集成等能力上的加速进步。专家指出,部署此类模型的企业可自动化高达 40% 的知识工作者任务,实现显著降本增效。同时,Anthropic 与 OpenAI 等公司的竞争加剧,推动市场估值上升,也促使监管关注反垄断与伦理合规。预测显示,2027 年有望实现多天任务时长,将对劳动力市场和安全咨询领域产生深远影响。 #AI #Anthropic #Mythos #METR #代理AI #自动化 #科技新闻 #行业趋势 #伦理合规 #监管
据预测研究所报道,Anthropic 的 Mythos 模型预览版在 2026 年 5 月底实现了 METR 80% 任务时长达到 3 小时 6 分钟,匹配了超级预测者原定 2026 年底的中位数预期。METR 指标衡量 AI 系统在至少 80% 成功率下持续完成现实任务的最长时长。这一突破标志着代理 AI 在长上下文推理、错误恢复和工具集成等能力上的加速进步。专家指出,部署此类模型的企业可自动化高达 40% 的知识工作者任务,实现显著降本增效。同时,Anthropic 与 OpenAI 等公司的竞争加剧,推动市场估值上升,也促使监管关注反垄断与伦理合规。预测显示,2027 年有望实现多天任务时长,将对劳动力市场和安全咨询领域产生深远影响。 #AI #Anthropic #Mythos #METR #代理AI #自动化 #科技新闻 #行业趋势 #伦理合规 #监管
MedCUA-Bench:专为临床计算机使用代理设计的纯截图基准测试
来自arXiv预印本的最新研究显示,研究人员提出了一项名为MedCUA-Bench的基准测试,旨在评估临床场景下计算机使用代理(Computer-Use Agents)的性能。该基准测试仅依赖截图作为输入,模拟医生在电子病历系统、影像工作站等临床软件中的操作流程,从而检验AI代理在真实医疗环境中的界面理解与任务执行能力。研究团队通过构建包含多种临床任务的截图数据集,为开发更安全、可靠的医疗AI助手提供了标准化评估工具。该工作已提交至arXiv,并附有论文全文及代码链接。 #MedCUA-Bench #临床AI #计算机使用代理 #基准测试 #医疗AI #arXiv #AI评估
来自arXiv预印本的最新研究显示,研究人员提出了一项名为MedCUA-Bench的基准测试,旨在评估临床场景下计算机使用代理(Computer-Use Agents)的性能。该基准测试仅依赖截图作为输入,模拟医生在电子病历系统、影像工作站等临床软件中的操作流程,从而检验AI代理在真实医疗环境中的界面理解与任务执行能力。研究团队通过构建包含多种临床任务的截图数据集,为开发更安全、可靠的医疗AI助手提供了标准化评估工具。该工作已提交至arXiv,并附有论文全文及代码链接。 #MedCUA-Bench #临床AI #计算机使用代理 #基准测试 #医疗AI #arXiv #AI评估
GTBench:基于课程的大语言模型图论数学研究助手评估基准
研究人员提出了一种名为GTBench的基准测试,该基准基于课程设计理念,专门用于评估大语言模型作为图论数学研究助手的能力。通过设置从基础到复杂的分层问题集,GTBench系统性地测试了LLM在图论领域的推理、证明和问题解决能力。研究团队利用该基准对多个主流大模型进行了评估,结果显示模型在基础概念理解上表现良好,但在复杂定理证明和创造性问题解决方面仍存在显著不足。这项工作为衡量和提升LLM在专业数学研究领域的应用提供了一个标准化的评估框架,有望推动AI辅助数学研究的发展。 #大语言模型 #图论 #数学研究 #基准测试 #AI #科研 #LLM #人工智能
研究人员提出了一种名为GTBench的基准测试,该基准基于课程设计理念,专门用于评估大语言模型作为图论数学研究助手的能力。通过设置从基础到复杂的分层问题集,GTBench系统性地测试了LLM在图论领域的推理、证明和问题解决能力。研究团队利用该基准对多个主流大模型进行了评估,结果显示模型在基础概念理解上表现良好,但在复杂定理证明和创造性问题解决方面仍存在显著不足。这项工作为衡量和提升LLM在专业数学研究领域的应用提供了一个标准化的评估框架,有望推动AI辅助数学研究的发展。 #大语言模型 #图论 #数学研究 #基准测试 #AI #科研 #LLM #人工智能
新研究提出“先思后语”多智能体社会模拟框架
近日,一篇提交至arXiv的论文《Think-Before-Speak: From Internal Evaluation to Public Expression in Multi-Agent Social Simulation》提出了一种新型多智能体社会模拟框架。该研究由Kaiqi Yang等人完成,核心思想是让智能体在公开发表言论前先进行内部评估,从而更真实地模拟人类社会的沟通与协作过程。传统多智能体系统往往让每个智能体直接输出回复,忽略了“思考后再表达”的认知环节。新方法引入内部评价机制,智能体在形成初步判断后,会进行自我审视和逻辑校验,再决定是否以及如何表达观点。实验表明,这一机制能显著提升模拟对话的合理性与推理深度,减少错误信息的传播,并增强群体决策的稳定性。该研究为人机协作、社交机器人及复杂系统仿真提供了新的设计思路,未来可望应用于在线讨论、民主协商模拟等领域。 #多智能体 #社会模拟 #先思后语 #AI推理 #arXiv #研究论文 #认知科学 #人机协作
近日,一篇提交至arXiv的论文《Think-Before-Speak: From Internal Evaluation to Public Expression in Multi-Agent Social Simulation》提出了一种新型多智能体社会模拟框架。该研究由Kaiqi Yang等人完成,核心思想是让智能体在公开发表言论前先进行内部评估,从而更真实地模拟人类社会的沟通与协作过程。传统多智能体系统往往让每个智能体直接输出回复,忽略了“思考后再表达”的认知环节。新方法引入内部评价机制,智能体在形成初步判断后,会进行自我审视和逻辑校验,再决定是否以及如何表达观点。实验表明,这一机制能显著提升模拟对话的合理性与推理深度,减少错误信息的传播,并增强群体决策的稳定性。该研究为人机协作、社交机器人及复杂系统仿真提供了新的设计思路,未来可望应用于在线讨论、民主协商模拟等领域。 #多智能体 #社会模拟 #先思后语 #AI推理 #arXiv #研究论文 #认知科学 #人机协作
EvoTrainer:协同进化LLM策略与训练框架,实现自主智能体强化学习
近日,一篇题为《EvoTrainer: Co-Evolving LLM Policies and Training Harnesses for Autonomous Agentic Reinforcement Learning》的论文引起关注。该研究提出了EvoTrainer框架,通过让大语言模型(LLM)的策略与训练框架协同进化,解决了传统强化学习中人工设计奖励函数和训练流程的瓶颈。EvoTrainer允许智能体在动态环境中自主调整学习策略,同时训练框架本身也能根据智能体表现进行优化,形成闭环进化。这一方法有望推动自主智能体在复杂任务中的泛化能力,减少人工干预,为下一代通用人工智能的发展提供新思路。论文已提交至arXiv平台,相关代码和数据可供研究者复现。 #EvoTrainer #强化学习 #LLM #自主智能体 #协同进化 #人工智能 #arXiv #AI前沿
近日,一篇题为《EvoTrainer: Co-Evolving LLM Policies and Training Harnesses for Autonomous Agentic Reinforcement Learning》的论文引起关注。该研究提出了EvoTrainer框架,通过让大语言模型(LLM)的策略与训练框架协同进化,解决了传统强化学习中人工设计奖励函数和训练流程的瓶颈。EvoTrainer允许智能体在动态环境中自主调整学习策略,同时训练框架本身也能根据智能体表现进行优化,形成闭环进化。这一方法有望推动自主智能体在复杂任务中的泛化能力,减少人工干预,为下一代通用人工智能的发展提供新思路。论文已提交至arXiv平台,相关代码和数据可供研究者复现。 #EvoTrainer #强化学习 #LLM #自主智能体 #协同进化 #人工智能 #arXiv #AI前沿
上海人工智能实验室领军科学家胡侠确认出席AICon上海站,分享智能体安全实践
AICon 2026上海站将于6月26日至27日举行,聚焦“构建可信赖、可规模化、可商业化的Agentic操作系统”。大会集结清华、复旦等高校教授及阿里、腾讯、华为等数十家头部公司技术专家,设置13大专题、近60场议题,深度探讨Agent工程化落地。上海人工智能实验室领军科学家胡侠确认出席“Agent安全、评测与可信治理”专题,分享《面向智能体的“安全即服务”模式探索:书安智能体操作系统的实践与思考》。他将介绍如何将安全能力内嵌于智能体运行全流程,构建系统隔离、流程治理、行为约束与持续演化的安全机制,支撑智能体在复杂业务中的稳定运行。胡侠曾任美国莱斯大学教授,发表论文200余篇,被引超4万次,主导开发AutoKeras等知名系统。 #AICon #上海人工智能实验室 #胡侠 #智能体 #Agent #安全即服务 #书安智能体操作系统 #AI工程化
AICon 2026上海站将于6月26日至27日举行,聚焦“构建可信赖、可规模化、可商业化的Agentic操作系统”。大会集结清华、复旦等高校教授及阿里、腾讯、华为等数十家头部公司技术专家,设置13大专题、近60场议题,深度探讨Agent工程化落地。上海人工智能实验室领军科学家胡侠确认出席“Agent安全、评测与可信治理”专题,分享《面向智能体的“安全即服务”模式探索:书安智能体操作系统的实践与思考》。他将介绍如何将安全能力内嵌于智能体运行全流程,构建系统隔离、流程治理、行为约束与持续演化的安全机制,支撑智能体在复杂业务中的稳定运行。胡侠曾任美国莱斯大学教授,发表论文200余篇,被引超4万次,主导开发AutoKeras等知名系统。 #AICon #上海人工智能实验室 #胡侠 #智能体 #Agent #安全即服务 #书安智能体操作系统 #AI工程化
DeskCraft 发布:桌面代理在专业工作流与人机协同中的基准测试
近日,一篇题为《DeskCraft: Benchmarking Desktop Agents on Professional Workflows and Human-in-the-Loop Collaboration》的学术论文在arXiv预印本平台公开。该研究由Wenkai Wang等8位作者共同完成,主要针对桌面代理在专业工作流场景下的性能以及人机协作效果提出了新的基准测试框架。DeskCraft旨在评估AI代理在执行复杂桌面任务时的准确率、效率和协作能力,涵盖文档处理、数据分析等典型企业级应用。研究团队设计了多种交互模式和评价指标,为未来桌面自动化与人工智能辅助办公的发展提供了参考标准。这一成果有望推动桌面代理在实际工作环境中的落地应用。 #桌面代理 #人机协作 #基准测试 #AI #专业工作流 #arXiv #研究论文
近日,一篇题为《DeskCraft: Benchmarking Desktop Agents on Professional Workflows and Human-in-the-Loop Collaboration》的学术论文在arXiv预印本平台公开。该研究由Wenkai Wang等8位作者共同完成,主要针对桌面代理在专业工作流场景下的性能以及人机协作效果提出了新的基准测试框架。DeskCraft旨在评估AI代理在执行复杂桌面任务时的准确率、效率和协作能力,涵盖文档处理、数据分析等典型企业级应用。研究团队设计了多种交互模式和评价指标,为未来桌面自动化与人工智能辅助办公的发展提供了参考标准。这一成果有望推动桌面代理在实际工作环境中的落地应用。 #桌面代理 #人机协作 #基准测试 #AI #专业工作流 #arXiv #研究论文
从长新闻到精准预测:重要性感知融合与PRM引导反射的时间序列预测方法
一篇题为《From Long News to Accurate Forecast: Importance-Aware Fusion and PRM-Guided Reflection for Time Series Forecasting》的学术论文引发关注。该研究由Mingyang Liu等九位作者共同完成,提出了一种结合重要性感知融合与过程奖励模型(PRM)引导反射的新框架,旨在从长篇新闻文本中提取关键信息,提升时间序列预测的准确性。论文通过多源数据融合与迭代推理优化,显著增强了模型对复杂动态事件的理解能力,为金融、气象等领域的精准预测提供了新思路。目前该论文已提交至arXiv平台,正在等待数据引用注册。 #时间序列预测 #新闻融合 #PRM #重要性感知 #深度学习 #AI #学术论文 #arXiv
一篇题为《From Long News to Accurate Forecast: Importance-Aware Fusion and PRM-Guided Reflection for Time Series Forecasting》的学术论文引发关注。该研究由Mingyang Liu等九位作者共同完成,提出了一种结合重要性感知融合与过程奖励模型(PRM)引导反射的新框架,旨在从长篇新闻文本中提取关键信息,提升时间序列预测的准确性。论文通过多源数据融合与迭代推理优化,显著增强了模型对复杂动态事件的理解能力,为金融、气象等领域的精准预测提供了新思路。目前该论文已提交至arXiv平台,正在等待数据引用注册。 #时间序列预测 #新闻融合 #PRM #重要性感知 #深度学习 #AI #学术论文 #arXiv
DELTAMEM:基于残差树的LLM代理增量经验记忆方法
近日,arXiv上预印本论文《DELTAMEM: Incremental Experience Memory for LLM Agents via Residual Trees》由Haoran Tan等四位作者提交。该研究针对大语言模型(LLM)代理在持续交互中需要存储和利用历史经验的问题,提出了一种名为DELTAMEM的增量经验记忆方法。该方法创新性地利用残差树(Residual Trees)结构,在维护代理记忆时仅记录与先前状态的关键差异,从而减少存储冗余并提高检索效率。实验表明,DELTAMEM在多个长期任务基准上显著优于现有记忆机制,使LLM代理能够更高效地积累和复用经验。这一工作为构建具备长期记忆能力的智能代理提供了新思路,有望推动对话系统、个人助手等场景的持续学习与自适应能力提升。 #LLM #代理 #增量记忆 #残差树 #人工智能 #论文 #arXiv
近日,arXiv上预印本论文《DELTAMEM: Incremental Experience Memory for LLM Agents via Residual Trees》由Haoran Tan等四位作者提交。该研究针对大语言模型(LLM)代理在持续交互中需要存储和利用历史经验的问题,提出了一种名为DELTAMEM的增量经验记忆方法。该方法创新性地利用残差树(Residual Trees)结构,在维护代理记忆时仅记录与先前状态的关键差异,从而减少存储冗余并提高检索效率。实验表明,DELTAMEM在多个长期任务基准上显著优于现有记忆机制,使LLM代理能够更高效地积累和复用经验。这一工作为构建具备长期记忆能力的智能代理提供了新思路,有望推动对话系统、个人助手等场景的持续学习与自适应能力提升。 #LLM #代理 #增量记忆 #残差树 #人工智能 #论文 #arXiv