CHI-Bench 开源基准测试揭示 AI 医疗 Agent 能力短板,最强模型任务通过率仅 28%
CHI-Bench 是一个专注于美国医疗系统的开源评估基准,近日在 ModelScope 魔搭社区正式发布。该项目设计了 75 个模拟医疗长程工作流的任务,涵盖从临床诊疗到保险理赔的完整流程,旨在测试前沿 AI Agent 的实际应用能力。研究人员使用该基准对包括 Claude Code 在内的 30 个先进 AI Agent 进行了压力测试。结果发现,表现最佳的 Claude Code 仅通过了 28% 的任务,而在涉及医院与保险公司直接协作的端到端任务中,所有 Agent 的得分均归零。这一结果凸显了当前 AI 技术在处理复杂医疗流程和跨机构协同工作时的显著局限性,为未来 AI 医疗系统的开发与优化提供了重要警示和参考方向。 #CHIBench #AI医疗 #基准测试 #人工智能 #医疗科技 #ClaudeCode #开源项目 #美国医疗 #Agent评估
CHI-Bench 是一个专注于美国医疗系统的开源评估基准,近日在 ModelScope 魔搭社区正式发布。该项目设计了 75 个模拟医疗长程工作流的任务,涵盖从临床诊疗到保险理赔的完整流程,旨在测试前沿 AI Agent 的实际应用能力。研究人员使用该基准对包括 Claude Code 在内的 30 个先进 AI Agent 进行了压力测试。结果发现,表现最佳的 Claude Code 仅通过了 28% 的任务,而在涉及医院与保险公司直接协作的端到端任务中,所有 Agent 的得分均归零。这一结果凸显了当前 AI 技术在处理复杂医疗流程和跨机构协同工作时的显著局限性,为未来 AI 医疗系统的开发与优化提供了重要警示和参考方向。 #CHIBench #AI医疗 #基准测试 #人工智能 #医疗科技 #ClaudeCode #开源项目 #美国医疗 #Agent评估
学习AVA:可信任AI在政策与开发研究中的经验教训
一篇题为《学习AVA:可信任生成式AI在政策与开发研究中的早期经验教训》的学术论文于2026年4月20日在arXiv平台发布。该研究由Nimisha Karnatak等六位作者共同完成,聚焦于名为AVA的可信任生成式AI系统,探讨了其在政策制定和发展研究领域的实际应用。论文基于AVA项目的实践案例,深入分析了在复杂政策和开发环境中构建可信任AI所面临的挑战,包括数据策展、模型透明度以及用户交互等方面的关键经验。研究指出,确保AI系统的可信度对于推动其在公共政策和国际发展领域的负责任使用至关重要。这些初步教训为未来AI技术的集成提供了指导,有助于研究人员和决策者更安全、有效地利用生成式AI工具支持政策分析和开发项目。 #AI #可信任AI #政策研究 #开发研究 #生成式AI #arXiv #学术论文 #人工智能 #数据策展
一篇题为《学习AVA:可信任生成式AI在政策与开发研究中的早期经验教训》的学术论文于2026年4月20日在arXiv平台发布。该研究由Nimisha Karnatak等六位作者共同完成,聚焦于名为AVA的可信任生成式AI系统,探讨了其在政策制定和发展研究领域的实际应用。论文基于AVA项目的实践案例,深入分析了在复杂政策和开发环境中构建可信任AI所面临的挑战,包括数据策展、模型透明度以及用户交互等方面的关键经验。研究指出,确保AI系统的可信度对于推动其在公共政策和国际发展领域的负责任使用至关重要。这些初步教训为未来AI技术的集成提供了指导,有助于研究人员和决策者更安全、有效地利用生成式AI工具支持政策分析和开发项目。 #AI #可信任AI #政策研究 #开发研究 #生成式AI #arXiv #学术论文 #人工智能 #数据策展
AI教学意外发现
在教授高级AI核心前沿技术的过程中,作者Steve Repetti发现了一个意外现象。原本他试图让AI(如Claude)掌握其共同编写的FGL平台,并解决AI在无关问题上产生混淆回答的缺陷。通过与AI的迭代协作和学习,他不仅提升了AI的流畅度,还意外创建出一个可移植的纯文本文件。该文件为Markdown或普通文本格式,高度优化了AI的上下文窗口和令牌成本限制,无需任何安装、账户或平台配置,直接拖入任何现代AI聊天中,即可在几秒内使AI精通特定知识领域。这一发现揭示了知识传递的新方式:文件本身成为工具链,实现了领域特定知识的即时跨平台共享。与平台绑定的知识容器(如自定义GPT)不同,这种“可移植入门文件”更具通用性,适用于需要多AI工具协作的场景,代表了AI辅助学习的创新突破。 #AI #科技 #创新 #知识管理 #人工智能 #前沿技术 #可移植性 #教育 #协作学习
在教授高级AI核心前沿技术的过程中,作者Steve Repetti发现了一个意外现象。原本他试图让AI(如Claude)掌握其共同编写的FGL平台,并解决AI在无关问题上产生混淆回答的缺陷。通过与AI的迭代协作和学习,他不仅提升了AI的流畅度,还意外创建出一个可移植的纯文本文件。该文件为Markdown或普通文本格式,高度优化了AI的上下文窗口和令牌成本限制,无需任何安装、账户或平台配置,直接拖入任何现代AI聊天中,即可在几秒内使AI精通特定知识领域。这一发现揭示了知识传递的新方式:文件本身成为工具链,实现了领域特定知识的即时跨平台共享。与平台绑定的知识容器(如自定义GPT)不同,这种“可移植入门文件”更具通用性,适用于需要多AI工具协作的场景,代表了AI辅助学习的创新突破。 #AI #科技 #创新 #知识管理 #人工智能 #前沿技术 #可移植性 #教育 #协作学习
企业部署AI代理面临安全风险,专家提出七大管理原则
2026年,AI代理(AI Agents)已从演示工具转变为企业实用解决方案。与传统“问答式”AI助手不同,AI代理能自主执行复杂任务,例如自动规划路径、处理实时交通状况。斯坦福HAI研究所数据显示,其基准测试准确率一年内从12%跃升至66%,其中Nous Research开源的Hermes Agent增长迅猛,已在GitHub获得超10万星标,并强调本地运行与零已知漏洞的安全优势。 然而,AI代理的强大自主性伴随显著风险。此前PocketOS代理曾于9秒内误删生产数据库,凸显了权限管理失控的严重后果。为此,行业专家提出七项核心管理原则:遵循最小权限原则、关键操作需人工审批、使用Docker等沙箱环境、避免向代理暴露敏感信息、审核第三方技能来源、全程日志审计,以及严格区分个人与企业代理使用场景。 业界认为,妥善管理AI代理风险的企业将获得竞争优势,而忽视安全则可能付出高昂代价。开源工具如Hermes Agent在提供强大功能的同时,也要求使用者对潜在错误负责。 #AI代理 #网络安全 #企业管理 #风险管理 #开源AI #HermesAgent #人工智能
2026年,AI代理(AI Agents)已从演示工具转变为企业实用解决方案。与传统“问答式”AI助手不同,AI代理能自主执行复杂任务,例如自动规划路径、处理实时交通状况。斯坦福HAI研究所数据显示,其基准测试准确率一年内从12%跃升至66%,其中Nous Research开源的Hermes Agent增长迅猛,已在GitHub获得超10万星标,并强调本地运行与零已知漏洞的安全优势。 然而,AI代理的强大自主性伴随显著风险。此前PocketOS代理曾于9秒内误删生产数据库,凸显了权限管理失控的严重后果。为此,行业专家提出七项核心管理原则:遵循最小权限原则、关键操作需人工审批、使用Docker等沙箱环境、避免向代理暴露敏感信息、审核第三方技能来源、全程日志审计,以及严格区分个人与企业代理使用场景。 业界认为,妥善管理AI代理风险的企业将获得竞争优势,而忽视安全则可能付出高昂代价。开源工具如Hermes Agent在提供强大功能的同时,也要求使用者对潜在错误负责。 #AI代理 #网络安全 #企业管理 #风险管理 #开源AI #HermesAgent #人工智能
IBM与红帽宣布50亿美元开源安全计划,应对AI时代漏洞挑战
IBM与红帽联合宣布启动“光井计划”,承诺投资50亿美元,利用前沿AI能力和超过2万名工程师的全球团队,帮助企业保障开源软件安全。该计划旨在建立全新的企业级开源使用模式,覆盖从上游开发到生产环境的整个生命周期。 计划核心是建立一个可信的企业级漏洞协调中心,结合全球工程师力量,大规模识别和修复漏洞。该中心将作为安全协调层,利用AI技术对海量开源代码进行测试和验证。这些能力将通过商业订阅提供,让企业能将经验证的安全补丁直接集成到现有供应链中。 目前,开源软件支撑着现代企业基础设施,超过90%的财富500强公司依赖开源软件。与此同时,AI技术的快速发展也加速了漏洞的发现与利用。IBM和红帽已与美国银行、花旗、高盛等十多家大型金融机构合作开展早期试点,共同塑造漏洞修复的新模式。 #IBM #红帽 #开源安全 #AI #光井计划 #企业级软件 #网络安全 #漏洞修复 #金融科技
IBM与红帽联合宣布启动“光井计划”,承诺投资50亿美元,利用前沿AI能力和超过2万名工程师的全球团队,帮助企业保障开源软件安全。该计划旨在建立全新的企业级开源使用模式,覆盖从上游开发到生产环境的整个生命周期。 计划核心是建立一个可信的企业级漏洞协调中心,结合全球工程师力量,大规模识别和修复漏洞。该中心将作为安全协调层,利用AI技术对海量开源代码进行测试和验证。这些能力将通过商业订阅提供,让企业能将经验证的安全补丁直接集成到现有供应链中。 目前,开源软件支撑着现代企业基础设施,超过90%的财富500强公司依赖开源软件。与此同时,AI技术的快速发展也加速了漏洞的发现与利用。IBM和红帽已与美国银行、花旗、高盛等十多家大型金融机构合作开展早期试点,共同塑造漏洞修复的新模式。 #IBM #红帽 #开源安全 #AI #光井计划 #企业级软件 #网络安全 #漏洞修复 #金融科技
破解本地 AI 代理效能瓶颈
要在本地让大语言模型代理真正发挥效用,远不止简单运行模型那么简单。本文以构建用于自动化单细胞RNA测序分析的代理为例,指出本地代理面临的核心挑战:冗长的指令和工具定义导致推理缓慢,且长会话容易因上下文溢出而崩溃。作者认为,对于需要高度可复现性和过程追踪的科学工作流,必须自主构建底层基础设施。 为了解决这些问题,作者通过一系列优化措施改进了开源推理引擎 vLLM,显著提升了推理速度。同时,他们设计了更好的上下文管理和结构化的“世界状态”来保存关键分析信息,确保长会话的稳定性。实验表明,在A100和H100 GPU上,这些优化有效提升了代理的性能和实用性,使基于本地开放权重模型(如Qwen3.6–27B、Gemma 4–31B)构建可靠的科学代理成为可能。 #本地AI #大语言模型 #科学计算 #AI基础设施 #vLLM #单细胞分析 #人工智能 #科技新闻
要在本地让大语言模型代理真正发挥效用,远不止简单运行模型那么简单。本文以构建用于自动化单细胞RNA测序分析的代理为例,指出本地代理面临的核心挑战:冗长的指令和工具定义导致推理缓慢,且长会话容易因上下文溢出而崩溃。作者认为,对于需要高度可复现性和过程追踪的科学工作流,必须自主构建底层基础设施。 为了解决这些问题,作者通过一系列优化措施改进了开源推理引擎 vLLM,显著提升了推理速度。同时,他们设计了更好的上下文管理和结构化的“世界状态”来保存关键分析信息,确保长会话的稳定性。实验表明,在A100和H100 GPU上,这些优化有效提升了代理的性能和实用性,使基于本地开放权重模型(如Qwen3.6–27B、Gemma 4–31B)构建可靠的科学代理成为可能。 #本地AI #大语言模型 #科学计算 #AI基础设施 #vLLM #单细胞分析 #人工智能 #科技新闻