CHI-Bench 开源基准测试揭示 AI 医疗 Agent 能力短板,最强模型任务通过率仅 28%
CHI-Bench 是一个专注于美国医疗系统的开源评估基准,近日在 ModelScope 魔搭社区正式发布。该项目设计了 75 个模拟医疗长程工作流的任务,涵盖从临床诊疗到保险理赔的完整流程,旨在测试前沿 AI Agent 的实际应用能力。研究人员使用该基准对包括 Claude Code 在内的 30 个先进 AI Agent 进行了压力测试。结果发现,表现最佳的 Claude Code 仅通过了 28% 的任务,而在涉及医院与保险公司直接协作的端到端任务中,所有 Agent 的得分均归零。这一结果凸显了当前 AI 技术在处理复杂医疗流程和跨机构协同工作时的显著局限性,为未来 AI 医疗系统的开发与优化提供了重要警示和参考方向。 #CHIBench #AI医疗 #基准测试 #人工智能 #医疗科技 #ClaudeCode #开源项目 #美国医疗 #Agent评估
CHI-Bench 是一个专注于美国医疗系统的开源评估基准,近日在 ModelScope 魔搭社区正式发布。该项目设计了 75 个模拟医疗长程工作流的任务,涵盖从临床诊疗到保险理赔的完整流程,旨在测试前沿 AI Agent 的实际应用能力。研究人员使用该基准对包括 Claude Code 在内的 30 个先进 AI Agent 进行了压力测试。结果发现,表现最佳的 Claude Code 仅通过了 28% 的任务,而在涉及医院与保险公司直接协作的端到端任务中,所有 Agent 的得分均归零。这一结果凸显了当前 AI 技术在处理复杂医疗流程和跨机构协同工作时的显著局限性,为未来 AI 医疗系统的开发与优化提供了重要警示和参考方向。 #CHIBench #AI医疗 #基准测试 #人工智能 #医疗科技 #ClaudeCode #开源项目 #美国医疗 #Agent评估
学习AVA:可信任AI在政策与开发研究中的经验教训
一篇题为《学习AVA:可信任生成式AI在政策与开发研究中的早期经验教训》的学术论文于2026年4月20日在arXiv平台发布。该研究由Nimisha Karnatak等六位作者共同完成,聚焦于名为AVA的可信任生成式AI系统,探讨了其在政策制定和发展研究领域的实际应用。论文基于AVA项目的实践案例,深入分析了在复杂政策和开发环境中构建可信任AI所面临的挑战,包括数据策展、模型透明度以及用户交互等方面的关键经验。研究指出,确保AI系统的可信度对于推动其在公共政策和国际发展领域的负责任使用至关重要。这些初步教训为未来AI技术的集成提供了指导,有助于研究人员和决策者更安全、有效地利用生成式AI工具支持政策分析和开发项目。 #AI #可信任AI #政策研究 #开发研究 #生成式AI #arXiv #学术论文 #人工智能 #数据策展
一篇题为《学习AVA:可信任生成式AI在政策与开发研究中的早期经验教训》的学术论文于2026年4月20日在arXiv平台发布。该研究由Nimisha Karnatak等六位作者共同完成,聚焦于名为AVA的可信任生成式AI系统,探讨了其在政策制定和发展研究领域的实际应用。论文基于AVA项目的实践案例,深入分析了在复杂政策和开发环境中构建可信任AI所面临的挑战,包括数据策展、模型透明度以及用户交互等方面的关键经验。研究指出,确保AI系统的可信度对于推动其在公共政策和国际发展领域的负责任使用至关重要。这些初步教训为未来AI技术的集成提供了指导,有助于研究人员和决策者更安全、有效地利用生成式AI工具支持政策分析和开发项目。 #AI #可信任AI #政策研究 #开发研究 #生成式AI #arXiv #学术论文 #人工智能 #数据策展
AI教学意外发现
在教授高级AI核心前沿技术的过程中,作者Steve Repetti发现了一个意外现象。原本他试图让AI(如Claude)掌握其共同编写的FGL平台,并解决AI在无关问题上产生混淆回答的缺陷。通过与AI的迭代协作和学习,他不仅提升了AI的流畅度,还意外创建出一个可移植的纯文本文件。该文件为Markdown或普通文本格式,高度优化了AI的上下文窗口和令牌成本限制,无需任何安装、账户或平台配置,直接拖入任何现代AI聊天中,即可在几秒内使AI精通特定知识领域。这一发现揭示了知识传递的新方式:文件本身成为工具链,实现了领域特定知识的即时跨平台共享。与平台绑定的知识容器(如自定义GPT)不同,这种“可移植入门文件”更具通用性,适用于需要多AI工具协作的场景,代表了AI辅助学习的创新突破。 #AI #科技 #创新 #知识管理 #人工智能 #前沿技术 #可移植性 #教育 #协作学习
在教授高级AI核心前沿技术的过程中,作者Steve Repetti发现了一个意外现象。原本他试图让AI(如Claude)掌握其共同编写的FGL平台,并解决AI在无关问题上产生混淆回答的缺陷。通过与AI的迭代协作和学习,他不仅提升了AI的流畅度,还意外创建出一个可移植的纯文本文件。该文件为Markdown或普通文本格式,高度优化了AI的上下文窗口和令牌成本限制,无需任何安装、账户或平台配置,直接拖入任何现代AI聊天中,即可在几秒内使AI精通特定知识领域。这一发现揭示了知识传递的新方式:文件本身成为工具链,实现了领域特定知识的即时跨平台共享。与平台绑定的知识容器(如自定义GPT)不同,这种“可移植入门文件”更具通用性,适用于需要多AI工具协作的场景,代表了AI辅助学习的创新突破。 #AI #科技 #创新 #知识管理 #人工智能 #前沿技术 #可移植性 #教育 #协作学习
企业部署AI代理面临安全风险,专家提出七大管理原则
2026年,AI代理(AI Agents)已从演示工具转变为企业实用解决方案。与传统“问答式”AI助手不同,AI代理能自主执行复杂任务,例如自动规划路径、处理实时交通状况。斯坦福HAI研究所数据显示,其基准测试准确率一年内从12%跃升至66%,其中Nous Research开源的Hermes Agent增长迅猛,已在GitHub获得超10万星标,并强调本地运行与零已知漏洞的安全优势。 然而,AI代理的强大自主性伴随显著风险。此前PocketOS代理曾于9秒内误删生产数据库,凸显了权限管理失控的严重后果。为此,行业专家提出七项核心管理原则:遵循最小权限原则、关键操作需人工审批、使用Docker等沙箱环境、避免向代理暴露敏感信息、审核第三方技能来源、全程日志审计,以及严格区分个人与企业代理使用场景。 业界认为,妥善管理AI代理风险的企业将获得竞争优势,而忽视安全则可能付出高昂代价。开源工具如Hermes Agent在提供强大功能的同时,也要求使用者对潜在错误负责。 #AI代理 #网络安全 #企业管理 #风险管理 #开源AI #HermesAgent #人工智能
2026年,AI代理(AI Agents)已从演示工具转变为企业实用解决方案。与传统“问答式”AI助手不同,AI代理能自主执行复杂任务,例如自动规划路径、处理实时交通状况。斯坦福HAI研究所数据显示,其基准测试准确率一年内从12%跃升至66%,其中Nous Research开源的Hermes Agent增长迅猛,已在GitHub获得超10万星标,并强调本地运行与零已知漏洞的安全优势。 然而,AI代理的强大自主性伴随显著风险。此前PocketOS代理曾于9秒内误删生产数据库,凸显了权限管理失控的严重后果。为此,行业专家提出七项核心管理原则:遵循最小权限原则、关键操作需人工审批、使用Docker等沙箱环境、避免向代理暴露敏感信息、审核第三方技能来源、全程日志审计,以及严格区分个人与企业代理使用场景。 业界认为,妥善管理AI代理风险的企业将获得竞争优势,而忽视安全则可能付出高昂代价。开源工具如Hermes Agent在提供强大功能的同时,也要求使用者对潜在错误负责。 #AI代理 #网络安全 #企业管理 #风险管理 #开源AI #HermesAgent #人工智能
IBM与红帽宣布50亿美元开源安全计划,应对AI时代漏洞挑战
IBM与红帽联合宣布启动“光井计划”,承诺投资50亿美元,利用前沿AI能力和超过2万名工程师的全球团队,帮助企业保障开源软件安全。该计划旨在建立全新的企业级开源使用模式,覆盖从上游开发到生产环境的整个生命周期。 计划核心是建立一个可信的企业级漏洞协调中心,结合全球工程师力量,大规模识别和修复漏洞。该中心将作为安全协调层,利用AI技术对海量开源代码进行测试和验证。这些能力将通过商业订阅提供,让企业能将经验证的安全补丁直接集成到现有供应链中。 目前,开源软件支撑着现代企业基础设施,超过90%的财富500强公司依赖开源软件。与此同时,AI技术的快速发展也加速了漏洞的发现与利用。IBM和红帽已与美国银行、花旗、高盛等十多家大型金融机构合作开展早期试点,共同塑造漏洞修复的新模式。 #IBM #红帽 #开源安全 #AI #光井计划 #企业级软件 #网络安全 #漏洞修复 #金融科技
IBM与红帽联合宣布启动“光井计划”,承诺投资50亿美元,利用前沿AI能力和超过2万名工程师的全球团队,帮助企业保障开源软件安全。该计划旨在建立全新的企业级开源使用模式,覆盖从上游开发到生产环境的整个生命周期。 计划核心是建立一个可信的企业级漏洞协调中心,结合全球工程师力量,大规模识别和修复漏洞。该中心将作为安全协调层,利用AI技术对海量开源代码进行测试和验证。这些能力将通过商业订阅提供,让企业能将经验证的安全补丁直接集成到现有供应链中。 目前,开源软件支撑着现代企业基础设施,超过90%的财富500强公司依赖开源软件。与此同时,AI技术的快速发展也加速了漏洞的发现与利用。IBM和红帽已与美国银行、花旗、高盛等十多家大型金融机构合作开展早期试点,共同塑造漏洞修复的新模式。 #IBM #红帽 #开源安全 #AI #光井计划 #企业级软件 #网络安全 #漏洞修复 #金融科技
破解本地 AI 代理效能瓶颈
要在本地让大语言模型代理真正发挥效用,远不止简单运行模型那么简单。本文以构建用于自动化单细胞RNA测序分析的代理为例,指出本地代理面临的核心挑战:冗长的指令和工具定义导致推理缓慢,且长会话容易因上下文溢出而崩溃。作者认为,对于需要高度可复现性和过程追踪的科学工作流,必须自主构建底层基础设施。 为了解决这些问题,作者通过一系列优化措施改进了开源推理引擎 vLLM,显著提升了推理速度。同时,他们设计了更好的上下文管理和结构化的“世界状态”来保存关键分析信息,确保长会话的稳定性。实验表明,在A100和H100 GPU上,这些优化有效提升了代理的性能和实用性,使基于本地开放权重模型(如Qwen3.6–27B、Gemma 4–31B)构建可靠的科学代理成为可能。 #本地AI #大语言模型 #科学计算 #AI基础设施 #vLLM #单细胞分析 #人工智能 #科技新闻
要在本地让大语言模型代理真正发挥效用,远不止简单运行模型那么简单。本文以构建用于自动化单细胞RNA测序分析的代理为例,指出本地代理面临的核心挑战:冗长的指令和工具定义导致推理缓慢,且长会话容易因上下文溢出而崩溃。作者认为,对于需要高度可复现性和过程追踪的科学工作流,必须自主构建底层基础设施。 为了解决这些问题,作者通过一系列优化措施改进了开源推理引擎 vLLM,显著提升了推理速度。同时,他们设计了更好的上下文管理和结构化的“世界状态”来保存关键分析信息,确保长会话的稳定性。实验表明,在A100和H100 GPU上,这些优化有效提升了代理的性能和实用性,使基于本地开放权重模型(如Qwen3.6–27B、Gemma 4–31B)构建可靠的科学代理成为可能。 #本地AI #大语言模型 #科学计算 #AI基础设施 #vLLM #单细胞分析 #人工智能 #科技新闻
AI揭示软件工程积弊
资深开发者发现,AI在应用过程中并非创造新问题,而是迫使团队直面长期被回避的系统缺陷。过去,开发者依靠个人经验绕过代码库中的历史包袱——如未记录的回调函数、过时的测试用例、隐含的服务限制知识。这些"机构记忆"随人员流动逐渐消失,却从未被固化为可靠的流程或文档。 当AI作为缺乏上下文记忆的"新手"介入开发时,会径直踏入人类早已学会规避的陷阱:触发已知漏洞、编写无人维护的代码模式、突破未经压力测试的服务边界。这迫使团队必须建立严格的测试规范、清晰的代码所有权和确定性验证机制——这些本应是软件工程的基础实践,却在快速迭代中被长期搁置。AI意外地成为了检验系统健康度的"混沌猴子",暴露出组织在知识传承和流程固化上的巨大漏洞。 #AI应用 #软件工程 #技术债 #系统可靠性 #开发实践 #知识管理 #混沌工程 #数字化转型
资深开发者发现,AI在应用过程中并非创造新问题,而是迫使团队直面长期被回避的系统缺陷。过去,开发者依靠个人经验绕过代码库中的历史包袱——如未记录的回调函数、过时的测试用例、隐含的服务限制知识。这些"机构记忆"随人员流动逐渐消失,却从未被固化为可靠的流程或文档。 当AI作为缺乏上下文记忆的"新手"介入开发时,会径直踏入人类早已学会规避的陷阱:触发已知漏洞、编写无人维护的代码模式、突破未经压力测试的服务边界。这迫使团队必须建立严格的测试规范、清晰的代码所有权和确定性验证机制——这些本应是软件工程的基础实践,却在快速迭代中被长期搁置。AI意外地成为了检验系统健康度的"混沌猴子",暴露出组织在知识传承和流程固化上的巨大漏洞。 #AI应用 #软件工程 #技术债 #系统可靠性 #开发实践 #知识管理 #混沌工程 #数字化转型
AI预测者最新更新
多位AI研究人员和预测平台近期对人工通用智能(AGI)的实现时间进行了追踪与更新。根据对Daniel Kokotajlo、Eli Lifland等专家的预测分析,从2023年至2025年,大多数预测者认为AGI将更早到来,但部分人士如Tamay Besilogru持保守态度。然而,2025年至2026年间,受xAI、Meta和Gemini等公司技术进展影响,预测者如Kokotajlo、Lifland及Metaculus社区成员Dario Amodei等将时间表推迟。进入2026年1月至4月,随着Anthropic技术的快速突破,所有更新预测的专家均将时间表调早,显示AGI实现可能加速。这一动态趋势表明,AI预测紧密依赖技术里程碑,从ChatGPT时代的乐观,到其他公司时代的谨慎,再到Anthropic时代的再次乐观,凸显了预测的易变性和对行业进展的高度敏感。 #AI #AGI #认知劳动自动化 #科技预测 #人工智能 #大模型 #预测更新 #技术进展
多位AI研究人员和预测平台近期对人工通用智能(AGI)的实现时间进行了追踪与更新。根据对Daniel Kokotajlo、Eli Lifland等专家的预测分析,从2023年至2025年,大多数预测者认为AGI将更早到来,但部分人士如Tamay Besilogru持保守态度。然而,2025年至2026年间,受xAI、Meta和Gemini等公司技术进展影响,预测者如Kokotajlo、Lifland及Metaculus社区成员Dario Amodei等将时间表推迟。进入2026年1月至4月,随着Anthropic技术的快速突破,所有更新预测的专家均将时间表调早,显示AGI实现可能加速。这一动态趋势表明,AI预测紧密依赖技术里程碑,从ChatGPT时代的乐观,到其他公司时代的谨慎,再到Anthropic时代的再次乐观,凸显了预测的易变性和对行业进展的高度敏感。 #AI #AGI #认知劳动自动化 #科技预测 #人工智能 #大模型 #预测更新 #技术进展