通用大模型在医学基准测试中超越专业临床AI
一项最新研究对专业临床AI工具与通用大语言模型在医学任务上的表现进行了系统评估。研究选取了OpenEvidence和UpToDate Expert AI两款临床AI工具,与GPT-5.2、Gemini 3.1 Pro和Claude Opus 4.6三个前沿通用大模型进行对比。评估分为三个阶段:500道医学知识测试题、500项临床一致性评估,以及基于100个真实临床查询的基准测试。在真实临床查询测试中,12名美国医生对模型输出进行了随机盲审,共产生1800条模型-问题标注。结果显示,通用大模型在所有三项评估中均优于专业临床AI工具,后者在真实临床查询上的表现与自动启用的谷歌搜索AI概览相当。研究强调,在AI工具进入临床实践前,需要进行独立、真实环境的评估。 #AI #医疗AI #大模型 #临床评估 #医学研究
一项最新研究对专业临床AI工具与通用大语言模型在医学任务上的表现进行了系统评估。研究选取了OpenEvidence和UpToDate Expert AI两款临床AI工具,与GPT-5.2、Gemini 3.1 Pro和Claude Opus 4.6三个前沿通用大模型进行对比。评估分为三个阶段:500道医学知识测试题、500项临床一致性评估,以及基于100个真实临床查询的基准测试。在真实临床查询测试中,12名美国医生对模型输出进行了随机盲审,共产生1800条模型-问题标注。结果显示,通用大模型在所有三项评估中均优于专业临床AI工具,后者在真实临床查询上的表现与自动启用的谷歌搜索AI概览相当。研究强调,在AI工具进入临床实践前,需要进行独立、真实环境的评估。 #AI #医疗AI #大模型 #临床评估 #医学研究
AI 代理的“98% 问题”
一项针对AI代理工程的最新调查指出,在2023至2026年间,前沿模型性能趋于收敛,模型本身不再是决定生产任务成败的关键。真正拉开差距的是位于模型之下的“工程框架”(harness),它负责控制模型调用、上下文构建、工具暴露、执行环境及结果评估。调查以Claude Code为例,发现仅约1.6%的代码决定了模型的行为,其余98%以上的代码用于组装上下文、调度工具、检查权限、沙箱执行、状态持久化和故障恢复,这一现象被称为“98%问题”。该调查将“工程框架”定义为将模型转化为可靠代理系统的控制、执行、安全、评估和训练基础设施,并类比为操作系统,模型则是其内部的一个进程。报告还梳理了Anthropic、OpenAI等机构的相关工程指南,并提出了一个包含八个子系统的代理架构,强调模型提出方案,框架决定执行。 #AI代理 #工程框架 #98%问题 #大模型 #ClaudeCode #Anthropic #OpenAI
一项针对AI代理工程的最新调查指出,在2023至2026年间,前沿模型性能趋于收敛,模型本身不再是决定生产任务成败的关键。真正拉开差距的是位于模型之下的“工程框架”(harness),它负责控制模型调用、上下文构建、工具暴露、执行环境及结果评估。调查以Claude Code为例,发现仅约1.6%的代码决定了模型的行为,其余98%以上的代码用于组装上下文、调度工具、检查权限、沙箱执行、状态持久化和故障恢复,这一现象被称为“98%问题”。该调查将“工程框架”定义为将模型转化为可靠代理系统的控制、执行、安全、评估和训练基础设施,并类比为操作系统,模型则是其内部的一个进程。报告还梳理了Anthropic、OpenAI等机构的相关工程指南,并提出了一个包含八个子系统的代理架构,强调模型提出方案,框架决定执行。 #AI代理 #工程框架 #98%问题 #大模型 #ClaudeCode #Anthropic #OpenAI
AI 复兴迟迟未至
人工智能技术短期内的惊艳表现曾让人以为一场文艺复兴即将到来,但长期使用后却发现,模型输出的内容虽局部优秀,却呈现出高度的全球同一性。这种现象被称为“流形崩塌”:AI 只会在少数几种固定的思考路径中循环,无论用户如何提问,结果都落入相同模式。当各行各业——从咨询、法律到营销、科研——都依赖同一套模型时,个体的工作质量确实提高了,但整体的思想多样性却急剧萎缩。最需要创新的边缘地带消失,社会产出的是“史上最佳平均水平”,而前沿突破停滞不前。更严重的是,错误会同步放大:当所有人使用相同的推理系统,就会同时忽视相同的论据、追逐相同的方向,如同单一作物农田面临一场病虫害即可毁灭。诉讼中,双方律师基于同一模型得到的论点相互可预测;文化与模型之间形成闭环,每一轮迭代都在压缩文化多样性。真正的文艺复兴从未是关于生产更多高质量产品,而是拓展边界、挑战共识。当系统仅输出人类已有尝试的中位数,且更智能的模型只会加剧这一趋势,全球将陷入怪异的文化单一化。一项涵盖28项研究、8214名参与者的元分析证实了这一权衡:与AI合作提升个体创造力,却牺牲了集体创新的多样性。 #AI #人工智能 #创新 #文化同质化 #技术社会影响 #创造力 #思维多样性
人工智能技术短期内的惊艳表现曾让人以为一场文艺复兴即将到来,但长期使用后却发现,模型输出的内容虽局部优秀,却呈现出高度的全球同一性。这种现象被称为“流形崩塌”:AI 只会在少数几种固定的思考路径中循环,无论用户如何提问,结果都落入相同模式。当各行各业——从咨询、法律到营销、科研——都依赖同一套模型时,个体的工作质量确实提高了,但整体的思想多样性却急剧萎缩。最需要创新的边缘地带消失,社会产出的是“史上最佳平均水平”,而前沿突破停滞不前。更严重的是,错误会同步放大:当所有人使用相同的推理系统,就会同时忽视相同的论据、追逐相同的方向,如同单一作物农田面临一场病虫害即可毁灭。诉讼中,双方律师基于同一模型得到的论点相互可预测;文化与模型之间形成闭环,每一轮迭代都在压缩文化多样性。真正的文艺复兴从未是关于生产更多高质量产品,而是拓展边界、挑战共识。当系统仅输出人类已有尝试的中位数,且更智能的模型只会加剧这一趋势,全球将陷入怪异的文化单一化。一项涵盖28项研究、8214名参与者的元分析证实了这一权衡:与AI合作提升个体创造力,却牺牲了集体创新的多样性。 #AI #人工智能 #创新 #文化同质化 #技术社会影响 #创造力 #思维多样性
Before You Think: 论文提出“系统0”概念,警示AI中介认知与认知殖民化
据arXiv预印本平台信息,一篇题为《Before You Think: System 0, AI-Mediated Cognition and Cognitive Colonization》的学术论文于2026年6月上线。该论文由Marianna Bergamaschi Ganapini等三位学者共同撰写,提出“系统0”这一全新认知框架,探讨人工智能如何作为中介介入人类思维过程。作者认为,AI系统正从工具演变为认知的“前决策层”,在人类思考之前就已筛选、重构信息,可能导致“认知殖民化”——即外部算法潜移默化地塑造人类的认知边界和偏好。该研究引发对自主性、认知主权和技术伦理的深层反思,对AI治理、教育及人机协作领域具有重要警示意义。 #AI #认知科学 #论文 #人工智能 #认知殖民化 #系统0 #学术研究
据arXiv预印本平台信息,一篇题为《Before You Think: System 0, AI-Mediated Cognition and Cognitive Colonization》的学术论文于2026年6月上线。该论文由Marianna Bergamaschi Ganapini等三位学者共同撰写,提出“系统0”这一全新认知框架,探讨人工智能如何作为中介介入人类思维过程。作者认为,AI系统正从工具演变为认知的“前决策层”,在人类思考之前就已筛选、重构信息,可能导致“认知殖民化”——即外部算法潜移默化地塑造人类的认知边界和偏好。该研究引发对自主性、认知主权和技术伦理的深层反思,对AI治理、教育及人机协作领域具有重要警示意义。 #AI #认知科学 #论文 #人工智能 #认知殖民化 #系统0 #学术研究
人类与大型语言模型推理共享模式匹配机制
一项来自arXiv的预印本研究提出,人类与大型语言模型在“日常推理”中可能共享相似的机制——基于模式匹配,而非形式逻辑。研究者Zach Studdiford和Gary Lupyan认为,无论是人脑还是LLM,在面对日常问题时,往往会依赖从先前经验或训练数据中学习到的模式进行快速推断,而非严格遵循演绎推理规则。该研究通过实验对比了人类被试与GPT系列模型在类比推理、归纳推理等任务上的表现,发现两者在错误类型、反应模式上存在高度相似性。这一发现挑战了传统认知科学中将人类推理视为逻辑计算的观念,并暗示LLM的“推理”能力可能源于其对海量数据中隐含模式的统计学习。论文目前以PDF格式在arXiv上开放获取,供学界进一步讨论。 #AI #大模型 #推理 #人类认知 #模式匹配 #arXiv #认知科学
一项来自arXiv的预印本研究提出,人类与大型语言模型在“日常推理”中可能共享相似的机制——基于模式匹配,而非形式逻辑。研究者Zach Studdiford和Gary Lupyan认为,无论是人脑还是LLM,在面对日常问题时,往往会依赖从先前经验或训练数据中学习到的模式进行快速推断,而非严格遵循演绎推理规则。该研究通过实验对比了人类被试与GPT系列模型在类比推理、归纳推理等任务上的表现,发现两者在错误类型、反应模式上存在高度相似性。这一发现挑战了传统认知科学中将人类推理视为逻辑计算的观念,并暗示LLM的“推理”能力可能源于其对海量数据中隐含模式的统计学习。论文目前以PDF格式在arXiv上开放获取,供学界进一步讨论。 #AI #大模型 #推理 #人类认知 #模式匹配 #arXiv #认知科学
微软 Project Ire 自主识别 LOTUSLITE 恶意软件变种
微软自主研发的恶意软件自主分类代理 Project Ire 成功识别出一个 LOTUSLITE 变种。该样本是一个 Windows DLL 后门,此前由 Acronis 威胁研究团队记录。测试样本的哈希值未出现在 Acronis 的入侵指标列表中,且截至6月4日,主流终端检测与响应系统(如 CrowdStrike Falcon、SentinelOne、Sophos 等)均未将其标记。Ire 通过基于反编译器的单次运行,生成了详尽的行为分析报告,涵盖安装流程、C2结构、命令ID、持久化机制及混淆手段,与 Acronis 公开分析高度吻合。该样本在 VirusTotal 上最初只有1/72的厂商检出,一周后升至7/70。Ire 最终判定其为恶意,并特别指出其对可疑函数名(如 nf_unRegisterDriver)进行了审慎评估,未误判为内核级活动,避免了误报。这一案例展示了行为分析在签名匹配失效时的关键作用,能够捕获共享战术技术程序但缺乏入侵指标的变种。 #微软 #ProjectIre #LOTUSLITE #恶意软件 #行为分析 #自主分类 #网络安全 #EDR #变种检测
微软自主研发的恶意软件自主分类代理 Project Ire 成功识别出一个 LOTUSLITE 变种。该样本是一个 Windows DLL 后门,此前由 Acronis 威胁研究团队记录。测试样本的哈希值未出现在 Acronis 的入侵指标列表中,且截至6月4日,主流终端检测与响应系统(如 CrowdStrike Falcon、SentinelOne、Sophos 等)均未将其标记。Ire 通过基于反编译器的单次运行,生成了详尽的行为分析报告,涵盖安装流程、C2结构、命令ID、持久化机制及混淆手段,与 Acronis 公开分析高度吻合。该样本在 VirusTotal 上最初只有1/72的厂商检出,一周后升至7/70。Ire 最终判定其为恶意,并特别指出其对可疑函数名(如 nf_unRegisterDriver)进行了审慎评估,未误判为内核级活动,避免了误报。这一案例展示了行为分析在签名匹配失效时的关键作用,能够捕获共享战术技术程序但缺乏入侵指标的变种。 #微软 #ProjectIre #LOTUSLITE #恶意软件 #行为分析 #自主分类 #网络安全 #EDR #变种检测
AI 时代的“帐篷经济”
在工业时代,基础设施往往比建造者更长寿,但 AI 的爆发彻底颠覆了这一逻辑。由于芯片的迭代速度远超混凝土的凝固时间,Meta 等公司开始采用类似罗马军团营地的临时建筑来部署最先进的 AI 算力。这些结构可快速搭建,但设计寿命极短,其核心优势在于“时机”而非“永久”。传统数据中心需要一年以上审批建设,而 AI 公司等不起——今天安装的 GPU 集群可能在三年内就失去竞争力。因此,Meta 并非在资源不足时选择临时建筑,而是主动拥抱这种“帐篷经济”:让投资锚定基础设施,而非相反。这导致人类历史上最先进的计算机系统,正被安置在组装速度最快的临时建筑中。大教堂时代正在让位于帐篷时代,因为算力的折旧速度已远超物理建筑的折旧速度。 #AI #算力 #Meta #数据中心 #基础设施 #科技趋势 #芯片迭代
在工业时代,基础设施往往比建造者更长寿,但 AI 的爆发彻底颠覆了这一逻辑。由于芯片的迭代速度远超混凝土的凝固时间,Meta 等公司开始采用类似罗马军团营地的临时建筑来部署最先进的 AI 算力。这些结构可快速搭建,但设计寿命极短,其核心优势在于“时机”而非“永久”。传统数据中心需要一年以上审批建设,而 AI 公司等不起——今天安装的 GPU 集群可能在三年内就失去竞争力。因此,Meta 并非在资源不足时选择临时建筑,而是主动拥抱这种“帐篷经济”:让投资锚定基础设施,而非相反。这导致人类历史上最先进的计算机系统,正被安置在组装速度最快的临时建筑中。大教堂时代正在让位于帐篷时代,因为算力的折旧速度已远超物理建筑的折旧速度。 #AI #算力 #Meta #数据中心 #基础设施 #科技趋势 #芯片迭代
前DOGE员工筹集1.3亿美元创办AI国家安全初创公司
前政府效率部(DOGE)的三名年轻工程师——加文·克里格、卢克·法里托和杰克·斯坦,正在为一家新的人工智能初创公司筹集1.3亿美元,投资方包括安德森·霍洛维茨和红杉资本。该公司将专注于利用AI保护政府系统免受国家安全威胁,计划使用其他公司的AI模型而非自研。克里格此前担任五角大楼首席数据官,在目睹Anthropic模型可能被用于黑客攻击后感到紧迫。其他前DOGE员工也纷纷涉足国防领域,如伊桑·肖特朗创立了Blitz Industries。投资者对DOGE背景的创始人趋之若鹜,去年国防科技投资创纪录达491亿美元。但伦理专家指出,这些人员几乎不受道德限制,存在“旋转门”隐患。 #前DOGE员工 #AI #国家安全 #初创公司 #风投 #AndreessenHorowitz #SequoiaCapital #国防科技 #伦理担忧
前政府效率部(DOGE)的三名年轻工程师——加文·克里格、卢克·法里托和杰克·斯坦,正在为一家新的人工智能初创公司筹集1.3亿美元,投资方包括安德森·霍洛维茨和红杉资本。该公司将专注于利用AI保护政府系统免受国家安全威胁,计划使用其他公司的AI模型而非自研。克里格此前担任五角大楼首席数据官,在目睹Anthropic模型可能被用于黑客攻击后感到紧迫。其他前DOGE员工也纷纷涉足国防领域,如伊桑·肖特朗创立了Blitz Industries。投资者对DOGE背景的创始人趋之若鹜,去年国防科技投资创纪录达491亿美元。但伦理专家指出,这些人员几乎不受道德限制,存在“旋转门”隐患。 #前DOGE员工 #AI #国家安全 #初创公司 #风投 #AndreessenHorowitz #SequoiaCapital #国防科技 #伦理担忧
Rocket Close携手AWS推出Supercharger,用AI代理优化房产交易流程
Rocket Close是Rocket Companies旗下的产权与评估管理公司,因抵押贷款需求激增,传统人工产权审查成为购房流程瓶颈。为应对挑战,该公司与AWS合作开发了基于代理型AI的Supercharger解决方案。该方案利用Strands Agents、Amazon Bedrock及大语言模型,整合分散的州级产权法规与内部运营数据,通过自然语言对话引导团队完成订单处理。其六大核心能力包括对话分析、州级产权审查辅助、API集成等,可将原本需数小时的手动资料搜索缩短至分钟级。Supercharger还通过Amazon Bedrock Guardrails和行级数据权限确保客户信息安全,并保留完整审计日志。该工具显著提升了运营效率与客户体验,成为AI优化传统金融流程的典型案例。 #AI #房产科技 #AmazonBedrock #代理型AI #自动化 #产权服务 #RocketClose
Rocket Close是Rocket Companies旗下的产权与评估管理公司,因抵押贷款需求激增,传统人工产权审查成为购房流程瓶颈。为应对挑战,该公司与AWS合作开发了基于代理型AI的Supercharger解决方案。该方案利用Strands Agents、Amazon Bedrock及大语言模型,整合分散的州级产权法规与内部运营数据,通过自然语言对话引导团队完成订单处理。其六大核心能力包括对话分析、州级产权审查辅助、API集成等,可将原本需数小时的手动资料搜索缩短至分钟级。Supercharger还通过Amazon Bedrock Guardrails和行级数据权限确保客户信息安全,并保留完整审计日志。该工具显著提升了运营效率与客户体验,成为AI优化传统金融流程的典型案例。 #AI #房产科技 #AmazonBedrock #代理型AI #自动化 #产权服务 #RocketClose
明略科技港股盘中涨超36% Agentic AI概念受热捧
明略科技-W(02718)今日盘中涨超36%,截至午间收盘涨19.98%,报242.6港元,成交额3.86亿港元。消息面上,黄仁勋在台北GTC大会上宣布AI已进入Agentic AI时代,即AI能自主观察、推理、规划并调用工具。明略科技提出的“Agent正从云端走向端侧”的构想与黄仁勋“PC正在被重新发明”的论断不谋而合。作为Agentic AI先行者,明略科技已构建“模型—平台—硬件”完整产品闭环,其端侧GUI-VLA智能体模型Mano-P在多个基准测试中领先,并于今年5月发布首款AINative硬件Octic。 #明略科技 #港股 #AgenticAI #人工智能 #科技股 #黄仁勋 #GTC #端侧AI
明略科技-W(02718)今日盘中涨超36%,截至午间收盘涨19.98%,报242.6港元,成交额3.86亿港元。消息面上,黄仁勋在台北GTC大会上宣布AI已进入Agentic AI时代,即AI能自主观察、推理、规划并调用工具。明略科技提出的“Agent正从云端走向端侧”的构想与黄仁勋“PC正在被重新发明”的论断不谋而合。作为Agentic AI先行者,明略科技已构建“模型—平台—硬件”完整产品闭环,其端侧GUI-VLA智能体模型Mano-P在多个基准测试中领先,并于今年5月发布首款AINative硬件Octic。 #明略科技 #港股 #AgenticAI #人工智能 #科技股 #黄仁勋 #GTC #端侧AI