合成推理数据微调损害真实疾病预测
一项最新研究指出,使用合成推理数据进行监督微调,反而会降低模型在真实疾病预测任务中的表现。该论文由Buxin Su等五位作者提交至arXiv预印本平台,标题为《Supervised Fine-tuning with Synthetic Rationale Data Hurts Real-World Disease Prediction》。研究团队通过实验发现,尽管合成数据在训练过程中看似能提升模型对推理路径的模拟能力,但在实际医疗场景中,这种微调方法会导致预测准确率下降,可能因合成数据与真实临床数据的分布差异,引入噪声或误导性关联。该发现对当前依赖合成数据增强模型推理能力的趋势提出警示,强调在疾病预测等高风险领域,需谨慎评估合成数据的适用性,避免过度依赖人工生成的推理逻辑。 #AI #医疗 #疾病预测 #合成数据 #监督微调 #arXiv #论文
一项最新研究指出,使用合成推理数据进行监督微调,反而会降低模型在真实疾病预测任务中的表现。该论文由Buxin Su等五位作者提交至arXiv预印本平台,标题为《Supervised Fine-tuning with Synthetic Rationale Data Hurts Real-World Disease Prediction》。研究团队通过实验发现,尽管合成数据在训练过程中看似能提升模型对推理路径的模拟能力,但在实际医疗场景中,这种微调方法会导致预测准确率下降,可能因合成数据与真实临床数据的分布差异,引入噪声或误导性关联。该发现对当前依赖合成数据增强模型推理能力的趋势提出警示,强调在疾病预测等高风险领域,需谨慎评估合成数据的适用性,避免过度依赖人工生成的推理逻辑。 #AI #医疗 #疾病预测 #合成数据 #监督微调 #arXiv #论文
RealMath-Eval:揭示顶级AI评判模型在真实人类推理中的短板
一篇题为《RealMath-Eval: Why SOTA Judges Struggle with Real Human Reasoning》的学术论文近日在arXiv上发布。该研究由Yiteng Mao等六位作者共同完成,旨在评估当前最先进的AI评判模型在处理真实人类数学推理时的表现。研究发现,尽管这些模型在标准测试中表现优异,但在面对人类复杂、非结构化的推理过程时,其评判准确率显著下降。论文通过构建专门的评估基准,揭示了现有模型在理解人类推理逻辑、识别隐含假设及处理模糊表述方面的根本性缺陷。这一发现对AI在教育和科研领域的应用提出了重要警示,表明当前技术尚无法可靠地替代人类进行深度推理的评判工作。 #AI #人工智能 #数学推理 #模型评估 #arXiv #学术研究 #RealMathEval
一篇题为《RealMath-Eval: Why SOTA Judges Struggle with Real Human Reasoning》的学术论文近日在arXiv上发布。该研究由Yiteng Mao等六位作者共同完成,旨在评估当前最先进的AI评判模型在处理真实人类数学推理时的表现。研究发现,尽管这些模型在标准测试中表现优异,但在面对人类复杂、非结构化的推理过程时,其评判准确率显著下降。论文通过构建专门的评估基准,揭示了现有模型在理解人类推理逻辑、识别隐含假设及处理模糊表述方面的根本性缺陷。这一发现对AI在教育和科研领域的应用提出了重要警示,表明当前技术尚无法可靠地替代人类进行深度推理的评判工作。 #AI #人工智能 #数学推理 #模型评估 #arXiv #学术研究 #RealMathEval
Regimes:一种可审计的保留门控改进循环,在LongMemEval上通过ActiveGraph验证
来自arXiv的一篇论文提出了一种名为“Regimes”的新型AI改进框架,该框架通过可审计的保留门控循环机制,显著提升了长文本记忆任务的性能。研究团队在LongMemEval基准测试中,结合ActiveGraph方法进行了验证。Regimes的核心设计在于引入一个“保留门控”步骤,确保模型在迭代优化过程中不会遗忘关键信息,同时保持整个流程的可审计性。该方法通过动态调整记忆保留策略,有效解决了长上下文场景下的信息丢失问题。实验结果表明,Regimes在多项长文本理解与推理任务上取得了领先成绩,为构建更可靠的AI系统提供了新思路。 #AI #机器学习 #长文本记忆 #可审计AI #arXiv论文
来自arXiv的一篇论文提出了一种名为“Regimes”的新型AI改进框架,该框架通过可审计的保留门控循环机制,显著提升了长文本记忆任务的性能。研究团队在LongMemEval基准测试中,结合ActiveGraph方法进行了验证。Regimes的核心设计在于引入一个“保留门控”步骤,确保模型在迭代优化过程中不会遗忘关键信息,同时保持整个流程的可审计性。该方法通过动态调整记忆保留策略,有效解决了长上下文场景下的信息丢失问题。实验结果表明,Regimes在多项长文本理解与推理任务上取得了领先成绩,为构建更可靠的AI系统提供了新思路。 #AI #机器学习 #长文本记忆 #可审计AI #arXiv论文
高效上下文工程
一项新研究提出,通过精简上下文信息,可以显著提升长期工具使用型大语言模型智能体的性能。该论文由Abhilasha Lodha等人撰写,发表于arXiv预印本平台。研究团队发现,传统方法中为智能体提供大量上下文往往导致信息过载,反而降低决策效率。他们提出了一种高效的上下文工程技术,通过选择性保留关键信息、去除冗余内容,使智能体在复杂任务中表现更佳。实验表明,该方法在多个基准测试中均优于传统全上下文方案,尤其在需要多步推理和工具调用的场景下效果显著。这一发现挑战了“更多上下文更好”的普遍认知,为构建更高效、更可靠的AI智能体提供了新思路。 #AI #大模型 #上下文工程 #智能体 #arXiv #研究论文
一项新研究提出,通过精简上下文信息,可以显著提升长期工具使用型大语言模型智能体的性能。该论文由Abhilasha Lodha等人撰写,发表于arXiv预印本平台。研究团队发现,传统方法中为智能体提供大量上下文往往导致信息过载,反而降低决策效率。他们提出了一种高效的上下文工程技术,通过选择性保留关键信息、去除冗余内容,使智能体在复杂任务中表现更佳。实验表明,该方法在多个基准测试中均优于传统全上下文方案,尤其在需要多步推理和工具调用的场景下效果显著。这一发现挑战了“更多上下文更好”的普遍认知,为构建更高效、更可靠的AI智能体提供了新思路。 #AI #大模型 #上下文工程 #智能体 #arXiv #研究论文
微软AI主管改口
微软AI部门负责人穆斯塔法·苏莱曼近日收回了他此前关于AI将取代白领工作的言论。在今年2月接受《金融时报》采访时,他曾声称AI将在12至18个月内取代办公室职员。但在本周一《The Verge》的Decoder节目中,苏莱曼将AI重新定义为一种辅助工具,而非取代工作的机器。他解释称,随着人们生成更多数字材料,较小的办公任务将"日益数字化、自动化",并强调需要区分"任务"和"工作"这两个概念,指出他之前的言论仅指人们在办公桌上执行的个别行为。苏莱曼曾于2010年联合创立DeepMind,2022年离开后创立Inflection AI,2024年3月被微软聘用领导新成立的"微软AI"部门。他并非唯一软化立场的AI高管,OpenAI首席执行官山姆·奥特曼上月也公开反驳就业恐慌论,强调其公司构建的是辅助人类的工具。 #AI #微软 #就业 #科技 #人工智能
微软AI部门负责人穆斯塔法·苏莱曼近日收回了他此前关于AI将取代白领工作的言论。在今年2月接受《金融时报》采访时,他曾声称AI将在12至18个月内取代办公室职员。但在本周一《The Verge》的Decoder节目中,苏莱曼将AI重新定义为一种辅助工具,而非取代工作的机器。他解释称,随着人们生成更多数字材料,较小的办公任务将"日益数字化、自动化",并强调需要区分"任务"和"工作"这两个概念,指出他之前的言论仅指人们在办公桌上执行的个别行为。苏莱曼曾于2010年联合创立DeepMind,2022年离开后创立Inflection AI,2024年3月被微软聘用领导新成立的"微软AI"部门。他并非唯一软化立场的AI高管,OpenAI首席执行官山姆·奥特曼上月也公开反驳就业恐慌论,强调其公司构建的是辅助人类的工具。 #AI #微软 #就业 #科技 #人工智能
AI Is a Thing We Made
Alex Raksin Jun 10, 2026 2 1 1 Share As I wrote the other day, AI is not “artificial” in the way dentures, Astroturf, and aspartame are artificial. It is better understood as artifactual. That sounds like a small distinction. It is not. Artificial makes us think of a counterfeit: the fake flower, the fake sweetener, the fake human mind. And once we code a thing as a fake version of us, we are left with one panicked question: will it replace us or won’t it? That question is understandable. It is also paralyzing. It stops thought before thought begins. Artifactual points in a different direction. It reminds us that AI is a made thing. But it is not made out of nothing, and it is not made out of alien substance. It is made out of human culture: out of records, books, images, arguments, jokes, sermons, invoices, poems, recipes, statutes, love letters, lab report
Alex Raksin Jun 10, 2026 2 1 1 Share As I wrote the other day, AI is not “artificial” in the way dentures, Astroturf, and aspartame are artificial. It is better understood as artifactual. That sounds like a small distinction. It is not. Artificial makes us think of a counterfeit: the fake flower, the fake sweetener, the fake human mind. And once we code a thing as a fake version of us, we are left with one panicked question: will it replace us or won’t it? That question is understandable. It is also paralyzing. It stops thought before thought begins. Artifactual points in a different direction. It reminds us that AI is a made thing. But it is not made out of nothing, and it is not made out of alien substance. It is made out of human culture: out of records, books, images, arguments, jokes, sermons, invoices, poems, recipes, statutes, love letters, lab report
s, and what Pope Leo might call our magnificent languages. We began by marking debts in cuneiform on clay. We went on to encode memory in alphabets, libraries, ledgers, printing presses, databases, search engines, and now models. AI belongs to that history. That does not make it harmless. It makes it legible. And once it becomes legible, we can ask a better question. Not: is this a fake human being? Not: will it replace us? The better question is: what should we do with it? That question is worth asking because AI is not just another tool. It is not a hammer. A hammer does roughly what its maker and user foresee. AI is a stranger kind of artifact: a human-made system whose capacities are still being discovered after the fact. That is precisely why panic is so unhelpful. Panic makes us spectators to our own imagined replacement. It leaves us staring at the machine as if history has already made its decision. But history has not made its decision. We still have to decide where AI belongs, what it may do, what it must not do, who benefits from it, who is protected from it, and what forms of human judgment should remain nondelegable. The first step is not to bow before it. The first step is not to fear it. The first step is to think about it accurately enough that we can govern it, use it, refuse it, limit it, and perhaps even learn from it. Call it artificial, and the mind jumps to replacement. Call it artifactual and another possibility opens. It is not a fake of us. It is a thing we made. Now we have to decide how to wield it.
Salesforce发布“Agentic Enterprise”战略:Agentforce成企业AI代理底层平台
Salesforce正将“Agentic Enterprise”打造为下一阶段的核心增长方向,并把Agentforce定位为企业构建和运营AI代理的底层平台。 6月10日,在首尔COEX举行的“Agentforce World Tour Korea 2026”上,Salesforce韩国负责人Park Se-jin表示,企业正需要向“Agentic Enterprise”转型。为此,Salesforce将打通后台系统、数据与人工运营流程,帮助客户把AI代理能力转化为可量化的业务价值。 他表示,企业AI代理能否真正落地,关键在于可信的数据基础和完善的系统集成能力。客户数据、业务语境和执行环境,必须在同一可信平台上实现连接与协同,而Salesforce希望扮演这一平台角色。 Salesforce同时强调,公司自身已率先实践“Agentic Enterprise”。目前,其内部已部署300多个AI代理,全年处理客服请求超过220万笔;由AI代理带来的年化销售管线规模达到1.3亿美元(约合2000亿韩元)。公司7.5万名员工均在使用AI代理,Agentforce也已发展为规模达8亿美元的业务。 其中一个代表性案例是销售线索自动化代理“Piper”。该代理可与访问网站的潜在客户进行7×24小时文本、语音和视频互动,目前已应用于全球网站,并计划在年内接入韩国网站。Salesforce预计,仅部署Piper和内部销售开发代表(SDR)代理,就可使销售管线生成规模较此前提升两倍以上。 在客户应用层面,Agentforce的效果也开始显现。Salesforce介绍称,Claude开发商Anthropic引入Agentforce后,营收运营(RevOps)生产效率提升超过10倍,销售周期缩短60%。 随着企业加快引入AI代理,Salesforce平台上的AI使用量也在快速攀升。以今年第一季度为例,平台消耗的大模型Token数量达到29万亿个,环比增长152%。与
Salesforce正将“Agentic Enterprise”打造为下一阶段的核心增长方向,并把Agentforce定位为企业构建和运营AI代理的底层平台。 6月10日,在首尔COEX举行的“Agentforce World Tour Korea 2026”上,Salesforce韩国负责人Park Se-jin表示,企业正需要向“Agentic Enterprise”转型。为此,Salesforce将打通后台系统、数据与人工运营流程,帮助客户把AI代理能力转化为可量化的业务价值。 他表示,企业AI代理能否真正落地,关键在于可信的数据基础和完善的系统集成能力。客户数据、业务语境和执行环境,必须在同一可信平台上实现连接与协同,而Salesforce希望扮演这一平台角色。 Salesforce同时强调,公司自身已率先实践“Agentic Enterprise”。目前,其内部已部署300多个AI代理,全年处理客服请求超过220万笔;由AI代理带来的年化销售管线规模达到1.3亿美元(约合2000亿韩元)。公司7.5万名员工均在使用AI代理,Agentforce也已发展为规模达8亿美元的业务。 其中一个代表性案例是销售线索自动化代理“Piper”。该代理可与访问网站的潜在客户进行7×24小时文本、语音和视频互动,目前已应用于全球网站,并计划在年内接入韩国网站。Salesforce预计,仅部署Piper和内部销售开发代表(SDR)代理,就可使销售管线生成规模较此前提升两倍以上。 在客户应用层面,Agentforce的效果也开始显现。Salesforce介绍称,Claude开发商Anthropic引入Agentforce后,营收运营(RevOps)生产效率提升超过10倍,销售周期缩短60%。 随着企业加快引入AI代理,Salesforce平台上的AI使用量也在快速攀升。以今年第一季度为例,平台消耗的大模型Token数量达到29万亿个,环比增长152%。与
此同时,Salesforce也重点强调“Agent Work Unit(AWU)”这一指标,即AI代理实际执行业务动作的规模。同期AWU达到16亿次,环比增长111%。公司还表示,客户在引入AI代理后,后台数据相关历史成本下降了80%。 除平台能力外,Salesforce还在会上披露了多家基于Salesforce CRM引入AI代理的客户案例。 其中,POSCO已将Salesforce选为其营销AX核心平台,并基于CRM数据构建多代理编排体系。 Musinsa则围绕其技术战略核心“One Core Multi Platform(OCMP)”选择了Salesforce。公司表示,在将Musinsa、29CM、Soldout等多个运营渠道及不同国家市场接入核心平台引擎的过程中,客户数据统一管理的需求不断上升。基于这一需求,Musinsa搭建了AI客服代理,使用户能够在同一对话窗口内完成商品搜索、推荐、换货和退货等流程。 Park Se-jin表示,Salesforce韩国将与客户共同推进“Agentic Enterprise”转型。与此同时,韩国市场目前也已可签署支持Agentforce和Data Cloud许可证无限试用的合同。 本内容在人工智能辅助下制作,并经本社编辑团队审核。韩文原文请点击 此处 查看。
仅需10秒!美团Tabbit 1.0重磅发布,重新定义AI智能体工作循环
6月9日,美团(Meituan)旗下GN06团队正式发布了AI原生浏览器(AI-native browser)Tabbit 1.0。作为Tabbit浏览器的核心入口,该产品标志着这款深度融合大模型的智能助手,已从内部测试阶段迈向大规模商业应用。自今年3月测试上线以来,Tabbit智能体(Tabbit Agent)的任务完成率显著提升,从最初的53.1%跃升至目前的90.8%,在交互准确性和执行稳定性方面达到了行业领先水平。 在技术核心方面,Tabbit 1.0基于美团自研的LongCat大模型(LongCat large model),并集成了DeepSeek、Kimi、通义千问等十余个主流模型,构建了一个强大的“模型家族”生态系统。该产品能够精确执行点击、滚动、跨网站协作等复杂的UI操作(UI operations),将基础任务的平均响应时间压缩至10秒以内。此次更新不仅增强了侧边栏AI对话的视图共享功能(view-sharing function),还实现了对Windows、macOS以及移动设备(iOS/Android)的全平台覆盖,确保了跨设备一致的智能办公体验。 GN06团队负责人刘炯(Liu Jiong)表示,Tabbit的使命是降低AI技术的使用门槛。通过“魔法提示广场”(Magic Tips Square)和创作者支持计划(creator support program),该浏览器已从一个简单的信息载体演变为高效的AI工作入口。行业观察家认为,Tabbit 1.0的发布标志着AI智能体(AI Agents)从“对话式咨询”向“行动式交付”转型的关键转折点。随着智能体执行效率的显著提升,该浏览器正成为个人数字生产力的核心基础,并有望彻底重塑未来的人机交互范式(human-computer interaction paradigm)和办公流程逻辑(office workflow logic)。 美团的AI战略布局: 美团作为中国领先的生活服务电子商务平台,其业务涵盖餐饮
6月9日,美团(Meituan)旗下GN06团队正式发布了AI原生浏览器(AI-native browser)Tabbit 1.0。作为Tabbit浏览器的核心入口,该产品标志着这款深度融合大模型的智能助手,已从内部测试阶段迈向大规模商业应用。自今年3月测试上线以来,Tabbit智能体(Tabbit Agent)的任务完成率显著提升,从最初的53.1%跃升至目前的90.8%,在交互准确性和执行稳定性方面达到了行业领先水平。 在技术核心方面,Tabbit 1.0基于美团自研的LongCat大模型(LongCat large model),并集成了DeepSeek、Kimi、通义千问等十余个主流模型,构建了一个强大的“模型家族”生态系统。该产品能够精确执行点击、滚动、跨网站协作等复杂的UI操作(UI operations),将基础任务的平均响应时间压缩至10秒以内。此次更新不仅增强了侧边栏AI对话的视图共享功能(view-sharing function),还实现了对Windows、macOS以及移动设备(iOS/Android)的全平台覆盖,确保了跨设备一致的智能办公体验。 GN06团队负责人刘炯(Liu Jiong)表示,Tabbit的使命是降低AI技术的使用门槛。通过“魔法提示广场”(Magic Tips Square)和创作者支持计划(creator support program),该浏览器已从一个简单的信息载体演变为高效的AI工作入口。行业观察家认为,Tabbit 1.0的发布标志着AI智能体(AI Agents)从“对话式咨询”向“行动式交付”转型的关键转折点。随着智能体执行效率的显著提升,该浏览器正成为个人数字生产力的核心基础,并有望彻底重塑未来的人机交互范式(human-computer interaction paradigm)和办公流程逻辑(office workflow logic)。 美团的AI战略布局: 美团作为中国领先的生活服务电子商务平台,其业务涵盖餐饮