浙大与蚂蚁集团联合研究:大模型可“未跑先知”预测机器学习方案优劣
当前机器学习智能体(Agent)在执行任务时,主要瓶颈不在代码生成,而在于物理执行时间过长——一套实验可能耗时数小时,导致Agent只能验证少量方案。浙江大学与蚂蚁集团联合实验室的一项研究发现,大语言模型具备在代码执行前预测机器学习方案相对性能的能力:在18438对真实方案对比中,DeepSeek-V3.2在思考模式下准确率达61.5%,显著高于随机基线(50%)和复杂度启发式(50.8%)。论文提出Data-centric Solution Preference任务,并引入Verified Data Analysis Report,让模型先“读懂数据”再判断代码与数据的匹配度。将该预测能力集成到Agent中后,搜索效率提升6倍,最终性能提升6%。该工作《Can We Predict Before Executing Machine Learning Agents?》已被ACL 2026接收为SAC Highlight。 #机器学习 #AI #大模型 #智能体 #ACL2026 #浙江大学 #蚂蚁集团 #效率提升 #论文 #前沿研究
当前机器学习智能体(Agent)在执行任务时,主要瓶颈不在代码生成,而在于物理执行时间过长——一套实验可能耗时数小时,导致Agent只能验证少量方案。浙江大学与蚂蚁集团联合实验室的一项研究发现,大语言模型具备在代码执行前预测机器学习方案相对性能的能力:在18438对真实方案对比中,DeepSeek-V3.2在思考模式下准确率达61.5%,显著高于随机基线(50%)和复杂度启发式(50.8%)。论文提出Data-centric Solution Preference任务,并引入Verified Data Analysis Report,让模型先“读懂数据”再判断代码与数据的匹配度。将该预测能力集成到Agent中后,搜索效率提升6倍,最终性能提升6%。该工作《Can We Predict Before Executing Machine Learning Agents?》已被ACL 2026接收为SAC Highlight。 #机器学习 #AI #大模型 #智能体 #ACL2026 #浙江大学 #蚂蚁集团 #效率提升 #论文 #前沿研究
ThinkingAI Agentic SDK 正式发布,助力鸿蒙端侧 Agent 可观测
随着鸿蒙 HarmonyOS 7 发布及智能体框架 HMAF 2.0 将 Agent 能力下沉至客户端,越来越多的应用开始嵌入对话式 Agent。然而,Agent 的内部运行过程——调用轨迹、耗时、成败等——对开发者而言如同黑箱,传统用户行为分析无法覆盖。ThinkingAI 正式推出 Agentic SDK,全面支持 HMAF 2.0 生态,为端侧 Agent 提供轻量、低侵入的运行观测能力。该 SDK 能完整记录 Agent 的任务执行链,包括所用工具、推理路径、Token 消耗及错误节点,并默认不采集原始对话内容,遵循鸿蒙 HPIC 规范,支持私有化部署。通过将用户操作与 Agent 运行信息对齐,开发者可在同一分析漏斗中排查问题、计算成本、优化留存,从而让端侧 Agent 的迭代有据可依。 #ThinkingAI #AgenticSDK #鸿蒙 #HMAF2.0 #端侧Agent #可观测性 #开发者工具 #AI
随着鸿蒙 HarmonyOS 7 发布及智能体框架 HMAF 2.0 将 Agent 能力下沉至客户端,越来越多的应用开始嵌入对话式 Agent。然而,Agent 的内部运行过程——调用轨迹、耗时、成败等——对开发者而言如同黑箱,传统用户行为分析无法覆盖。ThinkingAI 正式推出 Agentic SDK,全面支持 HMAF 2.0 生态,为端侧 Agent 提供轻量、低侵入的运行观测能力。该 SDK 能完整记录 Agent 的任务执行链,包括所用工具、推理路径、Token 消耗及错误节点,并默认不采集原始对话内容,遵循鸿蒙 HPIC 规范,支持私有化部署。通过将用户操作与 Agent 运行信息对齐,开发者可在同一分析漏斗中排查问题、计算成本、优化留存,从而让端侧 Agent 的迭代有据可依。 #ThinkingAI #AgenticSDK #鸿蒙 #HMAF2.0 #端侧Agent #可观测性 #开发者工具 #AI
数码港启动全港首个"一人公司"创业基地,Web4.0与智能体安全联盟同步成立
数码港于7月13日正式启动全港首个专为"一人公司"打造的创新创业基地——数码港OPC Hub,旨在结合阿里云、AWS、英伟达等国际企业资源,为AI创业者提供算力、模型、云服务等一站式支持。同日,数码港宣布成立"Web4.0与智能体安全联盟",携手360、CertiK、慢雾科技等12家安全服务企业,应对代理式人工智能与Web3.0融合带来的网络安全风险。该联盟将推动行业协作、制定安全框架,构建可信Web4.0生态。数码港作为香港数码科技枢纽,已汇聚超2300家企业,致力于推动香港成为全球Web4.0枢纽。 #数码港 #一人公司 #OPCHub #Web4.0 #智能体安全联盟 #AI #区块链 #网络安全 #香港科技 #创业
数码港于7月13日正式启动全港首个专为"一人公司"打造的创新创业基地——数码港OPC Hub,旨在结合阿里云、AWS、英伟达等国际企业资源,为AI创业者提供算力、模型、云服务等一站式支持。同日,数码港宣布成立"Web4.0与智能体安全联盟",携手360、CertiK、慢雾科技等12家安全服务企业,应对代理式人工智能与Web3.0融合带来的网络安全风险。该联盟将推动行业协作、制定安全框架,构建可信Web4.0生态。数码港作为香港数码科技枢纽,已汇聚超2300家企业,致力于推动香港成为全球Web4.0枢纽。 #数码港 #一人公司 #OPCHub #Web4.0 #智能体安全联盟 #AI #区块链 #网络安全 #香港科技 #创业
AICon 深圳大会聚焦 Agentic 负载下的 LLM 推理引擎设计
2026 年 AICon 人工智能开发与应用大会将于 8 月 21 日至 22 日在深圳举办,主题从模型能力转向可规模化的智能系统。阿里云高级开发工程师尚旭春将分享面向 Agentic 负载的下一代 LLM 推理引擎设计实践。他指出,随着 AI Agent 进入生产环境,推理负载呈现高并发、短请求、多轮工具调用等新特征,传统聊天场景的优化目标已不再适用。新一代推理引擎需在保证低延迟的同时提升 GPU Token 输出效率。尚旭春结合 TokenSpeed 研发经验,从 Runtime 与 Kernel 两个层面阐述设计思路,包括前缀缓存、推测解码、跨平台 Kernel 抽象等关键技术,并介绍 AMD GPU 上的适配实践。该分享旨在帮助开发者掌握面向 Agentic 场景的推理系统优化方法,提升大规模 LLM 部署效率。 #AICon #LLM #推理引擎 #Agent #AI基础设施 #性能优化 #TokenSpeed
2026 年 AICon 人工智能开发与应用大会将于 8 月 21 日至 22 日在深圳举办,主题从模型能力转向可规模化的智能系统。阿里云高级开发工程师尚旭春将分享面向 Agentic 负载的下一代 LLM 推理引擎设计实践。他指出,随着 AI Agent 进入生产环境,推理负载呈现高并发、短请求、多轮工具调用等新特征,传统聊天场景的优化目标已不再适用。新一代推理引擎需在保证低延迟的同时提升 GPU Token 输出效率。尚旭春结合 TokenSpeed 研发经验,从 Runtime 与 Kernel 两个层面阐述设计思路,包括前缀缓存、推测解码、跨平台 Kernel 抽象等关键技术,并介绍 AMD GPU 上的适配实践。该分享旨在帮助开发者掌握面向 Agentic 场景的推理系统优化方法,提升大规模 LLM 部署效率。 #AICon #LLM #推理引擎 #Agent #AI基础设施 #性能优化 #TokenSpeed
不公平的裁判
一篇来自arXiv的论文深入探讨了大型语言模型(LLM)在担任评判角色时存在的偏见问题。研究人员通过机械可解释性方法,系统分析了LLM作为裁判(LLM-as-Judge)过程中可能出现的系统性偏差,揭示了其内部工作机制如何导致不公平的判断结果。该研究指出,即使是在看似中立的评估任务中,LLM也会因训练数据的固有偏好或模型架构设计而产生偏向性输出。这一发现对于当前广泛使用LLM进行自动评估、内容审核等场景具有重要警示意义,可能推动更公平、可靠的AI评判系统的开发。论文由Zixiang Xu等七位作者共同完成,已提交至arXiv预印本平台。 #LLM #AI偏见 #机械可解释性 #arXiv #人工智能 #公平性 #自然语言处理 #模型评估
一篇来自arXiv的论文深入探讨了大型语言模型(LLM)在担任评判角色时存在的偏见问题。研究人员通过机械可解释性方法,系统分析了LLM作为裁判(LLM-as-Judge)过程中可能出现的系统性偏差,揭示了其内部工作机制如何导致不公平的判断结果。该研究指出,即使是在看似中立的评估任务中,LLM也会因训练数据的固有偏好或模型架构设计而产生偏向性输出。这一发现对于当前广泛使用LLM进行自动评估、内容审核等场景具有重要警示意义,可能推动更公平、可靠的AI评判系统的开发。论文由Zixiang Xu等七位作者共同完成,已提交至arXiv预印本平台。 #LLM #AI偏见 #机械可解释性 #arXiv #人工智能 #公平性 #自然语言处理 #模型评估
Turnitin Report 发布免费 AI 检测工具,帮助评估学生论文
一款名为 Turnitin Report 的免费 AI 检测工具正式上线,专为学生、作家和学术用户设计。该工具提供段落级 AI 检测报告,而非仅给出一个整体百分比,可分析文本中的可预测语句、重复段落结构、通用学术用语、缺乏具体细节等信号,并给出 0-100% 的 AI 相似度评分及风险等级。用户无需注册即可粘贴论文或作业进行检测,并获得哪些部分可能需要修改的建议。该工具旨在帮助学生在提交前识别并调整可能被判定为 AI 生成的内容,提升原创性和自然度。 #AI检测 #学术诚信 #论文检查 #免费工具 #学生 #写作辅助 #AI写作
一款名为 Turnitin Report 的免费 AI 检测工具正式上线,专为学生、作家和学术用户设计。该工具提供段落级 AI 检测报告,而非仅给出一个整体百分比,可分析文本中的可预测语句、重复段落结构、通用学术用语、缺乏具体细节等信号,并给出 0-100% 的 AI 相似度评分及风险等级。用户无需注册即可粘贴论文或作业进行检测,并获得哪些部分可能需要修改的建议。该工具旨在帮助学生在提交前识别并调整可能被判定为 AI 生成的内容,提升原创性和自然度。 #AI检测 #学术诚信 #论文检查 #免费工具 #学生 #写作辅助 #AI写作