研究重新评估AI生成测试对LLM软件工程代理的价值
近日,一项题为《重新思考由代理生成的测试对基于LLM的软件工程代理的价值》的研究在arXiv上发布。该研究由Zhi Chen等七位作者共同完成,旨在深入探讨大型语言模型(LLM)驱动的软件工程代理所自动生成的测试用例的实际效用。研究指出,当前广泛使用的由代理自生成测试的方法可能存在偏差或过度拟合问题,其对于提升代码质量与修复缺陷的真实价值有待厘清。作者通过系统性实验重新评估了这类测试的有效性,并提出了更稳健的评估框架,以指导未来LLM在软件工程中的可靠应用。这一工作对于推动AI辅助编程工具的健康发展具有重要意义。 #LLM #软件工程 #测试生成 #AI #研究 #arXiv #代码质量
近日,一项题为《重新思考由代理生成的测试对基于LLM的软件工程代理的价值》的研究在arXiv上发布。该研究由Zhi Chen等七位作者共同完成,旨在深入探讨大型语言模型(LLM)驱动的软件工程代理所自动生成的测试用例的实际效用。研究指出,当前广泛使用的由代理自生成测试的方法可能存在偏差或过度拟合问题,其对于提升代码质量与修复缺陷的真实价值有待厘清。作者通过系统性实验重新评估了这类测试的有效性,并提出了更稳健的评估框架,以指导未来LLM在软件工程中的可靠应用。这一工作对于推动AI辅助编程工具的健康发展具有重要意义。 #LLM #软件工程 #测试生成 #AI #研究 #arXiv #代码质量
英伟达发布首款PC超级芯片,黄仁勋称Agentic AI时代全面到来
在COMPUTEX 2026主题演讲中,英伟达CEO黄仁勋宣布智能体AI(Agentic AI)时代全面到来,指出token成为利润单位,算力即收入与利润。同时,英伟达正式进军PC市场,发布基于Arm架构的RTX Spark超级芯片(含此前代号N1X),专为Windows笔记本和小型工作站设计,自称“有史以来最高效的平台”。黄仁勋还透露,专为AI智能体打造的Vera CPU已全面投产,速度比x86处理器快1.8倍,可驱动多样化工作负载。他强调,传统应用代码在操作系统内运行的模式已被打破,新模式以大语言模型为核心,通过安全套件编排,处理包含工作记忆、长期记忆及工具使用的复杂工作流。 #英伟达 #PC超级芯片 #RTXSpark #AgenticAI #黄仁勋 #COMPUTEX #VeraCPU #芯片 #AI
在COMPUTEX 2026主题演讲中,英伟达CEO黄仁勋宣布智能体AI(Agentic AI)时代全面到来,指出token成为利润单位,算力即收入与利润。同时,英伟达正式进军PC市场,发布基于Arm架构的RTX Spark超级芯片(含此前代号N1X),专为Windows笔记本和小型工作站设计,自称“有史以来最高效的平台”。黄仁勋还透露,专为AI智能体打造的Vera CPU已全面投产,速度比x86处理器快1.8倍,可驱动多样化工作负载。他强调,传统应用代码在操作系统内运行的模式已被打破,新模式以大语言模型为核心,通过安全套件编排,处理包含工作记忆、长期记忆及工具使用的复杂工作流。 #英伟达 #PC超级芯片 #RTXSpark #AgenticAI #黄仁勋 #COMPUTEX #VeraCPU #芯片 #AI
奥尔特曼预言AI第三阶段,SpaceX冲刺1.78万亿美元估值,Anthropic发布安全架构
OpenAI CEO山姆·奥尔特曼近日提出AI发展将进入第三阶段,强调通用人工智能(AGI)的临近,并呼吁行业关注安全与治理。与此同时,SpaceX正寻求高达1.78万亿美元的IPO估值,成为全球最具价值的私营公司之一,其星链和星舰项目被视为估值核心。此外,Anthropic发布了Claude的安全隔离架构,通过分层权限和实时监控机制,旨在提升AI系统的可控性和抗风险能力。这些动态标志着AI和航天领域正加速变革,技术商业化与安全治理并行推进。 #AI #OpenAI #SpaceX #Anthropic #通用人工智能 #IPO #安全架构 #科技新闻
OpenAI CEO山姆·奥尔特曼近日提出AI发展将进入第三阶段,强调通用人工智能(AGI)的临近,并呼吁行业关注安全与治理。与此同时,SpaceX正寻求高达1.78万亿美元的IPO估值,成为全球最具价值的私营公司之一,其星链和星舰项目被视为估值核心。此外,Anthropic发布了Claude的安全隔离架构,通过分层权限和实时监控机制,旨在提升AI系统的可控性和抗风险能力。这些动态标志着AI和航天领域正加速变革,技术商业化与安全治理并行推进。 #AI #OpenAI #SpaceX #Anthropic #通用人工智能 #IPO #安全架构 #科技新闻
英伟达推出RTX Spark处理器,定义AI PC新标准
在GTC 2025大会上,英伟达发布全新RTX Spark处理器,标志着Windows PC正式进入AI智能体时代。RTX Spark搭载Blackwell GPU、与联发科合作定制的20核Grace CPU及128GB统一内存,FP4算力达1 petaflop,支持14毫米厚、3磅重的笔记本形态。黄仁勋强调,PC将从手动操作工具转变为运行智能体的AI超级计算机,可本地运行模型并调用软件工具完成复杂任务。同时,英伟达展示下一代AI超级芯片平台Vera Rubin,面向Agentic AI设计,并推出自研Vera CPU以优化智能体调度与延迟。RTX Spark提供笔记本、台式机、工作站三种形态,兼容Windows、CUDA及AI软件栈,目标让PC原生运行智能体,成为个人AI平台。 #英伟达 #AI #PC #智能体 #RTXSpark #VeraRubin #GTC #科技 #Windows #Agent
在GTC 2025大会上,英伟达发布全新RTX Spark处理器,标志着Windows PC正式进入AI智能体时代。RTX Spark搭载Blackwell GPU、与联发科合作定制的20核Grace CPU及128GB统一内存,FP4算力达1 petaflop,支持14毫米厚、3磅重的笔记本形态。黄仁勋强调,PC将从手动操作工具转变为运行智能体的AI超级计算机,可本地运行模型并调用软件工具完成复杂任务。同时,英伟达展示下一代AI超级芯片平台Vera Rubin,面向Agentic AI设计,并推出自研Vera CPU以优化智能体调度与延迟。RTX Spark提供笔记本、台式机、工作站三种形态,兼容Windows、CUDA及AI软件栈,目标让PC原生运行智能体,成为个人AI平台。 #英伟达 #AI #PC #智能体 #RTXSpark #VeraRubin #GTC #科技 #Windows #Agent
Meta AI客服被简单黑客攻破,暴露AI安全短板
近日,Meta的AI客服系统曝出严重安全漏洞:黑客只需使用与账户所有者匹配的VPN地址,直接向AI客服请求更改邮箱地址,系统便轻易执行。这一攻击手法极其简单,却成功绕过了安全防线。杜克大学教授Neil Gong指出,这种基础漏洞本应在部署前就被发现,Meta的疏忽令人惊讶。乔治城大学研究员Jessica Ji质疑Meta是否设置了基本的安全护栏。专家分析,AI代理的灵活性使其容易受骗,它们像急于完成任务的小学生,缺乏人类客服的警惕性。尽管可通过传统软件设置规则和红队测试来降低风险,但大语言模型的概率性本质意味着AI代理始终存在被攻击的可能。Meta已表示该漏洞已修复,但此事件凸显了AI安全面临的普遍挑战。 #AI安全 #Meta #黑客 #人工智能 #网络安全 #漏洞 #AI代理 #大模型 #科技新闻
近日,Meta的AI客服系统曝出严重安全漏洞:黑客只需使用与账户所有者匹配的VPN地址,直接向AI客服请求更改邮箱地址,系统便轻易执行。这一攻击手法极其简单,却成功绕过了安全防线。杜克大学教授Neil Gong指出,这种基础漏洞本应在部署前就被发现,Meta的疏忽令人惊讶。乔治城大学研究员Jessica Ji质疑Meta是否设置了基本的安全护栏。专家分析,AI代理的灵活性使其容易受骗,它们像急于完成任务的小学生,缺乏人类客服的警惕性。尽管可通过传统软件设置规则和红队测试来降低风险,但大语言模型的概率性本质意味着AI代理始终存在被攻击的可能。Meta已表示该漏洞已修复,但此事件凸显了AI安全面临的普遍挑战。 #AI安全 #Meta #黑客 #人工智能 #网络安全 #漏洞 #AI代理 #大模型 #科技新闻
《Control Resonant》既是续作,也是新起点
芬兰游戏开发商Remedy Entertainment正式公布了《Control Resonant》。从时间线来看,它是2019年《Control》的续作,但在叙事和玩法上两者并不直接延续。Remedy表示,这两款游戏更像是同一枚硬币的两面——共享世界观却各自独立。新作将引入全新的主角和超自然能力系统,同时保留前作标志性的物理破坏与悬疑氛围。玩家不需要通关前作即可直接体验,这降低了新用户的门槛。目前官方尚未公布具体发售日期,但已确认将登陆PC与主机平台。 #游戏 #Remedy #Control #ControlResonant #续作 #超自然 #动作冒险 #游戏新闻
芬兰游戏开发商Remedy Entertainment正式公布了《Control Resonant》。从时间线来看,它是2019年《Control》的续作,但在叙事和玩法上两者并不直接延续。Remedy表示,这两款游戏更像是同一枚硬币的两面——共享世界观却各自独立。新作将引入全新的主角和超自然能力系统,同时保留前作标志性的物理破坏与悬疑氛围。玩家不需要通关前作即可直接体验,这降低了新用户的门槛。目前官方尚未公布具体发售日期,但已确认将登陆PC与主机平台。 #游戏 #Remedy #Control #ControlResonant #续作 #超自然 #动作冒险 #游戏新闻
华为云发布“Agentic Infra”新范式,极致重构AI算力底座
在华为云最新技术解读中,其正式提出“Agentic Infra”新范式,核心是构建面向Agent时代的云基础设施——“Agentic计算机”。随着云计算进入Token工业时代,华为云通过软硬芯深度协同,实现四大突破:灵衢网络将分散资源互联成一体;基于昇腾950打造1024卡灵衢智能计算集群,算力提升2.6倍;推出记忆存储解决方案AMS,为Agent提供PB级超大记忆空间,缓存命中率提升至95%、成本节省63%;以及高性能极简网络支持灵活配比。同时,FlexNPU柔性液态算力架构实现算子级时空复用,将节点弹性及故障恢复时间从分钟级降至秒级。华为云表示,该技术将赋能中国企业Agent创新,提供坚实高效的国产底座。 #华为云 #AgenticInfra #AI基础设施 #大模型 #云计算 #昇腾 #智算集群
在华为云最新技术解读中,其正式提出“Agentic Infra”新范式,核心是构建面向Agent时代的云基础设施——“Agentic计算机”。随着云计算进入Token工业时代,华为云通过软硬芯深度协同,实现四大突破:灵衢网络将分散资源互联成一体;基于昇腾950打造1024卡灵衢智能计算集群,算力提升2.6倍;推出记忆存储解决方案AMS,为Agent提供PB级超大记忆空间,缓存命中率提升至95%、成本节省63%;以及高性能极简网络支持灵活配比。同时,FlexNPU柔性液态算力架构实现算子级时空复用,将节点弹性及故障恢复时间从分钟级降至秒级。华为云表示,该技术将赋能中国企业Agent创新,提供坚实高效的国产底座。 #华为云 #AgenticInfra #AI基础设施 #大模型 #云计算 #昇腾 #智算集群
FIDES:利用深层证据信号解决RAG中检索与记忆冲突的新方法
一篇题为《FIDES:利用深层证据信号实现检索-记忆冲突下的忠实推理》的论文预印本在arXiv上发布。针对检索增强生成(RAG)系统中检索到的外部文档与模型内部存储知识(参数记忆)常出现冲突、导致模型生成结果不可靠的问题,研究团队提出了FIDES(Faithful Inference via Deep Evidence Signals)框架。该方法通过从模型中提取深层证据信号,对检索信息与内部记忆进行精细权衡,有效识别并化解矛盾。实验表明,FIDES在多跳推理和事实一致性任务上显著提升了模型的忠实度,减少幻觉生成,为构建更可信的RAG系统提供了新思路。该论文由Zhe Yu等六位作者完成。 #RAG #检索增强生成 #忠实推理 #深度学习 #自然语言处理 #AI #论文
一篇题为《FIDES:利用深层证据信号实现检索-记忆冲突下的忠实推理》的论文预印本在arXiv上发布。针对检索增强生成(RAG)系统中检索到的外部文档与模型内部存储知识(参数记忆)常出现冲突、导致模型生成结果不可靠的问题,研究团队提出了FIDES(Faithful Inference via Deep Evidence Signals)框架。该方法通过从模型中提取深层证据信号,对检索信息与内部记忆进行精细权衡,有效识别并化解矛盾。实验表明,FIDES在多跳推理和事实一致性任务上显著提升了模型的忠实度,减少幻觉生成,为构建更可信的RAG系统提供了新思路。该论文由Zhe Yu等六位作者完成。 #RAG #检索增强生成 #忠实推理 #深度学习 #自然语言处理 #AI #论文
LLMs 数学形式化能力评估研究发表
近日,一篇题为《评估大语言模型在 Lean 中的数学形式化能力》的学术论文在 arXiv 预印本平台发布。该研究由 Tyson Klingner 等 8 位作者共同完成,系统评估了多个主流大语言模型在 Lean 数学形式化工具中的表现。数学形式化是将数学证明转化为计算机可验证代码的过程,对提升数学研究的严谨性和自动化水平至关重要,但传统上耗时耗力。研究团队通过设计标准化测试集,对比了不同 LLMs 在定理证明、策略生成、错误修正等方面的能力,揭示了模型在复杂数学推理中的优势与不足。该成果有望推动 AI 辅助数学证明的发展,为形式化验证领域提供新的技术路径。 #LLMs #数学形式化 #Lean #AI #arXiv #学术研究 #定理证明
近日,一篇题为《评估大语言模型在 Lean 中的数学形式化能力》的学术论文在 arXiv 预印本平台发布。该研究由 Tyson Klingner 等 8 位作者共同完成,系统评估了多个主流大语言模型在 Lean 数学形式化工具中的表现。数学形式化是将数学证明转化为计算机可验证代码的过程,对提升数学研究的严谨性和自动化水平至关重要,但传统上耗时耗力。研究团队通过设计标准化测试集,对比了不同 LLMs 在定理证明、策略生成、错误修正等方面的能力,揭示了模型在复杂数学推理中的优势与不足。该成果有望推动 AI 辅助数学证明的发展,为形式化验证领域提供新的技术路径。 #LLMs #数学形式化 #Lean #AI #arXiv #学术研究 #定理证明
AI编码代理如何“使用”你的技术?开发者需警惕黑箱操作
当开发者发布SDK、CLI或API后,AI编码代理会以不同于人类的方式调用这些技术。从“开发者输入提示”到“代理生成代码”之间,实际发生了什么?代理是否阅读文档?调用MCP服务器?还是仅凭记忆猜测?文章以“用Contoso Identity构建REST API”为例,拆解了代理的工作流程:首先,开发环境(如Copilot、Claude Code)组装上下文窗口,包括系统提示、工具描述、工作区文件等,但上下文窗口有限,代理会优先保留高相关性内容,忽略过长或无关的扩展描述。随后,模型一次性读取所有信息,若预训练中见过该技术,则会基于已有知识生成代码;若未见过,则可能求助或猜测。不同代理的行为倾向各异:有的主动调用工具,有的依赖自身知识。开发者无法控制代理的具体决策,但可通过优化扩展描述、确保文档清晰等方式提升被正确调用的概率。 #AI编码代理 #开发者工具 #上下文窗口 #模型行为 #技术适配
当开发者发布SDK、CLI或API后,AI编码代理会以不同于人类的方式调用这些技术。从“开发者输入提示”到“代理生成代码”之间,实际发生了什么?代理是否阅读文档?调用MCP服务器?还是仅凭记忆猜测?文章以“用Contoso Identity构建REST API”为例,拆解了代理的工作流程:首先,开发环境(如Copilot、Claude Code)组装上下文窗口,包括系统提示、工具描述、工作区文件等,但上下文窗口有限,代理会优先保留高相关性内容,忽略过长或无关的扩展描述。随后,模型一次性读取所有信息,若预训练中见过该技术,则会基于已有知识生成代码;若未见过,则可能求助或猜测。不同代理的行为倾向各异:有的主动调用工具,有的依赖自身知识。开发者无法控制代理的具体决策,但可通过优化扩展描述、确保文档清晰等方式提升被正确调用的概率。 #AI编码代理 #开发者工具 #上下文窗口 #模型行为 #技术适配