新型AI评测框架Incognita:基于社会分布式任务的生成式Agent评估
一项发表于arXiv的研究提出了名为Incognita的新型评估框架,用于衡量生成式AI智能体在社会分布式任务环境中的表现。该框架通过模拟真实世界的任务分布与协作场景,评估AI在动态、多因素环境下的行动能力。研究者指出,传统评测方法往往局限于静态任务,难以反映AI在复杂社会互动中的实际表现。Incognita框架通过构建具有社会性分布特征的任务环境,要求AI智能体在信息不对称、资源受限等条件下自主决策并完成目标。初步实验表明,该框架能有效区分不同能力层次的AI系统,为下一代AI评估标准化提供了新思路。该研究同时开源了相关数据与工具,以促进社区协作与透明度。 #AI #评估框架 #生成式Agent #社会分布式任务 #Incognita #arXiv #人工智能评测
一项发表于arXiv的研究提出了名为Incognita的新型评估框架,用于衡量生成式AI智能体在社会分布式任务环境中的表现。该框架通过模拟真实世界的任务分布与协作场景,评估AI在动态、多因素环境下的行动能力。研究者指出,传统评测方法往往局限于静态任务,难以反映AI在复杂社会互动中的实际表现。Incognita框架通过构建具有社会性分布特征的任务环境,要求AI智能体在信息不对称、资源受限等条件下自主决策并完成目标。初步实验表明,该框架能有效区分不同能力层次的AI系统,为下一代AI评估标准化提供了新思路。该研究同时开源了相关数据与工具,以促进社区协作与透明度。 #AI #评估框架 #生成式Agent #社会分布式任务 #Incognita #arXiv #人工智能评测
VERITAS
近日,一篇名为《VERITAS:面向科学研究的通用复制工具》的论文在arXiv上发布,作者为Haokun Liu等人。该论文提出了一种名为VERITAS的通用复制工具,旨在解决科学研究中的结果可重复性问题。论文介绍了该工具的设计与实现,并提供了PDF、HTML及TeX源码等多种访问方式。此外,论文页面还集成了多种学术工具和资源,如参考文献检索(NASA ADS、Google Scholar)、BibTeX导出、代码链接(通过CatalyzeX)、演示平台(Replicate、Hugging Face Spaces)以及相关论文推荐(Connected Papers、Litmaps)。该研究反映了科学界对开放性和可复制性的重视,并在arXiv社区通过arXivLabs项目支持实验性功能,强调用户数据隐私和社区协作。 #科学研究 #可重复性 #工具 #arXiv #学术论文
近日,一篇名为《VERITAS:面向科学研究的通用复制工具》的论文在arXiv上发布,作者为Haokun Liu等人。该论文提出了一种名为VERITAS的通用复制工具,旨在解决科学研究中的结果可重复性问题。论文介绍了该工具的设计与实现,并提供了PDF、HTML及TeX源码等多种访问方式。此外,论文页面还集成了多种学术工具和资源,如参考文献检索(NASA ADS、Google Scholar)、BibTeX导出、代码链接(通过CatalyzeX)、演示平台(Replicate、Hugging Face Spaces)以及相关论文推荐(Connected Papers、Litmaps)。该研究反映了科学界对开放性和可复制性的重视,并在arXiv社区通过arXivLabs项目支持实验性功能,强调用户数据隐私和社区协作。 #科学研究 #可重复性 #工具 #arXiv #学术论文
MedCalc-Pro
来自arXiv的一篇研究论文介绍了名为MedCalc-Pro的系统,旨在利用大语言模型(LLM)代理解决复杂的医学计算任务。该系统针对传统AI在临床计算中面临的挑战开发,通过将LLM作为智能代理,整合专门的计算工具和医学知识库,能够处理如药物剂量、生化指标换算等需要深度专业理解的复杂计算。论文详细阐述了MedCalc-Pro的架构,包括其如何通过多步推理和工具调用,提高计算准确性与可解释性。该研究实验结果表明,MedCalc-Pro在多个标准医学计算基准测试上表现优异,有望辅助临床决策,减少人为计算错误,为未来智能医疗应用提供了新的方向。 #大语言模型 #医学计算 #人工智能 #LLM #MedCalcPro #临床决策 #arXiv
来自arXiv的一篇研究论文介绍了名为MedCalc-Pro的系统,旨在利用大语言模型(LLM)代理解决复杂的医学计算任务。该系统针对传统AI在临床计算中面临的挑战开发,通过将LLM作为智能代理,整合专门的计算工具和医学知识库,能够处理如药物剂量、生化指标换算等需要深度专业理解的复杂计算。论文详细阐述了MedCalc-Pro的架构,包括其如何通过多步推理和工具调用,提高计算准确性与可解释性。该研究实验结果表明,MedCalc-Pro在多个标准医学计算基准测试上表现优异,有望辅助临床决策,减少人为计算错误,为未来智能医疗应用提供了新的方向。 #大语言模型 #医学计算 #人工智能 #LLM #MedCalcPro #临床决策 #arXiv
ASK in the Dark
近日,一篇题为《ASK in the Dark: Uncertainty-Gated LLM Assistance under Partial Observability》的学术论文在arXiv上发布。该研究由Juarez Monteiro等5位作者共同完成,提出了一种名为“ASK”的不确定性门控机制,旨在提升大语言模型在部分可观测环境下的辅助决策能力。传统LLM在面对信息不完整时容易出现错误或过度自信,而ASK框架通过动态评估模型自身的置信度,在不确定时主动暂停输出或请求澄清,从而显著提高回答的可靠性与安全性。该方法有望在自动驾驶、医疗诊断、金融风控等需要强鲁棒性的领域发挥关键作用。 #AI #大模型 #不确定性 #机器学习 #论文 #arXiv #LLM
近日,一篇题为《ASK in the Dark: Uncertainty-Gated LLM Assistance under Partial Observability》的学术论文在arXiv上发布。该研究由Juarez Monteiro等5位作者共同完成,提出了一种名为“ASK”的不确定性门控机制,旨在提升大语言模型在部分可观测环境下的辅助决策能力。传统LLM在面对信息不完整时容易出现错误或过度自信,而ASK框架通过动态评估模型自身的置信度,在不确定时主动暂停输出或请求澄清,从而显著提高回答的可靠性与安全性。该方法有望在自动驾驶、医疗诊断、金融风控等需要强鲁棒性的领域发挥关键作用。 #AI #大模型 #不确定性 #机器学习 #论文 #arXiv #LLM
VS Code团队携手OpenAI优化GPT
2026年7月6日,VS Code团队发文介绍与OpenAI合作的两周实验成果。该实验旨在通过调整GPT-5.5在VS Code编码工具中的系统提示词,让代理减少不必要的探索行为,更快做出有效编辑。实验发现,GPT-5.5在编码过程中经常花费大量标记用于搜索、重读和对比路径,导致响应变慢且费用增加。团队设计了两种提示优化方案:方案A增加一条简洁提醒,指导代理从具体锚点出发,仅收集必要上下文,避免广泛搜索;方案B则添加更多结构性约束。在每25%流量的分组实测中,优化后的代理在保持输出质量的同时,显著提升标记效率,用户等待时间和费用双双下降。这一改进对按使用量计费的场景尤为关键。 #VS Code #GPT-5.5 #提示工程 #AI编程 #标记效率 #OpenAI #代码代理
2026年7月6日,VS Code团队发文介绍与OpenAI合作的两周实验成果。该实验旨在通过调整GPT-5.5在VS Code编码工具中的系统提示词,让代理减少不必要的探索行为,更快做出有效编辑。实验发现,GPT-5.5在编码过程中经常花费大量标记用于搜索、重读和对比路径,导致响应变慢且费用增加。团队设计了两种提示优化方案:方案A增加一条简洁提醒,指导代理从具体锚点出发,仅收集必要上下文,避免广泛搜索;方案B则添加更多结构性约束。在每25%流量的分组实测中,优化后的代理在保持输出质量的同时,显著提升标记效率,用户等待时间和费用双双下降。这一改进对按使用量计费的场景尤为关键。 #VS Code #GPT-5.5 #提示工程 #AI编程 #标记效率 #OpenAI #代码代理
ACPO
来自arXiv的一篇研究论文提出了名为ACPO(自适应信用策略优化)的新方法,通过细粒度代理熵来优化强化学习中的信用分配。该论文由Zijun Xie、Yuyang You等学者共同完成,探讨了如何利用自适应机制改进策略优化过程,提升学习效率。ACPO方法在训练中动态调整信用分配,避免了传统方法的局限性,为强化学习领域提供了新的思路。尽管论文尚未正式注册DOI,但已可通过arXiv平台获取全文,并支持HTML、TeX源码等方式浏览。相关代码、数据及媒体资源可通过多个外部工具链接访问,如alphaXiv、Hugging Face等,便于研究者复现与进一步探索。 #ACPO #强化学习 #信用分配 #论文 #arXiv #AI
来自arXiv的一篇研究论文提出了名为ACPO(自适应信用策略优化)的新方法,通过细粒度代理熵来优化强化学习中的信用分配。该论文由Zijun Xie、Yuyang You等学者共同完成,探讨了如何利用自适应机制改进策略优化过程,提升学习效率。ACPO方法在训练中动态调整信用分配,避免了传统方法的局限性,为强化学习领域提供了新的思路。尽管论文尚未正式注册DOI,但已可通过arXiv平台获取全文,并支持HTML、TeX源码等方式浏览。相关代码、数据及媒体资源可通过多个外部工具链接访问,如alphaXiv、Hugging Face等,便于研究者复现与进一步探索。 #ACPO #强化学习 #信用分配 #论文 #arXiv #AI
物理信息神经网络赋能单自由度直升机安全强化学习
来自萨尔茨堡应用科学大学的研究团队提出了一种融合物理信息神经网络与强化学习的安全控制方案,旨在解决单自由度直升机系统的安全约束问题。该论文发表于arXiv平台,作者包括Georg Schäfer、Jakob Rehrl和Stefan Huber。该方法通过在强化学习框架中嵌入物理信息神经网络,使智能体能够在不违反系统物理限制的前提下学习最优控制策略。实验结果表明,与传统强化学习方法相比,该混合框架在直升机悬停和轨迹跟踪任务中显著降低了安全违规率,同时保持了优秀的控制性能。研究团队指出,这种将物理先验知识与数据驱动的强化学习相结合的方法,为复杂动态系统的安全控制提供了新思路,尤其在航空航天等对安全性要求极高的领域具有重要应用价值。 #强化学习 #物理信息神经网络 #安全控制 #直升机系统 #人工智能 #航空航天 #控制理论 #机器学习
来自萨尔茨堡应用科学大学的研究团队提出了一种融合物理信息神经网络与强化学习的安全控制方案,旨在解决单自由度直升机系统的安全约束问题。该论文发表于arXiv平台,作者包括Georg Schäfer、Jakob Rehrl和Stefan Huber。该方法通过在强化学习框架中嵌入物理信息神经网络,使智能体能够在不违反系统物理限制的前提下学习最优控制策略。实验结果表明,与传统强化学习方法相比,该混合框架在直升机悬停和轨迹跟踪任务中显著降低了安全违规率,同时保持了优秀的控制性能。研究团队指出,这种将物理先验知识与数据驱动的强化学习相结合的方法,为复杂动态系统的安全控制提供了新思路,尤其在航空航天等对安全性要求极高的领域具有重要应用价值。 #强化学习 #物理信息神经网络 #安全控制 #直升机系统 #人工智能 #航空航天 #控制理论 #机器学习