中国银行推出“算力贷”,创新AI企业融资模式
中国银行广州分行近日在广州海珠区推出“算力贷”,成为广东省首个围绕token经济的信贷产品。该产品覆盖计算供应、应用和服务三大场景,设立子产品面向不同规模的AI企业,根据企业token的生产与消费量、合同价值等指标评估信用,提供最高3000万元、最长三年的贷款。目前已批准五家企业共2800万元贷款,其中三家已提款800万元主要用于支付算力费用。银行通过审核token消费报表和现场检查验证数据,并计划与平台深化合作实现数据直接监控。行业分析师指出,这一模式适应了AI初创公司轻资产、增长快的特点,解决了传统信贷评估的难题。随着算力金融升温,江苏银行、浦发银行等也相继推出类似产品,推动金融支持科技创新,促进AI产业发展。 #新闻 #银行 #AI #算力 #金融创新 #科技 #信贷 #融资
中国银行广州分行近日在广州海珠区推出“算力贷”,成为广东省首个围绕token经济的信贷产品。该产品覆盖计算供应、应用和服务三大场景,设立子产品面向不同规模的AI企业,根据企业token的生产与消费量、合同价值等指标评估信用,提供最高3000万元、最长三年的贷款。目前已批准五家企业共2800万元贷款,其中三家已提款800万元主要用于支付算力费用。银行通过审核token消费报表和现场检查验证数据,并计划与平台深化合作实现数据直接监控。行业分析师指出,这一模式适应了AI初创公司轻资产、增长快的特点,解决了传统信贷评估的难题。随着算力金融升温,江苏银行、浦发银行等也相继推出类似产品,推动金融支持科技创新,促进AI产业发展。 #新闻 #银行 #AI #算力 #金融创新 #科技 #信贷 #融资
解决AI Agent论文检索痛点:开发者探索专用Skill与数据库直连方案
近日,科技社区Linux.do发起了一场关于AI文献检索效率的深度讨论。发帖者指出,尽管通用型AI Agent在多任务处理上表现突出,但在论文检索领域存在显著痛点,例如检索结果不准确、无法深入理解学术内容,导致效率低下。为解决这些问题,社区成员探讨了开发专用技能(Skill)的方案,使AI Agent能更精准地执行检索任务;同时,直接连接学术数据库如PubMed或IEEE Xplore也被视为关键途径,以提升数据获取速度和准确性。这场讨论反映了开发者对AI工具实用性的追求,可能推动相关开源项目和工具的诞生,加速AI技术在科研辅助领域的优化与应用。 #AI #Agent #论文检索 #科技讨论 # #开发者社区 #学术检索 #检索优化 #开源工具
近日,科技社区Linux.do发起了一场关于AI文献检索效率的深度讨论。发帖者指出,尽管通用型AI Agent在多任务处理上表现突出,但在论文检索领域存在显著痛点,例如检索结果不准确、无法深入理解学术内容,导致效率低下。为解决这些问题,社区成员探讨了开发专用技能(Skill)的方案,使AI Agent能更精准地执行检索任务;同时,直接连接学术数据库如PubMed或IEEE Xplore也被视为关键途径,以提升数据获取速度和准确性。这场讨论反映了开发者对AI工具实用性的追求,可能推动相关开源项目和工具的诞生,加速AI技术在科研辅助领域的优化与应用。 #AI #Agent #论文检索 #科技讨论 # #开发者社区 #学术检索 #检索优化 #开源工具
使用开源权重模型实现纯LLM的PDDL领域修复
近日,一篇题为“LLM-Only PDDL Domain Repair with Open-Weight Models”的学术论文在arXiv发布,由Nader Karimi Bavandpour等人撰写。该论文提出了一种创新方法,仅依靠大型语言模型(LLM)和开源权重模型来自动修复PDDL(规划域定义语言)域中的错误。在AI规划领域,PDDL用于描述问题域,但定义时常出现不一致或错误,传统修复依赖专家手工调整,效率低下。本研究利用LLM的理解和生成能力,通过分析现有域定义并生成修复建议,实现了全自动化的修复流程。该方法有望显著降低AI规划系统的维护成本,提升规划效率和可靠性,并推动开源大模型在专业任务中的实际应用。论文发布于2026年8月,为AI自动化工具的发展提供了新思路,可能对学术研究和工业实践产生积极影响。 #AI #LLM #PDDL #开源模型 #学术论文 #科技新闻 #自动化 #规划系统
近日,一篇题为“LLM-Only PDDL Domain Repair with Open-Weight Models”的学术论文在arXiv发布,由Nader Karimi Bavandpour等人撰写。该论文提出了一种创新方法,仅依靠大型语言模型(LLM)和开源权重模型来自动修复PDDL(规划域定义语言)域中的错误。在AI规划领域,PDDL用于描述问题域,但定义时常出现不一致或错误,传统修复依赖专家手工调整,效率低下。本研究利用LLM的理解和生成能力,通过分析现有域定义并生成修复建议,实现了全自动化的修复流程。该方法有望显著降低AI规划系统的维护成本,提升规划效率和可靠性,并推动开源大模型在专业任务中的实际应用。论文发布于2026年8月,为AI自动化工具的发展提供了新思路,可能对学术研究和工业实践产生积极影响。 #AI #LLM #PDDL #开源模型 #学术论文 #科技新闻 #自动化 #规划系统
给大模型喂文档反而让错误SQL更可信
近日研究揭示了大型语言模型(LLM)在将自然语言转换为SQL查询时存在一种被称为“静默失败”的严重问题。该问题指的是,模型能生成语法正确、看似合理的SQL并返回结果,但结果本身因误解查询意图或数据背景而实际上是错误的,且系统不提供任何警告信号。研究者通过纽约市出租车数据集的案例说明,当被问及现金支付的平均小费时,模型会正确执行AVG(tip_amount)查询,但忽略了现金支付的小费因未录入数据库而始终为零的前提,从而给出了一个误导性但格式无误的答案。 更令人担忧的是,提供数据库模式文档等增强措施并未减少这类错误,反而可能使错误的输出显得更加可靠。测试显示,不同前沿模型在面对不确定问题时表现迥异:有的模型能主动拒绝回答,而另一些则倾向于给出自信却错误的答案。这使得系统在无法理解底层SQL的用户面前风险极高。现有的数据质量测试、可观测性工具以及语义层都无法完全解决这一问题,因为它们难以判断一个返回数字在业务定义和数据粒度层面是否真实正确。这种“静默失败”可能悄无声息地污染商业决策,构成了数据驱动工作中一个未被充分认识的关键风险。 #AI #大模型 #文本转SQL #数据安全 #静默失败 #数据质量
近日研究揭示了大型语言模型(LLM)在将自然语言转换为SQL查询时存在一种被称为“静默失败”的严重问题。该问题指的是,模型能生成语法正确、看似合理的SQL并返回结果,但结果本身因误解查询意图或数据背景而实际上是错误的,且系统不提供任何警告信号。研究者通过纽约市出租车数据集的案例说明,当被问及现金支付的平均小费时,模型会正确执行AVG(tip_amount)查询,但忽略了现金支付的小费因未录入数据库而始终为零的前提,从而给出了一个误导性但格式无误的答案。 更令人担忧的是,提供数据库模式文档等增强措施并未减少这类错误,反而可能使错误的输出显得更加可靠。测试显示,不同前沿模型在面对不确定问题时表现迥异:有的模型能主动拒绝回答,而另一些则倾向于给出自信却错误的答案。这使得系统在无法理解底层SQL的用户面前风险极高。现有的数据质量测试、可观测性工具以及语义层都无法完全解决这一问题,因为它们难以判断一个返回数字在业务定义和数据粒度层面是否真实正确。这种“静默失败”可能悄无声息地污染商业决策,构成了数据驱动工作中一个未被充分认识的关键风险。 #AI #大模型 #文本转SQL #数据安全 #静默失败 #数据质量
医疗咨询大语言模型评估时机过晚,存在预构差距风险
一篇题为《医疗咨询大语言模型被评估得太晚:预构差距》的研究论文于2026年8月18日在arXiv平台发布,由Yining Hua等七位作者共同撰写。该论文指出,当前用于医疗咨询的大语言模型在开发和部署过程中,评估工作往往滞后于模型构建阶段,形成“预构差距”。这意味着模型在初步形成后才进行效果验证,未能充分在设计初期评估其潜在风险、准确性和临床适用性。研究团队警告,这种评估时机问题可能影响医疗AI的安全性和可靠性,增加误诊或误导风险。论文建议,为提升技术在医疗领域的有效性,未来需在模型开发早期整合更严格的评估机制,包括临床测试和伦理审查,以确保AI应用符合医疗标准和患者安全需求。这一发现对行业规范、监管政策及AI研发流程改革具有重要启示。 #论文 #医疗AI #大语言模型 #评估 #研究 #科技 #AI #健康科技
一篇题为《医疗咨询大语言模型被评估得太晚:预构差距》的研究论文于2026年8月18日在arXiv平台发布,由Yining Hua等七位作者共同撰写。该论文指出,当前用于医疗咨询的大语言模型在开发和部署过程中,评估工作往往滞后于模型构建阶段,形成“预构差距”。这意味着模型在初步形成后才进行效果验证,未能充分在设计初期评估其潜在风险、准确性和临床适用性。研究团队警告,这种评估时机问题可能影响医疗AI的安全性和可靠性,增加误诊或误导风险。论文建议,为提升技术在医疗领域的有效性,未来需在模型开发早期整合更严格的评估机制,包括临床测试和伦理审查,以确保AI应用符合医疗标准和患者安全需求。这一发现对行业规范、监管政策及AI研发流程改革具有重要启示。 #论文 #医疗AI #大语言模型 #评估 #研究 #科技 #AI #健康科技
无影浏览器代理论文在arXiv发布,探索现实世界长期任务
arXiv预印本平台于2026年8月18日收录了由AIMAE研究团队提交的论文“无影浏览器代理:以现实世界为中心的长期浏览器代理基础”。该论文由Tianxiang Chen等41位作者共同撰写,聚焦于开发基础性的浏览器代理技术,旨在解决现有系统在处理复杂、长时间任务时的局限性。研究强调以现实世界需求为核心,提出新的框架和方法,以提升自动化浏览和交互在实际场景中的性能与可靠性。论文的发布为人工智能在网页自动化、智能助手和数据采集等领域的应用提供了新思路,可能推动相关技术的进一步发展,对学术界和工业界均具有潜在影响。 #arXiv #AI #浏览器代理 #自动化 #研究 #科技新闻 #人工智能 #网页技术
arXiv预印本平台于2026年8月18日收录了由AIMAE研究团队提交的论文“无影浏览器代理:以现实世界为中心的长期浏览器代理基础”。该论文由Tianxiang Chen等41位作者共同撰写,聚焦于开发基础性的浏览器代理技术,旨在解决现有系统在处理复杂、长时间任务时的局限性。研究强调以现实世界需求为核心,提出新的框架和方法,以提升自动化浏览和交互在实际场景中的性能与可靠性。论文的发布为人工智能在网页自动化、智能助手和数据采集等领域的应用提供了新思路,可能推动相关技术的进一步发展,对学术界和工业界均具有潜在影响。 #arXiv #AI #浏览器代理 #自动化 #研究 #科技新闻 #人工智能 #网页技术
SignalReasoner 论文发布
2026年8月18日,arXiv平台收录了一篇由研究人员Guozheng Sun撰写的学术论文《SignalReasoner: Assessing the Upper Bound of 3B Models for Signal Mathematical Reasoning》。该研究针对当前大语言模型在科学计算领域的应用需求,评估了参数量为3B的模型在信号处理相关数学推理任务中的性能上限。论文通过系统实验分析,探讨了现有模型架构在处理复杂数学问题时的能力边界,并分析了影响推理准确性的关键因素。这项工作为优化模型设计和训练策略提供了实证依据,有助于推动AI技术在信号分析、科学发现等交叉领域的实际应用与发展。 #AI #大模型 #数学推理 #arXiv #研究论文 #信号处理 #机器学习 #学术新闻
2026年8月18日,arXiv平台收录了一篇由研究人员Guozheng Sun撰写的学术论文《SignalReasoner: Assessing the Upper Bound of 3B Models for Signal Mathematical Reasoning》。该研究针对当前大语言模型在科学计算领域的应用需求,评估了参数量为3B的模型在信号处理相关数学推理任务中的性能上限。论文通过系统实验分析,探讨了现有模型架构在处理复杂数学问题时的能力边界,并分析了影响推理准确性的关键因素。这项工作为优化模型设计和训练策略提供了实证依据,有助于推动AI技术在信号分析、科学发现等交叉领域的实际应用与发展。 #AI #大模型 #数学推理 #arXiv #研究论文 #信号处理 #机器学习 #学术新闻
LiveHouse-TS
近日,研究者 Haomin Wen 等人通过 arXiv 发表了 LiveHouse-TS,这是一个针对时间序列基础模型的开放世界活基准测试。该基准旨在解决现有评估方法在模拟动态真实环境方面的不足,通过持续更新的数据流和多样化场景,测试模型在开放世界中的适应性、泛化能力和鲁棒性。研究团队指出,传统基准多依赖静态数据集,难以反映实际应用中的复杂变化,而 LiveHouse-TS 引入了活数据机制,以推动时间序列分析领域的模型优化和跨学科应用。该工具的发布预计将为人工智能开发者提供更可靠的评估框架,促进基础模型在金融、医疗等领域的进步。 #时间序列 #基准测试 #AI #学术论文 #arXiv #机器学习 #数据科学 #开放世界
近日,研究者 Haomin Wen 等人通过 arXiv 发表了 LiveHouse-TS,这是一个针对时间序列基础模型的开放世界活基准测试。该基准旨在解决现有评估方法在模拟动态真实环境方面的不足,通过持续更新的数据流和多样化场景,测试模型在开放世界中的适应性、泛化能力和鲁棒性。研究团队指出,传统基准多依赖静态数据集,难以反映实际应用中的复杂变化,而 LiveHouse-TS 引入了活数据机制,以推动时间序列分析领域的模型优化和跨学科应用。该工具的发布预计将为人工智能开发者提供更可靠的评估框架,促进基础模型在金融、医疗等领域的进步。 #时间序列 #基准测试 #AI #学术论文 #arXiv #机器学习 #数据科学 #开放世界
新AI框架DeAR提出去中心化智能体协同推理新路径
由Xing Wei等五位研究者合作完成的学术论文《DeAR:基于能力锚定与协作思维导航的去中心化智能体推理》近期在arXiv平台发表。该论文提出了一种名为DeAR的全新框架,旨在解决当前智能体系统中集中式推理的局限性。DeAR的核心在于,它通过“能力锚定”机制让每个智能体清晰认知自身工具与知识边界,并借助“协作思维导航”协议,使多个智能体能在分布式环境中进行高效的推理任务分解、协作与信息整合。这一框架有望提升大规模复杂问题的求解效率与鲁棒性,为构建更灵活、可扩展的下一代多智能体系统提供了新的理论基础与技术方向。
由Xing Wei等五位研究者合作完成的学术论文《DeAR:基于能力锚定与协作思维导航的去中心化智能体推理》近期在arXiv平台发表。该论文提出了一种名为DeAR的全新框架,旨在解决当前智能体系统中集中式推理的局限性。DeAR的核心在于,它通过“能力锚定”机制让每个智能体清晰认知自身工具与知识边界,并借助“协作思维导航”协议,使多个智能体能在分布式环境中进行高效的推理任务分解、协作与信息整合。这一框架有望提升大规模复杂问题的求解效率与鲁棒性,为构建更灵活、可扩展的下一代多智能体系统提供了新的理论基础与技术方向。
ASI-Bench论文发布,探讨人工超级智能曙光
2026年8月18日,研究人员Junwei Zhou及41位合作者在arXiv预印本平台提交了题为“ASI-Bench: At the Dawn of Artificial Superintelligence”的论文。该论文聚焦于人工超级智能(ASI)这一前沿领域,旨在提出一个基准测试框架,以评估ASI在早期发展阶段的能力和挑战。随着当前AI技术的快速进步,从大语言模型到多模态系统的突破,超级智能的研究日益成为科技界的核心议题。本文的发布可能为ASI的理论探索和实验验证提供新的参考,推动学术界和工业界对智能极限的深入讨论。尽管论文具体内容尚未公开,但其标题暗示了对ASI时代来临前关键问题的系统分析,有望引发相关领域的广泛关注和后续研究。 #ASI #人工超级智能 #arXiv #论文 #AI #科技新闻 #前沿研究
2026年8月18日,研究人员Junwei Zhou及41位合作者在arXiv预印本平台提交了题为“ASI-Bench: At the Dawn of Artificial Superintelligence”的论文。该论文聚焦于人工超级智能(ASI)这一前沿领域,旨在提出一个基准测试框架,以评估ASI在早期发展阶段的能力和挑战。随着当前AI技术的快速进步,从大语言模型到多模态系统的突破,超级智能的研究日益成为科技界的核心议题。本文的发布可能为ASI的理论探索和实验验证提供新的参考,推动学术界和工业界对智能极限的深入讨论。尽管论文具体内容尚未公开,但其标题暗示了对ASI时代来临前关键问题的系统分析,有望引发相关领域的广泛关注和后续研究。 #ASI #人工超级智能 #arXiv #论文 #AI #科技新闻 #前沿研究
科学假设排名:对数概率能量评分方法优于提示型LLM-as
在最新发表于arXiv的论文中,研究人员Swati Rajwal等人研究了大型语言模型(LLMs)在评估科学假设质量时的能力。背景源于LLMs在科学领域的广泛应用,但其识别优秀假设的准确性仍待提升。研究提出了一种基于对数概率的能量评分方法,用于对科学假设进行排名,并与传统的提示型LLM-as-Judge方法进行对比。实验结果表明,该新方法在多个数据集上显著提高了排名准确性,能更可靠地筛选出高质量假设。这项发现为LLMs辅助科学发现提供了新见解,可能推动自动化科学评估工具的优化,增强AI在科研中的实用价值。 #大型语言模型 #科学假设 #AI研究 #机器学习 #论文发表 #自然语言处理 #新方法
在最新发表于arXiv的论文中,研究人员Swati Rajwal等人研究了大型语言模型(LLMs)在评估科学假设质量时的能力。背景源于LLMs在科学领域的广泛应用,但其识别优秀假设的准确性仍待提升。研究提出了一种基于对数概率的能量评分方法,用于对科学假设进行排名,并与传统的提示型LLM-as-Judge方法进行对比。实验结果表明,该新方法在多个数据集上显著提高了排名准确性,能更可靠地筛选出高质量假设。这项发现为LLMs辅助科学发现提供了新见解,可能推动自动化科学评估工具的优化,增强AI在科研中的实用价值。 #大型语言模型 #科学假设 #AI研究 #机器学习 #论文发表 #自然语言处理 #新方法
学术研究揭示显式状态激发在内存策略分类中的局限性
在计算机系统优化中,内存策略分类是提升性能的关键技术,传统上依赖显式状态激发方法。2026年8月18日,由Yihang Chen等七位研究者在学术预印本平台arXiv上发表了题为《显式状态激发不够
在计算机系统优化中,内存策略分类是提升性能的关键技术,传统上依赖显式状态激发方法。2026年8月18日,由Yihang Chen等七位研究者在学术预印本平台arXiv上发表了题为《显式状态激发不够
愚人金:针对开放权重模型移除安全措施攻击的防御性欺骗
微软Azure首席技术官Mark Russinovich在arXiv上发表了一篇题为《愚人金》的论文。该研究提出了一种新颖的防御策略,旨在应对针对开放权重大语言模型的“安全移除”攻击。攻击者可能通过微调等手段,试图移除模型内置的安全限制。论文的核心思想是采用“防御性欺骗”,即在模型训练阶段主动注入一种虚假的、看似能绕过安全限制的机制。这种机制类似于“愚人金”,对攻击者极具吸引力,但当其被触发时,并不会真正解除安全防护,反而会误导攻击者并可能暴露其意图。这种方法被认为能以较低成本和易于实施的方式,为开放权重模型提供一道有效的安全防线。 #AI #网络安全 #大语言模型 #防御机制 #学术论文
微软Azure首席技术官Mark Russinovich在arXiv上发表了一篇题为《愚人金》的论文。该研究提出了一种新颖的防御策略,旨在应对针对开放权重大语言模型的“安全移除”攻击。攻击者可能通过微调等手段,试图移除模型内置的安全限制。论文的核心思想是采用“防御性欺骗”,即在模型训练阶段主动注入一种虚假的、看似能绕过安全限制的机制。这种机制类似于“愚人金”,对攻击者极具吸引力,但当其被触发时,并不会真正解除安全防护,反而会误导攻击者并可能暴露其意图。这种方法被认为能以较低成本和易于实施的方式,为开放权重模型提供一道有效的安全防线。 #AI #网络安全 #大语言模型 #防御机制 #学术论文
评估基准测试
针对当前AI领域对小型语言模型安全性的广泛关注,一项新研究重点评估了现有自动化安全基准测试的可靠性。该研究指出,尽管使用基准测试来评估模型安全性已成为标准做法,但这些自动化测试工具本身的准确性和有效性往往未经严格验证。研究团队通过系统性的方法,对多个用于检测模型安全性(如有害内容生成、偏见等)的自动化基准测试进行了“元评估”。分析发现,部分基准测试存在设计缺陷或评估偏差,可能无法准确反映模型的真实安全风险。这项研究强调了在部署小型语言模型前,验证其安全评估工具本身有效性的重要性,旨在推动建立更严谨、可靠的安全评测体系,从而促进更安全的AI技术发展。 #人工智能 #AI安全 #语言模型 #基准测试 #学术研究 #arXiv
针对当前AI领域对小型语言模型安全性的广泛关注,一项新研究重点评估了现有自动化安全基准测试的可靠性。该研究指出,尽管使用基准测试来评估模型安全性已成为标准做法,但这些自动化测试工具本身的准确性和有效性往往未经严格验证。研究团队通过系统性的方法,对多个用于检测模型安全性(如有害内容生成、偏见等)的自动化基准测试进行了“元评估”。分析发现,部分基准测试存在设计缺陷或评估偏差,可能无法准确反映模型的真实安全风险。这项研究强调了在部署小型语言模型前,验证其安全评估工具本身有效性的重要性,旨在推动建立更严谨、可靠的安全评测体系,从而促进更安全的AI技术发展。 #人工智能 #AI安全 #语言模型 #基准测试 #学术研究 #arXiv