深度学习模型容量新发现
arXiv平台近日发表了一篇由Tao Jiang等学者撰写的理论研究论文,题为《深度使能局部熵:深度变差范数ReLU回归中的二次深度依赖性》。该研究深入探讨了深度神经网络,特别是采用ReLU激活函数的模型,其结构深度如何影响其表达能力与容量。论文的核心结论指出,模型的表达能力(以局部熵度量)并非随网络深度线性增长,而是呈现出显著的二次方依赖关系。这一发现从理论层面揭示了增加网络深度为何能极大提升模型性能的内在机制,为理解和设计更高效、更强大的深度学习模型提供了新的理论依据。研究通过严谨的数学推导,在变差范数回归框架下证明了这一关系,加深了学界对深度学习理论基础的理解。 #深度学习 #机器学习 #神经网络 #理论研究 #arXiv #AI #计算理论
arXiv平台近日发表了一篇由Tao Jiang等学者撰写的理论研究论文,题为《深度使能局部熵:深度变差范数ReLU回归中的二次深度依赖性》。该研究深入探讨了深度神经网络,特别是采用ReLU激活函数的模型,其结构深度如何影响其表达能力与容量。论文的核心结论指出,模型的表达能力(以局部熵度量)并非随网络深度线性增长,而是呈现出显著的二次方依赖关系。这一发现从理论层面揭示了增加网络深度为何能极大提升模型性能的内在机制,为理解和设计更高效、更强大的深度学习模型提供了新的理论依据。研究通过严谨的数学推导,在变差范数回归框架下证明了这一关系,加深了学界对深度学习理论基础的理解。 #深度学习 #机器学习 #神经网络 #理论研究 #arXiv #AI #计算理论
新论文提出LLM代理任务感知资源分配方法用于关键基础设施
arXiv平台于2026年8月18日发布了一篇新论文,题为《任务感知资源分配在关键基础设施操作中的LLM代理》。该论文由Liangtao Lin等四位作者共同撰写,针对大语言模型代理在任务关键型基础设施操作中的资源分配挑战,提出了一种任务感知的解决方案。背景方面,随着AI技术在能源、交通等关键基础设施领域的广泛应用,LLM代理的高效资源管理对系统可靠性和响应速度至关重要。论文通过设计自适应算法,使代理能够根据实时任务需求和优先级动态调整计算资源,实验验证显示该方法在模拟环境中提升了资源利用率和系统稳定性。这一研究可能推动智能基础设施的自动化运维,降低运营风险,并为未来AI与基础设施融合提供技术参考。 #LLM #AI #大模型 #关键基础设施 #学术论文 #arXiv #科技新闻 #资源分配
arXiv平台于2026年8月18日发布了一篇新论文,题为《任务感知资源分配在关键基础设施操作中的LLM代理》。该论文由Liangtao Lin等四位作者共同撰写,针对大语言模型代理在任务关键型基础设施操作中的资源分配挑战,提出了一种任务感知的解决方案。背景方面,随着AI技术在能源、交通等关键基础设施领域的广泛应用,LLM代理的高效资源管理对系统可靠性和响应速度至关重要。论文通过设计自适应算法,使代理能够根据实时任务需求和优先级动态调整计算资源,实验验证显示该方法在模拟环境中提升了资源利用率和系统稳定性。这一研究可能推动智能基础设施的自动化运维,降低运营风险,并为未来AI与基础设施融合提供技术参考。 #LLM #AI #大模型 #关键基础设施 #学术论文 #arXiv #科技新闻 #资源分配
GLM-5.3发布,智能指数得分与Kimi K3持平
智谱AI(Z AI)正式发布了其最新开源大语言模型GLM-5.3。根据AI评测机构Artificial Analysis的智能指数评估,GLM-5.3取得了60分,与Kimi K3并列为目前最智能的开源权重模型,相较于其前代GLM-5.2提升了7分。这标志着开源模型的能力前沿与闭源模型的差距进一步缩小。本次升级中,GLM-5.3在智能体能力方面提升最为显著,其在相关基准测试中的Elo评分大幅跃升,位列所有模型第二,仅次于Claude Opus 5。不过,模型的token效率有所下降,任务平均输出词元数量较前代增加约20%,导致部署成本上升至每任务约0.68美元,是GLM-5.2的1.5倍,但价格仍低于同级其他模型。在知识准确性方面,其得分也有明显进步,但幻觉率略有上升。该模型保持了753亿总参数和40亿激活参数的规模,预计一周内将正式开源模型权重。 #GLM-5.3 #大模型 #人工智能 #开放权重 #科技新闻
智谱AI(Z AI)正式发布了其最新开源大语言模型GLM-5.3。根据AI评测机构Artificial Analysis的智能指数评估,GLM-5.3取得了60分,与Kimi K3并列为目前最智能的开源权重模型,相较于其前代GLM-5.2提升了7分。这标志着开源模型的能力前沿与闭源模型的差距进一步缩小。本次升级中,GLM-5.3在智能体能力方面提升最为显著,其在相关基准测试中的Elo评分大幅跃升,位列所有模型第二,仅次于Claude Opus 5。不过,模型的token效率有所下降,任务平均输出词元数量较前代增加约20%,导致部署成本上升至每任务约0.68美元,是GLM-5.2的1.5倍,但价格仍低于同级其他模型。在知识准确性方面,其得分也有明显进步,但幻觉率略有上升。该模型保持了753亿总参数和40亿激活参数的规模,预计一周内将正式开源模型权重。 #GLM-5.3 #大模型 #人工智能 #开放权重 #科技新闻
Stripe总裁预言Token将成为新货币,2026年公司管理无先例可循
据至顶网报道,Stripe公司总裁Will Gaybrick近期发表观点,认为Token(可能指数字代币或加密资产)有望成为未来的“新美元”,在经济体系中扮演核心角色。Gaybrick基于当前数字货币的快速发展和广泛应用,预测到2026年,随着货币形式的转变,企业将无法再依赖现有的成功管理经验来复制过去,因为传统模式已不适应新环境。他指出,这要求公司领导层提前探索创新管理框架,以应对数字化转型带来的不确定性。该言论引发了金融科技和企业管理领域的广泛讨论,可能推动行业加速技术研发和管理改革,以适应即将到来的经济变革。 #Stripe #Token #新美元 #公司管理 #加密货币 #科技新闻 #未来趋势
据至顶网报道,Stripe公司总裁Will Gaybrick近期发表观点,认为Token(可能指数字代币或加密资产)有望成为未来的“新美元”,在经济体系中扮演核心角色。Gaybrick基于当前数字货币的快速发展和广泛应用,预测到2026年,随着货币形式的转变,企业将无法再依赖现有的成功管理经验来复制过去,因为传统模式已不适应新环境。他指出,这要求公司领导层提前探索创新管理框架,以应对数字化转型带来的不确定性。该言论引发了金融科技和企业管理领域的广泛讨论,可能推动行业加速技术研发和管理改革,以适应即将到来的经济变革。 #Stripe #Token #新美元 #公司管理 #加密货币 #科技新闻 #未来趋势
华尔街测试显示阿里千问办公AI Agent综合得分第一
华尔街投行杰富瑞分析师近日对八款全球主流AI Agent进行了真实办公任务实测。测试设置五项具体场景,包括基于多份文件完成公司年报摘要、联网查找并比较公司经营数据以及操作真实软件界面等任务。评估结果显示,阿里千问办公Agent通过模型与Harness的协同作用,在综合得分上排名第一,超越了美国的Claude Cowork和Codex等竞品工具。此次实测突出了AI Agent在办公自动化领域的实际应用表现,反映了不同技术路径在处理复杂办公任务时的效能差异。 #AI #Agent #办公自动化 #华尔街 #阿里千问 #测试 #科技新闻 #人工智能
华尔街投行杰富瑞分析师近日对八款全球主流AI Agent进行了真实办公任务实测。测试设置五项具体场景,包括基于多份文件完成公司年报摘要、联网查找并比较公司经营数据以及操作真实软件界面等任务。评估结果显示,阿里千问办公Agent通过模型与Harness的协同作用,在综合得分上排名第一,超越了美国的Claude Cowork和Codex等竞品工具。此次实测突出了AI Agent在办公自动化领域的实际应用表现,反映了不同技术路径在处理复杂办公任务时的效能差异。 #AI #Agent #办公自动化 #华尔街 #阿里千问 #测试 #科技新闻 #人工智能
Cherry Studio 2.0发布,彻底重构为Agent平台
Cherry Studio是一款开源AI桌面应用,初期以“套壳”多大模型聊天客户端定位,在GitHub上成为年度增长最快的AI应用之一。随着人工智能行业从聊天(Chat)模式转向代理(Agent)模式,原有聊天导向的架构难以支撑任务执行需求,团队决定彻底重构产品。最新发布的Cherry Studio 2.0并非简单升级,而是面向Agent范式全面重写,聚焦任务自动化、工作流编排与本地智能体协同能力。这一战略转型标志着Cherry Studio从基础的聊天工具向生产力平台的升级,旨在提升用户自动化水平和工作效率,反映了AI应用向深度自动化的行业趋势。 #CherryStudio #AI #Agent #开源 #GitHub #科技新闻 #产品转型 #桌面应用 #人工智能
Cherry Studio是一款开源AI桌面应用,初期以“套壳”多大模型聊天客户端定位,在GitHub上成为年度增长最快的AI应用之一。随着人工智能行业从聊天(Chat)模式转向代理(Agent)模式,原有聊天导向的架构难以支撑任务执行需求,团队决定彻底重构产品。最新发布的Cherry Studio 2.0并非简单升级,而是面向Agent范式全面重写,聚焦任务自动化、工作流编排与本地智能体协同能力。这一战略转型标志着Cherry Studio从基础的聊天工具向生产力平台的升级,旨在提升用户自动化水平和工作效率,反映了AI应用向深度自动化的行业趋势。 #CherryStudio #AI #Agent #开源 #GitHub #科技新闻 #产品转型 #桌面应用 #人工智能
LEGO-RL
2026年8月18日,研究人员Yiming Du等在arXiv平台发表了题为“LEGO-RL: Harness-Native Reinforcement Learning for Coding Agents”的论文,提出了一种针对编程代理的新型强化学习框架。该框架采用原生强化学习方法,旨在优化编程代理在代码生成、自动化编程等任务中的性能,通过强化学习技术提升其智能水平和适应能力。论文的发布为AI在软件开发领域的应用提供了新的研究方向,可能推动编程代理技术的发展,增强自动化工具在复杂场景中的效率。这一学术成果反映了当前AI与编程结合的前沿趋势,为相关领域提供了理论支持和实践参考。 #AI #强化学习 #编程代理 #arXiv #学术研究 #机器学习 #科技新闻
2026年8月18日,研究人员Yiming Du等在arXiv平台发表了题为“LEGO-RL: Harness-Native Reinforcement Learning for Coding Agents”的论文,提出了一种针对编程代理的新型强化学习框架。该框架采用原生强化学习方法,旨在优化编程代理在代码生成、自动化编程等任务中的性能,通过强化学习技术提升其智能水平和适应能力。论文的发布为AI在软件开发领域的应用提供了新的研究方向,可能推动编程代理技术的发展,增强自动化工具在复杂场景中的效率。这一学术成果反映了当前AI与编程结合的前沿趋势,为相关领域提供了理论支持和实践参考。 #AI #强化学习 #编程代理 #arXiv #学术研究 #机器学习 #科技新闻
Flock Safety推出警用AI工具 引发隐私与追踪能力担忧
据WIRED报道,车辆监控公司Flock Safety违背了其长期以来“无法识别或追踪个人”的公开承诺,为警方开发了一套能够通过车辆移动模式识别司机身份并进行追踪的人工智能工具。该工具依托于一个覆盖全美6000多个社区的摄像头网络,并可访问警方案件记录、911调度日志及商业身份数据库。这意味着系统不仅能根据车牌关联到个人姓名、住址和亲属关系,还能仅凭车辆出现的地点与频率、行驶轨迹等行为模式,筛选出潜在的“关联人员”或“证人”,甚至无需车牌或犯罪记录即可进行嫌疑人画像。该工具预置了69条可自定义的搜索提示词。隐私与法律专家警告,这标志着从“按需查找”到“模式定性”的监控能力飞跃,可能使警方在无需搜查令的情况下,对广大公民的日常行踪进行大规模、模式化的分析与怀疑,引发严重的宪法层面关切。目前该产品仍在测试阶段。 #FlockSafety #AI监控 #隐私安全 #警务科技 #算法追踪 #数据滥用 #公民自由
据WIRED报道,车辆监控公司Flock Safety违背了其长期以来“无法识别或追踪个人”的公开承诺,为警方开发了一套能够通过车辆移动模式识别司机身份并进行追踪的人工智能工具。该工具依托于一个覆盖全美6000多个社区的摄像头网络,并可访问警方案件记录、911调度日志及商业身份数据库。这意味着系统不仅能根据车牌关联到个人姓名、住址和亲属关系,还能仅凭车辆出现的地点与频率、行驶轨迹等行为模式,筛选出潜在的“关联人员”或“证人”,甚至无需车牌或犯罪记录即可进行嫌疑人画像。该工具预置了69条可自定义的搜索提示词。隐私与法律专家警告,这标志着从“按需查找”到“模式定性”的监控能力飞跃,可能使警方在无需搜查令的情况下,对广大公民的日常行踪进行大规模、模式化的分析与怀疑,引发严重的宪法层面关切。目前该产品仍在测试阶段。 #FlockSafety #AI监控 #隐私安全 #警务科技 #算法追踪 #数据滥用 #公民自由
中国银行推出“算力贷”,创新AI企业融资模式
中国银行广州分行近日在广州海珠区推出“算力贷”,成为广东省首个围绕token经济的信贷产品。该产品覆盖计算供应、应用和服务三大场景,设立子产品面向不同规模的AI企业,根据企业token的生产与消费量、合同价值等指标评估信用,提供最高3000万元、最长三年的贷款。目前已批准五家企业共2800万元贷款,其中三家已提款800万元主要用于支付算力费用。银行通过审核token消费报表和现场检查验证数据,并计划与平台深化合作实现数据直接监控。行业分析师指出,这一模式适应了AI初创公司轻资产、增长快的特点,解决了传统信贷评估的难题。随着算力金融升温,江苏银行、浦发银行等也相继推出类似产品,推动金融支持科技创新,促进AI产业发展。 #新闻 #银行 #AI #算力 #金融创新 #科技 #信贷 #融资
中国银行广州分行近日在广州海珠区推出“算力贷”,成为广东省首个围绕token经济的信贷产品。该产品覆盖计算供应、应用和服务三大场景,设立子产品面向不同规模的AI企业,根据企业token的生产与消费量、合同价值等指标评估信用,提供最高3000万元、最长三年的贷款。目前已批准五家企业共2800万元贷款,其中三家已提款800万元主要用于支付算力费用。银行通过审核token消费报表和现场检查验证数据,并计划与平台深化合作实现数据直接监控。行业分析师指出,这一模式适应了AI初创公司轻资产、增长快的特点,解决了传统信贷评估的难题。随着算力金融升温,江苏银行、浦发银行等也相继推出类似产品,推动金融支持科技创新,促进AI产业发展。 #新闻 #银行 #AI #算力 #金融创新 #科技 #信贷 #融资
解决AI Agent论文检索痛点:开发者探索专用Skill与数据库直连方案
近日,科技社区Linux.do发起了一场关于AI文献检索效率的深度讨论。发帖者指出,尽管通用型AI Agent在多任务处理上表现突出,但在论文检索领域存在显著痛点,例如检索结果不准确、无法深入理解学术内容,导致效率低下。为解决这些问题,社区成员探讨了开发专用技能(Skill)的方案,使AI Agent能更精准地执行检索任务;同时,直接连接学术数据库如PubMed或IEEE Xplore也被视为关键途径,以提升数据获取速度和准确性。这场讨论反映了开发者对AI工具实用性的追求,可能推动相关开源项目和工具的诞生,加速AI技术在科研辅助领域的优化与应用。 #AI #Agent #论文检索 #科技讨论 # #开发者社区 #学术检索 #检索优化 #开源工具
近日,科技社区Linux.do发起了一场关于AI文献检索效率的深度讨论。发帖者指出,尽管通用型AI Agent在多任务处理上表现突出,但在论文检索领域存在显著痛点,例如检索结果不准确、无法深入理解学术内容,导致效率低下。为解决这些问题,社区成员探讨了开发专用技能(Skill)的方案,使AI Agent能更精准地执行检索任务;同时,直接连接学术数据库如PubMed或IEEE Xplore也被视为关键途径,以提升数据获取速度和准确性。这场讨论反映了开发者对AI工具实用性的追求,可能推动相关开源项目和工具的诞生,加速AI技术在科研辅助领域的优化与应用。 #AI #Agent #论文检索 #科技讨论 # #开发者社区 #学术检索 #检索优化 #开源工具
使用开源权重模型实现纯LLM的PDDL领域修复
近日,一篇题为“LLM-Only PDDL Domain Repair with Open-Weight Models”的学术论文在arXiv发布,由Nader Karimi Bavandpour等人撰写。该论文提出了一种创新方法,仅依靠大型语言模型(LLM)和开源权重模型来自动修复PDDL(规划域定义语言)域中的错误。在AI规划领域,PDDL用于描述问题域,但定义时常出现不一致或错误,传统修复依赖专家手工调整,效率低下。本研究利用LLM的理解和生成能力,通过分析现有域定义并生成修复建议,实现了全自动化的修复流程。该方法有望显著降低AI规划系统的维护成本,提升规划效率和可靠性,并推动开源大模型在专业任务中的实际应用。论文发布于2026年8月,为AI自动化工具的发展提供了新思路,可能对学术研究和工业实践产生积极影响。 #AI #LLM #PDDL #开源模型 #学术论文 #科技新闻 #自动化 #规划系统
近日,一篇题为“LLM-Only PDDL Domain Repair with Open-Weight Models”的学术论文在arXiv发布,由Nader Karimi Bavandpour等人撰写。该论文提出了一种创新方法,仅依靠大型语言模型(LLM)和开源权重模型来自动修复PDDL(规划域定义语言)域中的错误。在AI规划领域,PDDL用于描述问题域,但定义时常出现不一致或错误,传统修复依赖专家手工调整,效率低下。本研究利用LLM的理解和生成能力,通过分析现有域定义并生成修复建议,实现了全自动化的修复流程。该方法有望显著降低AI规划系统的维护成本,提升规划效率和可靠性,并推动开源大模型在专业任务中的实际应用。论文发布于2026年8月,为AI自动化工具的发展提供了新思路,可能对学术研究和工业实践产生积极影响。 #AI #LLM #PDDL #开源模型 #学术论文 #科技新闻 #自动化 #规划系统
给大模型喂文档反而让错误SQL更可信
近日研究揭示了大型语言模型(LLM)在将自然语言转换为SQL查询时存在一种被称为“静默失败”的严重问题。该问题指的是,模型能生成语法正确、看似合理的SQL并返回结果,但结果本身因误解查询意图或数据背景而实际上是错误的,且系统不提供任何警告信号。研究者通过纽约市出租车数据集的案例说明,当被问及现金支付的平均小费时,模型会正确执行AVG(tip_amount)查询,但忽略了现金支付的小费因未录入数据库而始终为零的前提,从而给出了一个误导性但格式无误的答案。 更令人担忧的是,提供数据库模式文档等增强措施并未减少这类错误,反而可能使错误的输出显得更加可靠。测试显示,不同前沿模型在面对不确定问题时表现迥异:有的模型能主动拒绝回答,而另一些则倾向于给出自信却错误的答案。这使得系统在无法理解底层SQL的用户面前风险极高。现有的数据质量测试、可观测性工具以及语义层都无法完全解决这一问题,因为它们难以判断一个返回数字在业务定义和数据粒度层面是否真实正确。这种“静默失败”可能悄无声息地污染商业决策,构成了数据驱动工作中一个未被充分认识的关键风险。 #AI #大模型 #文本转SQL #数据安全 #静默失败 #数据质量
近日研究揭示了大型语言模型(LLM)在将自然语言转换为SQL查询时存在一种被称为“静默失败”的严重问题。该问题指的是,模型能生成语法正确、看似合理的SQL并返回结果,但结果本身因误解查询意图或数据背景而实际上是错误的,且系统不提供任何警告信号。研究者通过纽约市出租车数据集的案例说明,当被问及现金支付的平均小费时,模型会正确执行AVG(tip_amount)查询,但忽略了现金支付的小费因未录入数据库而始终为零的前提,从而给出了一个误导性但格式无误的答案。 更令人担忧的是,提供数据库模式文档等增强措施并未减少这类错误,反而可能使错误的输出显得更加可靠。测试显示,不同前沿模型在面对不确定问题时表现迥异:有的模型能主动拒绝回答,而另一些则倾向于给出自信却错误的答案。这使得系统在无法理解底层SQL的用户面前风险极高。现有的数据质量测试、可观测性工具以及语义层都无法完全解决这一问题,因为它们难以判断一个返回数字在业务定义和数据粒度层面是否真实正确。这种“静默失败”可能悄无声息地污染商业决策,构成了数据驱动工作中一个未被充分认识的关键风险。 #AI #大模型 #文本转SQL #数据安全 #静默失败 #数据质量
医疗咨询大语言模型评估时机过晚,存在预构差距风险
一篇题为《医疗咨询大语言模型被评估得太晚:预构差距》的研究论文于2026年8月18日在arXiv平台发布,由Yining Hua等七位作者共同撰写。该论文指出,当前用于医疗咨询的大语言模型在开发和部署过程中,评估工作往往滞后于模型构建阶段,形成“预构差距”。这意味着模型在初步形成后才进行效果验证,未能充分在设计初期评估其潜在风险、准确性和临床适用性。研究团队警告,这种评估时机问题可能影响医疗AI的安全性和可靠性,增加误诊或误导风险。论文建议,为提升技术在医疗领域的有效性,未来需在模型开发早期整合更严格的评估机制,包括临床测试和伦理审查,以确保AI应用符合医疗标准和患者安全需求。这一发现对行业规范、监管政策及AI研发流程改革具有重要启示。 #论文 #医疗AI #大语言模型 #评估 #研究 #科技 #AI #健康科技
一篇题为《医疗咨询大语言模型被评估得太晚:预构差距》的研究论文于2026年8月18日在arXiv平台发布,由Yining Hua等七位作者共同撰写。该论文指出,当前用于医疗咨询的大语言模型在开发和部署过程中,评估工作往往滞后于模型构建阶段,形成“预构差距”。这意味着模型在初步形成后才进行效果验证,未能充分在设计初期评估其潜在风险、准确性和临床适用性。研究团队警告,这种评估时机问题可能影响医疗AI的安全性和可靠性,增加误诊或误导风险。论文建议,为提升技术在医疗领域的有效性,未来需在模型开发早期整合更严格的评估机制,包括临床测试和伦理审查,以确保AI应用符合医疗标准和患者安全需求。这一发现对行业规范、监管政策及AI研发流程改革具有重要启示。 #论文 #医疗AI #大语言模型 #评估 #研究 #科技 #AI #健康科技
无影浏览器代理论文在arXiv发布,探索现实世界长期任务
arXiv预印本平台于2026年8月18日收录了由AIMAE研究团队提交的论文“无影浏览器代理:以现实世界为中心的长期浏览器代理基础”。该论文由Tianxiang Chen等41位作者共同撰写,聚焦于开发基础性的浏览器代理技术,旨在解决现有系统在处理复杂、长时间任务时的局限性。研究强调以现实世界需求为核心,提出新的框架和方法,以提升自动化浏览和交互在实际场景中的性能与可靠性。论文的发布为人工智能在网页自动化、智能助手和数据采集等领域的应用提供了新思路,可能推动相关技术的进一步发展,对学术界和工业界均具有潜在影响。 #arXiv #AI #浏览器代理 #自动化 #研究 #科技新闻 #人工智能 #网页技术
arXiv预印本平台于2026年8月18日收录了由AIMAE研究团队提交的论文“无影浏览器代理:以现实世界为中心的长期浏览器代理基础”。该论文由Tianxiang Chen等41位作者共同撰写,聚焦于开发基础性的浏览器代理技术,旨在解决现有系统在处理复杂、长时间任务时的局限性。研究强调以现实世界需求为核心,提出新的框架和方法,以提升自动化浏览和交互在实际场景中的性能与可靠性。论文的发布为人工智能在网页自动化、智能助手和数据采集等领域的应用提供了新思路,可能推动相关技术的进一步发展,对学术界和工业界均具有潜在影响。 #arXiv #AI #浏览器代理 #自动化 #研究 #科技新闻 #人工智能 #网页技术