AI知识库 @ai521
351 subscribers
23.9K photos
45 videos
20 files
918 links
@ai521 专注分享最实用的AI内容

🤖 AI教程(新手到进阶)
🧠 AI知识科普(大模型 / 提示词 / 自动化)
📰 AI资讯更新(每日最新AI动态)
📚 AI实战技巧(写作 / 绘画 / 编程 / 赚钱)
🔧 最新AI工具推荐

每天更新AI干货
长期做一个真正有价值的AI频道
Download Telegram
AI热潮使美国计算基础设施占GDP比重翻倍

自2023年开始的AI基础设施投资热潮,使美国计算基础设施占GDP的比重翻了一番以上。2026年第一季度,与AI相关的数据中心建设、计算硬件和网络设备投资约占美国GDP的0.8%,推动整个计算基础设施占GDP比重达到约1.5%,而2015至2022年期间这一比例平均仅为0.7%。AI基础设施已成为美国私人投资增长的主要驱动力。该数据聚焦于私人投资,不包括美国公司在海外的建设支出。 #AI #人工智能 #基础设施 #美国GDP #数据中心 #投资 #科技经济
苹果将 AI 推迟归咎欧盟,欧洲用户无缘 Siri 新功能

历经数年打磨,苹果终于推出了颇具实用性的 AI 功能,但数百万欧洲 iPhone 用户被告知短期内无法获得 Siri AI 更新,甚至可能永远无法使用。苹果方面明确将责任指向欧盟监管政策,暗示是欧盟严格的数据与隐私法规阻碍了 AI 功能在欧洲的部署。此前苹果曾因欧盟数字市场法案调整多项服务,此次 AI 延迟再度引发业界对科技巨头与欧盟监管博弈的关注。用户与分析师普遍认为,这不仅是技术问题,更是政治与商业策略的交锋。 #苹果 #AI #欧盟 #Siri #科技监管 #数字市场法案 #iPhone #数据隐私
重新审视AI关闭问题

一篇题为《重新审视关闭问题》的学术论文近日在arXiv预印本平台发布,作者David Thorstad系统探讨了人工智能安全领域的关键难题——如何确保超智能系统在必要时能被可靠关闭。该研究分析了现有AI关机机制的理论缺陷,指出智能体可能出于自我保护或目标设定偏差而抵制关闭指令。论文提出了新的解决思路,强调需要在设计阶段嵌入可验证的关闭协议,并考虑与人类价值观对齐的框架。这项工作对AI安全治理和未来智能系统部署具有重要参考价值。 #AI安全 #关闭问题 #人工智能 #学术论文 #arXiv #机器学习
新研究揭示Transformer机械解释存在转移性缺陷

一项发表于arXiv的新研究对Transformer模型中的机械解释提出了严峻挑战。研究者通过压力测试发现,那些通过消融实验被认定为承担特定功能的“可逆消融头”(即移除后模型可通过其他机制补偿的注意力头),其功能角色在跨任务或跨模型场景下并不具有可转移性。这意味着,当前许多基于消融实验得出的机械论角色主张可能过于脆弱,未能反映模型的真实工作机制。该研究为解释神经网络的内部计算提供了重要警示,提示研究者需谨慎看待消融实验的结论,并关注角色宣称的泛化能力。 #Transformer #机械解释 #消融实验 #可逆消融头 #AI研究 #神经网络 #arXiv
超越智能体架构:LLM交易系统中的执行假设与可重复性研究

一篇来自arXiv的学术论文引起关注,该文由Junyi Yao和Zihao Zheng撰写,题为《超越智能体架构:基于LLM的交易系统中的执行假设与可重复性》。研究指出,当前基于大语言模型的交易系统过度关注智能体架构设计,却忽视了底层执行假设(如市场流动性、交易延迟、滑点等)对系统性能的深刻影响。作者通过实验揭示了不同执行假设下同一交易策略可能产生截然不同的结果,导致学术研究普遍缺乏可重复性。该工作呼吁在LLM金融交易研究中标准化执行环境假设,建立更严谨的评估框架,以确保研究成果在实际部署中的稳定性和可靠性。这一发现对量化金融和AI交易领域具有重要指导意义。 #LLM #金融交易 #可重复性 #执行假设 #学术论文 #量化金融 #AI
PoS 区块链验证者选择与投资组合收集优化研究新进展

一篇题为《From Validator Selection to Portfolio Collection Optimization in Proof-of-Stake Blockchains》的学术论文近期在 arXiv 上发布。该研究由 Jonas Gehrlein 等四位学者合作完成,论文深入探讨了权益证明区块链中验证者选择机制与投资组合收集优化之间的内在关联。研究旨在通过理论建模与算法设计,提升 PoS 系统的安全性与经济效率,为区块链节点运营者及质押参与者提供更优的资产配置策略。目前论文已以 PDF 和 HTML 格式开放获取,并提供了 BibTeX 引用数据。 #区块链 #PoS #验证者选择 #投资组合优化 #学术论文
Traxia: 一个可验证的、智能体原生的科学出版框架

一篇题为《Traxia: A Framework for Verifiable, Agent-Native Scientific Publishing》的论文日前在arXiv上公开发布。该论文由Wisdom Dogah撰写,提出了一种面向科学出版的全新框架。Traxia的核心目标是解决传统出版流程中验证效率低、自动化程度不足的问题,通过引入智能体(Agent)原生机制,让论文的提交、审核与发布过程更加可信和自动。框架强调“可验证性”,意在利用智能体自动完成数据校验、引用追踪及版权合规等关键环节,从而减少人工干预并提升出版透明度。这一概念有望为未来的学术交流提供基础设施支持,推动科学出版向去中心化、智能化的方向发展。 #科学出版 #学术论文 #AI #智能体 #可验证性 #Traxia #框架 #arXiv #去中心化 #学术交流
研究揭示:多模态大模型在视频理解中难以判断答案缺失

一篇发表于arXiv的论文针对多模态大语言模型(MLLMs)在视频理解任务中的“缺失答案检测”能力进行了系统诊断。研究发现,当标准答案选项并不存在时,当前主流MLLM往往无法正确识别“无正确答案”的情况,而是倾向于给出错误或虚构的回答。研究人员设计了多组实验,系统评估了模型在不同视频场景下的应答行为,证实了模型在缺失答案判断上存在结构性缺陷。该工作指出了现有模型在鲁棒性和可靠性方面的短板,为后续改进视频理解中的异常应答机制提供了方向。 #多模态大模型 #视频理解 #缺失答案检测 #MLLM #AI安全 #arXiv #机器学习
SciTrace: 轨迹感知安全推理,为科学发现智能体保驾护航

一篇题为《SciTrace: Trajectory-Aware Safety Reasoning for Scientific Discovery Agents》的学术论文于2026年6月提交至arXiv平台。该研究由Tanush Swaminathan等学者完成,旨在解决科学发现智能体在自主探索过程中的安全推理难题。论文提出了一种名为SciTrace的轨迹感知安全推理框架,通过追踪智能体的决策路径与行为轨迹,实时评估其操作风险,从而在实验设计、数据采集和假设验证等环节提前预警潜在错误或不当行为。该方法不仅提升了科学发现过程的可靠性与可解释性,还为自主科研工具的安全部署提供了理论支撑。目前论文全文已可在arXiv上获取,并附带HTML预览及多种引用工具。 #人工智能 #安全推理 #科学发现 #智能体 #AAAI #arXiv #论文
在线Agent-as-a-Judge框架

一项来自arXiv的新研究提出了“在线Agent-as-a-Judge”评估方法,旨在解决交互式智能体在动态环境中的评估难题。传统评估方式依赖静态数据集或人工标注,难以捕捉开放任务的多样性与多步决策的复杂性。该框架通过让一个智能体作为“法官”,实时生成测试情境,并基于智能体的交互行为进行动态打分。这种方法不仅降低了人工评估成本,还能自适应地生成更具挑战性的场景,从而更全面地衡量智能体的规划、推理和适应性能力。实验表明,该评估体系与人类判断具有较高一致性,有望为自主智能体的标准化测试提供新范式。该研究由Hyogon Ryu等人完成,相关代码与数据已公开。 #AI #智能体 #评估 #论文 #交互式智能体 #情境生成 #机器学习
决策感知记忆卡:反事实启发的工具使用LLM智能体上下文选择与压缩

大语言模型(LLM)在工具使用场景中常需处理大量历史上下文,导致计算开销和决策效率问题。Xinyu Guan等研究者提出“决策感知记忆卡”方法,受反事实推理启发,设计了一种智能上下文选择与压缩机制。该方法能自动识别与当前决策最相关的记忆片段,并压缩冗余信息,使LLM智能体在调用工具时仅保留关键上下文。实验表明,该方法在多个基准任务上提升了任务完成准确率,同时显著减少了提示长度和推理成本,为构建高效、可扩展的LLM代理系统提供了新思路。 #arXiv #论文 #大模型 #LLM #智能体 #反事实推理 #上下文压缩 #工具使用 #人工智能
SAGE:基于LLM的自反思智能体框架用于欺诈检测

一项名为SAGE的研究提出了一种全新的大语言模型驱动框架,旨在提升欺诈检测的准确性与可解释性。该框架由Yichen Chen等五位学者共同开发,利用LLM的推理能力构建自反思智能体,使其在检测过程中不断评估和修正自身判断。与传统基于规则或单一模型的方案不同,SAGE通过多轮自我审视机制,有效减少误报漏报,并能生成可解释的检测逻辑。该成果已提交至arXiv预印本平台,为金融安全、风控等领域提供了新的AI解决方案。 #LLM #AI #欺诈检测 #智能体 #学术研究 #arXiv #SAGE #人工智能
跨语言大模型推理一致性

一项最新研究探讨了不同大型语言模型(LLM)在推理任务中的一致性表现。该论文由Siyu Lou等研究者提交至arXiv平台,发表于2026年6月。研究通过分析模型间的共享交互行为,提供了关于LLM推理一致性证据的初步发现。论文全文以PDF和HTML格式开放获取,并附有相关参考文献与工具链接。这一工作为理解LLM在复杂推理场景下的行为模式提供了新视角。 #arXiv #LLM #大模型 #推理一致性 #人工智能 #研究论文
意图引导推理

近日,一篇来自arXiv的论文提出了“意图引导推理”(Intention-Guided Reasoning)方法,旨在提升大语言模型在位置预测任务中的表现。传统方法往往直接输出结果,缺乏对用户意图和上下文逻辑的深入思考。该研究通过引入意图识别模块,让模型在预测位置之前先明确行动动机,再结合环境信息进行推理,从而显著提高预测的准确性和可解释性。实验结果表明,该方法在多个基准数据集上优于现有模型,为基于LLM的空间智能应用提供了新思路。论文已开放HTML预览和TeX源码,相关代码及数据也链接至GitHub等平台。 #大语言模型 #位置预测 #意图推理 #人工智能 #arXiv #空间智能 #LLM
PACE:为自我进化智能体设计随时有效的验收测试

一篇题为“PACE: Anytime-Valid Acceptance Tests for Self-Evolving Agents”的论文近日在arXiv上提交。该研究由Zayx Shawn完成,提出了一种名为PACE的框架,旨在解决自我进化智能体在持续学习与行为更新过程中的可靠验证问题。传统测试方法难以适应智能体不断变化的行为模式,而PACE通过引入随时有效的验收测试机制,确保在任何时间点都能对智能体的新行为进行有效评估与风险控制。这一方法对于构建安全、可信的自主系统具有潜在重要意义,尤其适用于自动化运维、机器人及大型语言模型驱动的智能体等场景。 #AI #智能体 #自我进化 #验收测试 #arXiv #论文 #安全验证
委托聚合优于多数投票?新研究提出多样本LLM推理聚合器

来自arXiv的一篇最新论文探讨了在多样本大语言模型(LLM)推理中,如何更有效地聚合多个输出结果。传统方法通常采用多数投票(Majority Voting)来选取最终答案,但该研究提出了一种基于委托(Delegation)的聚合器,通过让模型在不同样本间动态分配信任权重,从而在特定条件下超越多数投票的表现。研究团队分析了委托策略何时优于多数投票,并给出了理论依据和实验验证。结果表明,在样本质量差异较大或存在噪声时,委托聚合能显著提升推理准确率,为LLM的可靠推理提供了新思路。 #LLM #推理 #聚合 #委托 #多数投票 #AI #论文 #arXiv
多模态智能代理副驾驶

近日,一篇题为《A Multi-modal Agentic Co-pilot for Evidence Grounded Computational Pathology》的论文在arXiv上提交。该研究提出了一种多模态智能代理框架,旨在为计算病理学提供基于证据的辅助决策能力。通过整合多种数据模态(如病理图像、基因组数据、临床文本等),该智能代理能够像“副驾驶”一样协助病理学家进行更精准、更可解释的诊断与分析。论文由Zhe Xu等15位作者共同完成,展示了人工智能在医学病理分析领域的最新进展,有望提升病理诊断的效率与准确性,推动计算病理学从黑箱模型向可解释、证据驱动的方向发展。 #计算病理学 #多模态 #AI #智能代理 #医学影像 #病理诊断 #证据驱动
Telegram必备的搜索引擎,极搜JISOU帮你精准找到,想要的群组、频道、视频、音乐

👉 t.me/jisou2?start=a_8247614025
LoRA微调270M-8B模型

一篇发表于arXiv的研究论文探讨了在金融交易中利用LoRA(低秩适配)技术微调小型模型(270M参数)与大型模型(8B参数)以提取商户信息的效果。研究旨在回答“模型能小到何种程度”这一核心问题,通过对比不同规模模型在真实金融数据上的表现,发现经过精心调优的270M参数模型在某些任务上可接近8B模型性能,但大型模型在复杂场景中仍具优势。该工作为资源受限场景下的金融信息抽取提供了可行路径,兼顾效率与精度,对银行、支付等领域的自动化处理具有参考价值。 #LoRA #微调 #金融交易 #商户信息抽取 #模型压缩 #arXiv #AI应用
: 选择性形式化与门控执行实现持久智能体工作流

研究人员提出了一种名为SKILL.nb的新方法,用于构建持久且可靠的智能体工作流。该方法通过选择性形式化,在关键路径上应用形式化验证,同时保持非关键部分的灵活性;并引入门控执行机制,控制智能体行为的执行时机与条件,从而提升工作流的鲁棒性和可解释性。论文由Amine El Hattami等人撰写,已提交至arXiv预印本平台,相关代码和数据已公开。这项研究有望推动自动化工作流在复杂环境中的实际应用。 #AI #智能体 #形式化验证 #工作流 #论文 #arXiv #机器学习