AI知识库 @ai521
684 subscribers
30.2K photos
59 videos
27 files
1.25K links
@ai521 专注分享最实用的AI内容

🤖 AI教程(新手到进阶)
🧠 AI知识科普(大模型 / 提示词 / 自动化)
📰 AI资讯更新(每日最新AI动态)
📚 AI实战技巧(写作 / 绘画 / 编程 / 赚钱)
🔧 最新AI工具推荐

每天更新AI干货
长期做一个真正有价值的AI频道
Download Telegram
智能体安全基准有效性遭质疑

一项由Youting Wang等学者提交至arXiv的研究对当前智能体安全基准进行了有效性审计。研究发现,许多广泛使用的安全基准可能并未真正衡量智能体的安全性,而是更多地反映了其能力水平。这种混淆可能导致对智能体风险的误判,尤其是在自主决策场景中。研究呼吁重新审视基准设计,确保评估指标能区分安全与能力,从而推动更可靠的AI安全研究。 #AI安全 #智能体 #基准测试 #有效性审计 #arXiv #研究
Library Reachability in LSR-Synth

一篇题为《Library Reachability in LSR-Synth: How Anti-Memorization Design Changes the Measurement of Symbolic Discovery》的论文近日在arXiv上发布,作者为Zhan'ao Yao等。该研究聚焦于LSR-Synth系统中的库可达性问题,深入探讨了反记忆化设计对符号发现度量方式的根本性影响。传统方法在评估符号发现时易受记忆化偏差干扰,而LSR-Synth通过引入反记忆化机制,重新定义了库可达性的测量标准,为更准确地评估符号发现算法的能力提供了新视角。这项工作可能推动机器学习中符号推理与可解释性研究的发展,尤其对程序合成、定理证明等领域的基准测试设计具有参考价值。 #论文 #arXiv #符号发现 #LSR-Synth #反记忆化 #库可达性 #机器学习 #AI研究
多智能体规划新方法:STL

来自arXiv平台的一篇最新论文提出了一种名为STL-GO的多智能体规划方法,专门处理包含时空与拓扑约束的复杂任务。该论文由Sheryl Paul等六位作者共同完成,于2026年7月29日提交,目前可通过PDF和HTML格式获取全文。STL-GO方法旨在解决多智能体系统在协同作业中面临的空间、时间及拓扑结构约束,有望提升无人机编队、自动驾驶车队、机器人集群等场景的规划效率与安全性。论文还提供了相关代码和数据链接,供学界进一步研究与复现。 #多智能体 #规划 #时空约束 #拓扑约束 #STL-GO #AI #机器人 #论文 #arXiv
ViSAGE

来自arXiv预印本的最新研究,论文题为《ViSAGE: Constructing Self-Correcting Memories for Long-Form Video Understanding》,作者包括Xinkui Zhao等七位学者。该研究针对长视频理解中记忆一致性差、上下文漂移等问题,提出了一种名为ViSAGE的自纠正记忆框架。ViSAGE通过动态更新和纠错机制,在长视频推理过程中持续维护准确的情景记忆,从而显著提升模型对长时间跨度的视频内容理解能力。实验表明,该方法在多个长视频理解基准上取得了领先性能,为解决长视频分析中的记忆衰减难题提供了新思路。 #ViSAGE #长视频理解 #自纠正记忆 #AI #计算机视觉 #论文 #arXiv
大语言模型临床决策支持尚不安全,研究警示风险

一项发表于arXiv的研究指出,尽管大语言模型在医疗领域展现出潜力,但尚不足以安全应用于自主临床决策支持。研究团队通过真实世界临床场景的推理测试发现,模型在复杂病例中容易出现逻辑错误、信息遗漏和过度自信等问题,可能导致误诊或不当治疗建议。研究强调,当前大语言模型缺乏对临床上下文的深度理解,且无法可靠处理不确定性,将其直接用于临床决策存在显著安全隐患。该研究呼吁在部署前需进行更严格的验证和监管。 #AI安全 #大语言模型 #临床决策 #医疗AI #arXiv #研究论文 #人工智能
研究提出“步感知推理能量”概念,分析LLM思维链推理难度

近日,arXiv平台上出现一篇题为《How Hard Does It Think? Analyzing Step-Aware Reasoning Energy in LLM Chain-of-Thought Trajectories》的论文,由Hui Wei等十一位作者共同提交。该研究聚焦于大型语言模型在思维链推理过程中各个步骤的推理难度,创新性地提出了“步感知推理能量”这一分析框架,旨在量化模型在每一步思考中所消耗的“能量”。论文通过分析推理轨迹,试图揭示模型在何时、何处面临更复杂的推理任务。这一工作为理解LLM的内在推理机制、优化推理效率以及提升模型可解释性提供了新的视角,有望推动更高效、更透明的AI推理系统发展。 #LLM #思维链 #推理能量 #AI研究 #arXiv #论文 #可解释性 #大模型
本体引导的去重感知提取层

arXiv 上发布了一篇题为《An Ontology-Guided, Deduplication-Aware Extraction Layer for Knowledge Graph Construction from Heterogeneous Documents》的论文。该论文由 Vaibhav Dangaich 等作者于 2026 年 7 月 22 日提交。研究提出了一种结合本体引导与去重感知的提取层方法,旨在从异构文档中高效构建知识图谱。该方法通过利用本体结构指导信息抽取,同时引入去重机制减少冗余数据,有望提升知识图谱构建的准确性与效率。论文目前提供 PDF 及 HTML 版本供浏览。 #知识图谱 #本体 #去重 #异构文档 #信息抽取 #AI #学术论文
Telegram必备的搜索引擎,极搜JISOU帮你精准找到,想要的群组、频道、视频、音乐

👉 t.me/jisou2?start=a_8247614025
混合分词与串并行解码赋能跨域序列推荐

近日,一项关于跨域序列推荐的研究成果在arXiv上发布。该论文由Yuxuan Hu等六位研究者共同完成,提出了一种结合混合分词(Hybrid Tokenization)与串并行解码(Serial-Parallel Decoding)的新方法,旨在提升跨域场景下序列推荐系统的性能。传统方法在处理用户多域行为时往往面临语义鸿沟和效率瓶颈,而该工作通过创新的分词策略将不同域的信息统一编码,并设计串并行混合的解码架构,兼顾了长序列理解与推荐速度。实验表明,该方法在多个公开数据集上显著优于现有基准,为跨域推荐提供了更高效、更精准的解决方案,对电商、内容平台等场景具有潜在应用价值。 #跨域推荐 #序列推荐 #混合分词 #串并行解码 #AI #推荐系统 #arXiv #论文
TAPR:任务感知提示重写器显著提升大语言模型性能

arXiv上发布的一项新研究提出了一种名为TAPR(Task-Aware Prompt Rewriter)的方法,旨在通过任务感知的提示重写来增强大语言模型(LLM)的表现。该方法由Oliver Savolainen等人共同开发,通过对用户原始提示进行智能优化,使其更符合模型理解与任务需求,从而在推理、生成等任务中取得更优效果。实验表明,TAPR能在无需额外训练的情况下,显著提升LLM在多种基准测试中的准确率与效率。该技术为实用化部署提供了低成本、即插即用的性能增强方案,有望推动大模型在复杂场景中的更广泛应用。 #大语言模型 #提示工程 #TAPR #arXiv #AI研究 #性能优化
ThinkReset: 可学习中间接口构建用于有限上下文长程推理

来自arXiv的最新论文《ThinkReset: Learnable Intermediate Interface Construction for Bounded-Context Long-Horizon Reasoning》提出了一种创新方法,旨在解决大语言模型在有限上下文窗口下进行长程推理时的瓶颈问题。该研究通过构建可学习的中间接口,允许模型在推理过程中“重置”上下文,从而在保持计算效率的同时突破上下文长度限制。实验表明,该方法在多个长程推理基准任务上显著优于传统基线,为复杂推理任务提供了一种高效且可扩展的解决方案,有望推动大模型在数学推理、代码生成等领域的应用。 #人工智能 #大模型 #长程推理 #上下文学习 #LLM #论文 #推理增强
AI 发布探索数学猜想的大模型框架,目标直指黎曼假设

近日,一篇题为《LLM Framework for Discovering Major Mathematical Conjectures: AI's Quest for the Next Riemann Hypothesis》的论文在 arXiv 预印本平台上线。该研究由 Alizer Wong 等八位作者共同完成,提出了一种利用大语言模型(LLM)来发现重大数学猜想的通用框架。框架旨在通过 AI 的推理与生成能力,辅助数学家探索如黎曼假设等未解难题。论文详细介绍了模型设计、训练方法及初步实验效果,展示了 AI 在数学发现领域的巨大潜力,或将推动数学研究范式的变革。 #AI #大语言模型 #数学猜想 #黎曼假设 #arXiv #科研论文
AI能否评估AI科学家?新研究探讨自动多模型评审自主研究系统

一项来自arXiv的预印本研究提出,借助多模型自动评审机制,可以系统性地评估自主研究生成系统的表现。研究团队设计了一套基准测试框架,利用多个AI模型对AI生成的科学研究成果进行评价,试图回答“AI能否公正评估AI科学家”这一核心问题。实验表明,该方法在一致性、效率和可扩展性上优于传统人工评审,但仍存在模型偏见、评价标准差异等挑战。该研究为未来自动科研评估体系提供了新思路,有望推动AI在科学发现与评审中的深度应用。 #AI #科研评估 #自动评审 #多模型 #arXiv #AI科学家 #基准测试
OpenClaw 与 Ollama 结合,探索全自主可扩展 AI 代理系统

近日,一篇题为《OpenClaw and Ollama in Agentic AI: Toward Fully Autonomous and Scalable AI Agent Systems》的论文引发关注。该研究由 Konstantinos I. Roumeliotis 等人提出,旨在通过整合 OpenClaw 框架与 Ollama 模型,推动 AI 代理系统向更高自主性和可扩展性迈进。论文探讨了当前智能代理在复杂任务中的局限性,并设计了一种新的架构,使代理能够更高效地决策、学习并适应动态环境。这一工作为构建下一代自主 AI 系统提供了理论支撑与实践路径,有望在机器人、自动化服务等领域产生深远影响。 #AI #AgenticAI #OpenClaw #Ollama #自主AI #可扩展AI #论文 #arXiv
AI Visibility 工具上线,一键检测品牌在 ChatGPT 等 AI 中的推荐情况

随着 ChatGPT、Gemini、Claude 和 Perplexity 等 AI 助手成为用户获取产品推荐的重要渠道,品牌在 AI 回答中的可见性日益关键。一款名为 AI Visibility 的新工具应运而生,帮助品牌快速了解自己是否被这些 AI 助手提及。用户只需输入品牌名称和网站,工具便会模拟用户常见问题,检查各 AI 助手的回答,并给出可见性评分和具体提及情况。该工具还支持对比竞争对手,让品牌清楚自己在 AI 推荐中的位置。与传统 SEO 不同,AI 可见性更依赖品牌在整个网络中的信誉和一致信息,而非单一页面优化。随着越来越多消费者在购买前咨询 AI,品牌需主动监测并提升 AI 可见性,以免错失潜在客户。 #AI可见性 #品牌推荐 #ChatGPT #Gemini #Claude #Perplexity #AI搜索 #营销工具 #科技新闻
大语言模型辅助揭秘深度学习编译器前端Bug

该论文由Xinyi Yuan等作者提交至arXiv,采用大语言模型(LLM)辅助的方法,对深度学习编译器前端的Bug进行了系统性实证研究。研究通过分析大量真实Bug案例,借助LLM的分析能力,揭示了前端Bug的常见模式、成因及影响,并总结了主要类型,为编译器开发者提供了检测与修复建议。该工作对提升深度学习编译器的可靠性和开发效率具有重要参考价值。 #深度学习 #编译器 #LLM #Bug研究 #arXiv #论文 #人工智能
孙成昊谈跨大西洋关系走向,李岩驳斥美方AI蒸馏指控

清华大学国际安全与战略专家孙成昊在最新《求是》杂志撰文指出,跨大西洋关系虽面临严重压力,但由于长期制度机制驱动和路径依赖,彻底“脱钩”可能性较低。他同时认为,美国正从“领导西方”转向“管理联盟”,而欧盟推进战略自主意在增强自身能力而非脱离美国,这将成为未来联盟的核心矛盾。中国现代国际关系研究院专家李岩则就美国对中国AI企业“工业规模蒸馏”的指控进行反驳,称美方将正常技术实践纳入国家安全框架,意在阻碍中国发展并垄断AI工具。她指出,中国AI坚持开源开放,正改变全球AI竞争格局,并呼吁建立基于广泛共识的全球AI治理框架。 #国际关系 #跨大西洋关系 #中美AI竞争 #蒸馏 #战略自主 #开源 #清华大学 #中国现代国际关系研究院 #求是
新韩银行推出AI代理,房地产贷款审查效率提升70%

新韩银行在韩国金融圈率先开发了用于分析房地产担保贷款鉴定评价书的AI代理。鉴定评价书是确认担保价值的重要资料,以往需由职员人工核查外部评价法人提交的文件内容。通过结合大语言模型、机器人流程自动化和光学字符识别技术,AI代理能够自动识别文件内容,分析项目匹配性并提示需确认事项。最终决策仍由职员完成,以确保流程稳健。实测显示,每份评价书的检查时间缩短约70%,日处理量提升约3倍。目前该工具先应用于集合建筑,后续将根据准确性和稳定性验证结果,逐步扩展至其他文件格式和房地产类型。 #新韩银行 #AI代理 #金融科技 #房地产贷款 #效率提升 #大语言模型 #自动化