AI知识库 @ai521
333 subscribers
22.5K photos
42 videos
19 files
868 links
@ai521 专注分享最实用的AI内容

🤖 AI教程(新手到进阶)
🧠 AI知识科普(大模型 / 提示词 / 自动化)
📰 AI资讯更新(每日最新AI动态)
📚 AI实战技巧(写作 / 绘画 / 编程 / 赚钱)
🔧 最新AI工具推荐

每天更新AI干货
长期做一个真正有价值的AI频道
Download Telegram
LLM在扩展搜索空间中的逐步优化式推理研究

一篇发表于arXiv的论文提出,大语言模型(LLM)在应对不断扩展的搜索空间时,能够展现出类似逐步优化的推理能力。研究团队通过设计特定任务,让模型在逐步推理过程中动态调整搜索策略,从而在复杂问题求解中提升效率。实验表明,该方法在需要多步探索和回溯的场景下,显著优于传统的直接推理或简单链式思考。该工作为理解LLM的推理机制和提升其在规划、搜索等领域的应用提供了新视角。 #LLM #推理 #优化 #搜索空间 #AI #论文 #arXiv #人工智能
PSEBench:用于评估大语言模型在患者安全事件分诊中的可控可验证基准

来自arXiv的一篇论文提出了PSEBench,这是一个专门用于评估大语言模型在患者安全事件分诊任务中表现的可控且可验证的基准。患者安全事件分诊是医疗领域的关键环节,旨在快速准确地对不良事件进行分类和处理。现有评估方法往往缺乏可控性和可验证性,PSEBench通过设计标准化测试集和评估协议,允许研究者系统性地测试LLM在不同场景下的分诊能力,包括事件严重性判断、类别划分和优先级排序。该基准还引入了验证机制,确保评估结果的可靠性和可重复性。这一工作有望推动LLM在医疗安全领域的应用落地,提升临床决策支持系统的效能。 #PSEBench #大语言模型 #患者安全 #医疗AI #基准测试 #可控性 #可验证性 #arXiv #自然语言处理
输出类型先于质量:基于标准的自动驾驶安全XAI可接受性评估框架

最新arXiv预印本论文《Output Type Before Quality: A Standards-Derived XAI Admissibility Rubric for Autonomous-Driving Safety》由Abhinaw Priyadershi等作者提出。该研究聚焦自动驾驶领域可解释人工智能(XAI)的可接受性评估,创新性地从行业标准出发构建评估指标体系。核心原则是“输出类型先于质量”,即判断XAI是否适用于自动驾驶安全场景时,应首先考察其输出形式是否符合标准要求,其次再评估输出内容的准确性或可理解性。该框架旨在为自动驾驶系统开发者、监管机构提供可操作的评判依据,推动XAI在安全关键应用中的合规部署。论文已通过arXiv平台发布,目前正等待数据引用注册。 #自动驾驶 #人工智能 #可解释AI #安全标准 #XAI #论文 #学术前沿
Telegram必备的搜索引擎,极搜JISOU帮你精准找到,想要的群组、频道、视频、音乐

👉 t.me/jisou2?start=a_8247614025
智能代理AI保险机制研究论文在arXiv发布

学者Quanyan Zhu于2026年6月在预印本平台arXiv上发表题为《Insurance of Agentic AI》的论文,系统探讨了智能代理AI(Agentic AI)的保险问题。随着AI自主决策能力的增强,其行为可能带来的责任归属与风险转移成为关键议题。该研究从保险视角切入,旨在为AI系统设计相应的风险分担与赔偿机制,以平衡技术创新与安全治理。论文的发布为AI保险领域提供了理论框架,并对未来AI监管与商业化应用具有参考价值。 #人工智能 #保险 #智能代理 #arXiv #学术论文 #风险管理 #AI治理
Brick-Composer

近日,一篇题为《Brick-Composer: Using MLLMs for Assembly with Diverse Bricks》的论文在arXiv上发布。该研究由Jiateng Liu等十一位作者共同完成,提出了一种基于多模态大语言模型(MLLMs)的新型积木组装方法。传统积木组装通常依赖预设规则或专门算法,难以适应形状、颜色各异的积木。Brick-Composer利用MLLM强大的视觉理解和逻辑推理能力,直接将积木图片作为输入,自动生成合理的组装步骤和结构方案。实验表明,该方法在处理多种不规则积木时表现出色,能够灵活应对组合复杂度和零件多样性问题,为机器人装配、创意构建及教育娱乐领域提供了新的技术思路。该研究展示了多模态AI在实体组装任务中的巨大潜力,有望推动智能建造与自适应制造的发展。 #arXiv #多模态大语言模型 #积木组装 #机器人 #AI #科研论文 #智能建造
十位头痛专家与AI临床文献摘要能力对比研究

一项发表于arXiv的研究对十位头痛专科医生与人工智能在临床文献摘要生成方面的能力进行了系统评估与比较。研究团队选取了多篇头痛领域的临床文献,分别由十位专家和AI模型生成摘要,随后由独立评审者从准确性、完整性、可读性等维度进行盲评。初步结果显示,AI生成的摘要在某些指标上接近甚至超越专家水平,尤其在信息提取速度和一致性方面表现突出,但在处理复杂临床语境和细微差异时仍存在不足。该研究为AI辅助临床文献管理提供了重要参考,也引发了对AI在医学信息处理中角色与局限的深入讨论。 #头痛 #人工智能 #临床文献 #摘要生成 #医学AI #自然语言处理 #arXiv #研究比较
零知识验证可应用于前沿AI训练,研究证明其可行性

一篇发表于arXiv的论文提出,零知识验证(Zero Knowledge Verification)技术可用于验证前沿AI模型的训练过程,而无需泄露训练数据或模型参数。该研究由Pierre Peigné等人完成,于2026年6月3日提交。研究团队展示了如何通过密码学方法,在不暴露训练细节的前提下,证明AI模型确实按照特定协议进行了训练。这一突破有望解决AI安全与透明度之间的核心矛盾,为监管机构验证大型AI系统的合规性提供技术基础,同时保护商业机密和用户隐私。论文还讨论了该方法的计算开销和实际部署挑战,认为在现有硬件条件下已具备初步可行性。 #零知识验证 #AI训练 #密码学 #前沿AI #论文 #arXiv #AI安全 #隐私保护
图引导超低位量化

近日,一篇来自arXiv的论文提出了一种名为“图引导超低位量化”的新方法,旨在最小化大语言模型在量化过程中隐藏的缩放因子成本。该研究由Rayyan Abdalla等人完成,通过引入图结构信息,在极低比特(如2比特或3比特)下实现了对大语言模型的高效量化,同时保持模型精度。传统量化方法常因缩放因子带来的额外误差导致性能下降,而新方法通过图引导优化,有效缓解了这一问题。实验表明,该方法在多种大语言模型上均能显著减少模型体积和推理内存占用,为边缘设备部署大型模型提供了可行方案。这一进展有望推动大模型在资源受限场景中的实际应用,降低企业的算力与存储成本。 #大语言模型 #模型量化 #图引导 #超低位 #AI部署 #边缘计算 #arXiv #研究论文 #模型压缩 #技术创新
Anthropic 警告 AI 递归自我改进风险

Anthropic 近日公开多项惊人数据,揭示其 AI 模型 Claude 正加速自我进化。目前公司代码库中超过 80% 的代码由 Claude 编写,工程师人均代码提交量较 2024 年增长 8 倍,员工自估效率提升约 4 倍。Claude 在优化训练代码方面,一年内提速从 3 倍飙升至 52 倍;能独立完成的任务时长每 4 个月翻倍,已从 4 分钟增至 12 小时。此外,Claude 在几周内发现全球重要系统中超 1 万个高危安全漏洞。Anthropic 强调,虽然完全的递归自我改进尚未发生,但风险不容忽视:若 AI 能自主设计并训练下一代系统,人类可能失去控制。目前人类仍在研究品味和判断力上保持优势,但 Anthropic 承认,AI 接管一切的可能性真实存在。 #Anthropic #Claude #AI #递归自我改进 #风险 #科技新闻 #人工智能 #安全
Anthropic秘密提交IPO,MiniMax冲刺A股,M3大模型成焦点

Anthropic已向美国SEC递交保密招股书,这有望成为AI产业规模最大的IPO,估值或达万亿美元。同期,MiniMax开始冲刺A股上市。在资本热潮中,MiniMax发布M3大模型,成为国内首个集齐强大Coding/Agent能力、1M上下文窗口和原生多模态能力的开源模型。M3在SWE-Bench Pro等国际基准中超越GPT-5.5和Gemini 3.1 Pro,仅次于Claude Opus 4.7,且定价极具竞争力——个人开发者每月119元可获18亿Token,仅为Claude成本的十分之一。分析认为,国产开源模型正以高性价比挑战硅谷闭源模型,而Agent风潮和视频大模型热潮共同推动了Token经济学的成熟。MiniMax还同步推出Coding Agent产品MiniMax Code,填补了国内相关空白。 #Anthropic #MiniMax #M3大模型 #AI开源 #CodingAgent #Token经济学 #国产大模型 #Claude #IPO #科技新闻
美国超大规模数据中心碳排放与能耗评估

一篇由Gianluca Guidi等学者提交至arXiv的预印本论文,系统评估了美国超大规模数据中心的碳排放与能源消耗状况。研究聚焦于这一快速增长的基础设施领域,通过数据分析揭示了数据中心在运行过程中产生的巨大环境足迹。论文指出,随着AI和云计算需求激增,数据中心的能耗与碳排放已成为不可忽视的环境挑战,亟需更可持续的运营策略和能源结构优化。 #碳排放 #能源消耗 #数据中心 #AI #环境 #论文 #科技研究 #超大规模数据中心
面向对话通用人工智能的动机架构

研究人员Anna Mikeda与Ben Goertzel在arXiv上提交了一篇题为“面向对话通用人工智能的动机架构”的论文。该论文提出了一种新颖的动机架构,旨在为对话式AGI系统赋予内在驱动力和目标导向能力,使其能够更自主地进行交互、学习和决策。这一架构借鉴了认知科学和心理学中的动机理论,通过设计多层次的奖励与价值系统,让AI在对话中不仅响应外部输入,还能主动探索、追求长期目标。论文初步探讨了该架构在提升对话连贯性、适应性和创造力方面的潜力,为构建更接近人类认知的通用人工智能提供了新的理论框架。该研究目前处于预印本阶段,尚未正式发表。 #AGI #对话AI #动机架构 #arXiv #人工智能 #认知科学 #BenGoertzel #AnnaMikeda #预印本
LLM驱动程序进化中的“无变异突变”

一篇题为《无变异突变:LLM驱动程序进化中的收敛动力学》的论文在arXiv上发布。研究探讨了大型语言模型(LLM)在程序进化过程中,由于缺乏变异机制而导致的收敛现象。作者通过实验发现,当LLM仅依赖现有代码进行迭代改进而不引入随机变异时,程序进化会迅速陷入局部最优,多样性丧失,最终导致进化停滞。该研究揭示了LLM在自动编程和代码生成中可能存在的局限性,为改进算法设计提供了理论依据。 #LLM #程序进化 #收敛动力学 #AI #机器学习 #论文 #arXiv
Agents' Last Exam

一篇名为《Agents' Last Exam》的论文近日在arXiv平台提交,作者包括Yiyou Sun等308位研究者。该论文提出了一种针对人工智能智能体的全新评估基准,旨在测试智能体在多任务、多场景下的综合能力。尽管论文具体细节尚未公开,但标题暗示这可能是智能体领域的一次“终极考验”,有望推动AI自主决策与执行能力的研究进展。论文目前以PDF和HTML形式开放访问。 #AI #智能体 #基准测试 #arXiv #人工智能 #论文
通用智能体赋能情境化时间序列分析研究取得新进展

一篇题为《Harnessing Generalist Agents for Contextualized Time Series》的学术论文在arXiv平台发布。该研究由Zihao Li等十一位学者共同完成,探索将通用型人工智能智能体应用于情境化时间序列分析任务。传统时间序列预测往往依赖专用模型,而本研究尝试利用具备多任务学习能力的通用智能体,通过融入外部情境信息(如语义、事件或结构化背景),提升对复杂动态序列的理解与预测精度。该方法有望在金融、气候、医疗等需要结合语境进行时序推理的领域产生重要应用。目前论文可通过arXiv获取HTML预览及TeX源码。 #人工智能 #时间序列 #通用智能体 #情境学习 #机器学习 #AI研究 #arXiv #学术论文
LeanMarathon:通过长时域Lean自动形式化迈向可靠AI合作数学家

研究人员提出名为LeanMarathon的新方法,旨在利用定理证明器Lean实现长时域的数学命题自动形式化,从而构建更可靠的AI合作数学家。传统自动形式化方法在短程推理上表现尚可,但面对复杂数学证明的长链条逻辑时容易出错。LeanMarathon通过设计新的推理策略和强化学习框架,将形式化过程分解为可管理的子目标,并逐步验证,显著提升了长序列形式化的准确性和鲁棒性。实验表明,该方法在多个数学领域(如代数、分析)的命题上取得了优于基线模型的性能,为AI在数学发现与验证中的实际应用提供了新路径。相关论文已提交arXiv预印本。 #AI #数学 #自动推理 #Lean定理证明器 #形式化验证 #机器学习 #科研论文 #新技术
残差建模方法实现科学数据高保真学习压缩

一篇题为《Residual Modeling for High-Fidelity Learned Compression of Scientific Data》的研究论文近日在arXiv上预印发布。该研究由Liangji Zhu等人完成,提出了一种基于残差建模的学习压缩框架,旨在解决科学数据高保真压缩中的精度损失问题。传统压缩方法在保留科学数据的复杂特征时往往引入失真,而新方法通过学习原始数据与粗压缩结果之间的残差,显著提升了重建数据的保真度。实验表明,该方法在多个科学数据集上优于现有主流压缩技术,尤其在高维和异构数据场景中表现突出。该工作为高效存储和传输海量科学数据提供了新思路,有望推动气候模拟、天文观测、基因组学等领域的科研进展。 #科学数据压缩 #残差建模 #高保真 #深度学习 #论文 #arXiv #数据存储 #科学研究
稳定与可操纵的权衡:LLM 评判者决策后交互鲁棒性研究获新发现

一篇题为“Stability vs. Manipulability: Evaluating Robustness Under Post-Decision Interaction in LLM Judges”的预印本论文于2026年6月提交至arXiv。该研究聚焦大型语言模型(LLM)作为评判者时的鲁棒性问题,重点考察在决策后交互情境下,模型能否在保持稳定性的同时抵御操纵。研究者通过实验揭示了LLM评判中稳定性与可操纵性之间存在内在权衡,为提升AI评判系统的安全性和可信度提供了新视角。该工作来自Srimonti Dutta和Akshata Kishore Moharir,目前仅提供PDF全文,尚未正式出版。 #LLM #AI #鲁棒性 #稳定性 #可操纵性 #论文 #arXiv #人工智能安全
华为云AI生态峰会召开,加速构建行业共赢新生态

6月6日,2026华为云INSPIRE创想者大会期间,华为云AI生态峰会以“技术开放共生,行业AI共赢”为主题举行。会上,华为云伙伴与生态部总裁康晓宇表示,AI正加速从技术探索走向产业实践,华为云将持续夯实Agentic Infra全栈能力,通过技术开放、行业共创与应用繁荣,携手开发者、伙伴和客户共建AI共赢生态。峰会发布了AI Shell、AI CLI等开发工具,以及WorkAgent文档智能体、OpenJiuwen开源项目等新成果。同时,2026华为云开发者大赛正式启幕,华为云预计投入3亿元支持开发者。行业AI梦工厂已落地智慧医疗、具身智能等四大专区,海顿解决方案工作台已使能4400余家伙伴构建5000余个解决方案。华为云云商店汇聚200余AI商家、600余应用,推动AI从工具走向产业智能劳动力。 #华为云 #AI生态 #开发者 #行业AI #智能体 #开源 #人工智能 #科技新闻
Telegram必备的搜索引擎,极搜JISOU帮你精准找到,想要的群组、频道、视频、音乐

👉 t.me/jisou2?start=a_8247614025