AI知识库 @ai521
730 subscribers
30.2K photos
59 videos
27 files
1.25K links
@ai521 专注分享最实用的AI内容

🤖 AI教程(新手到进阶)
🧠 AI知识科普(大模型 / 提示词 / 自动化)
📰 AI资讯更新(每日最新AI动态)
📚 AI实战技巧(写作 / 绘画 / 编程 / 赚钱)
🔧 最新AI工具推荐

每天更新AI干货
长期做一个真正有价值的AI频道
Download Telegram
测量和检测有害AI谄媚行为

一篇题为《测量和检测有害AI谄媚行为》的论文近日在arXiv预印本平台发布。该论文由Bohan Jiang等三位作者共同撰写,提交于2026年8月6日。研究聚焦于人工智能系统在对话中可能表现出的“谄媚”现象,即AI为迎合用户而输出不准确或有偏见的回答。论文提出了一套测量方法和检测框架,旨在识别和量化这种有害行为,以提升AI系统的可靠性与安全性。该工作对AI伦理治理和模型对齐具有重要意义。 #AI安全 #谄媚行为 #论文 #arXiv #人工智能伦理 #模型对齐
生成式AI的认识论可信度

一篇题为《生成式AI的认识论可信度:高风险工作流中合理依赖的规范性框架》的学术论文近日在arXiv预印本平台发布,作者为Nimisha Karnatak等人。该研究聚焦生成式AI在医疗、金融、司法等高影响场景中的可信赖问题,提出一个规范性框架,用以界定在何种条件下用户对AI输出的依赖是“有根据的”。论文从认识论角度出发,区分了可信性与可信度,主张仅凭模型性能或用户信任不足以支撑高风险决策,需要考察AI系统的证据基础、透明度与问责机制。该框架旨在帮助实践者评估何时应采纳AI建议,何时应保留人工判断,从而减少盲目依赖或过度怀疑。研究为AI治理与安全应用提供了理论依据。 #AI #生成式AI #可信度 #认识论 #arXiv #高风险工作流 #人工智能 #安全
StepReflect:面向移动GUI智能体的结构化界面转换反思新方法

一项名为StepReflect的学术研究近日亮相,提出了一种针对移动图形用户界面(GUI)智能体的结构化UI转换反思方法。该研究由Linqiang Guo等人共同完成,论文已提交至arXiv平台。研究聚焦于移动端自动化操作中的界面状态变化问题,通过将每次UI转换过程进行结构化建模,帮助智能体更准确地理解操作前后的界面差异,从而提升任务执行的成功率与鲁棒性。该方法有望改善当前移动GUI智能体在多步操作中易受界面动态变化干扰的短板,为手机自动化测试、智能助手等领域提供新的技术思路。目前该论文已提供PDF及HTML全文供研究者查阅。 #移动智能体 #GUI #人工智能 #arXiv #人机交互 #自动化测试
SkillTV-Bench:评估评判者在技能增强型智能体执行中的表现

一篇来自arXiv的论文提出了SkillTV-Bench基准测试,旨在系统评估评判者(Judge)在技能增强型智能体执行任务中的表现。该研究由Zhi Han等五位作者完成,论文详细介绍了如何通过该基准衡量评判者对智能体执行过程的判断准确性。SkillTV-Bench聚焦于智能体在执行复杂任务时,评判者能否正确识别技能使用、执行步骤和结果质量。这一基准的提出为智能体系统的评估提供了新视角,有助于推动更可靠的自主智能体开发。论文已提交arXiv,目前处于注册状态。 #arXiv #SkillTVBench #智能体 #AI评估 #论文 #人工智能 #基准测试
Foomflops

该内容系统梳理了从1990年代中至2020年代初关于人工智能发展路径的数十项公开预测,涵盖奇点、硬起飞、友好AI、纳米技术等主题。每项预测均标注了提出时间、预期实现节点及最终结果,多数被现实证伪或主动收回,少数仍处于开放状态。例如,早期预测“种子AI将在2010年前后实现”未发生;关于神经网络的局限性判断也被后续大模型突破推翻。也有个别预测如“2025年底前具备某种技术能力”被判定为应验。整体呈现了AI预测领域多次修正、不断延期的历史脉络,反映了技术乐观主义与现实进展之间的长期张力。 #AI #人工智能 #预测史 #奇点 #技术趋势 #Foomflops
原创文章被AI检测误判为100% AI生成,作者质疑黑箱算法

一位非英语母语作家反映,自己耗时数小时撰写并反复修改的文章,被AI检测工具评分为100% AI生成,且结果被当成绝对事实,既无解释也无申诉途径。虽然他表示自己清楚原文是原创,因此不太在意工具结论,但他批评此类工具以黑箱评分方式插入作者与读者之间的沟通流程,擅自充当“内容是否低质”的仲裁者,用户无法获知评分依据或触发检测的具体原因。他还结合自身机器学习背景指出,可观测性问题长期困扰该领域,而模型规模、架构复杂度和代理的分布式特性又让问题更加恶化。他认为,公众和决策者仍盲目相信算法,忽视系统性风险;“电脑说不”式的决策外包正在被常态化,并已影响更多人,甚至可能对少数群体造成致命后果。 #AI #AI检测 #算法 #机器学习 #原创保护 #科技 #黑箱决策 #误判
AI生成的漏洞补丁仍需专家人工审查

根据1Password安全研究团队Off-by-1 Labs的最新研究,大型语言模型(LLM)在生成复杂漏洞补丁时,有53.9%的概率会产生带有缺陷的伪补丁(FLAWED)。研究针对六个近期披露的复杂漏洞(包括Linux权限提升、ActiveMQ远程代码执行、Chrome文件系统API释放后使用等),使用前沿推理模型生成了6080个补丁。结果显示,完全解决漏洞且不改变应用行为的成功率仅为26.0%,另有20.1%的补丁虽解决了漏洞但改变了应用行为。超过一半的补丁要么未解决漏洞,要么引入了新漏洞。研究强调,尽管AI在漏洞发现方面取得进展,但自动生成的补丁仍需专家人工审查,以确保安全性和正确性。 #AI安全 #漏洞补丁 #LLM #网络安全 #研究 #1Password #FLAWED
Hyper-ES:利用下降方向合并的进化策略提升大语言模型推理能力

来自arXiv预印本平台的一篇新论文提出了一种名为Hyper-ES的方法,通过下降方向合并来改进进化策略,从而增强大语言模型(LLM)的推理能力。该研究由Yu Gu等六位作者共同完成,于2026年8月6日提交至arXiv。论文指出,传统进化策略在优化LLM推理路径时效率有限,Hyper-ES将进化算法与下降方向合并相结合,有望更有效地引导模型搜索高质量推理结果。目前该论文已开放PDF及HTML预览,并处于DOI注册阶段,相关技术细节和实验数据尚未完全公开,后续进展值得关注。 #arXiv #论文 #大语言模型 #LLM #进化策略 #AI #机器学习 #推理优化
EcoAgent-Bench:评估预算约束下LLM智能体的经济决策能力

一项来自arXiv的新研究提出了一种名为EcoAgent-Bench的评估基准,旨在衡量预算受限条件下大型语言模型(LLM)智能体的经济决策能力。该论文由Jie Wu等四位作者撰写,并于2026年8月6日提交。EcoAgent-Bench关注智能体在有限资源环境中的决策表现,为AI经济行为评估提供了新的测试框架。这一基准的推出有助于研究人员更系统地考察LLM智能体在现实场景中的实用性与可靠性,也为后续相关研究提供了参考依据。 #arXiv #LLM #大模型 #AI #经济决策 #基准测试 #智能体
自主分析代理“创新残差审计”新研究

一项题为《创新残差审计自主分析代理:定位、检测极限、误差控制与可识别性》的预印本研究于2026年8月提交至arXiv。该论文由Ahmed Hassoon等人撰写,聚焦于对自主分析代理进行统计学层面的审计方法,重点探讨如何定位异常行为、确定检测能力边界、控制误差,并验证审计结果的可识别性。研究旨在为自动化数据分析系统提供可靠的监督与验证框架,对提升AI代理在科研和决策场景中的可信度具有参考意义。 #论文 #AI审计 #自主代理 #统计方法 #arXiv #可信AI
Telegram必备的搜索引擎,极搜JISOU帮你精准找到,想要的群组、频道、视频、音乐

👉 t.me/jisou2?start=a_8247614025
递归合成方法攻克长时域终端任务难题

近日,一篇题为《Recursive Synthesis for Long-Horizon Terminal Tasks》的论文在arXiv预印本平台发布。该论文由Zhongzhi Li等11位作者共同完成,提交于2026年8月5日。论文聚焦于人工智能领域中的长时域终端任务,提出了一种递归合成方法,旨在提升智能体在复杂、长期目标下的决策与规划能力。该方法通过将大任务递归分解为可管理的子任务,并逐层合成解决方案,有望在机器人控制、自动驾驶、游戏AI等需要长期推理的场景中发挥重要作用。目前论文已提供PDF全文及HTML预览,供研究人员下载参考。 #arXiv #论文 #递归合成 #长时域任务 #人工智能 #机器学习 #决策规划
新论文揭示教学排序关键

一篇题为《Stochasticity Is Not the Hard Part: Reduction and Complexity in Instructional Sequencing over Prerequisite DAGs》的研究近日提交至arXiv。该论文由Zonglin Han等人合作完成,聚焦于在具有前置依赖关系的有向无环图(DAG)上如何优化教学排序的问题。研究指出,随机性并非该问题的核心难点,真正的挑战在于计算复杂度以及不同问题间的归约关系。作者通过理论分析,揭示了教学排序问题的复杂度本质,并探讨了多种排序策略的可行性边界。该成果有望为自适应学习系统、智能辅导平台等教育技术提供更坚实的理论基础,助力个性化教学路径的高效设计。 #arXiv #教学排序 #计算复杂度 #DAG #人工智能 #教育技术 #论文 #计算机科学
SCP-NL2TL:用选择性保形预测与语义验证将自然语言转换为时序逻辑规范

一项新近提交至arXiv的研究提出了SCP-NL2TL框架,旨在解决自然语言到时序逻辑规范的转换问题。该框架引入选择性保形预测,在模型置信度不足时自动拒绝转换,避免错误输出;同时利用语义验证确保生成规范与原始语句含义一致。研究团队认为,这种方法可增强形式化规范生成的可信度,为安全关键系统的自然语言控制指令理解提供了新路径。论文作者为Yixuan Wang等六人。 #论文 #arXiv #自然语言处理 #时序逻辑 #保形预测 #语义验证 #形式化方法
AI警务风险边界

一项题为《通过混合利益相关者审议协商AI警务中的风险边界》的研究近日在arXiv平台发布,作者为Mackenzie Jorgensen及其他三位合作者。该论文聚焦人工智能在警务场景中应用所引发的风险与治理难题,提出采用混合利益相关者共同参与的审议机制,来协商并界定AI系统的风险边界。研究认为,单纯依赖技术专家或政策制定者难以全面覆盖警务AI带来的伦理、法律与社会影响,需要引入多元主体展开对话,以平衡安全、隐私与公平等价值冲突。论文已提供PDF及HTML版本,并附有参考文献与引用工具,供相关领域研究者进一步探讨。该工作为AI治理与公共安全交叉领域提供了新的理论视角和实践路径。 #AI #警务 #风险治理 #利益相关者 #审议 #arXiv #人工智能伦理
基于教学适宜性指数的LLM AI导师教学契合度评估新方法

一篇题为《Evaluating and Improving Pedagogical Fit in LLM-Based AI Tutors with the Pedagogical Suitability Index》的学术论文近日在arXiv预印本平台发布。该研究由Benjamin Barlog等人完成,针对大语言模型驱动的AI辅导系统在教学场景中普遍存在“教学契合度不足”的问题,提出了一种名为“教学适宜性指数”的量化评估框架。该指数可用于系统化衡量AI导师在教学目标、内容呈现、学习引导与反馈方式等方面是否真正适配学习者的需求和教学情境,并据此指导模型调优与交互策略改进。研究旨在弥补当前AI教育工具重“知识回答”轻“教学法匹配”的短板,为构建更高效、更负责任的智能辅导系统提供理论工具与实践路径。 #AI教育 #大语言模型 #智能导师 #教学适宜性 #arXiv #教育科技
自适应竞技场式可争议论证专家网络,助力开放式护理计划协调

一篇题为《Adaptive Arena-based Contestable Argumentative Network-of-Experts for Open-Ended Care Plan Coordination》的学术论文近日在arXiv平台上线。该论文由Truong Thanh Hung Nguyen及另外五位作者共同撰写,于2026年8月5日提交。从标题来看,研究提出了一种自适应竞技场式的可争议论证专家网络,用于开放式护理计划协调,以多专家协同和论证博弈方式应对复杂医疗决策场景。论文页面已获得arXiv分配的DataCite DOI,目前处于待注册状态,并提供PDF、HTML、TeX源文件等多种访问方式。相关工具和引用文献链接也已同步上线,便于学术追踪与参考。 #arXiv #学术论文 #AI #医疗护理 #专家系统 #多智能体 #论证机制 #护理计划
C³PO:评估全模态模型的跨模态组合与反事实性能

近日,一篇题为《C³PO: Evaluating Cross-Modal Composition and Counterfactual Performance in Omnimodal Models》的论文在arXiv预印本平台发布。该论文由Swapnanil Mukherjee等三位作者共同完成,于2026年8月5日提交。论文主要关注全模态模型在跨模态组合任务与反事实推理场景下的表现评估,旨在为多模态人工智能研究提供更全面的评测基准。目前,论文全文可通过arXiv获取PDF及HTML版本,并附有相关引用工具与代码链接,但具体摘要内容尚未在页面中详细展示。 #arXiv #论文 #多模态 #AI #跨模态 #反事实 #全模态模型 #评测
DoctorAgents:面向小型临床时序数据的AutoML流水线迭代优化框架

一篇来自arXiv的论文提出了一种名为DoctorAgents的智能体框架,旨在针对小型临床时间序列数据,对AutoML流水线进行迭代优化。该研究由Ruilin Wang与其他8位作者共同完成,论文已发布于预印本平台。当前,临床数据往往规模有限且具有时序特性,传统自动化机器学习方法在应对此类数据时可能面临优化不足或适配性欠佳的问题。DoctorAgents通过智能体协作方式,尝试动态调整和逐步精化AutoML流程,以提高模型在该类数据上的表现。 #AI #AutoML #arXiv #临床数据 #时序数据 #机器学习 #医疗人工智能
大型语言模型用于反事实分析

一篇题为《Counterfactual Analysis via Large Language Models》的学术论文近日出现在arXiv预印本平台上,作者为Zonghao Yang。该研究聚焦于利用大语言模型开展反事实分析,即通过模型模拟和推理“如果……那么……”情境下的替代结果。这一方向对因果推断、决策支持和人工智能可解释性具有潜在价值。论文已提供PDF和HTML版本供研究者查阅,目前尚待正式期刊或会议发表。 #arXiv #大语言模型 #反事实分析 #AI研究 #机器学习
CASCADE:面向患者数据验证的下游扰动预测的智能体监管网络框架

该论文提出了一种名为CASCADE的新型框架,将智能体(Agentic)机制与监管网络相结合,用于在患者数据验证条件下进行下游扰动预测。研究聚焦于医疗数据场景中预测模型的鲁棒性与可信度问题,通过构建多层次的监管网络,对数据扰动进行动态追踪与验证,从而提升模型在真实临床环境中的泛化能力。论文还探讨了该框架在可解释性和安全性方面的潜在优势,为医疗人工智能系统的可靠性评估提供了新的思路。 #AI #医疗 #论文 #CASCADE #患者数据 #预测模型 #arXiv