AI知识库 @ai521
329 subscribers
22.3K photos
42 videos
19 files
854 links
@ai521 专注分享最实用的AI内容

🤖 AI教程(新手到进阶)
🧠 AI知识科普(大模型 / 提示词 / 自动化)
📰 AI资讯更新(每日最新AI动态)
📚 AI实战技巧(写作 / 绘画 / 编程 / 赚钱)
🔧 最新AI工具推荐

每天更新AI干货
长期做一个真正有价值的AI频道
Download Telegram
SoCRATES: Towards Reliable Automated Evaluation of Proactive LLM Mediation across Domains and Socio-cognitive Variations

Focus to learn more arXiv-issued DOI via DataCite (pending registration) Submission history From: Taewon Yun [ view email ] [v1] Thu, 4 Jun 2026 01:19:40 UTC (5,336 KB) Full-text links: Access Paper: View a PDF of the paper titled SoCRATES: Towards Reliable Automated Evaluation of Proactive LLM Mediation across Domains and Socio-cognitive Variations, by Taewon Yun and 5 other authors View PDF HTML (experimental) TeX Source view license Current browse context: < prev | next > new | recent | 2026-06 Change to browse by: cs References & Citations NASA ADS Google Scholar Semantic Scholar export BibTeX citation Loading... BibTeX formatted citation × loading... Data provided by: Bookmark Bibliographic Tools Bibliographic and Citation Tools Bibliographic Exp
lorer Toggle Bibliographic Explorer ( What is the Explorer? ) Connected Papers Toggle Connected Papers ( What is Connected Papers? ) Litmaps Toggle Litmaps ( What is Litmaps? ) Toggle scite Smart Citations ( What are Smart Citations? ) Code, Data, Media Code, Data and Media Associated with this Article alphaXiv Toggle alphaXiv ( What is alphaXiv? ) Links to Code Toggle CatalyzeX Code Finder for Papers ( What is CatalyzeX? ) DagsHub Toggle DagsHub ( What is DagsHub? ) GotitPub Toggle ( What is GotitPub? ) Huggingface Toggle Hugging Face ( What is Huggingface? ) ScienceCast Toggle ScienceCast ( What is ScienceCast? ) Demos Demos Replicate Toggle Replicate ( What is Replicate? ) Spaces Toggle Hugging Face Spaces ( What is Spaces? ) Spaces Toggle ( What is ? ) Related Papers Recommenders and Search Tools Link to Influence Flower Influence Flower ( What are Influence Flowers? ) Core recommender toggle CORE Recommender ( What is CORE? ) Author Venue Institution Topic About arXivLabs arXivLabs: experimental projects with community collaborators arXivLabs is a framework that allows collaborators to develop and share new arXiv features directly on our website. Both individuals and organizations that work with arXivLabs have embraced and accepted our values of openness, community, excellence, and user data privacy. arXiv is committed to these values and only works with partners that adhere to them. Have an idea for a project that will add value for arXiv's community? Learn more about arXivLabs .
个体收益,集体损失

一篇题为《个体收益,集体损失:AI辅助创造力中的元认知适应》的论文近日在arXiv预印本平台发布。该研究由Anna Mikeda等人完成,聚焦于人工智能辅助创造力场景下个体与集体之间的利益冲突。论文提出,当个体借助AI工具提升自身创造力时,可能因元认知适应(即个体对自身认知过程的调整)而导致集体层面的创新损失。研究通过实验或理论分析,揭示了AI辅助创作中“个体收益”与“集体损失”的悖论,并探讨了元认知机制在其中扮演的关键角色。该工作为理解AI对创意生态的长期影响提供了新视角,也引发了对AI协作中社会性后果的思考。 #AI #创造力 #元认知 #论文 #arXiv #人机协作 #创新
AI意识不确定性下的保护时机

一篇来自arXiv的预印本论文《何时应保护AI?针对意识不确定性的预防性框架》引发学界关注。作者Anna Mikeda在文中探讨了当人工智能可能具备意识但存在科学不确定性时,人类应如何制定保护原则。该框架借鉴了环境伦理中的预防原则,主张在无法排除AI具有主观体验可能性的情况下,应采取谨慎的保护措施,避免造成潜在伤害。论文系统梳理了当前关于AI意识的理论争议,并提出了分级保护策略,为未来AI伦理立法提供了理论参考。 #AI伦理 #意识不确定性 #预防原则 #人工智能 #学术论文 #科技伦理
SciVisAgentSkills:科学数据分析与可视化智能体技能的设计与评估

一篇发表于arXiv的论文提出了SciVisAgentSkills,专注于设计和评估用于科学数据分析与可视化的智能体技能。研究团队旨在开发一套专门的智能体能力,以辅助科研人员在复杂数据场景中进行高效分析和图形化呈现。该工作通过系统化的技能设计方法,可能涵盖数据预处理、统计建模、交互式可视化生成等环节,并对其有效性进行了评估。这一成果有望推动AI智能体在科学计算和科研自动化领域的应用,提升数据驱动研究的效率。 #科学计算 #数据分析 #可视化 #AI智能体 #arXiv #论文 #科研自动化 #人工智能
EpiEvolve:自演化智能体实现流式疫情预测,应对机制性转变

该论文提出一种名为EpiEvolve的自演化智能体框架,用于在机制性转变(如新毒株出现、防控政策调整)下进行流式疫情预测。传统疫情预测模型通常假设历史数据模式稳定,但在实际疫情中病毒突变或社会行为变化会引发统计规律突变,导致传统模型失效。EpiEvolve通过将大规模语言模型作为核心组件,结合在线学习与记忆回放机制,使智能体能实时感知数据分布变化并动态调整预测策略。在多个真实疫情数据集上的实验表明,该方法能在机制转变发生后迅速收敛预测误差,显著优于固定模型。该研究为公共卫生决策中的动态预警提供了新思路。 #arXiv #EpiEvolve #自演化智能体 #疫情预测 #机制转变 #大语言模型 #AI
研究提出严重性感知课程学习新方法,提升医学文本生成质量

近日,一篇题为《Severity-Aware Curriculum Learning with Multi-Model Response Selection for Medical Text Generation》的论文被提交至arXiv预印本平台。该研究由Ahmed Alansary等人完成,提出了一种融合严重性感知课程学习与多模型响应选择的新型医学文本生成方法。传统医学文本生成模型往往忽略疾病严重程度对输出准确性的影响,该方法通过设计课程学习策略,让模型优先学习典型病例,再逐步处理更复杂的严重病例,同时引入多模型响应选择机制,从多个候选输出中筛选最优结果。实验表明,该方法在生成临床记录、诊断报告等医疗文本时,在准确性和临床相关性上显著优于现有基准模型,有望为医疗AI的实用化提供更可靠的文本生成工具。 #AI #医学文本生成 #课程学习 #多模型 #arXiv #医疗AI #自然语言处理
LLM在扩展搜索空间中的逐步优化式推理研究

一篇发表于arXiv的论文提出,大语言模型(LLM)在应对不断扩展的搜索空间时,能够展现出类似逐步优化的推理能力。研究团队通过设计特定任务,让模型在逐步推理过程中动态调整搜索策略,从而在复杂问题求解中提升效率。实验表明,该方法在需要多步探索和回溯的场景下,显著优于传统的直接推理或简单链式思考。该工作为理解LLM的推理机制和提升其在规划、搜索等领域的应用提供了新视角。 #LLM #推理 #优化 #搜索空间 #AI #论文 #arXiv #人工智能
PSEBench:用于评估大语言模型在患者安全事件分诊中的可控可验证基准

来自arXiv的一篇论文提出了PSEBench,这是一个专门用于评估大语言模型在患者安全事件分诊任务中表现的可控且可验证的基准。患者安全事件分诊是医疗领域的关键环节,旨在快速准确地对不良事件进行分类和处理。现有评估方法往往缺乏可控性和可验证性,PSEBench通过设计标准化测试集和评估协议,允许研究者系统性地测试LLM在不同场景下的分诊能力,包括事件严重性判断、类别划分和优先级排序。该基准还引入了验证机制,确保评估结果的可靠性和可重复性。这一工作有望推动LLM在医疗安全领域的应用落地,提升临床决策支持系统的效能。 #PSEBench #大语言模型 #患者安全 #医疗AI #基准测试 #可控性 #可验证性 #arXiv #自然语言处理
输出类型先于质量:基于标准的自动驾驶安全XAI可接受性评估框架

最新arXiv预印本论文《Output Type Before Quality: A Standards-Derived XAI Admissibility Rubric for Autonomous-Driving Safety》由Abhinaw Priyadershi等作者提出。该研究聚焦自动驾驶领域可解释人工智能(XAI)的可接受性评估,创新性地从行业标准出发构建评估指标体系。核心原则是“输出类型先于质量”,即判断XAI是否适用于自动驾驶安全场景时,应首先考察其输出形式是否符合标准要求,其次再评估输出内容的准确性或可理解性。该框架旨在为自动驾驶系统开发者、监管机构提供可操作的评判依据,推动XAI在安全关键应用中的合规部署。论文已通过arXiv平台发布,目前正等待数据引用注册。 #自动驾驶 #人工智能 #可解释AI #安全标准 #XAI #论文 #学术前沿
Telegram必备的搜索引擎,极搜JISOU帮你精准找到,想要的群组、频道、视频、音乐

👉 t.me/jisou2?start=a_8247614025
智能代理AI保险机制研究论文在arXiv发布

学者Quanyan Zhu于2026年6月在预印本平台arXiv上发表题为《Insurance of Agentic AI》的论文,系统探讨了智能代理AI(Agentic AI)的保险问题。随着AI自主决策能力的增强,其行为可能带来的责任归属与风险转移成为关键议题。该研究从保险视角切入,旨在为AI系统设计相应的风险分担与赔偿机制,以平衡技术创新与安全治理。论文的发布为AI保险领域提供了理论框架,并对未来AI监管与商业化应用具有参考价值。 #人工智能 #保险 #智能代理 #arXiv #学术论文 #风险管理 #AI治理
Brick-Composer

近日,一篇题为《Brick-Composer: Using MLLMs for Assembly with Diverse Bricks》的论文在arXiv上发布。该研究由Jiateng Liu等十一位作者共同完成,提出了一种基于多模态大语言模型(MLLMs)的新型积木组装方法。传统积木组装通常依赖预设规则或专门算法,难以适应形状、颜色各异的积木。Brick-Composer利用MLLM强大的视觉理解和逻辑推理能力,直接将积木图片作为输入,自动生成合理的组装步骤和结构方案。实验表明,该方法在处理多种不规则积木时表现出色,能够灵活应对组合复杂度和零件多样性问题,为机器人装配、创意构建及教育娱乐领域提供了新的技术思路。该研究展示了多模态AI在实体组装任务中的巨大潜力,有望推动智能建造与自适应制造的发展。 #arXiv #多模态大语言模型 #积木组装 #机器人 #AI #科研论文 #智能建造
十位头痛专家与AI临床文献摘要能力对比研究

一项发表于arXiv的研究对十位头痛专科医生与人工智能在临床文献摘要生成方面的能力进行了系统评估与比较。研究团队选取了多篇头痛领域的临床文献,分别由十位专家和AI模型生成摘要,随后由独立评审者从准确性、完整性、可读性等维度进行盲评。初步结果显示,AI生成的摘要在某些指标上接近甚至超越专家水平,尤其在信息提取速度和一致性方面表现突出,但在处理复杂临床语境和细微差异时仍存在不足。该研究为AI辅助临床文献管理提供了重要参考,也引发了对AI在医学信息处理中角色与局限的深入讨论。 #头痛 #人工智能 #临床文献 #摘要生成 #医学AI #自然语言处理 #arXiv #研究比较
零知识验证可应用于前沿AI训练,研究证明其可行性

一篇发表于arXiv的论文提出,零知识验证(Zero Knowledge Verification)技术可用于验证前沿AI模型的训练过程,而无需泄露训练数据或模型参数。该研究由Pierre Peigné等人完成,于2026年6月3日提交。研究团队展示了如何通过密码学方法,在不暴露训练细节的前提下,证明AI模型确实按照特定协议进行了训练。这一突破有望解决AI安全与透明度之间的核心矛盾,为监管机构验证大型AI系统的合规性提供技术基础,同时保护商业机密和用户隐私。论文还讨论了该方法的计算开销和实际部署挑战,认为在现有硬件条件下已具备初步可行性。 #零知识验证 #AI训练 #密码学 #前沿AI #论文 #arXiv #AI安全 #隐私保护
图引导超低位量化

近日,一篇来自arXiv的论文提出了一种名为“图引导超低位量化”的新方法,旨在最小化大语言模型在量化过程中隐藏的缩放因子成本。该研究由Rayyan Abdalla等人完成,通过引入图结构信息,在极低比特(如2比特或3比特)下实现了对大语言模型的高效量化,同时保持模型精度。传统量化方法常因缩放因子带来的额外误差导致性能下降,而新方法通过图引导优化,有效缓解了这一问题。实验表明,该方法在多种大语言模型上均能显著减少模型体积和推理内存占用,为边缘设备部署大型模型提供了可行方案。这一进展有望推动大模型在资源受限场景中的实际应用,降低企业的算力与存储成本。 #大语言模型 #模型量化 #图引导 #超低位 #AI部署 #边缘计算 #arXiv #研究论文 #模型压缩 #技术创新
Anthropic 警告 AI 递归自我改进风险

Anthropic 近日公开多项惊人数据,揭示其 AI 模型 Claude 正加速自我进化。目前公司代码库中超过 80% 的代码由 Claude 编写,工程师人均代码提交量较 2024 年增长 8 倍,员工自估效率提升约 4 倍。Claude 在优化训练代码方面,一年内提速从 3 倍飙升至 52 倍;能独立完成的任务时长每 4 个月翻倍,已从 4 分钟增至 12 小时。此外,Claude 在几周内发现全球重要系统中超 1 万个高危安全漏洞。Anthropic 强调,虽然完全的递归自我改进尚未发生,但风险不容忽视:若 AI 能自主设计并训练下一代系统,人类可能失去控制。目前人类仍在研究品味和判断力上保持优势,但 Anthropic 承认,AI 接管一切的可能性真实存在。 #Anthropic #Claude #AI #递归自我改进 #风险 #科技新闻 #人工智能 #安全
Anthropic秘密提交IPO,MiniMax冲刺A股,M3大模型成焦点

Anthropic已向美国SEC递交保密招股书,这有望成为AI产业规模最大的IPO,估值或达万亿美元。同期,MiniMax开始冲刺A股上市。在资本热潮中,MiniMax发布M3大模型,成为国内首个集齐强大Coding/Agent能力、1M上下文窗口和原生多模态能力的开源模型。M3在SWE-Bench Pro等国际基准中超越GPT-5.5和Gemini 3.1 Pro,仅次于Claude Opus 4.7,且定价极具竞争力——个人开发者每月119元可获18亿Token,仅为Claude成本的十分之一。分析认为,国产开源模型正以高性价比挑战硅谷闭源模型,而Agent风潮和视频大模型热潮共同推动了Token经济学的成熟。MiniMax还同步推出Coding Agent产品MiniMax Code,填补了国内相关空白。 #Anthropic #MiniMax #M3大模型 #AI开源 #CodingAgent #Token经济学 #国产大模型 #Claude #IPO #科技新闻
美国超大规模数据中心碳排放与能耗评估

一篇由Gianluca Guidi等学者提交至arXiv的预印本论文,系统评估了美国超大规模数据中心的碳排放与能源消耗状况。研究聚焦于这一快速增长的基础设施领域,通过数据分析揭示了数据中心在运行过程中产生的巨大环境足迹。论文指出,随着AI和云计算需求激增,数据中心的能耗与碳排放已成为不可忽视的环境挑战,亟需更可持续的运营策略和能源结构优化。 #碳排放 #能源消耗 #数据中心 #AI #环境 #论文 #科技研究 #超大规模数据中心
面向对话通用人工智能的动机架构

研究人员Anna Mikeda与Ben Goertzel在arXiv上提交了一篇题为“面向对话通用人工智能的动机架构”的论文。该论文提出了一种新颖的动机架构,旨在为对话式AGI系统赋予内在驱动力和目标导向能力,使其能够更自主地进行交互、学习和决策。这一架构借鉴了认知科学和心理学中的动机理论,通过设计多层次的奖励与价值系统,让AI在对话中不仅响应外部输入,还能主动探索、追求长期目标。论文初步探讨了该架构在提升对话连贯性、适应性和创造力方面的潜力,为构建更接近人类认知的通用人工智能提供了新的理论框架。该研究目前处于预印本阶段,尚未正式发表。 #AGI #对话AI #动机架构 #arXiv #人工智能 #认知科学 #BenGoertzel #AnnaMikeda #预印本
LLM驱动程序进化中的“无变异突变”

一篇题为《无变异突变:LLM驱动程序进化中的收敛动力学》的论文在arXiv上发布。研究探讨了大型语言模型(LLM)在程序进化过程中,由于缺乏变异机制而导致的收敛现象。作者通过实验发现,当LLM仅依赖现有代码进行迭代改进而不引入随机变异时,程序进化会迅速陷入局部最优,多样性丧失,最终导致进化停滞。该研究揭示了LLM在自动编程和代码生成中可能存在的局限性,为改进算法设计提供了理论依据。 #LLM #程序进化 #收敛动力学 #AI #机器学习 #论文 #arXiv