SoCRATES: Towards Reliable Automated Evaluation of Proactive LLM Mediation across Domains and Socio-cognitive Variations
Focus to learn more arXiv-issued DOI via DataCite (pending registration) Submission history From: Taewon Yun [ view email ] [v1] Thu, 4 Jun 2026 01:19:40 UTC (5,336 KB) Full-text links: Access Paper: View a PDF of the paper titled SoCRATES: Towards Reliable Automated Evaluation of Proactive LLM Mediation across Domains and Socio-cognitive Variations, by Taewon Yun and 5 other authors View PDF HTML (experimental) TeX Source view license Current browse context: < prev | next > new | recent | 2026-06 Change to browse by: cs References & Citations NASA ADS Google Scholar Semantic Scholar export BibTeX citation Loading... BibTeX formatted citation × loading... Data provided by: Bookmark Bibliographic Tools Bibliographic and Citation Tools Bibliographic Exp
Focus to learn more arXiv-issued DOI via DataCite (pending registration) Submission history From: Taewon Yun [ view email ] [v1] Thu, 4 Jun 2026 01:19:40 UTC (5,336 KB) Full-text links: Access Paper: View a PDF of the paper titled SoCRATES: Towards Reliable Automated Evaluation of Proactive LLM Mediation across Domains and Socio-cognitive Variations, by Taewon Yun and 5 other authors View PDF HTML (experimental) TeX Source view license Current browse context: < prev | next > new | recent | 2026-06 Change to browse by: cs References & Citations NASA ADS Google Scholar Semantic Scholar export BibTeX citation Loading... BibTeX formatted citation × loading... Data provided by: Bookmark Bibliographic Tools Bibliographic and Citation Tools Bibliographic Exp
lorer Toggle Bibliographic Explorer ( What is the Explorer? ) Connected Papers Toggle Connected Papers ( What is Connected Papers? ) Litmaps Toggle Litmaps ( What is Litmaps? ) Toggle scite Smart Citations ( What are Smart Citations? ) Code, Data, Media Code, Data and Media Associated with this Article alphaXiv Toggle alphaXiv ( What is alphaXiv? ) Links to Code Toggle CatalyzeX Code Finder for Papers ( What is CatalyzeX? ) DagsHub Toggle DagsHub ( What is DagsHub? ) GotitPub Toggle ( What is GotitPub? ) Huggingface Toggle Hugging Face ( What is Huggingface? ) ScienceCast Toggle ScienceCast ( What is ScienceCast? ) Demos Demos Replicate Toggle Replicate ( What is Replicate? ) Spaces Toggle Hugging Face Spaces ( What is Spaces? ) Spaces Toggle ( What is ? ) Related Papers Recommenders and Search Tools Link to Influence Flower Influence Flower ( What are Influence Flowers? ) Core recommender toggle CORE Recommender ( What is CORE? ) Author Venue Institution Topic About arXivLabs arXivLabs: experimental projects with community collaborators arXivLabs is a framework that allows collaborators to develop and share new arXiv features directly on our website. Both individuals and organizations that work with arXivLabs have embraced and accepted our values of openness, community, excellence, and user data privacy. arXiv is committed to these values and only works with partners that adhere to them. Have an idea for a project that will add value for arXiv's community? Learn more about arXivLabs .
个体收益,集体损失
一篇题为《个体收益,集体损失:AI辅助创造力中的元认知适应》的论文近日在arXiv预印本平台发布。该研究由Anna Mikeda等人完成,聚焦于人工智能辅助创造力场景下个体与集体之间的利益冲突。论文提出,当个体借助AI工具提升自身创造力时,可能因元认知适应(即个体对自身认知过程的调整)而导致集体层面的创新损失。研究通过实验或理论分析,揭示了AI辅助创作中“个体收益”与“集体损失”的悖论,并探讨了元认知机制在其中扮演的关键角色。该工作为理解AI对创意生态的长期影响提供了新视角,也引发了对AI协作中社会性后果的思考。 #AI #创造力 #元认知 #论文 #arXiv #人机协作 #创新
一篇题为《个体收益,集体损失:AI辅助创造力中的元认知适应》的论文近日在arXiv预印本平台发布。该研究由Anna Mikeda等人完成,聚焦于人工智能辅助创造力场景下个体与集体之间的利益冲突。论文提出,当个体借助AI工具提升自身创造力时,可能因元认知适应(即个体对自身认知过程的调整)而导致集体层面的创新损失。研究通过实验或理论分析,揭示了AI辅助创作中“个体收益”与“集体损失”的悖论,并探讨了元认知机制在其中扮演的关键角色。该工作为理解AI对创意生态的长期影响提供了新视角,也引发了对AI协作中社会性后果的思考。 #AI #创造力 #元认知 #论文 #arXiv #人机协作 #创新
EpiEvolve:自演化智能体实现流式疫情预测,应对机制性转变
该论文提出一种名为EpiEvolve的自演化智能体框架,用于在机制性转变(如新毒株出现、防控政策调整)下进行流式疫情预测。传统疫情预测模型通常假设历史数据模式稳定,但在实际疫情中病毒突变或社会行为变化会引发统计规律突变,导致传统模型失效。EpiEvolve通过将大规模语言模型作为核心组件,结合在线学习与记忆回放机制,使智能体能实时感知数据分布变化并动态调整预测策略。在多个真实疫情数据集上的实验表明,该方法能在机制转变发生后迅速收敛预测误差,显著优于固定模型。该研究为公共卫生决策中的动态预警提供了新思路。 #arXiv #EpiEvolve #自演化智能体 #疫情预测 #机制转变 #大语言模型 #AI
该论文提出一种名为EpiEvolve的自演化智能体框架,用于在机制性转变(如新毒株出现、防控政策调整)下进行流式疫情预测。传统疫情预测模型通常假设历史数据模式稳定,但在实际疫情中病毒突变或社会行为变化会引发统计规律突变,导致传统模型失效。EpiEvolve通过将大规模语言模型作为核心组件,结合在线学习与记忆回放机制,使智能体能实时感知数据分布变化并动态调整预测策略。在多个真实疫情数据集上的实验表明,该方法能在机制转变发生后迅速收敛预测误差,显著优于固定模型。该研究为公共卫生决策中的动态预警提供了新思路。 #arXiv #EpiEvolve #自演化智能体 #疫情预测 #机制转变 #大语言模型 #AI
研究提出严重性感知课程学习新方法,提升医学文本生成质量
近日,一篇题为《Severity-Aware Curriculum Learning with Multi-Model Response Selection for Medical Text Generation》的论文被提交至arXiv预印本平台。该研究由Ahmed Alansary等人完成,提出了一种融合严重性感知课程学习与多模型响应选择的新型医学文本生成方法。传统医学文本生成模型往往忽略疾病严重程度对输出准确性的影响,该方法通过设计课程学习策略,让模型优先学习典型病例,再逐步处理更复杂的严重病例,同时引入多模型响应选择机制,从多个候选输出中筛选最优结果。实验表明,该方法在生成临床记录、诊断报告等医疗文本时,在准确性和临床相关性上显著优于现有基准模型,有望为医疗AI的实用化提供更可靠的文本生成工具。 #AI #医学文本生成 #课程学习 #多模型 #arXiv #医疗AI #自然语言处理
近日,一篇题为《Severity-Aware Curriculum Learning with Multi-Model Response Selection for Medical Text Generation》的论文被提交至arXiv预印本平台。该研究由Ahmed Alansary等人完成,提出了一种融合严重性感知课程学习与多模型响应选择的新型医学文本生成方法。传统医学文本生成模型往往忽略疾病严重程度对输出准确性的影响,该方法通过设计课程学习策略,让模型优先学习典型病例,再逐步处理更复杂的严重病例,同时引入多模型响应选择机制,从多个候选输出中筛选最优结果。实验表明,该方法在生成临床记录、诊断报告等医疗文本时,在准确性和临床相关性上显著优于现有基准模型,有望为医疗AI的实用化提供更可靠的文本生成工具。 #AI #医学文本生成 #课程学习 #多模型 #arXiv #医疗AI #自然语言处理
PSEBench:用于评估大语言模型在患者安全事件分诊中的可控可验证基准
来自arXiv的一篇论文提出了PSEBench,这是一个专门用于评估大语言模型在患者安全事件分诊任务中表现的可控且可验证的基准。患者安全事件分诊是医疗领域的关键环节,旨在快速准确地对不良事件进行分类和处理。现有评估方法往往缺乏可控性和可验证性,PSEBench通过设计标准化测试集和评估协议,允许研究者系统性地测试LLM在不同场景下的分诊能力,包括事件严重性判断、类别划分和优先级排序。该基准还引入了验证机制,确保评估结果的可靠性和可重复性。这一工作有望推动LLM在医疗安全领域的应用落地,提升临床决策支持系统的效能。 #PSEBench #大语言模型 #患者安全 #医疗AI #基准测试 #可控性 #可验证性 #arXiv #自然语言处理
来自arXiv的一篇论文提出了PSEBench,这是一个专门用于评估大语言模型在患者安全事件分诊任务中表现的可控且可验证的基准。患者安全事件分诊是医疗领域的关键环节,旨在快速准确地对不良事件进行分类和处理。现有评估方法往往缺乏可控性和可验证性,PSEBench通过设计标准化测试集和评估协议,允许研究者系统性地测试LLM在不同场景下的分诊能力,包括事件严重性判断、类别划分和优先级排序。该基准还引入了验证机制,确保评估结果的可靠性和可重复性。这一工作有望推动LLM在医疗安全领域的应用落地,提升临床决策支持系统的效能。 #PSEBench #大语言模型 #患者安全 #医疗AI #基准测试 #可控性 #可验证性 #arXiv #自然语言处理
输出类型先于质量:基于标准的自动驾驶安全XAI可接受性评估框架
最新arXiv预印本论文《Output Type Before Quality: A Standards-Derived XAI Admissibility Rubric for Autonomous-Driving Safety》由Abhinaw Priyadershi等作者提出。该研究聚焦自动驾驶领域可解释人工智能(XAI)的可接受性评估,创新性地从行业标准出发构建评估指标体系。核心原则是“输出类型先于质量”,即判断XAI是否适用于自动驾驶安全场景时,应首先考察其输出形式是否符合标准要求,其次再评估输出内容的准确性或可理解性。该框架旨在为自动驾驶系统开发者、监管机构提供可操作的评判依据,推动XAI在安全关键应用中的合规部署。论文已通过arXiv平台发布,目前正等待数据引用注册。 #自动驾驶 #人工智能 #可解释AI #安全标准 #XAI #论文 #学术前沿
最新arXiv预印本论文《Output Type Before Quality: A Standards-Derived XAI Admissibility Rubric for Autonomous-Driving Safety》由Abhinaw Priyadershi等作者提出。该研究聚焦自动驾驶领域可解释人工智能(XAI)的可接受性评估,创新性地从行业标准出发构建评估指标体系。核心原则是“输出类型先于质量”,即判断XAI是否适用于自动驾驶安全场景时,应首先考察其输出形式是否符合标准要求,其次再评估输出内容的准确性或可理解性。该框架旨在为自动驾驶系统开发者、监管机构提供可操作的评判依据,推动XAI在安全关键应用中的合规部署。论文已通过arXiv平台发布,目前正等待数据引用注册。 #自动驾驶 #人工智能 #可解释AI #安全标准 #XAI #论文 #学术前沿
Brick-Composer
近日,一篇题为《Brick-Composer: Using MLLMs for Assembly with Diverse Bricks》的论文在arXiv上发布。该研究由Jiateng Liu等十一位作者共同完成,提出了一种基于多模态大语言模型(MLLMs)的新型积木组装方法。传统积木组装通常依赖预设规则或专门算法,难以适应形状、颜色各异的积木。Brick-Composer利用MLLM强大的视觉理解和逻辑推理能力,直接将积木图片作为输入,自动生成合理的组装步骤和结构方案。实验表明,该方法在处理多种不规则积木时表现出色,能够灵活应对组合复杂度和零件多样性问题,为机器人装配、创意构建及教育娱乐领域提供了新的技术思路。该研究展示了多模态AI在实体组装任务中的巨大潜力,有望推动智能建造与自适应制造的发展。 #arXiv #多模态大语言模型 #积木组装 #机器人 #AI #科研论文 #智能建造
近日,一篇题为《Brick-Composer: Using MLLMs for Assembly with Diverse Bricks》的论文在arXiv上发布。该研究由Jiateng Liu等十一位作者共同完成,提出了一种基于多模态大语言模型(MLLMs)的新型积木组装方法。传统积木组装通常依赖预设规则或专门算法,难以适应形状、颜色各异的积木。Brick-Composer利用MLLM强大的视觉理解和逻辑推理能力,直接将积木图片作为输入,自动生成合理的组装步骤和结构方案。实验表明,该方法在处理多种不规则积木时表现出色,能够灵活应对组合复杂度和零件多样性问题,为机器人装配、创意构建及教育娱乐领域提供了新的技术思路。该研究展示了多模态AI在实体组装任务中的巨大潜力,有望推动智能建造与自适应制造的发展。 #arXiv #多模态大语言模型 #积木组装 #机器人 #AI #科研论文 #智能建造
十位头痛专家与AI临床文献摘要能力对比研究
一项发表于arXiv的研究对十位头痛专科医生与人工智能在临床文献摘要生成方面的能力进行了系统评估与比较。研究团队选取了多篇头痛领域的临床文献,分别由十位专家和AI模型生成摘要,随后由独立评审者从准确性、完整性、可读性等维度进行盲评。初步结果显示,AI生成的摘要在某些指标上接近甚至超越专家水平,尤其在信息提取速度和一致性方面表现突出,但在处理复杂临床语境和细微差异时仍存在不足。该研究为AI辅助临床文献管理提供了重要参考,也引发了对AI在医学信息处理中角色与局限的深入讨论。 #头痛 #人工智能 #临床文献 #摘要生成 #医学AI #自然语言处理 #arXiv #研究比较
一项发表于arXiv的研究对十位头痛专科医生与人工智能在临床文献摘要生成方面的能力进行了系统评估与比较。研究团队选取了多篇头痛领域的临床文献,分别由十位专家和AI模型生成摘要,随后由独立评审者从准确性、完整性、可读性等维度进行盲评。初步结果显示,AI生成的摘要在某些指标上接近甚至超越专家水平,尤其在信息提取速度和一致性方面表现突出,但在处理复杂临床语境和细微差异时仍存在不足。该研究为AI辅助临床文献管理提供了重要参考,也引发了对AI在医学信息处理中角色与局限的深入讨论。 #头痛 #人工智能 #临床文献 #摘要生成 #医学AI #自然语言处理 #arXiv #研究比较
零知识验证可应用于前沿AI训练,研究证明其可行性
一篇发表于arXiv的论文提出,零知识验证(Zero Knowledge Verification)技术可用于验证前沿AI模型的训练过程,而无需泄露训练数据或模型参数。该研究由Pierre Peigné等人完成,于2026年6月3日提交。研究团队展示了如何通过密码学方法,在不暴露训练细节的前提下,证明AI模型确实按照特定协议进行了训练。这一突破有望解决AI安全与透明度之间的核心矛盾,为监管机构验证大型AI系统的合规性提供技术基础,同时保护商业机密和用户隐私。论文还讨论了该方法的计算开销和实际部署挑战,认为在现有硬件条件下已具备初步可行性。 #零知识验证 #AI训练 #密码学 #前沿AI #论文 #arXiv #AI安全 #隐私保护
一篇发表于arXiv的论文提出,零知识验证(Zero Knowledge Verification)技术可用于验证前沿AI模型的训练过程,而无需泄露训练数据或模型参数。该研究由Pierre Peigné等人完成,于2026年6月3日提交。研究团队展示了如何通过密码学方法,在不暴露训练细节的前提下,证明AI模型确实按照特定协议进行了训练。这一突破有望解决AI安全与透明度之间的核心矛盾,为监管机构验证大型AI系统的合规性提供技术基础,同时保护商业机密和用户隐私。论文还讨论了该方法的计算开销和实际部署挑战,认为在现有硬件条件下已具备初步可行性。 #零知识验证 #AI训练 #密码学 #前沿AI #论文 #arXiv #AI安全 #隐私保护
图引导超低位量化
近日,一篇来自arXiv的论文提出了一种名为“图引导超低位量化”的新方法,旨在最小化大语言模型在量化过程中隐藏的缩放因子成本。该研究由Rayyan Abdalla等人完成,通过引入图结构信息,在极低比特(如2比特或3比特)下实现了对大语言模型的高效量化,同时保持模型精度。传统量化方法常因缩放因子带来的额外误差导致性能下降,而新方法通过图引导优化,有效缓解了这一问题。实验表明,该方法在多种大语言模型上均能显著减少模型体积和推理内存占用,为边缘设备部署大型模型提供了可行方案。这一进展有望推动大模型在资源受限场景中的实际应用,降低企业的算力与存储成本。 #大语言模型 #模型量化 #图引导 #超低位 #AI部署 #边缘计算 #arXiv #研究论文 #模型压缩 #技术创新
近日,一篇来自arXiv的论文提出了一种名为“图引导超低位量化”的新方法,旨在最小化大语言模型在量化过程中隐藏的缩放因子成本。该研究由Rayyan Abdalla等人完成,通过引入图结构信息,在极低比特(如2比特或3比特)下实现了对大语言模型的高效量化,同时保持模型精度。传统量化方法常因缩放因子带来的额外误差导致性能下降,而新方法通过图引导优化,有效缓解了这一问题。实验表明,该方法在多种大语言模型上均能显著减少模型体积和推理内存占用,为边缘设备部署大型模型提供了可行方案。这一进展有望推动大模型在资源受限场景中的实际应用,降低企业的算力与存储成本。 #大语言模型 #模型量化 #图引导 #超低位 #AI部署 #边缘计算 #arXiv #研究论文 #模型压缩 #技术创新
Anthropic 警告 AI 递归自我改进风险
Anthropic 近日公开多项惊人数据,揭示其 AI 模型 Claude 正加速自我进化。目前公司代码库中超过 80% 的代码由 Claude 编写,工程师人均代码提交量较 2024 年增长 8 倍,员工自估效率提升约 4 倍。Claude 在优化训练代码方面,一年内提速从 3 倍飙升至 52 倍;能独立完成的任务时长每 4 个月翻倍,已从 4 分钟增至 12 小时。此外,Claude 在几周内发现全球重要系统中超 1 万个高危安全漏洞。Anthropic 强调,虽然完全的递归自我改进尚未发生,但风险不容忽视:若 AI 能自主设计并训练下一代系统,人类可能失去控制。目前人类仍在研究品味和判断力上保持优势,但 Anthropic 承认,AI 接管一切的可能性真实存在。 #Anthropic #Claude #AI #递归自我改进 #风险 #科技新闻 #人工智能 #安全
Anthropic 近日公开多项惊人数据,揭示其 AI 模型 Claude 正加速自我进化。目前公司代码库中超过 80% 的代码由 Claude 编写,工程师人均代码提交量较 2024 年增长 8 倍,员工自估效率提升约 4 倍。Claude 在优化训练代码方面,一年内提速从 3 倍飙升至 52 倍;能独立完成的任务时长每 4 个月翻倍,已从 4 分钟增至 12 小时。此外,Claude 在几周内发现全球重要系统中超 1 万个高危安全漏洞。Anthropic 强调,虽然完全的递归自我改进尚未发生,但风险不容忽视:若 AI 能自主设计并训练下一代系统,人类可能失去控制。目前人类仍在研究品味和判断力上保持优势,但 Anthropic 承认,AI 接管一切的可能性真实存在。 #Anthropic #Claude #AI #递归自我改进 #风险 #科技新闻 #人工智能 #安全
Anthropic秘密提交IPO,MiniMax冲刺A股,M3大模型成焦点
Anthropic已向美国SEC递交保密招股书,这有望成为AI产业规模最大的IPO,估值或达万亿美元。同期,MiniMax开始冲刺A股上市。在资本热潮中,MiniMax发布M3大模型,成为国内首个集齐强大Coding/Agent能力、1M上下文窗口和原生多模态能力的开源模型。M3在SWE-Bench Pro等国际基准中超越GPT-5.5和Gemini 3.1 Pro,仅次于Claude Opus 4.7,且定价极具竞争力——个人开发者每月119元可获18亿Token,仅为Claude成本的十分之一。分析认为,国产开源模型正以高性价比挑战硅谷闭源模型,而Agent风潮和视频大模型热潮共同推动了Token经济学的成熟。MiniMax还同步推出Coding Agent产品MiniMax Code,填补了国内相关空白。 #Anthropic #MiniMax #M3大模型 #AI开源 #CodingAgent #Token经济学 #国产大模型 #Claude #IPO #科技新闻
Anthropic已向美国SEC递交保密招股书,这有望成为AI产业规模最大的IPO,估值或达万亿美元。同期,MiniMax开始冲刺A股上市。在资本热潮中,MiniMax发布M3大模型,成为国内首个集齐强大Coding/Agent能力、1M上下文窗口和原生多模态能力的开源模型。M3在SWE-Bench Pro等国际基准中超越GPT-5.5和Gemini 3.1 Pro,仅次于Claude Opus 4.7,且定价极具竞争力——个人开发者每月119元可获18亿Token,仅为Claude成本的十分之一。分析认为,国产开源模型正以高性价比挑战硅谷闭源模型,而Agent风潮和视频大模型热潮共同推动了Token经济学的成熟。MiniMax还同步推出Coding Agent产品MiniMax Code,填补了国内相关空白。 #Anthropic #MiniMax #M3大模型 #AI开源 #CodingAgent #Token经济学 #国产大模型 #Claude #IPO #科技新闻