OpenAI GPT-5.6 Sol、Terra 和 Luna 登陆 Amazon Bedrock
OpenAI 最新一代模型 GPT-5.6 的三个版本——Sol、Terra 和 Luna——已在 Amazon Bedrock 上正式可用。Sol 是旗舰推理模型,适合自主编码代理和长程推理;Terra 平衡性能与成本,适用于日常生产工作;Luna 则面向高吞吐、低延迟推理场景。三个模型均支持文本和图像输入、272K 上下文窗口,并通过 OpenAI Responses API 在 bedrock-mantle 端点提供访问。定价与 OpenAI 官方一致,使用量计入现有 AWS 承诺额度,且推理数据仅保留用于安全检测,不会用于模型训练。用户可通过 OpenAI Python 和 TypeScript SDK 直接调用,并在 AWS IAM 策略和 VPC 内运行,满足数据驻留要求。 #OpenAI #GPT56 #AmazonBedrock #大模型 #AI #云计算 #推理模型 #Sol #Terra #Luna
OpenAI 最新一代模型 GPT-5.6 的三个版本——Sol、Terra 和 Luna——已在 Amazon Bedrock 上正式可用。Sol 是旗舰推理模型,适合自主编码代理和长程推理;Terra 平衡性能与成本,适用于日常生产工作;Luna 则面向高吞吐、低延迟推理场景。三个模型均支持文本和图像输入、272K 上下文窗口,并通过 OpenAI Responses API 在 bedrock-mantle 端点提供访问。定价与 OpenAI 官方一致,使用量计入现有 AWS 承诺额度,且推理数据仅保留用于安全检测,不会用于模型训练。用户可通过 OpenAI Python 和 TypeScript SDK 直接调用,并在 AWS IAM 策略和 VPC 内运行,满足数据驻留要求。 #OpenAI #GPT56 #AmazonBedrock #大模型 #AI #云计算 #推理模型 #Sol #Terra #Luna
表格大模型崛起
一种名为“表格大模型”(tabular LLMs)的新型预测模型正在颠覆传统数据分析方式。这类模型无需针对用户数据进行训练,即可像语言模型补全文本一样,零样本预测表格中缺失的列。在TabArena排行榜上,所有单模型超越最优化梯度提升树的记录均来自此类模型。作者在自有硬件上独立复现了最强开放权重模型TabICLv2,使用51个数据集的标准协议,耗时2.1小时(成本约2美元)完成验证。结果显示其性能与官方数据高度吻合,中位数相对差异仅0.08%,证实了排行榜的有效性。表格基础模型本质上是经过预训练的Transformer,通过上下文学习(in-context learning)工作:将已知标签的行作为上下文,模型通过注意力机制计算与待预测行的相似度并给出加权答案。近年来该家族快速壮大,包括TabPFN、TabICL系列、TabDPT及谷歌的TabFM等。尽管被称为“表格LLM”,但这些模型并非处理语言,而是直接处理表格中的单元格、列和行,使用无固定词汇表的数值与类别数据。 #表格大模型 #TabLLM #基础模型 #零样本预测 #机器学习 #AI #TabArena #TabICLv2
一种名为“表格大模型”(tabular LLMs)的新型预测模型正在颠覆传统数据分析方式。这类模型无需针对用户数据进行训练,即可像语言模型补全文本一样,零样本预测表格中缺失的列。在TabArena排行榜上,所有单模型超越最优化梯度提升树的记录均来自此类模型。作者在自有硬件上独立复现了最强开放权重模型TabICLv2,使用51个数据集的标准协议,耗时2.1小时(成本约2美元)完成验证。结果显示其性能与官方数据高度吻合,中位数相对差异仅0.08%,证实了排行榜的有效性。表格基础模型本质上是经过预训练的Transformer,通过上下文学习(in-context learning)工作:将已知标签的行作为上下文,模型通过注意力机制计算与待预测行的相似度并给出加权答案。近年来该家族快速壮大,包括TabPFN、TabICL系列、TabDPT及谷歌的TabFM等。尽管被称为“表格LLM”,但这些模型并非处理语言,而是直接处理表格中的单元格、列和行,使用无固定词汇表的数值与类别数据。 #表格大模型 #TabLLM #基础模型 #零样本预测 #机器学习 #AI #TabArena #TabICLv2
多代理系统负载感知缓存研究论文提交至arXiv
近日,一篇题为《Workload-Aware Caching for Multi-Agent Systems》的研究论文被提交至arXiv预印本平台。该论文由Anas Mohamed等六位作者共同完成,于2026年6月14日发布。论文聚焦于多代理系统中的缓存优化问题,提出了一种负载感知的缓存策略,通过动态感知各代理的工作负载来调整缓存分配,旨在提升系统整体效率和响应速度。该工作属于计算机科学领域,目前论文全文已开放访问,为分布式AI和物联网等场景中的代理协作提供了新的研究思路。 #多代理系统 #负载感知 #缓存 #人工智能 #arXiv #计算机科学 #研究论文
近日,一篇题为《Workload-Aware Caching for Multi-Agent Systems》的研究论文被提交至arXiv预印本平台。该论文由Anas Mohamed等六位作者共同完成,于2026年6月14日发布。论文聚焦于多代理系统中的缓存优化问题,提出了一种负载感知的缓存策略,通过动态感知各代理的工作负载来调整缓存分配,旨在提升系统整体效率和响应速度。该工作属于计算机科学领域,目前论文全文已开放访问,为分布式AI和物联网等场景中的代理协作提供了新的研究思路。 #多代理系统 #负载感知 #缓存 #人工智能 #arXiv #计算机科学 #研究论文
AISE-Bench:面向学术知识图谱信息检索的全周期基准测试
近日,一篇发表于ACM SIGKDD 2026的论文提出了AISE-Bench,这是一个专为学术知识图谱上的信息检索任务设计的全周期策划基准。该基准由Fanjin Zhang等10位作者共同完成,旨在系统评估模型在学术知识图谱中查找、推理和整合信息的能力。AISE-Bench覆盖了从查询理解到答案生成的完整流程,包含精心构建的测试集和评估指标,为相关研究提供了标准化评测平台。研究团队已在arXiv上公开论文全文及数据资源,以推动学术知识图谱信息检索领域的进展。 #学术知识图谱 #信息检索 #基准测试 #KDD2026 #AI #知识图谱 #科研工具
近日,一篇发表于ACM SIGKDD 2026的论文提出了AISE-Bench,这是一个专为学术知识图谱上的信息检索任务设计的全周期策划基准。该基准由Fanjin Zhang等10位作者共同完成,旨在系统评估模型在学术知识图谱中查找、推理和整合信息的能力。AISE-Bench覆盖了从查询理解到答案生成的完整流程,包含精心构建的测试集和评估指标,为相关研究提供了标准化评测平台。研究团队已在arXiv上公开论文全文及数据资源,以推动学术知识图谱信息检索领域的进展。 #学术知识图谱 #信息检索 #基准测试 #KDD2026 #AI #知识图谱 #科研工具
新论文提出FlowEdit
近日,一篇题为《FlowEdit: Information-Theoretic Control of LLM Reasoning Flows for Ill-posed Problems Involving Conflicts》的学术论文在arXiv平台发布。该研究由Sizhe Tang等六位作者共同完成,针对大语言模型(LLM)在处理涉及冲突的不当问题(ill-posed problems)时推理能力不足的挑战,提出了一种名为FlowEdit的新方法。FlowEdit从信息论角度入手,通过控制LLM的推理流(reasoning flows),引导模型在矛盾信息中做出更合理、稳健的判断。实验表明,该方法能有效提升LLM在复杂冲突场景下的推理准确性和鲁棒性,为未来构建更可靠、能应对真实世界模糊问题的AI系统提供了新的理论框架与技术路径。 #AI #大模型 #LLM #推理 #信息论 #论文 #FlowEdit #arXiv
近日,一篇题为《FlowEdit: Information-Theoretic Control of LLM Reasoning Flows for Ill-posed Problems Involving Conflicts》的学术论文在arXiv平台发布。该研究由Sizhe Tang等六位作者共同完成,针对大语言模型(LLM)在处理涉及冲突的不当问题(ill-posed problems)时推理能力不足的挑战,提出了一种名为FlowEdit的新方法。FlowEdit从信息论角度入手,通过控制LLM的推理流(reasoning flows),引导模型在矛盾信息中做出更合理、稳健的判断。实验表明,该方法能有效提升LLM在复杂冲突场景下的推理准确性和鲁棒性,为未来构建更可靠、能应对真实世界模糊问题的AI系统提供了新的理论框架与技术路径。 #AI #大模型 #LLM #推理 #信息论 #论文 #FlowEdit #arXiv
MKEvolve
近日,一篇题为《MKEvolve: A Modular Multi-Agent Framework for Kernel Code Generation》的论文在arXiv平台发布。该论文由Jinsoo Yoo等人撰写,提出了一种模块化多智能体框架,旨在自动化操作系统内核代码的生成过程。传统内核开发高度依赖人工编写,任务复杂且易错;MKEvolve通过将代码生成任务拆解,并让多个专用智能体协作完成模块构建与整合,有望提升开发效率与代码可靠性。这一研究将多智能体协作机制引入系统底层软件生成领域,为操作系统自动构建与内核编程工具的发展提供了新思路。 #MKEvolve #内核代码生成 #多智能体框架 #模块化设计 #AI #代码自动化 #操作系统 #arXiv #论文
近日,一篇题为《MKEvolve: A Modular Multi-Agent Framework for Kernel Code Generation》的论文在arXiv平台发布。该论文由Jinsoo Yoo等人撰写,提出了一种模块化多智能体框架,旨在自动化操作系统内核代码的生成过程。传统内核开发高度依赖人工编写,任务复杂且易错;MKEvolve通过将代码生成任务拆解,并让多个专用智能体协作完成模块构建与整合,有望提升开发效率与代码可靠性。这一研究将多智能体协作机制引入系统底层软件生成领域,为操作系统自动构建与内核编程工具的发展提供了新思路。 #MKEvolve #内核代码生成 #多智能体框架 #模块化设计 #AI #代码自动化 #操作系统 #arXiv #论文
因子化概率分布可比性研究论文在arXiv发表
据arXiv平台信息,一篇题为《Inducing Comparability of Factorised Probability Distributions》的学术论文于2026年6月提交,作者包括Jan Speller、Malte Luttermann、Marcel Gehrke和Tanya Braun。该论文聚焦于因子化概率分布的可比性问题,这类分布是概率图模型与机器学习中的核心工具,但不同分布间的直接比较长期缺乏有效手段。研究提出一种系统性方法,通过数学结构诱导分布间的可比性,有望提升概率推理、不确定建模及决策分析等任务的效率与一致性。目前论文提供PDF与HTML全文下载,并配有多种学术工具链接。 #因子化概率分布 #可比性 #机器学习 #概率推理 #arXiv #计算机科学 #学术论文
据arXiv平台信息,一篇题为《Inducing Comparability of Factorised Probability Distributions》的学术论文于2026年6月提交,作者包括Jan Speller、Malte Luttermann、Marcel Gehrke和Tanya Braun。该论文聚焦于因子化概率分布的可比性问题,这类分布是概率图模型与机器学习中的核心工具,但不同分布间的直接比较长期缺乏有效手段。研究提出一种系统性方法,通过数学结构诱导分布间的可比性,有望提升概率推理、不确定建模及决策分析等任务的效率与一致性。目前论文提供PDF与HTML全文下载,并配有多种学术工具链接。 #因子化概率分布 #可比性 #机器学习 #概率推理 #arXiv #计算机科学 #学术论文
优化超图RAG:arXiv新论文聚焦事实提取与分块检索
一篇题为《Optimizing Hypergraph-Based RAG: Toward Better Fact Extraction and Chunk Retrieval》的论文于2026年7月2日提交至arXiv预印本平台。该论文由Houda Khrouf等研究人员撰写,聚焦于基于超图结构的检索增强生成(RAG)优化问题。针对传统RAG在事实提取与分块检索中存在的精度和效率瓶颈,作者提出通过超图对文本中的实体、关系及上下文连接进行高阶建模,从而改善检索质量与知识对齐效果。论文虽尚未完成DataCite注册,但已提供PDF全文预览。这一研究有望为RAG框架在知识密集型任务中的应用提供新的方法论支持,对提升大模型外部知识融合能力具有参考价值。 #arXiv #论文 #RAG #超图 #事实提取 #分块检索 #AI #大模型 #知识检索 #优化
一篇题为《Optimizing Hypergraph-Based RAG: Toward Better Fact Extraction and Chunk Retrieval》的论文于2026年7月2日提交至arXiv预印本平台。该论文由Houda Khrouf等研究人员撰写,聚焦于基于超图结构的检索增强生成(RAG)优化问题。针对传统RAG在事实提取与分块检索中存在的精度和效率瓶颈,作者提出通过超图对文本中的实体、关系及上下文连接进行高阶建模,从而改善检索质量与知识对齐效果。论文虽尚未完成DataCite注册,但已提供PDF全文预览。这一研究有望为RAG框架在知识密集型任务中的应用提供新的方法论支持,对提升大模型外部知识融合能力具有参考价值。 #arXiv #论文 #RAG #超图 #事实提取 #分块检索 #AI #大模型 #知识检索 #优化