Xcode 27 Beta 原生集成谷歌 Gemini,三大 AI 编程智能体齐聚苹果平台
科技媒体 9to5Mac 报道,苹果在 Xcode 27 Beta 中新增原生谷歌 Gemini 集成,这是继 OpenAI Codex 和 Anthropic Claude Agent 之后第三个内置的 AI 编程智能体。开发者无需切换工具,即可在 Xcode 内完成构建新功能、审查代码、修复 Bug 等复杂多步骤任务。通过 Xcode Intelligence 设置面板配置 Gemini 后,该智能体能理解项目上下文,辅助生成样板代码,还能根据项目文档和文件结构更新整个项目,全面提升了开发效率。 #苹果 #Xcode #Gemini #AI编程 #智能体 #OpenAI #Claude #开发者 #科技新闻
科技媒体 9to5Mac 报道,苹果在 Xcode 27 Beta 中新增原生谷歌 Gemini 集成,这是继 OpenAI Codex 和 Anthropic Claude Agent 之后第三个内置的 AI 编程智能体。开发者无需切换工具,即可在 Xcode 内完成构建新功能、审查代码、修复 Bug 等复杂多步骤任务。通过 Xcode Intelligence 设置面板配置 Gemini 后,该智能体能理解项目上下文,辅助生成样板代码,还能根据项目文档和文件结构更新整个项目,全面提升了开发效率。 #苹果 #Xcode #Gemini #AI编程 #智能体 #OpenAI #Claude #开发者 #科技新闻
人类最后考试已不够用,Agent最后考试来了!
随着AI Agent技术的快速发展,传统的人类能力测试已无法全面评估其性能。近日,一项名为“Agent最后考试”的新型评估体系被提出,旨在测试AI Agent在复杂任务中的自主决策、多步骤推理和工具调用能力。该考试涵盖编程、数据分析、网络搜索等真实场景,要求Agent在没有人类干预的情况下完成目标。研究团队表示,现有模型在简单任务上表现良好,但在需要长期规划和环境适应性的任务中仍存在明显短板。这一评估标准的推出,将推动AI Agent从实验室走向实际应用,并引发关于AI安全与可控性的新讨论。 #AI #Agent #人工智能 #评估标准 #科技前沿
随着AI Agent技术的快速发展,传统的人类能力测试已无法全面评估其性能。近日,一项名为“Agent最后考试”的新型评估体系被提出,旨在测试AI Agent在复杂任务中的自主决策、多步骤推理和工具调用能力。该考试涵盖编程、数据分析、网络搜索等真实场景,要求Agent在没有人类干预的情况下完成目标。研究团队表示,现有模型在简单任务上表现良好,但在需要长期规划和环境适应性的任务中仍存在明显短板。这一评估标准的推出,将推动AI Agent从实验室走向实际应用,并引发关于AI安全与可控性的新讨论。 #AI #Agent #人工智能 #评估标准 #科技前沿
YZi Labs 面向多领域招募创业者,聚焦 Web3 与 AI 融合
YZi Labs 近日宣布,正在积极寻找覆盖 Web3 金融基础设施、Agentic economy、DeFi、AI 与医疗健康等方向的创业者。该机构旨在通过整合前沿技术与金融场景,推动去中心化经济与人工智能的深度结合。此次招募重点关注能够利用区块链和 AI 技术解决实际问题的创新项目,尤其是在金融基础设施、智能经济体和医疗健康领域的应用。YZi Labs 表示,将为入选的创业者提供资源支持与生态合作机会,以加速相关技术的落地与商业化。 #YZiLabs #Web3 #DeFi #AI #医疗健康 #创业 #区块链 #金融基础设施
YZi Labs 近日宣布,正在积极寻找覆盖 Web3 金融基础设施、Agentic economy、DeFi、AI 与医疗健康等方向的创业者。该机构旨在通过整合前沿技术与金融场景,推动去中心化经济与人工智能的深度结合。此次招募重点关注能够利用区块链和 AI 技术解决实际问题的创新项目,尤其是在金融基础设施、智能经济体和医疗健康领域的应用。YZi Labs 表示,将为入选的创业者提供资源支持与生态合作机会,以加速相关技术的落地与商业化。 #YZiLabs #Web3 #DeFi #AI #医疗健康 #创业 #区块链 #金融基础设施
Claude Fable 5 刚出笼,CEO 就呼吁把它关进笼子吗?
据网络流传的标题信息,Anthropic 公司最新发布的 Claude Fable 5 模型引发争议,其 CEO 在发布后公开呼吁对模型进行限制。由于原始页面加载失败(错误 521),具体细节无法获取。该事件凸显了 AI 快速发展与安全监管之间的紧张关系。 #Claude #Fable5 #AI安全 #Anthropic #科技新闻
据网络流传的标题信息,Anthropic 公司最新发布的 Claude Fable 5 模型引发争议,其 CEO 在发布后公开呼吁对模型进行限制。由于原始页面加载失败(错误 521),具体细节无法获取。该事件凸显了 AI 快速发展与安全监管之间的紧张关系。 #Claude #Fable5 #AI安全 #Anthropic #科技新闻
工程师的恐惧不是AI,而是重新变回新手
在2026年墨尔本Web Directions AI工程师大会上,一位演讲者通过历史类比揭示了当前AI工具推广中的深层阻力。他指出,工程师们并非害怕AI本身,而是害怕重新变回“新手”——那种对代码库一无所知、无法解释自己交付的内容、不得不问出本应知道答案的问题的状态。这种恐惧与1976年数学教师对计算器的抵制如出一辙:当时教师们担心学生依赖计算器会丧失基本计算能力,但后续研究表明,使用计算器的学生在标准化测试中概念知识和问题解决能力反而提升,计算技能虽有损失但总体可控。如今,AI编码工具正引发类似争议:领导层追求速度,基层工程师却因“不知道自己的价值何在”而抵触。演讲者认为,这种身份认同危机才是组织内部AI推广摩擦的真正根源,而非简单的“抗拒改变”。 #AI #工程师 #职业发展 #技术变革 #身份认同 #计算器 #历史类比 #WebDirections
在2026年墨尔本Web Directions AI工程师大会上,一位演讲者通过历史类比揭示了当前AI工具推广中的深层阻力。他指出,工程师们并非害怕AI本身,而是害怕重新变回“新手”——那种对代码库一无所知、无法解释自己交付的内容、不得不问出本应知道答案的问题的状态。这种恐惧与1976年数学教师对计算器的抵制如出一辙:当时教师们担心学生依赖计算器会丧失基本计算能力,但后续研究表明,使用计算器的学生在标准化测试中概念知识和问题解决能力反而提升,计算技能虽有损失但总体可控。如今,AI编码工具正引发类似争议:领导层追求速度,基层工程师却因“不知道自己的价值何在”而抵触。演讲者认为,这种身份认同危机才是组织内部AI推广摩擦的真正根源,而非简单的“抗拒改变”。 #AI #工程师 #职业发展 #技术变革 #身份认同 #计算器 #历史类比 #WebDirections
TerraBench:新基准测试AI智能体在地球系统异构数据中的推理能力
来自arXiv的预印本论文《TerraBench: Can Agents Reason Over Heterogeneous Earth-System Data?》由Dat Tien Nguyen等七位作者提交。该研究提出了一个名为TerraBench的新基准,专门用于评估人工智能智能体在处理和推理地球系统异构数据方面的能力。地球系统数据涵盖气象、海洋、地质等多源异构信息,现有模型往往难以有效整合与推理。TerraBench通过设计涵盖多模态、跨尺度数据的任务,测试智能体从海量、嘈杂、格式不一的数据中提取有效信息并做出合理推断的表现。初步实验表明,当前主流AI模型在此类复杂场景下仍存在显著局限,尤其在数据一致性理解和跨域知识迁移方面。该基准的发布有望推动地球科学领域AI推理能力的发展,为气候预测、灾害预警等应用提供评测工具。 #TerraBench #AI推理 #地球系统数据 #异构数据 #人工智能 #地球科学 #arXiv #智能体
来自arXiv的预印本论文《TerraBench: Can Agents Reason Over Heterogeneous Earth-System Data?》由Dat Tien Nguyen等七位作者提交。该研究提出了一个名为TerraBench的新基准,专门用于评估人工智能智能体在处理和推理地球系统异构数据方面的能力。地球系统数据涵盖气象、海洋、地质等多源异构信息,现有模型往往难以有效整合与推理。TerraBench通过设计涵盖多模态、跨尺度数据的任务,测试智能体从海量、嘈杂、格式不一的数据中提取有效信息并做出合理推断的表现。初步实验表明,当前主流AI模型在此类复杂场景下仍存在显著局限,尤其在数据一致性理解和跨域知识迁移方面。该基准的发布有望推动地球科学领域AI推理能力的发展,为气候预测、灾害预警等应用提供评测工具。 #TerraBench #AI推理 #地球系统数据 #异构数据 #人工智能 #地球科学 #arXiv #智能体
长视频RAG研究论文提出新检索策略与方法
近期,一篇题为《重新思考长视频中的RAG:检索什么以及如何使用?》的学术论文在arXiv平台上预发布,作者为Yuho Lee等8位研究者。该论文聚焦长视频场景下的检索增强生成(RAG)技术,指出传统RAG在处理时长较长、内容复杂的视频时,面临信息冗余、时序依赖和语义碎片化等核心挑战。作者系统分析了长视频中“检索什么”以及“如何利用检索结果”这两个关键问题,并提出了一套全新的检索策略与使用框架,旨在优化模型对视频内容的理解与生成质量。该工作预计将为视频问答、自动摘要、多模态对话等应用提供创新思路,并推动RAG技术在视频领域的深化发展。 #RAG #长视频 #检索增强生成 #多模态 #AI #论文 #arXiv #视频理解
近期,一篇题为《重新思考长视频中的RAG:检索什么以及如何使用?》的学术论文在arXiv平台上预发布,作者为Yuho Lee等8位研究者。该论文聚焦长视频场景下的检索增强生成(RAG)技术,指出传统RAG在处理时长较长、内容复杂的视频时,面临信息冗余、时序依赖和语义碎片化等核心挑战。作者系统分析了长视频中“检索什么”以及“如何利用检索结果”这两个关键问题,并提出了一套全新的检索策略与使用框架,旨在优化模型对视频内容的理解与生成质量。该工作预计将为视频问答、自动摘要、多模态对话等应用提供创新思路,并推动RAG技术在视频领域的深化发展。 #RAG #长视频 #检索增强生成 #多模态 #AI #论文 #arXiv #视频理解
可见光与热成像视频监控增强技术研究
该论文由Vanessa Buhrmester等学者撰写,发表于2019年SPIE Security + Defence会议,并于2026年6月提交至arXiv预印本平台。研究聚焦于可见光与热光谱范围内视频监控系统的数据增强技术,旨在提升监控系统在复杂环境下的目标识别与跟踪性能。论文系统总结了多种针对可见光图像和热成像图像的增强方法,包括几何变换、色彩调整、噪声注入等经典技术,并探讨了如何结合两者互补信息以优化模型鲁棒性。实验结果表明,合理的数据增强策略能显著改善深度学习模型在监控场景中的泛化能力,尤其对低光照、遮挡等挑战场景效果明显。该工作为安防领域视频分析提供了实用技术参考。 #视频监控 #数据增强 #可见光 #热成像 #深度学习 #安全防御
该论文由Vanessa Buhrmester等学者撰写,发表于2019年SPIE Security + Defence会议,并于2026年6月提交至arXiv预印本平台。研究聚焦于可见光与热光谱范围内视频监控系统的数据增强技术,旨在提升监控系统在复杂环境下的目标识别与跟踪性能。论文系统总结了多种针对可见光图像和热成像图像的增强方法,包括几何变换、色彩调整、噪声注入等经典技术,并探讨了如何结合两者互补信息以优化模型鲁棒性。实验结果表明,合理的数据增强策略能显著改善深度学习模型在监控场景中的泛化能力,尤其对低光照、遮挡等挑战场景效果明显。该工作为安防领域视频分析提供了实用技术参考。 #视频监控 #数据增强 #可见光 #热成像 #深度学习 #安全防御
SciR
近期一篇arXiv预印本论文提出了名为SciR的可控基准,专门用于评估大语言模型(LLMs)的科学推理能力。该基准由Pierre Beckmann等人设计,旨在克服现有科学推理基准中混杂因素多、可控性不足的问题。SciR通过精细化的任务构建和难度控制,允许研究者更系统地测试模型在物理、化学、生物等学科中的逻辑推理步骤。论文展示了该基准在多个主流LLM上的初步评测结果,揭示了模型在复杂科学推理场景下的表现差异与局限性。该工作为未来LLM在科学研究领域的应用提供了更可靠的评估工具,并有望推动模型推理能力的提升。 #科学推理 #大语言模型 #基准测试 #AI #论文 #SciR #自然语言处理
近期一篇arXiv预印本论文提出了名为SciR的可控基准,专门用于评估大语言模型(LLMs)的科学推理能力。该基准由Pierre Beckmann等人设计,旨在克服现有科学推理基准中混杂因素多、可控性不足的问题。SciR通过精细化的任务构建和难度控制,允许研究者更系统地测试模型在物理、化学、生物等学科中的逻辑推理步骤。论文展示了该基准在多个主流LLM上的初步评测结果,揭示了模型在复杂科学推理场景下的表现差异与局限性。该工作为未来LLM在科学研究领域的应用提供了更可靠的评估工具,并有望推动模型推理能力的提升。 #科学推理 #大语言模型 #基准测试 #AI #论文 #SciR #自然语言处理
Otters++:基于时间到首次脉冲的高能效光学脉冲Transformer
近日,arXiv上预印本论文《Otters++: A Time-to-first-spike Based Energy Efficient Optical Spiking Transformer》引起关注。该研究由Zhanglu Yan等8位作者共同完成,提出了一种新型光学脉冲Transformer架构,通过引入“时间到首次脉冲”编码机制,显著提升了神经形态计算的能效比。传统Transformer模型在视觉和语言任务中计算开销巨大,而这项研究将脉冲神经网络与光学计算结合,有望在低功耗边缘设备上实现高效推理。论文目前处于arXiv预印本阶段,尚未正式发表,但已提供PDF和HTML浏览。相关代码和数据资源也已开放,推动该领域进一步探索。 #光学计算 #脉冲神经网络 #Transformer #能效 #arXiv #神经形态计算
近日,arXiv上预印本论文《Otters++: A Time-to-first-spike Based Energy Efficient Optical Spiking Transformer》引起关注。该研究由Zhanglu Yan等8位作者共同完成,提出了一种新型光学脉冲Transformer架构,通过引入“时间到首次脉冲”编码机制,显著提升了神经形态计算的能效比。传统Transformer模型在视觉和语言任务中计算开销巨大,而这项研究将脉冲神经网络与光学计算结合,有望在低功耗边缘设备上实现高效推理。论文目前处于arXiv预印本阶段,尚未正式发表,但已提供PDF和HTML浏览。相关代码和数据资源也已开放,推动该领域进一步探索。 #光学计算 #脉冲神经网络 #Transformer #能效 #arXiv #神经形态计算
多智能体优势实为幻觉?新论文引发反思
据arXiv预印本显示,一篇题为《多智能体优势的幻觉》的论文由Prathyusha Jwalapuram等十位研究者提交。该研究直指当前AI领域广泛推崇的多智能体系统(如多Agent协作、群体智能)在实际任务中并未显著超越单智能体表现。通过严谨的实验与理论分析,作者发现所谓的优势可能源于评估偏差、任务设计或统计噪声,本质上是一种“幻觉”。这一结论对多智能体应用从自动驾驶到大型语言模型协同等方向提出了重要质疑,提醒学界和工业界需重新审视“人多力量大”的假设,避免陷入过度乐观的技术路线。 #arXiv #多智能体 #AI #论文 #幻觉 #人工智能 #人工智能研究 #学术前沿
据arXiv预印本显示,一篇题为《多智能体优势的幻觉》的论文由Prathyusha Jwalapuram等十位研究者提交。该研究直指当前AI领域广泛推崇的多智能体系统(如多Agent协作、群体智能)在实际任务中并未显著超越单智能体表现。通过严谨的实验与理论分析,作者发现所谓的优势可能源于评估偏差、任务设计或统计噪声,本质上是一种“幻觉”。这一结论对多智能体应用从自动驾驶到大型语言模型协同等方向提出了重要质疑,提醒学界和工业界需重新审视“人多力量大”的假设,避免陷入过度乐观的技术路线。 #arXiv #多智能体 #AI #论文 #幻觉 #人工智能 #人工智能研究 #学术前沿