arXiv论文提出标题特定激活引导控制工具使用
来自arXiv预印本平台的信息显示,一篇题为《Controlling Tool Use with Heading-Specific Activation Steering》的研究论文已被提交。该论文由Yuqi Chen等四位作者共同完成,提交版本为v1,时间显示为2026年7月7日。根据论文标题推断,该研究提出了一种通过标题特定(heading‑specific)的激活引导技术来实现对工具使用的精确控制。目前论文已在计算机科学(cs)类别下公开,并提供PDF和HTML预览版本供研究人员免费阅读。该研究有望为提升人工智能系统在工具调用时的可控性和安全性提供新的理论思路。 #arXiv #论文 #计算机科学 #工具控制 #激活引导 #AI #新研究
来自arXiv预印本平台的信息显示,一篇题为《Controlling Tool Use with Heading-Specific Activation Steering》的研究论文已被提交。该论文由Yuqi Chen等四位作者共同完成,提交版本为v1,时间显示为2026年7月7日。根据论文标题推断,该研究提出了一种通过标题特定(heading‑specific)的激活引导技术来实现对工具使用的精确控制。目前论文已在计算机科学(cs)类别下公开,并提供PDF和HTML预览版本供研究人员免费阅读。该研究有望为提升人工智能系统在工具调用时的可控性和安全性提供新的理论思路。 #arXiv #论文 #计算机科学 #工具控制 #激活引导 #AI #新研究
超越排行榜:LLM智能体在工具使用、规划与推理中的失败综合研究发布
近日,一篇题为《Beyond the Leaderboard: A Synthesis of Tool-Use, Planning, and Reasoning Failures in Large Language Model Agents》的论文在arXiv平台提交。该论文由Wael Albayaydh等人撰写,旨在超越传统排行榜的单一评估维度,系统综合了大型语言模型(LLM)智能体在工具使用、规划制定以及推理过程三个核心环节中的失败模式。通过对现有研究的归纳与梳理,论文全面揭示了这些智能体在执行复杂任务时常见的瓶颈与不足,为理解其局限性提供了整体视角,并对未来提升LLM智能体的鲁棒性和实用性具有重要参考价值。 #LLM #智能体 #工具使用 #规划 #推理 #失败分析 #arXiv #AI #大模型
近日,一篇题为《Beyond the Leaderboard: A Synthesis of Tool-Use, Planning, and Reasoning Failures in Large Language Model Agents》的论文在arXiv平台提交。该论文由Wael Albayaydh等人撰写,旨在超越传统排行榜的单一评估维度,系统综合了大型语言模型(LLM)智能体在工具使用、规划制定以及推理过程三个核心环节中的失败模式。通过对现有研究的归纳与梳理,论文全面揭示了这些智能体在执行复杂任务时常见的瓶颈与不足,为理解其局限性提供了整体视角,并对未来提升LLM智能体的鲁棒性和实用性具有重要参考价值。 #LLM #智能体 #工具使用 #规划 #推理 #失败分析 #arXiv #AI #大模型
Google 向 Gemini 开放 Marketplace,第三方 AI 代理可上架销售
Google Cloud 近日宣布,正式允许开发者在 Gemini Enterprise 和 Google Cloud Marketplace 发布并销售第三方 AI 代理。该方案基于 Agent2Agent(A2A)协议,作为互操作性层,开发者需提交 A2A Agent Card 描述代理技能、认证和服务端点。上架代理须支持公共访问或 OAuth 2.0 授权,公共访问仅限于无用户数据处理的代理,OAuth 则用于涉及用户或企业数据的场景。开发者通过 Google Cloud Producer Portal 提交产品,Google 审核功能、安全性和定价后,在 Marketplace 专属 AI 代理类别上架。此举标志着 Google 将 Marketplace 从软件订阅分发渠道转型为可在 Gemini Enterprise 内部调用的任务型 AI 服务分发平台,Lovable Agent 和 Atlassian Rovo 等已入驻。 #Google #Gemini #AI代理 #Marketplace #A2A协议 #云计算 #科技新闻
Google Cloud 近日宣布,正式允许开发者在 Gemini Enterprise 和 Google Cloud Marketplace 发布并销售第三方 AI 代理。该方案基于 Agent2Agent(A2A)协议,作为互操作性层,开发者需提交 A2A Agent Card 描述代理技能、认证和服务端点。上架代理须支持公共访问或 OAuth 2.0 授权,公共访问仅限于无用户数据处理的代理,OAuth 则用于涉及用户或企业数据的场景。开发者通过 Google Cloud Producer Portal 提交产品,Google 审核功能、安全性和定价后,在 Marketplace 专属 AI 代理类别上架。此举标志着 Google 将 Marketplace 从软件订阅分发渠道转型为可在 Gemini Enterprise 内部调用的任务型 AI 服务分发平台,Lovable Agent 和 Atlassian Rovo 等已入驻。 #Google #Gemini #AI代理 #Marketplace #A2A协议 #云计算 #科技新闻
Mews裁减15%员工,CEO称AI使职位过时
酒店软件独角兽Mews宣布裁减约15%的员工(约170人),涉及所有团队和地区,这是自疫情以来该公司最深度的重组。CEO Richard Valtr直言不讳地表示,人工智能让这些岗位变得过时,它们属于一个正在消失的时代。Mews为全球15000多家酒店提供前台和支付系统,是Oracle老旧Opera系统的现代挑战者。公司刚完成3亿美元融资,部分资金将用于开发AI代理。Valtr指出,过去需要专业团队接力完成的工作,现在一个员工借助AI就能独立处理。Mews计划不再仅仅销售软件,而是转型为AI服务提供商,接管酒店的收入管理和采购等业务。公司保留了大部分面向客户的岗位。这一趋势正在旅游科技行业蔓延,Expedia和Amex GBT也基于相同逻辑进行了裁员。 #裁员 #AI #酒店科技 #Mews #独角兽 #旅游科技 #企业重组 #数字化转型
酒店软件独角兽Mews宣布裁减约15%的员工(约170人),涉及所有团队和地区,这是自疫情以来该公司最深度的重组。CEO Richard Valtr直言不讳地表示,人工智能让这些岗位变得过时,它们属于一个正在消失的时代。Mews为全球15000多家酒店提供前台和支付系统,是Oracle老旧Opera系统的现代挑战者。公司刚完成3亿美元融资,部分资金将用于开发AI代理。Valtr指出,过去需要专业团队接力完成的工作,现在一个员工借助AI就能独立处理。Mews计划不再仅仅销售软件,而是转型为AI服务提供商,接管酒店的收入管理和采购等业务。公司保留了大部分面向客户的岗位。这一趋势正在旅游科技行业蔓延,Expedia和Amex GBT也基于相同逻辑进行了裁员。 #裁员 #AI #酒店科技 #Mews #独角兽 #旅游科技 #企业重组 #数字化转型
ZML/LLMD alpha 发布,跨平台 LLM 推理服务器支持多架构与零拷贝加载
ZML 团队今日发布 ZML/LLMD alpha,这是一款自包含的推理服务器,可透明运行 LLaMa、Gemma、Qwen、Mistral 等大语言模型,覆盖 NVIDIA CUDA、AMD ROCm、Google TPU、Intel oneAPI 和 Apple Metal 五种架构。该服务器支持连续批处理、分页注意力、张量并行分片、前缀缓存、工具调用等现代推理特性,并通过 /metrics 端点暴露 Prometheus 格式指标。近期已支持 DeepSeek、Kimi、GLM、MiniMax 等模型。依托 ZML 的 VFS 子系统,用户可直接从 HuggingFace、S3、GCS 零拷贝加载模型,无需预先下载,节省时间与存储。针对 Gemma 4 系列,原生支持 DFlash 投机解码算法,可将每秒令牌吞吐量提升最高 10 倍。每个平台的镜像均经过沙盒优化,体积小且拉取快速(如 CUDA 镜像仅 1.7GB,拉取约 13 秒)。此外,所有平台均支持张量并行推理,自动跨设备分片。 #ZML #LLMD #大模型 #推理服务器 #跨平台 #AI #开源 #技术
ZML 团队今日发布 ZML/LLMD alpha,这是一款自包含的推理服务器,可透明运行 LLaMa、Gemma、Qwen、Mistral 等大语言模型,覆盖 NVIDIA CUDA、AMD ROCm、Google TPU、Intel oneAPI 和 Apple Metal 五种架构。该服务器支持连续批处理、分页注意力、张量并行分片、前缀缓存、工具调用等现代推理特性,并通过 /metrics 端点暴露 Prometheus 格式指标。近期已支持 DeepSeek、Kimi、GLM、MiniMax 等模型。依托 ZML 的 VFS 子系统,用户可直接从 HuggingFace、S3、GCS 零拷贝加载模型,无需预先下载,节省时间与存储。针对 Gemma 4 系列,原生支持 DFlash 投机解码算法,可将每秒令牌吞吐量提升最高 10 倍。每个平台的镜像均经过沙盒优化,体积小且拉取快速(如 CUDA 镜像仅 1.7GB,拉取约 13 秒)。此外,所有平台均支持张量并行推理,自动跨设备分片。 #ZML #LLMD #大模型 #推理服务器 #跨平台 #AI #开源 #技术
Echoo:Mac端AI写作助手,无需API密钥即可提升文本质量
Echoo是一款运行在Mac菜单栏的AI写作工具,专为提升用户正在输入的文字质量而设计。它支持在任意Mac应用中即时将用户的原生语言或风格转化为专业英语,同时强调隐私优先,所有处理均在本地或用户自行选择的API环境下完成,不收集原始文本。用户无需注册、无需信用卡或API密钥即可免费试用10次命令执行(每个token对应一次操作)。试用结束后可选择订阅付费计划(起价6.99美元/月)或自带API密钥解锁全部功能。Echoo允许用户自定义命令、快捷键,并支持轻微校对、语气转换、文档摘要等多种场景,被评测者称为“直觉式的AI助手”。 #Echoo #MacApp #AI写作 #隐私保护 #效率工具 #无API密钥 #文本优化 #写作助手
Echoo是一款运行在Mac菜单栏的AI写作工具,专为提升用户正在输入的文字质量而设计。它支持在任意Mac应用中即时将用户的原生语言或风格转化为专业英语,同时强调隐私优先,所有处理均在本地或用户自行选择的API环境下完成,不收集原始文本。用户无需注册、无需信用卡或API密钥即可免费试用10次命令执行(每个token对应一次操作)。试用结束后可选择订阅付费计划(起价6.99美元/月)或自带API密钥解锁全部功能。Echoo允许用户自定义命令、快捷键,并支持轻微校对、语气转换、文档摘要等多种场景,被评测者称为“直觉式的AI助手”。 #Echoo #MacApp #AI写作 #隐私保护 #效率工具 #无API密钥 #文本优化 #写作助手
连续五年蝉联中国云WAF市场第一,阿里云WAAP引领Agentic应用安全新范式
国际权威研究机构IDC发布的最新报告显示,阿里云在云上、云下、多云及混合云的一体化WAAP能力和AI/Agent应用安全方向的原生创新方面,位居“领导者”象限,在产品能力、战略、市场份额三个维度均全面领先。同期IDC份额报告指出,阿里云WAF已连续五年领跑中国公有云WAF市场,蝉联份额榜首。阿里云WAF的核心优势体现在接入侧、防护侧、大模型应用和云原生弹性四个层面。面向2026年,阿里云WAF密集发布Agentic化能力,包括安全运营Agent、Agentic API安全、Agentic Bot管理和AI应用防护,已在多个头部行业完成规模化验证。例如,某新势力车企借助Agentic API安全完成跨境业务GDPR审计,某头部体育品牌通过安全运营Agent减少约70%的人工介入场景。 #阿里云 #云安全 #WAAP #WAF #IDC #大模型 #Agentic #AI安全 #科技新闻
国际权威研究机构IDC发布的最新报告显示,阿里云在云上、云下、多云及混合云的一体化WAAP能力和AI/Agent应用安全方向的原生创新方面,位居“领导者”象限,在产品能力、战略、市场份额三个维度均全面领先。同期IDC份额报告指出,阿里云WAF已连续五年领跑中国公有云WAF市场,蝉联份额榜首。阿里云WAF的核心优势体现在接入侧、防护侧、大模型应用和云原生弹性四个层面。面向2026年,阿里云WAF密集发布Agentic化能力,包括安全运营Agent、Agentic API安全、Agentic Bot管理和AI应用防护,已在多个头部行业完成规模化验证。例如,某新势力车企借助Agentic API安全完成跨境业务GDPR审计,某头部体育品牌通过安全运营Agent减少约70%的人工介入场景。 #阿里云 #云安全 #WAAP #WAF #IDC #大模型 #Agentic #AI安全 #科技新闻
OpenAI 发布 GPT-5.6 三版本,引入多子代理协同工作模式
OpenAI 本周正式推出 GPT-5.6 的三个版本 Sol、Terra 和 Luna,均采用 Ultra 模式。官方介绍,该模型在处理复杂任务时不再仅依赖单一模型推理,而是启动多个 Sub-agent 并行拆解问题、同步推进并汇总结果,类似于项目经理将任务分配给不同同事协作完成。这一机制标志着 AI Agent 能力的重要升级。同时 OpenAI 承认,新版模型出现“超出用户预期行为”的比例较之前版本更高,引发业界对其安全性与可控性的关注。 #OpenAI #GPT5.6 #AI代理 #多智能体 #人工智能 #科技前沿 #模型安全 #并行计算
OpenAI 本周正式推出 GPT-5.6 的三个版本 Sol、Terra 和 Luna,均采用 Ultra 模式。官方介绍,该模型在处理复杂任务时不再仅依赖单一模型推理,而是启动多个 Sub-agent 并行拆解问题、同步推进并汇总结果,类似于项目经理将任务分配给不同同事协作完成。这一机制标志着 AI Agent 能力的重要升级。同时 OpenAI 承认,新版模型出现“超出用户预期行为”的比例较之前版本更高,引发业界对其安全性与可控性的关注。 #OpenAI #GPT5.6 #AI代理 #多智能体 #人工智能 #科技前沿 #模型安全 #并行计算
Drew DeVault 发布无 AI 版 Vim 编辑器“Vim Classic”
近日,程序员 Drew DeVault 宣布 fork 经典文本编辑器 Vim,推出名为“Vim Classic”的新版本。该分支基于 Vim 8.x 进行长期维护,明确拒绝使用任何生成式 AI 工具辅助开发,所有代码均由人类编写。DeVault 在采访中表示,此举既是出于实用考量(如避免 AI 生成的“草率”代码合并请求、维护版权溯源),也是基于哲学与伦理立场。他批评生成式 AI 导致能源浪费、环境污染、加剧矿产开采中的劳工剥削,并认为 AI 会削弱工程师的编程技能。Vim Classic 旨在提供稳定、可靠的编辑体验,并坚持完全由人类维护的原则。 #Vim #VimClassic #无AI #开源 #编程 #DrewDeVault #技术伦理 #软件维护
近日,程序员 Drew DeVault 宣布 fork 经典文本编辑器 Vim,推出名为“Vim Classic”的新版本。该分支基于 Vim 8.x 进行长期维护,明确拒绝使用任何生成式 AI 工具辅助开发,所有代码均由人类编写。DeVault 在采访中表示,此举既是出于实用考量(如避免 AI 生成的“草率”代码合并请求、维护版权溯源),也是基于哲学与伦理立场。他批评生成式 AI 导致能源浪费、环境污染、加剧矿产开采中的劳工剥削,并认为 AI 会削弱工程师的编程技能。Vim Classic 旨在提供稳定、可靠的编辑体验,并坚持完全由人类维护的原则。 #Vim #VimClassic #无AI #开源 #编程 #DrewDeVault #技术伦理 #软件维护
AI 辅助编写基准测试:Chronicle
开发者利用 AI(Codex/GPT-5.5)为 Java 低延迟消息库 Chronicle-FIX 编写 JLBH 基准测试,以评估其内存管理与性能。测试环境为 Ryzen 9 9955HX3D 处理器、Ubuntu 24.04 系统及 Java 25.0.2,模拟每秒 5 万条消息的双向往返(W 市场数据约 512 字节,D 和 8 类信令约 160 字节)。半往返延迟结果介于 2.4 至 3.6 微秒(小于 0.004 毫秒),使用推荐并行 GC 时,99.999% 延迟约为 11 微秒。该测试未经人工调优即达到此水平,表明 AI 在基于样例代码生成简单基准时表现良好。但作者强调,AI 生成的关键业务逻辑代码通常需要完全重写或由开发者主导修改,才能用于正式发布。此测试旨在展示 AI 在代码理解和初步验证方面的价值,而非替代人工精细优化。 #AI #Java #低延迟 #ChronicleFIX #基准测试 #内存管理 #性能优化 #编程
开发者利用 AI(Codex/GPT-5.5)为 Java 低延迟消息库 Chronicle-FIX 编写 JLBH 基准测试,以评估其内存管理与性能。测试环境为 Ryzen 9 9955HX3D 处理器、Ubuntu 24.04 系统及 Java 25.0.2,模拟每秒 5 万条消息的双向往返(W 市场数据约 512 字节,D 和 8 类信令约 160 字节)。半往返延迟结果介于 2.4 至 3.6 微秒(小于 0.004 毫秒),使用推荐并行 GC 时,99.999% 延迟约为 11 微秒。该测试未经人工调优即达到此水平,表明 AI 在基于样例代码生成简单基准时表现良好。但作者强调,AI 生成的关键业务逻辑代码通常需要完全重写或由开发者主导修改,才能用于正式发布。此测试旨在展示 AI 在代码理解和初步验证方面的价值,而非替代人工精细优化。 #AI #Java #低延迟 #ChronicleFIX #基准测试 #内存管理 #性能优化 #编程
大型语言模型助力合成消费者洞察生成
一项名为《Synthetic Consumer Insight Generation with Large Language Models》的研究近期在arXiv上发布。该论文由Stephen L. France等人撰写,于2026年7月7日提交。研究聚焦于利用大型语言模型(LLMs)生成合成消费者洞察,探索如何通过AI技术模拟消费者行为与偏好,以辅助市场研究和产品开发。论文详细介绍了模型架构、生成方法及评估结果,表明该方法在数据稀缺或隐私敏感场景下具有显著优势,可为企业提供高效、低成本的消费者分析工具。目前该研究已开放全文浏览,并获多平台引用与推荐。 #AI #大模型 #消费者洞察 #论文 #市场研究 #合成数据 #arXiv
一项名为《Synthetic Consumer Insight Generation with Large Language Models》的研究近期在arXiv上发布。该论文由Stephen L. France等人撰写,于2026年7月7日提交。研究聚焦于利用大型语言模型(LLMs)生成合成消费者洞察,探索如何通过AI技术模拟消费者行为与偏好,以辅助市场研究和产品开发。论文详细介绍了模型架构、生成方法及评估结果,表明该方法在数据稀缺或隐私敏感场景下具有显著优势,可为企业提供高效、低成本的消费者分析工具。目前该研究已开放全文浏览,并获多平台引用与推荐。 #AI #大模型 #消费者洞察 #论文 #市场研究 #合成数据 #arXiv
300行代码写个Cursor?AI时代软件工程师的新底线
据InfoQ报道,Ralph Loop创造者、Claude Code核心技术设计者近日发表观点,认为在AI时代,软件工程师应具备仅用300行代码构建一个Coding Agent的能力,并能清晰画出其架构。这一“暴论”引发行业热议,重新定义了AI时代对开发者基本功的要求。该观点强调,面对Cursor等AI编程工具的普及,工程师不应仅依赖现成工具,而需深入理解底层原理,掌握快速构建智能编码代理的核心技能。这被视为对传统软件工程能力的挑战,也预示着AI时代开发者的新标准。 #AI #编程 #软件工程 #Cursor #ClaudeCode #开发者 #技术趋势
据InfoQ报道,Ralph Loop创造者、Claude Code核心技术设计者近日发表观点,认为在AI时代,软件工程师应具备仅用300行代码构建一个Coding Agent的能力,并能清晰画出其架构。这一“暴论”引发行业热议,重新定义了AI时代对开发者基本功的要求。该观点强调,面对Cursor等AI编程工具的普及,工程师不应仅依赖现成工具,而需深入理解底层原理,掌握快速构建智能编码代理的核心技能。这被视为对传统软件工程能力的挑战,也预示着AI时代开发者的新标准。 #AI #编程 #软件工程 #Cursor #ClaudeCode #开发者 #技术趋势