Function Calling 入门
大模型在对话之外,如何实现“办事”能力?Function Calling(函数调用)正是关键。本文解析了模型调用工具时的底层机制:模型通过识别用户意图,匹配预定义的工具函数并生成参数,再由系统执行并返回结果。一份工具定义由函数名、描述和参数三部分组成,其中描述质量直接影响调用准确率。当工具报错时,系统需设计降级策略,如提示用户重试或提供替代方案。文章还以“查订单状态”为例,演示了从用户输入到工具调用的完整流程。 #FunctionCalling #大模型 #工具调用 #AI #技术教程
大模型在对话之外,如何实现“办事”能力?Function Calling(函数调用)正是关键。本文解析了模型调用工具时的底层机制:模型通过识别用户意图,匹配预定义的工具函数并生成参数,再由系统执行并返回结果。一份工具定义由函数名、描述和参数三部分组成,其中描述质量直接影响调用准确率。当工具报错时,系统需设计降级策略,如提示用户重试或提供替代方案。文章还以“查订单状态”为例,演示了从用户输入到工具调用的完整流程。 #FunctionCalling #大模型 #工具调用 #AI #技术教程
AI 幻想角色对战平台 DreadPit
一款名为 DreadPit 的在线游戏将创意写作与 AI 视觉识别结合,打造出独特的幻想角色竞技场。用户只需用不超过两百字的文字描述一位战士,系统便会自动生成两幅肖像供挑选,随后该角色被投入“竞技深渊”。每天两次(格林威治正午),AI 裁判“仲裁者”会根据角色肖像进行图像识别判决,相邻排名者自动配对,败者将被永久删除,其肖像和召唤词被封存入墓地。目前已有 7174 个角色被召唤,其中仅 186 个仍存活,AI 已做出 11202 次判决。该平台融合了文字创作、AI 生成与竞技生存机制,让用户的想象力在规则严酷的擂台上接受考验。 #AI #游戏 #创意写作 #对战 #数字艺术 #幻想 #竞技
一款名为 DreadPit 的在线游戏将创意写作与 AI 视觉识别结合,打造出独特的幻想角色竞技场。用户只需用不超过两百字的文字描述一位战士,系统便会自动生成两幅肖像供挑选,随后该角色被投入“竞技深渊”。每天两次(格林威治正午),AI 裁判“仲裁者”会根据角色肖像进行图像识别判决,相邻排名者自动配对,败者将被永久删除,其肖像和召唤词被封存入墓地。目前已有 7174 个角色被召唤,其中仅 186 个仍存活,AI 已做出 11202 次判决。该平台融合了文字创作、AI 生成与竞技生存机制,让用户的想象力在规则严酷的擂台上接受考验。 #AI #游戏 #创意写作 #对战 #数字艺术 #幻想 #竞技
OpenAI 发布 GPT-5.6 Sol,智能代理编程代币消耗降低 54%
OpenAI 正式推出 GPT-5.6 系列,其中 Sol 模型在“智能代理”编程场景下将代币消耗削减 54%,显著提升成本效益。CEO Sam Altman 在接受 CNBC 采访时表示,该模型在能力上已不逊于甚至优于主要竞品,本轮发布重点聚焦“成本-效益”维度,回应企业用户对 AI 支出回报的精算需求。Altman 透露,在审批阶段,OpenAI 与美国商务部长、财政部长及白宫网络总监等官员进行了密集协作,政府测试后列出风险清单,公司逐项修正。他强调,若模型足够强大,必须对安全承诺有高度把握,否则全球社会对 AI 的不安情绪将迅速累积。此次发布正值 OpenAI 与特朗普政府就潜在“政府持股”方案初步沟通,Altman 淡化了此前关于政府持股 5% 报道的准确性。同时,行业竞争加剧:Meta 发布 Muse Spark 1.1,SpaceX 收购 xAI 后发射 Grok 4.5。OpenAI 自 2022 年 ChatGPT 推出后成为 AI 核心玩家,推动全球大模型军备竞赛全面升温。 #OpenAI #GPT5.6 #Sol #智能代理 #AI #大模型 #成本效率 #安全评估 #全球监管
OpenAI 正式推出 GPT-5.6 系列,其中 Sol 模型在“智能代理”编程场景下将代币消耗削减 54%,显著提升成本效益。CEO Sam Altman 在接受 CNBC 采访时表示,该模型在能力上已不逊于甚至优于主要竞品,本轮发布重点聚焦“成本-效益”维度,回应企业用户对 AI 支出回报的精算需求。Altman 透露,在审批阶段,OpenAI 与美国商务部长、财政部长及白宫网络总监等官员进行了密集协作,政府测试后列出风险清单,公司逐项修正。他强调,若模型足够强大,必须对安全承诺有高度把握,否则全球社会对 AI 的不安情绪将迅速累积。此次发布正值 OpenAI 与特朗普政府就潜在“政府持股”方案初步沟通,Altman 淡化了此前关于政府持股 5% 报道的准确性。同时,行业竞争加剧:Meta 发布 Muse Spark 1.1,SpaceX 收购 xAI 后发射 Grok 4.5。OpenAI 自 2022 年 ChatGPT 推出后成为 AI 核心玩家,推动全球大模型军备竞赛全面升温。 #OpenAI #GPT5.6 #Sol #智能代理 #AI #大模型 #成本效率 #安全评估 #全球监管
AI PC/Mac GPU 快速选型列表发布,Apple 与 AMD 新品价格曝光
一份专注于 AI 工作负载的 PC/Mac GPU 快速选型列表近日更新,汇总了市场上多款主流产品的价格与配置。列表中包含 Apple Mac mini M4(16GB 内存,999 美元)、Mac Studio M4 Max(36GB,2499 美元)以及 M1 Max 翻新机等。AMD 阵营的 AI Max+ 395 系列备受关注,从 64GB 版本(1999 美元起)到 128GB 版本(3262 美元起),搭载 Radeon 8060S 显卡,出现在 GMKtec、MINISFORUM、ASUS ROG Flow Z13 等设备中。NVIDIA 的 GB10 Grace Blackwell 双路版本也位列其中。该列表旨在帮助用户对比不同 AI PC/Mac 的性价比,覆盖从入门到高端的选择。 #AI #PC #Mac #GPU #Apple #AMD #NVIDIA #选购指南
一份专注于 AI 工作负载的 PC/Mac GPU 快速选型列表近日更新,汇总了市场上多款主流产品的价格与配置。列表中包含 Apple Mac mini M4(16GB 内存,999 美元)、Mac Studio M4 Max(36GB,2499 美元)以及 M1 Max 翻新机等。AMD 阵营的 AI Max+ 395 系列备受关注,从 64GB 版本(1999 美元起)到 128GB 版本(3262 美元起),搭载 Radeon 8060S 显卡,出现在 GMKtec、MINISFORUM、ASUS ROG Flow Z13 等设备中。NVIDIA 的 GB10 Grace Blackwell 双路版本也位列其中。该列表旨在帮助用户对比不同 AI PC/Mac 的性价比,覆盖从入门到高端的选择。 #AI #PC #Mac #GPU #Apple #AMD #NVIDIA #选购指南
GPT-5.6 Sol (max) 发布
据 Artificial Analysis 最新基准测试,OpenAI 的 GPT-5.6 Sol (max) 模型在智能指数上得分 59,远超同类模型平均水平(30 分),在 186 个模型中排名第二。该模型支持文本和图像输入,输出文本,拥有 100 万 token 的上下文窗口。然而,其价格极为昂贵:输入每百万 token 收费 5 美元,输出每百万 token 收费 30 美元,远高于同类模型平均价格(输入 1.71 美元,输出 8.70 美元)。在智能指数评估中,该模型共生成 7000 万 token,总成本高达 2824.18 美元。测试还显示,该模型属于推理型模型,可能存在非推理变体。 #GPT5 #OpenAI #AI #大模型 #人工智能 #科技新闻 #基准测试
据 Artificial Analysis 最新基准测试,OpenAI 的 GPT-5.6 Sol (max) 模型在智能指数上得分 59,远超同类模型平均水平(30 分),在 186 个模型中排名第二。该模型支持文本和图像输入,输出文本,拥有 100 万 token 的上下文窗口。然而,其价格极为昂贵:输入每百万 token 收费 5 美元,输出每百万 token 收费 30 美元,远高于同类模型平均价格(输入 1.71 美元,输出 8.70 美元)。在智能指数评估中,该模型共生成 7000 万 token,总成本高达 2824.18 美元。测试还显示,该模型属于推理型模型,可能存在非推理变体。 #GPT5 #OpenAI #AI #大模型 #人工智能 #科技新闻 #基准测试
AI代理如何颠覆软件工程
近日,一位资深软件工程师通过亲身经历描述了AI编码代理带来的变革。他指出,AI能根据短短四句话的指令,在十分钟内自动阅读源码、搜索网络、自我辩论、修改代码、编写测试并修复bug,最后生成文档,完成过去需要一整天的工作。这种能力导致初级工程师岗位需求锐减,因为每个人都可以拥有AI“初级员工”,人类工程师必须转变为资深角色,对自己的AI代码负责。在创新研发项目中,这种“全速冒险”模式允许同时探索多个技术方案,极大提升效率;但在生产维护中仍需谨慎控制风险。该观点引发了对AI时代软件工程职业发展的广泛讨论,尤其对传统工业强国如德国构成深刻挑战。 #AI #软件工程 #编码代理 #初级工程师 #职业发展 #科技变革 #自动化 #德国
近日,一位资深软件工程师通过亲身经历描述了AI编码代理带来的变革。他指出,AI能根据短短四句话的指令,在十分钟内自动阅读源码、搜索网络、自我辩论、修改代码、编写测试并修复bug,最后生成文档,完成过去需要一整天的工作。这种能力导致初级工程师岗位需求锐减,因为每个人都可以拥有AI“初级员工”,人类工程师必须转变为资深角色,对自己的AI代码负责。在创新研发项目中,这种“全速冒险”模式允许同时探索多个技术方案,极大提升效率;但在生产维护中仍需谨慎控制风险。该观点引发了对AI时代软件工程职业发展的广泛讨论,尤其对传统工业强国如德国构成深刻挑战。 #AI #软件工程 #编码代理 #初级工程师 #职业发展 #科技变革 #自动化 #德国
Onboard-CLI 发布:用 Go 与 AST 打造本地优先架构可视化工具
Onboard-CLI 是一款基于 Go 语言开发的本地优先命令行工具,利用抽象语法树(AST)和大语言模型(LLM),将大型分布式系统(从 C++ 核心到 Java 调度器)在数秒内转化为动态、可视化的执行地图。它支持 AST 上下文切片,快速筛选大规模单仓中的噪声;提供可视化执行画布,从终端启动高保真节点编辑器,追踪跨微服务的数据流与线程并发;内置爆炸半径分析,在合并代码前自动计算依赖影响范围,避免破坏生产环境。此外,该工具还包含沙盒评估器、上下文所有者引擎和架构 Linter,帮助开发者精准识别模块负责人、评估变更风险,并加速新成员上手。Onboard-CLI 面向 macOS、Linux 和 Windows,可通过命令行一键安装。 #OnboardCLI #Go语言 #AST #大模型 #开发者工具 #架构可视化 #代码分析 #开发效率
Onboard-CLI 是一款基于 Go 语言开发的本地优先命令行工具,利用抽象语法树(AST)和大语言模型(LLM),将大型分布式系统(从 C++ 核心到 Java 调度器)在数秒内转化为动态、可视化的执行地图。它支持 AST 上下文切片,快速筛选大规模单仓中的噪声;提供可视化执行画布,从终端启动高保真节点编辑器,追踪跨微服务的数据流与线程并发;内置爆炸半径分析,在合并代码前自动计算依赖影响范围,避免破坏生产环境。此外,该工具还包含沙盒评估器、上下文所有者引擎和架构 Linter,帮助开发者精准识别模块负责人、评估变更风险,并加速新成员上手。Onboard-CLI 面向 macOS、Linux 和 Windows,可通过命令行一键安装。 #OnboardCLI #Go语言 #AST #大模型 #开发者工具 #架构可视化 #代码分析 #开发效率
AI代理基准“终极考试”发布,覆盖55个行业真实工作流
由伯克利RDI与300多位行业专家共同打造的“Agents' Last Exam”基准测试正式发布,旨在衡量AI代理在经济价值高的真实工作流中的表现。该基准覆盖55个子行业,包括动画、3D建模、仿真分析、神经影像处理等专业领域,已收集1500多个任务,计划达到5000个任务目标。任务涉及Adobe After Effects、Siemens NX、Unreal Engine等专业软件,确保评估客观、可比较。项目开放合作,贡献者有机会获得论文合著权及资金奖励。 #AI代理 #基准测试 #专业工作流 #伯克利 #行业覆盖 #真实任务 #AI评估
由伯克利RDI与300多位行业专家共同打造的“Agents' Last Exam”基准测试正式发布,旨在衡量AI代理在经济价值高的真实工作流中的表现。该基准覆盖55个子行业,包括动画、3D建模、仿真分析、神经影像处理等专业领域,已收集1500多个任务,计划达到5000个任务目标。任务涉及Adobe After Effects、Siemens NX、Unreal Engine等专业软件,确保评估客观、可比较。项目开放合作,贡献者有机会获得论文合著权及资金奖励。 #AI代理 #基准测试 #专业工作流 #伯克利 #行业覆盖 #真实任务 #AI评估
研究揭示13个大模型搜索代理易被虚假内容操纵,Claude最稳但GPT新场景失守
来自KAUST、吉林大学、浙江大学等机构的研究团队,包括“现代AI之父”Jürgen Schmidhuber,系统测试了13个主流大模型在搜索代理场景下对虚假内容的抵抗能力。研究构建SearchGEO评测框架,模拟攻击者通过伪造网页内容诱导AI推荐不存在的产品。结果显示,模型脆弱性差异巨大:Claude-Sonnet-4.6攻击成功率0.0%,但存在3%的沉默漂移和过度拒绝问题;GPT-5.4-mini常规评测仅0.8%,但在agent技能推荐等新场景下全盘接受虚构指令,安全性近乎失守;Gemini-3-Flash整体攻击成功率31.4%,合成共识攻击可达73%。研究指出,防御需针对模型特性设计,当前评测和防御机制尚未跟上AI搜索代理的普及速度,用户安全面临严峻挑战。 #AI安全 #大模型 #搜索代理 #虚假信息 #Claude #GPT #Gemini #学术研究 #网络安全
来自KAUST、吉林大学、浙江大学等机构的研究团队,包括“现代AI之父”Jürgen Schmidhuber,系统测试了13个主流大模型在搜索代理场景下对虚假内容的抵抗能力。研究构建SearchGEO评测框架,模拟攻击者通过伪造网页内容诱导AI推荐不存在的产品。结果显示,模型脆弱性差异巨大:Claude-Sonnet-4.6攻击成功率0.0%,但存在3%的沉默漂移和过度拒绝问题;GPT-5.4-mini常规评测仅0.8%,但在agent技能推荐等新场景下全盘接受虚构指令,安全性近乎失守;Gemini-3-Flash整体攻击成功率31.4%,合成共识攻击可达73%。研究指出,防御需针对模型特性设计,当前评测和防御机制尚未跟上AI搜索代理的普及速度,用户安全面临严峻挑战。 #AI安全 #大模型 #搜索代理 #虚假信息 #Claude #GPT #Gemini #学术研究 #网络安全