Token 应该有自己的工作
在AI Agent系统调优实践中,绝大多数团队仅依赖增加预算或更换更昂贵模型这一单一手段来提升任务完成度。Anthropic平台工程负责人Katelyn Lesse与平台产品负责人Angela Jiang在AI Engineer World's Fair主舞台上指出,Agent的Token使用其实可以更有针对性。他们认为,每个Token应当被赋予明确的工作职能,而非简单地增加数量。通过为Token分配具体任务,例如特定步骤的指令执行、上下文记忆或错误修正,系统可以显著提升效率并降低冗余消耗。这一观点挑战了当前业内普遍的“暴力调优”做法,强调精细化管理Token资源,类似于在项目团队中为每个成员划定职责分工。两位专家呼吁开发者重新思考Agent工作流的设计逻辑,从粗放的预算加法转向结构化的Token任务分配模式,从而实现更高效、更经济的人工智能系统优化。 #AI #Agent #Token #Anthropic #系统调优 #AI工程 #大模型
在AI Agent系统调优实践中,绝大多数团队仅依赖增加预算或更换更昂贵模型这一单一手段来提升任务完成度。Anthropic平台工程负责人Katelyn Lesse与平台产品负责人Angela Jiang在AI Engineer World's Fair主舞台上指出,Agent的Token使用其实可以更有针对性。他们认为,每个Token应当被赋予明确的工作职能,而非简单地增加数量。通过为Token分配具体任务,例如特定步骤的指令执行、上下文记忆或错误修正,系统可以显著提升效率并降低冗余消耗。这一观点挑战了当前业内普遍的“暴力调优”做法,强调精细化管理Token资源,类似于在项目团队中为每个成员划定职责分工。两位专家呼吁开发者重新思考Agent工作流的设计逻辑,从粗放的预算加法转向结构化的Token任务分配模式,从而实现更高效、更经济的人工智能系统优化。 #AI #Agent #Token #Anthropic #系统调优 #AI工程 #大模型
AI Agent 拥有写权限但管控缺位,行业面临安全新挑战
AI 工程师这个角色正从特定职位演变为一种横跨创始人、CTO、工程师与产品经理的共同经历,虽资历各异,但踩过的坑却日趋相似。Amplify Partners 投资人 Barr Yaron 连续多年主持针对该群体的年度问卷,今年首次联合 Notion 和 Vercel 发布报告,共收集 1048 份有效反馈。调查显示,随着 AI Agent 逐渐获得文件写入、数据库修改等高级权限,现有的管控机制和安全流程未能同步跟进,导致数据泄露、误操作等风险显著上升。从业者普遍反映,缺乏清晰的权限分级和实时监控手段,在部署 Agent 时往往面临“能运行但不可控”的困境,亟需行业共同制定新的安全标准和治理框架。 #AI安全 #Agent权限 #AI工程师 #科技治理 #行业报告
AI 工程师这个角色正从特定职位演变为一种横跨创始人、CTO、工程师与产品经理的共同经历,虽资历各异,但踩过的坑却日趋相似。Amplify Partners 投资人 Barr Yaron 连续多年主持针对该群体的年度问卷,今年首次联合 Notion 和 Vercel 发布报告,共收集 1048 份有效反馈。调查显示,随着 AI Agent 逐渐获得文件写入、数据库修改等高级权限,现有的管控机制和安全流程未能同步跟进,导致数据泄露、误操作等风险显著上升。从业者普遍反映,缺乏清晰的权限分级和实时监控手段,在部署 Agent 时往往面临“能运行但不可控”的困境,亟需行业共同制定新的安全标准和治理框架。 #AI安全 #Agent权限 #AI工程师 #科技治理 #行业报告
Agent 之困
近日,WorkOS 创始人 Michael Grinich 在 AI Engineer World's Fair 2026 上发表演讲指出,当前 Agent(智能体)发展的最大瓶颈并非模型能力或工具框架,而是如何突破专为人设计的登录验证系统。过去大半年业界聚焦于模型性能与构建 harness,却忽视了Agent 应用新服务时面临的基本门槛——点击登录按钮、输入密码、识别验证码等人类操作无法被自动化。Grinich 强调,若无法解决这一前置性问题,Agent 的规模化落地将始终受限,呼吁行业重新审视身份验证机制的无障碍设计。 #Agent #登录验证 #AI工程 #WorkOS #开发者困境 #人工智能 #科技
近日,WorkOS 创始人 Michael Grinich 在 AI Engineer World's Fair 2026 上发表演讲指出,当前 Agent(智能体)发展的最大瓶颈并非模型能力或工具框架,而是如何突破专为人设计的登录验证系统。过去大半年业界聚焦于模型性能与构建 harness,却忽视了Agent 应用新服务时面临的基本门槛——点击登录按钮、输入密码、识别验证码等人类操作无法被自动化。Grinich 强调,若无法解决这一前置性问题,Agent 的规模化落地将始终受限,呼吁行业重新审视身份验证机制的无障碍设计。 #Agent #登录验证 #AI工程 #WorkOS #开发者困境 #人工智能 #科技
Speechify Simba 3.2 登顶文生语音 Arena 排行榜
人工智能分析平台 Artificial Analysis 发布最新 Speech Arena 排行榜,Speechify 的 Simba 3.2 API 以 1233 的 Elo 评分跃居首位,成为目前最受用户偏好的文生语音模型。该排行榜基于用户在盲测中对不同模型生成的语音样本进行自然度对比投票得出。紧随其后的是 Gemini 3.1 Flash TTS(1214分)、Sonic 3.5(1210分)等。在开源模型类别中,Step Audio EditX 以 1115分的 Elo 评分表现最佳。价格方面,Kokoro 82M v1.0 性价比较高,每百万字符仅需 0.65 美元。 #AI #文生语音 #Speechify #Simba3.2 #语音合成 #人工智能
人工智能分析平台 Artificial Analysis 发布最新 Speech Arena 排行榜,Speechify 的 Simba 3.2 API 以 1233 的 Elo 评分跃居首位,成为目前最受用户偏好的文生语音模型。该排行榜基于用户在盲测中对不同模型生成的语音样本进行自然度对比投票得出。紧随其后的是 Gemini 3.1 Flash TTS(1214分)、Sonic 3.5(1210分)等。在开源模型类别中,Step Audio EditX 以 1115分的 Elo 评分表现最佳。价格方面,Kokoro 82M v1.0 性价比较高,每百万字符仅需 0.65 美元。 #AI #文生语音 #Speechify #Simba3.2 #语音合成 #人工智能
并非所有任务都该消耗Token
近期有团队构建了一个智能体,每天从API拉取指标数据,转换JSON格式后存入数据库。第一天运行良好,但随后账单来了——每次执行都要加载数千Token的原始JSON到上下文窗口,让语言模型执行无需推理的格式化任务,结果不仅频繁出错,还因上下文拥挤导致实际推理能力下降。这暴露了一个普遍陷阱:团队将语言模型当作通用运行时,任何可描述的任务都用提示来完成。但模型是按Token计费的推理引擎,非自动定时任务或数据库。当你让它做本不需要智能的工作时,成本飙升且输出质量下降。核心技能是学会什么不该用Token处理。提示虽然快速,但当一次性任务变成定期作业时,每条确定性任务通过模型处理后,都会继承三个属性:非确定性、慢速和计费。现在你为原本免费且零错误的计划函数付费。两个症状随之显现并相互加剧:一是成本与错误指标挂钩——Token消耗应追踪你要求的判断价值,而非机械工作量;二是上下文膨胀——填入原始记录会挤占模型擅长推理的地方,导致质量下降且成本上升,最终支付更多却得到更差答案。建议将所有任务分为两类:需要判断的交给智能体,需要精确可重复的留在应用中。你只需一次性用Token构建应用,随后每次运行不再支付Token。 #AI #人工智能 #语言模型 #成本优化 #智能体 #确定性计算
近期有团队构建了一个智能体,每天从API拉取指标数据,转换JSON格式后存入数据库。第一天运行良好,但随后账单来了——每次执行都要加载数千Token的原始JSON到上下文窗口,让语言模型执行无需推理的格式化任务,结果不仅频繁出错,还因上下文拥挤导致实际推理能力下降。这暴露了一个普遍陷阱:团队将语言模型当作通用运行时,任何可描述的任务都用提示来完成。但模型是按Token计费的推理引擎,非自动定时任务或数据库。当你让它做本不需要智能的工作时,成本飙升且输出质量下降。核心技能是学会什么不该用Token处理。提示虽然快速,但当一次性任务变成定期作业时,每条确定性任务通过模型处理后,都会继承三个属性:非确定性、慢速和计费。现在你为原本免费且零错误的计划函数付费。两个症状随之显现并相互加剧:一是成本与错误指标挂钩——Token消耗应追踪你要求的判断价值,而非机械工作量;二是上下文膨胀——填入原始记录会挤占模型擅长推理的地方,导致质量下降且成本上升,最终支付更多却得到更差答案。建议将所有任务分为两类:需要判断的交给智能体,需要精确可重复的留在应用中。你只需一次性用Token构建应用,随后每次运行不再支付Token。 #AI #人工智能 #语言模型 #成本优化 #智能体 #确定性计算
Hugging Face 一键接入 SageMaker Studio,简化模型开发流程
Hugging Face 与亚马逊 SageMaker AI 宣布推出一项深度链接集成功能。开发者现在可以直接在 Hugging Face 模型页面上点击"自定义"或"部署"按钮,一键跳转至 SageMaker Studio 工作环境。所选模型会自动预加载,所有权限和配置也由系统自动完成,无需手动创建域、配置 IAM 权限或申请 GPU 配额。此前,从 Hugging Face 发现模型到在 SageMaker Studio 开始实验需要多个繁琐步骤,严重拖慢开发迭代速度。此次集成直接在支持的模型页面上添加了操作按钮,点击后即可跳转至已配置好的 SageMaker AI 控制台。新创建的环境预置了包括监督微调、直接偏好优化、可验证奖励强化学习及 AI 反馈强化学习在内的全套模型定制权限,并支持部署至 SageMaker AI 或 Amazon Bedrock 端点。对于现有 Studio 环境,系统也会提供引导链接帮助用户添加必要权限。Arcee AI 创始人表示,这一整合让开源模型从发现到企业级部署的最后一公里变得极为顺畅,开发者可以完全在自有 AWS 环境中进行实验。 #HuggingFace #SageMaker #AI #云计算 #模型部署
Hugging Face 与亚马逊 SageMaker AI 宣布推出一项深度链接集成功能。开发者现在可以直接在 Hugging Face 模型页面上点击"自定义"或"部署"按钮,一键跳转至 SageMaker Studio 工作环境。所选模型会自动预加载,所有权限和配置也由系统自动完成,无需手动创建域、配置 IAM 权限或申请 GPU 配额。此前,从 Hugging Face 发现模型到在 SageMaker Studio 开始实验需要多个繁琐步骤,严重拖慢开发迭代速度。此次集成直接在支持的模型页面上添加了操作按钮,点击后即可跳转至已配置好的 SageMaker AI 控制台。新创建的环境预置了包括监督微调、直接偏好优化、可验证奖励强化学习及 AI 反馈强化学习在内的全套模型定制权限,并支持部署至 SageMaker AI 或 Amazon Bedrock 端点。对于现有 Studio 环境,系统也会提供引导链接帮助用户添加必要权限。Arcee AI 创始人表示,这一整合让开源模型从发现到企业级部署的最后一公里变得极为顺畅,开发者可以完全在自有 AWS 环境中进行实验。 #HuggingFace #SageMaker #AI #云计算 #模型部署
Amazon Nova 推出“选择性遗忘”技术,让AI模型精准合规
企业部署基础模型时常面临两难:内置的内容审核机制虽保障安全,却可能误伤合法业务需求,例如安全团队要求生成钓鱼邮件样本用于员工培训时,模型会因安全策略拒绝执行。亚马逊云科技发布Amazon Nova可定制内容审核设置(CCMS),通过逆向直接偏好优化(rDPO)技术实现模型的“选择性遗忘”。该技术在不重新训练的情况下,利用低秩适配(LoRA)适配器精准移除模型对特定策略的偏离行为,使模型在客户批准的政策领域生成内容,同时保持其他方面的对齐。核心挑战在于平衡:模型需在不再回绝目标内容的同时,维持指令遵循、编程、数学等通用能力,并保持非目标领域的合规。研究表明,直接微调可能损害模型质量,而rDPO通过优化偏好学习方法,有效减少过度回绝,提升业务实用性。 #亚马逊云科技 #AI合规 #模型遗忘 #大模型 #机器学习
企业部署基础模型时常面临两难:内置的内容审核机制虽保障安全,却可能误伤合法业务需求,例如安全团队要求生成钓鱼邮件样本用于员工培训时,模型会因安全策略拒绝执行。亚马逊云科技发布Amazon Nova可定制内容审核设置(CCMS),通过逆向直接偏好优化(rDPO)技术实现模型的“选择性遗忘”。该技术在不重新训练的情况下,利用低秩适配(LoRA)适配器精准移除模型对特定策略的偏离行为,使模型在客户批准的政策领域生成内容,同时保持其他方面的对齐。核心挑战在于平衡:模型需在不再回绝目标内容的同时,维持指令遵循、编程、数学等通用能力,并保持非目标领域的合规。研究表明,直接微调可能损害模型质量,而rDPO通过优化偏好学习方法,有效减少过度回绝,提升业务实用性。 #亚马逊云科技 #AI合规 #模型遗忘 #大模型 #机器学习