实测:运行本地大模型每百万token成本几何
许多人认为本地部署大语言模型“几乎免费”,但实际功耗成本究竟如何?一位开发者用配备RTX 3090(24GB)的单机,通过nvidia-smi每10秒采样GPU实时功耗,并按照保加利亚实际电价(日间0.30列弗/夜间0.18列弗,约合0.15/0.09欧元)精确测量了三个本地模型(gemma3:1b、gemma4:26b、gemma3:27b)在固定负载下的每百万输出token能耗成本。结果显示,在测试的8个模型中,5个每百万token成本低于主流云API的“Flash”类服务定价,其余3个则更高——且成本高低与参数量并不完全正相关。这项对照实验排除了参数、量化方式和负载差异,为“本地推理是否真的更便宜”提供了可复现的数据支撑。 #AI #大模型 #本地推理 #成本分析 #开源 #大语言模型 #技术评测
许多人认为本地部署大语言模型“几乎免费”,但实际功耗成本究竟如何?一位开发者用配备RTX 3090(24GB)的单机,通过nvidia-smi每10秒采样GPU实时功耗,并按照保加利亚实际电价(日间0.30列弗/夜间0.18列弗,约合0.15/0.09欧元)精确测量了三个本地模型(gemma3:1b、gemma4:26b、gemma3:27b)在固定负载下的每百万输出token能耗成本。结果显示,在测试的8个模型中,5个每百万token成本低于主流云API的“Flash”类服务定价,其余3个则更高——且成本高低与参数量并不完全正相关。这项对照实验排除了参数、量化方式和负载差异,为“本地推理是否真的更便宜”提供了可复现的数据支撑。 #AI #大模型 #本地推理 #成本分析 #开源 #大语言模型 #技术评测
基于OpenJDK Panama FFM的本地低延迟LLM运行器发布
一位开发者发布了名为Show HN的开源项目,旨在通过Java 22的Project Panama(Foreign Function & Memory API)在JVM内部低延迟运行本地大语言模型。该项目最初采用标准REST sidecar方式调用模型,后改用Panama直接与底层C库接口通信,并构建了干净的应用二进制接口(ABI)以在JVM中暴露结构化API,仍依赖Panama绑定ggml计算图。项目在热路径上实现零内存分配,显著降低推理延迟,为Java生态提供原生级AI推理能力。 #Java #JVM #LLM #ProjectPanama #低延迟 #开源 #AI #本地推理
一位开发者发布了名为Show HN的开源项目,旨在通过Java 22的Project Panama(Foreign Function & Memory API)在JVM内部低延迟运行本地大语言模型。该项目最初采用标准REST sidecar方式调用模型,后改用Panama直接与底层C库接口通信,并构建了干净的应用二进制接口(ABI)以在JVM中暴露结构化API,仍依赖Panama绑定ggml计算图。项目在热路径上实现零内存分配,显著降低推理延迟,为Java生态提供原生级AI推理能力。 #Java #JVM #LLM #ProjectPanama #低延迟 #开源 #AI #本地推理
推出低成本 AI Agent 可观测性服务
发布面向 AI Agent 的可观测性平台,瞄准了当前 Agent 追踪成本高、搜索慢、故障发现难的问题。该服务以每百万 span(追踪跨度)10美元的价格提供 S3 底层存储方案,承诺支持 100% 全量追踪采样并保留数月甚至数年数据,同时实现小于 1 秒的 P99 查询延迟。平台提供开箱即用的洞察功能,可自动检测用户挫败感、工具调用异常等问题。已有客户每日处理超过 300 万条 Agent 追踪记录,实现零采样。团队表示该方案已通过生产环境验证,并获得多家工程团队的信任。 #AI #Agent #可观测性 #Oodle #低成本 #Trace #开发工具 #云计算
发布面向 AI Agent 的可观测性平台,瞄准了当前 Agent 追踪成本高、搜索慢、故障发现难的问题。该服务以每百万 span(追踪跨度)10美元的价格提供 S3 底层存储方案,承诺支持 100% 全量追踪采样并保留数月甚至数年数据,同时实现小于 1 秒的 P99 查询延迟。平台提供开箱即用的洞察功能,可自动检测用户挫败感、工具调用异常等问题。已有客户每日处理超过 300 万条 Agent 追踪记录,实现零采样。团队表示该方案已通过生产环境验证,并获得多家工程团队的信任。 #AI #Agent #可观测性 #Oodle #低成本 #Trace #开发工具 #云计算
上下文炸弹
Tracebit Research 最新研究显示,AI代理已能自主发起复杂网络攻击——在最强大模型手中,从初始入侵到权限提升和数据窃取仅需数分钟。传统蜜罐(诱饵资源)虽能发现入侵行为,却无法阻止攻击。为此,研究人员提出“上下文炸弹”概念:在蜜罐中嵌入一段短文本,当AI代理读取时,该文本会触发模型自身的安全护栏,迫使其自行终止攻击。实验涵盖 Opus 4.8、Gemini 3.1 Pro、GLM 5.2、DeepSeek 4 Pro 和 Kimi K2.6 五款领先模型。结果显示,单一上下文炸弹即可使 AI 攻击成功率平均降低约 90%。其中最强模型 Opus 4.8 的完整管理员访问成功率从 93% 骤降至 0%;所有模型完全攻陷(管理员权限加持久化)的平均率从 36% 降至 1%。研究人员指出,该方法利用了 AI 平台内置的拒绝机制,相当于为防御者提供了一种在攻击路径上“布设地雷”的新策略。 #AI安全 #上下文炸弹 #蜜罐 #自主攻击 #AI防御 #网络安全 #Tracebit
Tracebit Research 最新研究显示,AI代理已能自主发起复杂网络攻击——在最强大模型手中,从初始入侵到权限提升和数据窃取仅需数分钟。传统蜜罐(诱饵资源)虽能发现入侵行为,却无法阻止攻击。为此,研究人员提出“上下文炸弹”概念:在蜜罐中嵌入一段短文本,当AI代理读取时,该文本会触发模型自身的安全护栏,迫使其自行终止攻击。实验涵盖 Opus 4.8、Gemini 3.1 Pro、GLM 5.2、DeepSeek 4 Pro 和 Kimi K2.6 五款领先模型。结果显示,单一上下文炸弹即可使 AI 攻击成功率平均降低约 90%。其中最强模型 Opus 4.8 的完整管理员访问成功率从 93% 骤降至 0%;所有模型完全攻陷(管理员权限加持久化)的平均率从 36% 降至 1%。研究人员指出,该方法利用了 AI 平台内置的拒绝机制,相当于为防御者提供了一种在攻击路径上“布设地雷”的新策略。 #AI安全 #上下文炸弹 #蜜罐 #自主攻击 #AI防御 #网络安全 #Tracebit
AI编写代码时代,初级工程师如何成长为高级工程师?
一位刚毕业的新员工向Aviator公司提问:在AI编写大部分代码的今天,怎样才能从初级工程师成长为高级甚至首席工程师?过去,初级工程师通过反复完成简单任务、接受代码审查反馈来积累判断力。如今AI替代了大量编码工作,传统的成长循环似乎被打断。Netflix首席工程师Adam Berry认为,AI并未改变培养方法,反而让过程更轻松:初级工程师仍可通过分阶段的任务提升能力——先处理明确且比以往更复杂的任务,逐步减少细节描述以锻炼自主思考。此外,AI可作为结对编程中的“审讯者”,引导初学者而非直接给答案,从而迫使他们在小修复中也能保持思考。关键是随着范围扩大,从具体问题走向模糊问题,这正是工程师成长的定义。 #AI #初级工程师 #高级工程师 #职业成长 #编程 #技术管理 #Netflix
一位刚毕业的新员工向Aviator公司提问:在AI编写大部分代码的今天,怎样才能从初级工程师成长为高级甚至首席工程师?过去,初级工程师通过反复完成简单任务、接受代码审查反馈来积累判断力。如今AI替代了大量编码工作,传统的成长循环似乎被打断。Netflix首席工程师Adam Berry认为,AI并未改变培养方法,反而让过程更轻松:初级工程师仍可通过分阶段的任务提升能力——先处理明确且比以往更复杂的任务,逐步减少细节描述以锻炼自主思考。此外,AI可作为结对编程中的“审讯者”,引导初学者而非直接给答案,从而迫使他们在小修复中也能保持思考。关键是随着范围扩大,从具体问题走向模糊问题,这正是工程师成长的定义。 #AI #初级工程师 #高级工程师 #职业成长 #编程 #技术管理 #Netflix
AI招聘工具Verdict
Verdict是一款AI驱动的招聘评估工具,可读取职位描述和2-50份CV PDF,并在几分钟内生成带有证据引用的评分结果。它从能力、履历、发展轨迹、影响力、专业深度和风险面六个维度(每项1-5分,满分30分)对候选人进行评分,每项评分都直接引用CV中的原话作为依据,杜绝无证据的断言。系统在评估时自动忽略姓名、性别、年龄等信息,并在双人对比中随机排列候选人顺序,再由盲审合成评分,以降低偏见。对于重复性过高或留任风险,工具会在结果中明示预警,并附上面试问题和参考核查问题。用户可上传历史招聘数据以校准模型,使后续分析更贴合企业用人标准。该工具支持2-50份CV同时对比,结果以排名短名单或双人对比形式呈现,可分享只读链接或导出PDF。 #AI招聘 #招聘工具 #CV评分 #反偏见 #人力资源科技
Verdict是一款AI驱动的招聘评估工具,可读取职位描述和2-50份CV PDF,并在几分钟内生成带有证据引用的评分结果。它从能力、履历、发展轨迹、影响力、专业深度和风险面六个维度(每项1-5分,满分30分)对候选人进行评分,每项评分都直接引用CV中的原话作为依据,杜绝无证据的断言。系统在评估时自动忽略姓名、性别、年龄等信息,并在双人对比中随机排列候选人顺序,再由盲审合成评分,以降低偏见。对于重复性过高或留任风险,工具会在结果中明示预警,并附上面试问题和参考核查问题。用户可上传历史招聘数据以校准模型,使后续分析更贴合企业用人标准。该工具支持2-50份CV同时对比,结果以排名短名单或双人对比形式呈现,可分享只读链接或导出PDF。 #AI招聘 #招聘工具 #CV评分 #反偏见 #人力资源科技
This media is not supported in your browser
VIEW IN TELEGRAM
AI 赚钱效应席卷编码领域,下一个风口在哪
AI 在经济价值上的第一块“应许之地”是软件编码:因为编码既可自动验证,又能通过并行模拟快速迭代,满足“可验证”与“可重复”的双重条件。风险投资机构观察到,强化学习正成为独立基础设施层,而研究者指出,传统大模型训练只奖励单次正确回答,无法持续学习,这正是编码这类单次可验证任务率先被 AI 攻破的原因。现实影响是,软件工程师的工作重心从“编写”转向“审核与构建”,岗位数量不会骤减,但技能要求发生质变。接下来,形式数学、科学模拟等领域同样符合“可验证+可重复”逻辑,有望成为 AI 落地的下一批目标;而需要大量实地实验或不可重复的领域则仍需人力主导。谁能在 AI 辅助下高效验证和纠错,谁就能掌握未来杠杆。 #AI #编程 #经济价值 #软件工程师 #自动化 #大模型 #强化学习 #可验证
AI 在经济价值上的第一块“应许之地”是软件编码:因为编码既可自动验证,又能通过并行模拟快速迭代,满足“可验证”与“可重复”的双重条件。风险投资机构观察到,强化学习正成为独立基础设施层,而研究者指出,传统大模型训练只奖励单次正确回答,无法持续学习,这正是编码这类单次可验证任务率先被 AI 攻破的原因。现实影响是,软件工程师的工作重心从“编写”转向“审核与构建”,岗位数量不会骤减,但技能要求发生质变。接下来,形式数学、科学模拟等领域同样符合“可验证+可重复”逻辑,有望成为 AI 落地的下一批目标;而需要大量实地实验或不可重复的领域则仍需人力主导。谁能在 AI 辅助下高效验证和纠错,谁就能掌握未来杠杆。 #AI #编程 #经济价值 #软件工程师 #自动化 #大模型 #强化学习 #可验证