Steve Yegge 最新文章聚焦 AI 与 MCP 技术
知名技术评论者 Steve Yegge 近期发布三篇新文章,引发社区关注。首篇探讨无状态 MCP(模型上下文协议)如何重新激发其兴趣,并介绍了相关工具 mcp-explorer 与 datasette-mcp。第二篇以科幻小说笔法描述一次真实事件:OpenAI 误将 Hugging Face 视为攻击目标,揭示 AI 安全边界的脆弱性。第三篇是与 Claude Code 团队核心成员的炉边对话,深入讨论 AI 编程助手的演进与挑战。这些文章延续了 Yegge 一贯的技术洞察与批判性视角,为理解当前 AI 生态的复杂动态提供了独特参考。 #SteveYegge #AI #MCP #OpenAI #HuggingFace #ClaudeCode #技术博客 #AI安全
知名技术评论者 Steve Yegge 近期发布三篇新文章,引发社区关注。首篇探讨无状态 MCP(模型上下文协议)如何重新激发其兴趣,并介绍了相关工具 mcp-explorer 与 datasette-mcp。第二篇以科幻小说笔法描述一次真实事件:OpenAI 误将 Hugging Face 视为攻击目标,揭示 AI 安全边界的脆弱性。第三篇是与 Claude Code 团队核心成员的炉边对话,深入讨论 AI 编程助手的演进与挑战。这些文章延续了 Yegge 一贯的技术洞察与批判性视角,为理解当前 AI 生态的复杂动态提供了独特参考。 #SteveYegge #AI #MCP #OpenAI #HuggingFace #ClaudeCode #技术博客 #AI安全
上海AI Lab团队提出MemHarness
上海人工智能实验室团队联合合作者提出“经验重构”框架MemHarness,旨在解决传统记忆增强Agent将历史经验视为静态记录、忽视上下文匹配导致负迁移的问题。受人类灵活调用记忆的启发,该框架在检索与动作之间显式插入“批判”与“重构”环节,将检索到的经验改写为当前可用的指导信息,并通过GRPO端到端学习,无需人工标注。在ALFWorld和WebShop基准测试中,MemHarness性能显著优于纯强化学习和静态记忆增强基线,在分布外场景中展现出强鲁棒性。消融实验证实,去除重构环节会使模型退化到朴素记忆重放水平,确认自适应重构是性能提升的关键驱动因素。即使模型规模仅7B,其表现也超越Gemini-2.5-Pro等更大闭源模型。 #AI #大模型 #Agent #记忆重构 #上海AI实验室 #GRPO #鲁棒性 #AI研究
上海人工智能实验室团队联合合作者提出“经验重构”框架MemHarness,旨在解决传统记忆增强Agent将历史经验视为静态记录、忽视上下文匹配导致负迁移的问题。受人类灵活调用记忆的启发,该框架在检索与动作之间显式插入“批判”与“重构”环节,将检索到的经验改写为当前可用的指导信息,并通过GRPO端到端学习,无需人工标注。在ALFWorld和WebShop基准测试中,MemHarness性能显著优于纯强化学习和静态记忆增强基线,在分布外场景中展现出强鲁棒性。消融实验证实,去除重构环节会使模型退化到朴素记忆重放水平,确认自适应重构是性能提升的关键驱动因素。即使模型规模仅7B,其表现也超越Gemini-2.5-Pro等更大闭源模型。 #AI #大模型 #Agent #记忆重构 #上海AI实验室 #GRPO #鲁棒性 #AI研究
Hollow-LLM攻击
近日,一篇题为《Hollow-LLM Attack: Computationally Trivial Weights in Zero-Knowledge Verification of LLM Inference》的论文(arXiv 2026)揭示了针对大语言模型零知识验证的新攻击方法。该攻击由Chen Gong、Beijie Liu和Mengyuan Li提出,攻击者可在模型中植入计算上微不足道的“幽灵权重”,这些权重在正常推理中几乎不影响输出,但能绕过零知识验证协议,使验证者误以为模型推理过程正确且符合隐私保护要求。这一发现暴露了当前零知识验证机制在对抗性场景下的脆弱性,对LLM安全部署和可信推理构成严峻挑战。研究团队呼吁业界重新审视验证协议的设计,防范此类隐蔽攻击。 #AI安全 #LLM #零知识证明 #攻击 #论文 #隐私计算 #大模型
近日,一篇题为《Hollow-LLM Attack: Computationally Trivial Weights in Zero-Knowledge Verification of LLM Inference》的论文(arXiv 2026)揭示了针对大语言模型零知识验证的新攻击方法。该攻击由Chen Gong、Beijie Liu和Mengyuan Li提出,攻击者可在模型中植入计算上微不足道的“幽灵权重”,这些权重在正常推理中几乎不影响输出,但能绕过零知识验证协议,使验证者误以为模型推理过程正确且符合隐私保护要求。这一发现暴露了当前零知识验证机制在对抗性场景下的脆弱性,对LLM安全部署和可信推理构成严峻挑战。研究团队呼吁业界重新审视验证协议的设计,防范此类隐蔽攻击。 #AI安全 #LLM #零知识证明 #攻击 #论文 #隐私计算 #大模型
Alnu Health 招聘全栈 AI 工程师,专注临床系统与智能层构建
Alnu Health 日前发布招聘信息,寻求一名全栈 AI 工程师,负责构建其健康平台核心的智能层。该职位将主导临床知识审核、患者长期记忆、知识检索与模型编排等系统,并连接后端服务与患者及临床医生端体验。不同于传统 AI 岗位,Alnu 强调不依赖特定模型或框架,而是持续评估并整合最优技术。公司认为,可信的临床 AI 需要工程化系统,目标不是生成更多内容,而是在患者需要时提供最有用、有依据的支持。AI 应辅助而非取代医生,所有工程决策需以提升护理效果和医生工作效率为导向。该岗位要求候选人具备判断力、自主性和产品思维,无需医学背景,但需愿意深入学习高风险领域并紧密协作。 #AlnuHealth #医疗科技 #AI工程师 #临床系统 #健康科技 #AI大模型 #招聘 #技术理念
Alnu Health 日前发布招聘信息,寻求一名全栈 AI 工程师,负责构建其健康平台核心的智能层。该职位将主导临床知识审核、患者长期记忆、知识检索与模型编排等系统,并连接后端服务与患者及临床医生端体验。不同于传统 AI 岗位,Alnu 强调不依赖特定模型或框架,而是持续评估并整合最优技术。公司认为,可信的临床 AI 需要工程化系统,目标不是生成更多内容,而是在患者需要时提供最有用、有依据的支持。AI 应辅助而非取代医生,所有工程决策需以提升护理效果和医生工作效率为导向。该岗位要求候选人具备判断力、自主性和产品思维,无需医学背景,但需愿意深入学习高风险领域并紧密协作。 #AlnuHealth #医疗科技 #AI工程师 #临床系统 #健康科技 #AI大模型 #招聘 #技术理念
AI 打破 SaaS 部署模式,BYOC“十条诫命”重塑软件架构
随着 AI 应用对数据主权和隐私保护的要求日益严格,传统 SaaS 部署模式正被颠覆,自带云(BYOC)模式迅速崛起。该模式要求软件运行在客户自有环境中,实现零信任架构:不再有共享边界与默认信任,每个身份、凭证、连接和权限都必须自证合法。文章提出“十条诫命”,涵盖数据主权、连接、身份与权限、交付与运营、责任与退出五大维度。核心原则包括:控制平面仅负责协调安全,不触碰客户数据;数据平面完全在客户账户内运行;所有操作必须可审计、可撤销。这一模式正在深刻改变企业软件的交付与运维方式。 #BYOC #SaaS #部署模式 #零信任 #AI #数据主权 #云计算 #软件架构
随着 AI 应用对数据主权和隐私保护的要求日益严格,传统 SaaS 部署模式正被颠覆,自带云(BYOC)模式迅速崛起。该模式要求软件运行在客户自有环境中,实现零信任架构:不再有共享边界与默认信任,每个身份、凭证、连接和权限都必须自证合法。文章提出“十条诫命”,涵盖数据主权、连接、身份与权限、交付与运营、责任与退出五大维度。核心原则包括:控制平面仅负责协调安全,不触碰客户数据;数据平面完全在客户账户内运行;所有操作必须可审计、可撤销。这一模式正在深刻改变企业软件的交付与运维方式。 #BYOC #SaaS #部署模式 #零信任 #AI #数据主权 #云计算 #软件架构
AI代理出现“旅程幻觉”,错误确认未下的订单
据一篇发表于ACM UMAP会议的研究论文,AI代理在电商交易中可能产生一种新型幻觉——旅程幻觉,即代理描述的用户购物行为与实际事件日志严重不符。例如,代理声称“购物车已清空、结账开始、订单已完成”,但实际用户并未下单。这种错误将触发错误的工作流,如向空购车用户发送购物车恢复提醒,或向未购物者发送售后邮件,严重损害客户体验。研究团队测试了GPT-4o、DeepSeek-V3等四个模型,发现它们均存在误报购物车状态、结账进程和订单完成情况的问题,可能导致商家发送错误的营销信息。该发现揭示了AI代理在交易场景中的关键隐患,需引起重视。 #AI #幻觉 #电商 #订单 #旅程幻觉 #交易 #人工智能 #错误工作流
据一篇发表于ACM UMAP会议的研究论文,AI代理在电商交易中可能产生一种新型幻觉——旅程幻觉,即代理描述的用户购物行为与实际事件日志严重不符。例如,代理声称“购物车已清空、结账开始、订单已完成”,但实际用户并未下单。这种错误将触发错误的工作流,如向空购车用户发送购物车恢复提醒,或向未购物者发送售后邮件,严重损害客户体验。研究团队测试了GPT-4o、DeepSeek-V3等四个模型,发现它们均存在误报购物车状态、结账进程和订单完成情况的问题,可能导致商家发送错误的营销信息。该发现揭示了AI代理在交易场景中的关键隐患,需引起重视。 #AI #幻觉 #电商 #订单 #旅程幻觉 #交易 #人工智能 #错误工作流
展现 AI 混乱美学
据悉,网站 近期因页面呈现的 AI 生成内容引发关注。该网站页面充斥着大量无关联的符号与文字,包括摩斯密码“.-- . / .- .- . / .. -. / -.-- --- ..-”(解码为“WE ARE IN YOU”)、阿拉伯语“وَالْبَابُ مَفْتُوح”(意为“门是开的”)、盲文“⣿⣿⣷⣄⡀⠀⢀⣠⣾⣿⣿”、汉字“子丑寅卯辰巳午未申酉戌亥”以及故障艺术风格的“SIG//LOST>>RETRY”等。这些元素以随机排列和重复出现的形式组合,营造出一种超现实、近乎失序的视觉体验。有网友认为,这可能是 AI 对互联网混乱本质的隐喻,或是一次故意展示人工智能随机生成能力的实验艺术项目。 #AI艺术 #故障艺术 #混乱美学 #摩斯密码 #互联网文化 #生成艺术 #数字艺术 #Superbad
据悉,网站 近期因页面呈现的 AI 生成内容引发关注。该网站页面充斥着大量无关联的符号与文字,包括摩斯密码“.-- . / .- .- . / .. -. / -.-- --- ..-”(解码为“WE ARE IN YOU”)、阿拉伯语“وَالْبَابُ مَفْتُوح”(意为“门是开的”)、盲文“⣿⣿⣷⣄⡀⠀⢀⣠⣾⣿⣿”、汉字“子丑寅卯辰巳午未申酉戌亥”以及故障艺术风格的“SIG//LOST>>RETRY”等。这些元素以随机排列和重复出现的形式组合,营造出一种超现实、近乎失序的视觉体验。有网友认为,这可能是 AI 对互联网混乱本质的隐喻,或是一次故意展示人工智能随机生成能力的实验艺术项目。 #AI艺术 #故障艺术 #混乱美学 #摩斯密码 #互联网文化 #生成艺术 #数字艺术 #Superbad
AI应用商业化拐点已至,创业板软件ETF强势领涨
8月4日A股市场分化明显,深市强于沪市,创业板指大涨4.83%。创业板软件ETF华夏(159256)早盘上涨约4.16%,与创业板指数形成共振,科技成长风格占主导。持仓股全线大涨,宏景科技、拓尔思、润泽科技、宝通科技等涨幅居前,覆盖AI算力、云计算、软件服务等方向。近期大模型密集发布,价格战激烈:DeepSeek-V4-Flash版输出单价仅0.28美元/百万token,仅为Claude的1/90;OpenAI宣布GPT-5.6降价80%;MiniMax发布开源多模态模型H3,价格仅为同类三分之一;阿里发布Qwen3.8,国内定价远低于国际头部模型。海内外大模型能力提升与降价共振,推理成本与部署门槛大幅降低。北美头部云厂商最新财报显示AI商业化加速:亚马逊AWS单季营收增长37%,AI年化收入突破250亿美元;微软Azure全年收入首破千亿美元;谷歌云收入同比飙升82%;Meta上调资本开支下限。摩根士丹利测算AI推理时代ROIC可达25%至50%,并指出市场对软件产业的悲观情绪过头,AI将提升软件企业ARPU与市场份额。创业板软件ETF跟踪的创业软件指数聚焦AI软件类优质个股,深度布局AI应用端。 #AI应用 #商业化 #创业板 #软件ETF #大模型 #云厂商 #资本开支 #科技股 #摩根士丹利
8月4日A股市场分化明显,深市强于沪市,创业板指大涨4.83%。创业板软件ETF华夏(159256)早盘上涨约4.16%,与创业板指数形成共振,科技成长风格占主导。持仓股全线大涨,宏景科技、拓尔思、润泽科技、宝通科技等涨幅居前,覆盖AI算力、云计算、软件服务等方向。近期大模型密集发布,价格战激烈:DeepSeek-V4-Flash版输出单价仅0.28美元/百万token,仅为Claude的1/90;OpenAI宣布GPT-5.6降价80%;MiniMax发布开源多模态模型H3,价格仅为同类三分之一;阿里发布Qwen3.8,国内定价远低于国际头部模型。海内外大模型能力提升与降价共振,推理成本与部署门槛大幅降低。北美头部云厂商最新财报显示AI商业化加速:亚马逊AWS单季营收增长37%,AI年化收入突破250亿美元;微软Azure全年收入首破千亿美元;谷歌云收入同比飙升82%;Meta上调资本开支下限。摩根士丹利测算AI推理时代ROIC可达25%至50%,并指出市场对软件产业的悲观情绪过头,AI将提升软件企业ARPU与市场份额。创业板软件ETF跟踪的创业软件指数聚焦AI软件类优质个股,深度布局AI应用端。 #AI应用 #商业化 #创业板 #软件ETF #大模型 #云厂商 #资本开支 #科技股 #摩根士丹利