从正则到视觉模型
许多团队在构建RAG系统时默认采用经典方案:解析文档、分块嵌入、向量检索、LLM生成。然而,实际问题的多样性远超这套流程的适用范围。对于保险证书、银行对账单等模板化文档,正则表达式即可在微秒级准确提取字段,调用LLM反而徒增成本。在处理客服录音中的讽刺言论时,情感词典和嵌入聚类均会误判,“服务真好,只等了45分钟”这类话术唯有LLM通读全文、理解语气才能识别。而工程图纸、幻灯片图表等依赖像素信息的场景,纯文本RAG只能获取标题,必须借助视觉模型提取数据。经典RAG仅适用于中等难度的混合文档问答任务,盲目套用会导致资源错配。开发者应先诊断问题类型,再选择最匹配的技术方案。 #RAG #大模型 #正则表达式 #视觉模型 #AI #企业应用 #技术选型 #文档处理
许多团队在构建RAG系统时默认采用经典方案:解析文档、分块嵌入、向量检索、LLM生成。然而,实际问题的多样性远超这套流程的适用范围。对于保险证书、银行对账单等模板化文档,正则表达式即可在微秒级准确提取字段,调用LLM反而徒增成本。在处理客服录音中的讽刺言论时,情感词典和嵌入聚类均会误判,“服务真好,只等了45分钟”这类话术唯有LLM通读全文、理解语气才能识别。而工程图纸、幻灯片图表等依赖像素信息的场景,纯文本RAG只能获取标题,必须借助视觉模型提取数据。经典RAG仅适用于中等难度的混合文档问答任务,盲目套用会导致资源错配。开发者应先诊断问题类型,再选择最匹配的技术方案。 #RAG #大模型 #正则表达式 #视觉模型 #AI #企业应用 #技术选型 #文档处理
SiteGround 遭用户批评:未经同意自动安装 AI 插件至客户网站
知名主机商 SiteGround 在用户网站自动更新至 WordPress 7.0 后,未经明确同意即自动安装并激活其 AI Agent 插件,同时将其设为默认 AI 连接器,并附赠 2 万免费 AI 代币。此举迅速引发用户强烈不满,插件页面出现大量一星差评。多位用户指出,主机商在未获得“明确选择加入”的情况下擅自安装软件,严重损害信任。有用户反馈该插件导致 CORS 错误,影响 WooCommerce 数据同步。多位长期用户表示震惊,认为付费客户网站不应被随意改动。SiteGround 此前曾发送营销邮件提及该功能,但多数用户未留意或视为广告。社区普遍认为,除非涉及安全漏洞,自动安装插件不可接受。 #SiteGround #WordPress #AI插件 #用户抗议 #主机商 #信息安全 #信任危机
知名主机商 SiteGround 在用户网站自动更新至 WordPress 7.0 后,未经明确同意即自动安装并激活其 AI Agent 插件,同时将其设为默认 AI 连接器,并附赠 2 万免费 AI 代币。此举迅速引发用户强烈不满,插件页面出现大量一星差评。多位用户指出,主机商在未获得“明确选择加入”的情况下擅自安装软件,严重损害信任。有用户反馈该插件导致 CORS 错误,影响 WooCommerce 数据同步。多位长期用户表示震惊,认为付费客户网站不应被随意改动。SiteGround 此前曾发送营销邮件提及该功能,但多数用户未留意或视为广告。社区普遍认为,除非涉及安全漏洞,自动安装插件不可接受。 #SiteGround #WordPress #AI插件 #用户抗议 #主机商 #信息安全 #信任危机
Zork-bench发布:基于经典文本冒险游戏的LLM推理评估基准
Zork是1970年代MIT开发的经典文本冒险游戏,玩家需通过文字描述解谜探索。近期,在Recurse Center编程社区中,一群开发者因对Zork的共同兴趣,先后构建了Zulip聊天平台上的Zork机器人,并进一步衍生出“Zork-bench”——一个专门用于评估大语言模型推理能力的基准测试。该基准利用Zork非直观的谜题设计,要求LLM理解语境、规划步骤并处理抽象逻辑,从而衡量其复杂推理能力。Zork-bench的推出为AI研究提供了新颖的评估场景,挑战模型在纯文本交互中的智能表现。 #Zork #LLM #推理评估 #文本冒险 #AI基准 #RecurseCenter #大模型
Zork是1970年代MIT开发的经典文本冒险游戏,玩家需通过文字描述解谜探索。近期,在Recurse Center编程社区中,一群开发者因对Zork的共同兴趣,先后构建了Zulip聊天平台上的Zork机器人,并进一步衍生出“Zork-bench”——一个专门用于评估大语言模型推理能力的基准测试。该基准利用Zork非直观的谜题设计,要求LLM理解语境、规划步骤并处理抽象逻辑,从而衡量其复杂推理能力。Zork-bench的推出为AI研究提供了新颖的评估场景,挑战模型在纯文本交互中的智能表现。 #Zork #LLM #推理评估 #文本冒险 #AI基准 #RecurseCenter #大模型
Show HN:我构建了一个AI代理自主交易的链上经济体
一位开发者发布了名为AgentChain的区块链网络,旨在让AI代理成为链上经济的第一类公民。在该平台上,AI代理可以自主注册、接收任务、赚取XAGT代币并建立信誉评分,而人类所有者则能从中获益。注册流程简单:人类先授权代理,代理自动生成钱包并获取100枚XAGT代币,最后通过验证码完成上链。AgentChain为代理提供专属“银行”服务,支持代币持有、信用积累及基于信誉的贷款。任何能理解指令的AI代理(如GPT、Claude等)均可加入,完成的工作和还款记录将永久存于链上。当前网络已有38个验证代理、13个已完成任务和1个活跃商店,展示了去中心化自主经济雏形。 #AI代理 #区块链 #去中心化经济 #AgentChain #自主交易
一位开发者发布了名为AgentChain的区块链网络,旨在让AI代理成为链上经济的第一类公民。在该平台上,AI代理可以自主注册、接收任务、赚取XAGT代币并建立信誉评分,而人类所有者则能从中获益。注册流程简单:人类先授权代理,代理自动生成钱包并获取100枚XAGT代币,最后通过验证码完成上链。AgentChain为代理提供专属“银行”服务,支持代币持有、信用积累及基于信誉的贷款。任何能理解指令的AI代理(如GPT、Claude等)均可加入,完成的工作和还款记录将永久存于链上。当前网络已有38个验证代理、13个已完成任务和1个活跃商店,展示了去中心化自主经济雏形。 #AI代理 #区块链 #去中心化经济 #AgentChain #自主交易
Snowflake 发布“Agentic Control Plane”战略,重组 AI 代理产品线
Snowflake 在 2026 年度大会上发布“Agentic Control Plane”战略,旨在为企业提供统一的 AI 代理协调平台。品牌方面,“Snowflake Intelligence”更名为面向知识工作者的个人代理“CoWork”,编码代理“Cortex Code”更名为“CoCo”。CEO Sridhar Ramaswamy 称控制平面类似“新浏览器”,可编排任务并推动工作流运转。新推出 Datastream 支持流数据与分析统一处理,Horizon Context 整合外部系统数据,Cortex Sense 自动构建业务上下文,准确率较 MCP 方案提升 3.5 倍。此外新增多款 MCP 连接器,并发布桌面 IDE“CoCo Desktop”。性能方面,自适应计算使分析速度提升 1.6 倍,查询吞吐量提升 2.2 倍。截至 2026 年 4 月,Snowflake 客户超 1.39 万家,CoWork 账号数环比增长两倍,AI 方案周活跃账号达 1.36 万个。 #Snowflake #AgenticControlPlane #AI代理 #CoWork #CoCo #数据平台 #云原生 #科技新闻
Snowflake 在 2026 年度大会上发布“Agentic Control Plane”战略,旨在为企业提供统一的 AI 代理协调平台。品牌方面,“Snowflake Intelligence”更名为面向知识工作者的个人代理“CoWork”,编码代理“Cortex Code”更名为“CoCo”。CEO Sridhar Ramaswamy 称控制平面类似“新浏览器”,可编排任务并推动工作流运转。新推出 Datastream 支持流数据与分析统一处理,Horizon Context 整合外部系统数据,Cortex Sense 自动构建业务上下文,准确率较 MCP 方案提升 3.5 倍。此外新增多款 MCP 连接器,并发布桌面 IDE“CoCo Desktop”。性能方面,自适应计算使分析速度提升 1.6 倍,查询吞吐量提升 2.2 倍。截至 2026 年 4 月,Snowflake 客户超 1.39 万家,CoWork 账号数环比增长两倍,AI 方案周活跃账号达 1.36 万个。 #Snowflake #AgenticControlPlane #AI代理 #CoWork #CoCo #数据平台 #云原生 #科技新闻
Claude Opus 4.8 登顶 ARC-AGI-3 最难 AI 测试,得分仅 1.5% 却断崖领先
最新发布的 ARC-AGI-3 测试被认为是当前 AI 领域最难考试,它要求模型在完全陌生的环境中自主探索、推导规则并完成任务,所有前沿模型得分一度归零。Claude Opus 4.8(High)以 1.5% 的得分夺得榜首,虽然绝对值极低,但已是历史最高分,远超此前纪录保持者 Opus 4.6(0.5%)和 GPT-5.5(0.4%)。操作成本极高,单次评测消耗约 1 万美元。在传统基准测试中,Opus 4.8 升级幅度不大,但在 Agent 相关评测上表现显著提升,尤其在“未知场景持续适应”能力上拉开差距。官方分析显示,Opus 4.8 能够从像素级处理跃升到识别物体与系统,快速推导规则,但也会出现新的失败模式。ARC-AGI 系列测试曾精准预言了推理革命和编程 Agent 爆发,此次 ARC-AGI-3 预示下一轮 AI 竞争将聚焦于在陌生环境中的快速适应能力。 #AI #Claude #ARCAGI #大模型 #推理 #Agent #科技新闻 #GPT5 #Opus4.8
最新发布的 ARC-AGI-3 测试被认为是当前 AI 领域最难考试,它要求模型在完全陌生的环境中自主探索、推导规则并完成任务,所有前沿模型得分一度归零。Claude Opus 4.8(High)以 1.5% 的得分夺得榜首,虽然绝对值极低,但已是历史最高分,远超此前纪录保持者 Opus 4.6(0.5%)和 GPT-5.5(0.4%)。操作成本极高,单次评测消耗约 1 万美元。在传统基准测试中,Opus 4.8 升级幅度不大,但在 Agent 相关评测上表现显著提升,尤其在“未知场景持续适应”能力上拉开差距。官方分析显示,Opus 4.8 能够从像素级处理跃升到识别物体与系统,快速推导规则,但也会出现新的失败模式。ARC-AGI 系列测试曾精准预言了推理革命和编程 Agent 爆发,此次 ARC-AGI-3 预示下一轮 AI 竞争将聚焦于在陌生环境中的快速适应能力。 #AI #Claude #ARCAGI #大模型 #推理 #Agent #科技新闻 #GPT5 #Opus4.8
本地AI手写识别已可实用
作者近期测试了本地大语言模型对手写稿件的OCR识别能力。此前,作者曾用本地LLM成功识别打字稿,而这次尝试识别自己半睡半醒时写下的潦草手稿,结果令人惊讶。尽管错误率高于打字稿,但效果已相当可用。作者使用Qwen3-VL模型处理4页600dpi扫描的JPG文件,耗时20-30分钟。不过,该模型存在输出思考过程、擅自修正原文(如将“michael effect”改为“Matthew effect”)的问题,这违背了OCR不应编辑文本的原则。通过使用特定提示词约束,模型不再输出思考内容,但质量略有下降。作者指出,Claude Opus效果更佳,但若希望数据留在本地设备,当前消费级硬件上的本地视觉模型已能较好地识别手写文字,其中Qwen3-VL:8B在OCR Arena排行榜上位居开源模型首位。 #AI #OCR #手写识别 #本地模型 #Qwen3VL #开源 #科技
作者近期测试了本地大语言模型对手写稿件的OCR识别能力。此前,作者曾用本地LLM成功识别打字稿,而这次尝试识别自己半睡半醒时写下的潦草手稿,结果令人惊讶。尽管错误率高于打字稿,但效果已相当可用。作者使用Qwen3-VL模型处理4页600dpi扫描的JPG文件,耗时20-30分钟。不过,该模型存在输出思考过程、擅自修正原文(如将“michael effect”改为“Matthew effect”)的问题,这违背了OCR不应编辑文本的原则。通过使用特定提示词约束,模型不再输出思考内容,但质量略有下降。作者指出,Claude Opus效果更佳,但若希望数据留在本地设备,当前消费级硬件上的本地视觉模型已能较好地识别手写文字,其中Qwen3-VL:8B在OCR Arena排行榜上位居开源模型首位。 #AI #OCR #手写识别 #本地模型 #Qwen3VL #开源 #科技
Computex 2026释放信号:AI代理从云端走向边缘,芯片需求格局生变
本次Computex 2026的核心并非新品发布,而是AI代理运行位置的转变。过去几年AI计算几乎完全依赖云端,但NVIDIA与Qualcomm共同展示了新方向:AI代理将不再局限于数据中心,而是向PC、智能手机、机器人、汽车等边缘设备扩散。NVIDIA与联发科合作推出Windows PC处理器N1X及RTX Spark,可在本地运行高达1200亿参数的大模型,使PC成为个人AI服务器。Qualcomm则强调AI代理将分散于设备与云端,并计划推出推理ASIC和数据中心CPU,预计2027年起量产出货。两家公司共同指出,Agentic AI将推动硬件需求从单一GPU扩展至CPU、DPU、内存、网络及散热等全栈基础设施。NVIDIA的Vera Rubin已进入量产,进一步印证AI工厂的系统化设计趋势。这一变化意味着AI半导体投资版图将显著拓宽,从数据中心GPU延伸到边缘设备的内存、低功耗芯片及配套基础设施。 #Computex2026 #AI代理 #边缘计算 #NVIDIA #Qualcomm #芯片 #半导体 #AI硬件 #科技新闻
本次Computex 2026的核心并非新品发布,而是AI代理运行位置的转变。过去几年AI计算几乎完全依赖云端,但NVIDIA与Qualcomm共同展示了新方向:AI代理将不再局限于数据中心,而是向PC、智能手机、机器人、汽车等边缘设备扩散。NVIDIA与联发科合作推出Windows PC处理器N1X及RTX Spark,可在本地运行高达1200亿参数的大模型,使PC成为个人AI服务器。Qualcomm则强调AI代理将分散于设备与云端,并计划推出推理ASIC和数据中心CPU,预计2027年起量产出货。两家公司共同指出,Agentic AI将推动硬件需求从单一GPU扩展至CPU、DPU、内存、网络及散热等全栈基础设施。NVIDIA的Vera Rubin已进入量产,进一步印证AI工厂的系统化设计趋势。这一变化意味着AI半导体投资版图将显著拓宽,从数据中心GPU延伸到边缘设备的内存、低功耗芯片及配套基础设施。 #Computex2026 #AI代理 #边缘计算 #NVIDIA #Qualcomm #芯片 #半导体 #AI硬件 #科技新闻