GPT-5.5 低成本实现接近顶级模型的编码能力
DeepSWE 发布了一项针对前沿编码代理的评估基准测试结果,该测试涵盖113个仓库、91种编程语言和5种模型。结果显示,GPT-5.5高配置版本以平均成本7.23美元获得67%的通过率,而顶级模型Claude Fable高配置版本以21.63美元成本达到70%的通过率。两者性能仅相差3%,但GPT-5.5的成本仅为前者的三分之一。DeepSWE基准专门设计应对现有公共基准的饱和问题,通过长周期工程任务、硬性通过/失败标准、防过度拟合设计及计算预算限制等四大创新来区分模型真实能力。其他表现突出的模型包括Claude Opus 4.8(59%,成本13.22美元)和GPT-5.4(52%,成本5.65美元)。 #AI #编程 #GPT5 #Claude #基准测试 #代码模型 #科技
DeepSWE 发布了一项针对前沿编码代理的评估基准测试结果,该测试涵盖113个仓库、91种编程语言和5种模型。结果显示,GPT-5.5高配置版本以平均成本7.23美元获得67%的通过率,而顶级模型Claude Fable高配置版本以21.63美元成本达到70%的通过率。两者性能仅相差3%,但GPT-5.5的成本仅为前者的三分之一。DeepSWE基准专门设计应对现有公共基准的饱和问题,通过长周期工程任务、硬性通过/失败标准、防过度拟合设计及计算预算限制等四大创新来区分模型真实能力。其他表现突出的模型包括Claude Opus 4.8(59%,成本13.22美元)和GPT-5.4(52%,成本5.65美元)。 #AI #编程 #GPT5 #Claude #基准测试 #代码模型 #科技
AI时代SaaS经济模式面临变革
SaaS(软件即服务)曾是科技行业最重要的变革之一,它通过云端订阅模式降低了企业软件采购与维护成本,为软件公司和用户带来共赢。云计算进一步推动了SaaS的规模化部署。如今,以Claude和Codex为代表的AI编码代理让软件开发更加容易,但SaaS商业模式正受到双重冲击:一方面,AI模型以Token计费,使每步推理产生可变成本,压缩利润空间;另一方面,具备自主决策能力的AI代理可跨工具操作,企业开始质疑为何要为多个孤立SaaS付费。这使得纯数据录入、简单工作流等“点解决方案”变得脆弱。未来SaaS的持久性取决于能否在数据流动性、网络效应和深度集成等方面建立护城河,同时重新定义定价方式,从席位制转向价值导向。 #SaaS #AI #云计算 #代理 #商业模式 #科技趋势 #软件经济
SaaS(软件即服务)曾是科技行业最重要的变革之一,它通过云端订阅模式降低了企业软件采购与维护成本,为软件公司和用户带来共赢。云计算进一步推动了SaaS的规模化部署。如今,以Claude和Codex为代表的AI编码代理让软件开发更加容易,但SaaS商业模式正受到双重冲击:一方面,AI模型以Token计费,使每步推理产生可变成本,压缩利润空间;另一方面,具备自主决策能力的AI代理可跨工具操作,企业开始质疑为何要为多个孤立SaaS付费。这使得纯数据录入、简单工作流等“点解决方案”变得脆弱。未来SaaS的持久性取决于能否在数据流动性、网络效应和深度集成等方面建立护城河,同时重新定义定价方式,从席位制转向价值导向。 #SaaS #AI #云计算 #代理 #商业模式 #科技趋势 #软件经济
AI将每位工程师变成三人,公司现在需要更多产品思考者
据行业报道,Anthropic近期要求其增长团队招聘更多产品经理而非减少,原因是其AI工具Claude Code已悄然将工程团队的实际产出提升至原有三倍,瓶颈从集成开发环境转移到决定构建什么的人。这一细节在AI效率炒作中易被忽视,却代表了整个行业的结构性转变:软件开发的瓶颈不再是编码,而是决定编码什么。近十年来,软件工程是缓慢吸收的知识,通过Stack Overflow等标准化流程实践,工程师与产品经理分工明确。但自2022年ChatGPT发布以来,这一模式首先被浏览器标签中的AI提示打破,随后嵌入IDE的Cursor和Claude Code进一步瓦解了资深工程师的升级路径。当前,更宽的上下文窗口使团队能在两天完成原本两周的功能构建,Amazon Kiro IDE团队和AWS的案例证实了这一点,18个月的重架构30人工程由6人76天完成。再到2026年的Routines时代,Club Code推出定时持久智能体,工程师的角色转向编排。 #AI #产品经理 #工程效率 #软件开发 #Anthropic #ClaudeCode #创新
据行业报道,Anthropic近期要求其增长团队招聘更多产品经理而非减少,原因是其AI工具Claude Code已悄然将工程团队的实际产出提升至原有三倍,瓶颈从集成开发环境转移到决定构建什么的人。这一细节在AI效率炒作中易被忽视,却代表了整个行业的结构性转变:软件开发的瓶颈不再是编码,而是决定编码什么。近十年来,软件工程是缓慢吸收的知识,通过Stack Overflow等标准化流程实践,工程师与产品经理分工明确。但自2022年ChatGPT发布以来,这一模式首先被浏览器标签中的AI提示打破,随后嵌入IDE的Cursor和Claude Code进一步瓦解了资深工程师的升级路径。当前,更宽的上下文窗口使团队能在两天完成原本两周的功能构建,Amazon Kiro IDE团队和AWS的案例证实了这一点,18个月的重架构30人工程由6人76天完成。再到2026年的Routines时代,Club Code推出定时持久智能体,工程师的角色转向编排。 #AI #产品经理 #工程效率 #软件开发 #Anthropic #ClaudeCode #创新
Collabora Office 26.04 更新:内置可选 AI 助手,支持自定义大模型
协作办公套件 Collabora Office 发布 26.04 版本,核心亮点是集成了可选的 AI 助手功能,并加强了与 Windows、macOS 及 Linux 系统的集成。该 AI 助手默认关闭,可直接在 Writer、Calc 和 Impress 中通过侧边栏调用,用于撰写或缩短文本、创建电子表格公式、分析错误、从要点构建演示文稿,还能生成图像。用户可自主选择 AI 提供商或语言模型,从云服务到自托管模型均可,应用直接与所选模型通信,不经过 Collabora,且仅在用户明确许可时才会访问文档内容。新版本还依据欧盟 AI 法案显示透明度声明。此外,桌面版适配了各平台特性,如 Windows 的原生菜单栏和证书存储支持,macOS 的原生菜单和文档标签,以及 Linux 的 Qt6 WebEngine 与 Flatpak/Snap 分发。功能层面,Writer 新增文档比较和多页视图,Calc 支持计算透视字段,Impress 引入幻灯片分区和“跟随我”演示功能。套件现已支持导入导出 Markdown 文档,并默认以只读模式打开文件。 #CollaboraOffice #开源办公套件 #AI助手 #大模型 #办公软件 #科技新闻
协作办公套件 Collabora Office 发布 26.04 版本,核心亮点是集成了可选的 AI 助手功能,并加强了与 Windows、macOS 及 Linux 系统的集成。该 AI 助手默认关闭,可直接在 Writer、Calc 和 Impress 中通过侧边栏调用,用于撰写或缩短文本、创建电子表格公式、分析错误、从要点构建演示文稿,还能生成图像。用户可自主选择 AI 提供商或语言模型,从云服务到自托管模型均可,应用直接与所选模型通信,不经过 Collabora,且仅在用户明确许可时才会访问文档内容。新版本还依据欧盟 AI 法案显示透明度声明。此外,桌面版适配了各平台特性,如 Windows 的原生菜单栏和证书存储支持,macOS 的原生菜单和文档标签,以及 Linux 的 Qt6 WebEngine 与 Flatpak/Snap 分发。功能层面,Writer 新增文档比较和多页视图,Calc 支持计算透视字段,Impress 引入幻灯片分区和“跟随我”演示功能。套件现已支持导入导出 Markdown 文档,并默认以只读模式打开文件。 #CollaboraOffice #开源办公套件 #AI助手 #大模型 #办公软件 #科技新闻
EASI研究工程学
一项名为“工程人工最高级愚蠢”(EASI)的开放研究框架正式提出,旨在对计算系统中的结构化非理性进行系统分类、复制与分析。该框架完全背离主流AI追求正确性的方向,转而专门研究如何设计、复现并放大系统的持续荒谬与错误。其核心理论论文及配套剧本《冰箱阴谋》共同展示了结构化愚蠢如何递归演化:将事实纠正、数学验证等转化为自信且极具魅力的错误闭环。该框架通过严格的技术指标和分层架构,将偶然的系统失效升级为可测量、可重复的“高超错误”。研究人员认为,用这种高度优化的胡说对系统进行压力测试,能为AI安全、模因研究与批判性思维教育提供至关重要的认知红队工具。 #AI安全 #工程愚蠢 #认知红队 #反智研究 #架构设计
一项名为“工程人工最高级愚蠢”(EASI)的开放研究框架正式提出,旨在对计算系统中的结构化非理性进行系统分类、复制与分析。该框架完全背离主流AI追求正确性的方向,转而专门研究如何设计、复现并放大系统的持续荒谬与错误。其核心理论论文及配套剧本《冰箱阴谋》共同展示了结构化愚蠢如何递归演化:将事实纠正、数学验证等转化为自信且极具魅力的错误闭环。该框架通过严格的技术指标和分层架构,将偶然的系统失效升级为可测量、可重复的“高超错误”。研究人员认为,用这种高度优化的胡说对系统进行压力测试,能为AI安全、模因研究与批判性思维教育提供至关重要的认知红队工具。 #AI安全 #工程愚蠢 #认知红队 #反智研究 #架构设计
AI 市场定价能力动摇
数据显示,衡量用户为 AI 代币支付成本的“硅谷数据 LLM 代币支出指数”自5月高点已下跌近20%,该指数自去年12月创立以来曾一度翻倍。这一下跌对7000亿美元以上的资本支出热潮发出警示信号:AI 公司正面临成本敏感型客户的压力,定价权正在丧失,市场对 AI 暴利预期的合理性存疑。资深投资者路易斯·纳维利耶指出,目前有大量报道显示,以代币定价的 AI 解决方案用户因高昂成本不得不限制使用,OpenAI 推迟首次公开募股也被视为盈利难题的信号。不过,指数下跌并不直接等同于 AI 更便宜,该指数反映的是边际支付意愿,可能意味着标价下降、需求转向更廉价模型,或买家承受意愿的真实软化。尽管自2023年以来代币价格已暴跌超90%,但总支出仍约翻倍,这支持了牛市观点:需求是真实的,资本支出物有所值。但空头警告,指数持续疲软可能终结 AI 板块的集体上涨热潮——代币支出是下一轮资本支出的支撑,而目前账单已显得捉襟见肘。安联研究指出,AI 投资与销售之间存在近46%的增长差距,比2001年电信泡沫时的32%更为严重。此外,美国政府对关键行业展现新的管控意愿——本周取消对 Anthropic 模型的外国访问限制前,监管机构曾要求 OpenAI 分步推出新版本;欧盟《人工智能法案》也对前沿模型提出强制性评估和透明度要求。这些监管虽未直接限制价格,但加大了部署与合规成本。 #AI #定价权 #代币价格 #人工智能 #市场分析 #监管 #资本支出 #美股
数据显示,衡量用户为 AI 代币支付成本的“硅谷数据 LLM 代币支出指数”自5月高点已下跌近20%,该指数自去年12月创立以来曾一度翻倍。这一下跌对7000亿美元以上的资本支出热潮发出警示信号:AI 公司正面临成本敏感型客户的压力,定价权正在丧失,市场对 AI 暴利预期的合理性存疑。资深投资者路易斯·纳维利耶指出,目前有大量报道显示,以代币定价的 AI 解决方案用户因高昂成本不得不限制使用,OpenAI 推迟首次公开募股也被视为盈利难题的信号。不过,指数下跌并不直接等同于 AI 更便宜,该指数反映的是边际支付意愿,可能意味着标价下降、需求转向更廉价模型,或买家承受意愿的真实软化。尽管自2023年以来代币价格已暴跌超90%,但总支出仍约翻倍,这支持了牛市观点:需求是真实的,资本支出物有所值。但空头警告,指数持续疲软可能终结 AI 板块的集体上涨热潮——代币支出是下一轮资本支出的支撑,而目前账单已显得捉襟见肘。安联研究指出,AI 投资与销售之间存在近46%的增长差距,比2001年电信泡沫时的32%更为严重。此外,美国政府对关键行业展现新的管控意愿——本周取消对 Anthropic 模型的外国访问限制前,监管机构曾要求 OpenAI 分步推出新版本;欧盟《人工智能法案》也对前沿模型提出强制性评估和透明度要求。这些监管虽未直接限制价格,但加大了部署与合规成本。 #AI #定价权 #代币价格 #人工智能 #市场分析 #监管 #资本支出 #美股
Flora:为AI打造的容错型图表库,完美呈现不完美输入
一位数据工程师在10天内从零构建了Flora图表库。这是一个容错、兼容Mermaid语法的开源库,能够从有瑕疵的输入中渲染出精美、可交互的SVG图表。Flora解决了两个痛点:一是Mermaid图表的美学限制,难以定制颜色和样式;二是大语言模型生成的Mermaid代码经常有语法错误,导致渲染失败。Flora能在遇到无法解析的行时跳过并继续渲染其余部分,同时报告错误位置,而非直接崩溃。图表支持缩放、平移以及节点上下游追踪功能。开发者在10天内完成了TypeScript构建、npm包发布和解析器设计,并提供了多种集成方式,包括HTML、HTML模块、React和Vue组件,以及Python包装器。 #图表库 #开源 #AI #Mermaid #数据工程 #前端开发 #TypeScript
一位数据工程师在10天内从零构建了Flora图表库。这是一个容错、兼容Mermaid语法的开源库,能够从有瑕疵的输入中渲染出精美、可交互的SVG图表。Flora解决了两个痛点:一是Mermaid图表的美学限制,难以定制颜色和样式;二是大语言模型生成的Mermaid代码经常有语法错误,导致渲染失败。Flora能在遇到无法解析的行时跳过并继续渲染其余部分,同时报告错误位置,而非直接崩溃。图表支持缩放、平移以及节点上下游追踪功能。开发者在10天内完成了TypeScript构建、npm包发布和解析器设计,并提供了多种集成方式,包括HTML、HTML模块、React和Vue组件,以及Python包装器。 #图表库 #开源 #AI #Mermaid #数据工程 #前端开发 #TypeScript