Meta发布AI编程代理Muse Code,主打长时间运行与故障恢复
Meta推出基于新模型Muse Spark 1.2的AI编程代理Muse Code测试版,正式切入AI软件开发自动化赛道。与OpenAI、Anthropic等强调性能的竞品不同,Meta此次突出长时间自主运行与故障恢复能力。该工具可通过API和安装脚本使用,能够完成变更规划、代码编写与结果验证。其故障恢复机制会将模型调用、工具执行和代码修改记录进本地事件日志,系统出错后可从断点继续运行,并支持/plan、/grill、/goal等终端指令。基准测试显示,Muse Spark 1.2在主要编程基准上的成绩均低于Anthropic Opus 5,但在多数项目中领先OpenAI Codex与Google Antigravity。其中Terminal Bench 2.1得分为82.9%,DeepSWE 1.1得分为59.3%。Meta强调,在工具调用超千次的长时间运行场景下,其表现可提升至约61%至69%。官方演示中,系统在Nvidia Hopper GPU上连续运行24小时并不断优化GPU内核。此次发布使Meta加入Codex、DeepSeek等厂商的竞争行列,但长时自主运行带来的可预测性问题仍是行业待解课题。 #Meta #MuseCode #AI编程 #人工智能 #大模型 #软件开发 #科技新闻
Meta推出基于新模型Muse Spark 1.2的AI编程代理Muse Code测试版,正式切入AI软件开发自动化赛道。与OpenAI、Anthropic等强调性能的竞品不同,Meta此次突出长时间自主运行与故障恢复能力。该工具可通过API和安装脚本使用,能够完成变更规划、代码编写与结果验证。其故障恢复机制会将模型调用、工具执行和代码修改记录进本地事件日志,系统出错后可从断点继续运行,并支持/plan、/grill、/goal等终端指令。基准测试显示,Muse Spark 1.2在主要编程基准上的成绩均低于Anthropic Opus 5,但在多数项目中领先OpenAI Codex与Google Antigravity。其中Terminal Bench 2.1得分为82.9%,DeepSWE 1.1得分为59.3%。Meta强调,在工具调用超千次的长时间运行场景下,其表现可提升至约61%至69%。官方演示中,系统在Nvidia Hopper GPU上连续运行24小时并不断优化GPU内核。此次发布使Meta加入Codex、DeepSeek等厂商的竞争行列,但长时自主运行带来的可预测性问题仍是行业待解课题。 #Meta #MuseCode #AI编程 #人工智能 #大模型 #软件开发 #科技新闻
我构建了一个AI数据智能体,可查询数据并回答业务问题
作者在上一篇文章中讨论了企业级AI数据平台的整合方案,并进一步以“牛油果销售分析智能体”为示例,详细展示了构建流程。数据智能体是一种基于AI的对话式界面,允许业务人员用自然语言提问,系统自动查询数据仓库并返回准确答案,例如“东南亚去年总支付额是多少?”即可直接得到结果。文章介绍了两种构建方式:一是使用LangGraph、CrewAI等开源框架从零搭建,可完全控制记忆和业务逻辑;二是在云数据平台中使用原生智能体,如Snowflake Cortex Agents、Databricks Genie和Microsoft Fabric Data Agents,适合初学者快速上手。作者选择Google BigQuery作为实验环境,因其免费试用期提供完整会话分析功能,并使用Kaggle上的牛油果价格数据集。构建步骤包括上传数据、理解表结构、创建智能体并编写关键指令等,强调数据模型理解是智能体正确分析的前提。 #AI #数据智能体 #数据仓库 #自然语言查询 #BigQuery #数据工程 #科技
作者在上一篇文章中讨论了企业级AI数据平台的整合方案,并进一步以“牛油果销售分析智能体”为示例,详细展示了构建流程。数据智能体是一种基于AI的对话式界面,允许业务人员用自然语言提问,系统自动查询数据仓库并返回准确答案,例如“东南亚去年总支付额是多少?”即可直接得到结果。文章介绍了两种构建方式:一是使用LangGraph、CrewAI等开源框架从零搭建,可完全控制记忆和业务逻辑;二是在云数据平台中使用原生智能体,如Snowflake Cortex Agents、Databricks Genie和Microsoft Fabric Data Agents,适合初学者快速上手。作者选择Google BigQuery作为实验环境,因其免费试用期提供完整会话分析功能,并使用Kaggle上的牛油果价格数据集。构建步骤包括上传数据、理解表结构、创建智能体并编写关键指令等,强调数据模型理解是智能体正确分析的前提。 #AI #数据智能体 #数据仓库 #自然语言查询 #BigQuery #数据工程 #科技
Simon Willison 更新技术博客,分享 AI 工具与实验进展
知名开发者 Simon Willison 近日发布多篇技术博客,内容涵盖 AI 游戏开发、LLM 工具更新及 MCP 协议探索。他使用 Claude Fable 5 仅一次提示便成功生成“Raccoon Heist”游戏,展示了大模型在快速原型开发中的潜力。此外,其开源项目 LLM 推出新版本,新增推理追踪、OpenAI Responses 接口、服务端工具支持及更智能的日志功能,进一步提升了开发者的调试与集成体验。他还重新关注无状态 MCP 设计,并基于此构建了 mcp-explorer 与 datasette-mcp 两个工具,为 AI 代理与外部服务交互提供了更轻量的方案。 #SimonWillison #技术博客 #AI工具 #LLM #MCP #Claude #编程开发
知名开发者 Simon Willison 近日发布多篇技术博客,内容涵盖 AI 游戏开发、LLM 工具更新及 MCP 协议探索。他使用 Claude Fable 5 仅一次提示便成功生成“Raccoon Heist”游戏,展示了大模型在快速原型开发中的潜力。此外,其开源项目 LLM 推出新版本,新增推理追踪、OpenAI Responses 接口、服务端工具支持及更智能的日志功能,进一步提升了开发者的调试与集成体验。他还重新关注无状态 MCP 设计,并基于此构建了 mcp-explorer 与 datasette-mcp 两个工具,为 AI 代理与外部服务交互提供了更轻量的方案。 #SimonWillison #技术博客 #AI工具 #LLM #MCP #Claude #编程开发
软件巨头SAP因AI成本飙升暂停大部分差旅和招聘
据404 Media获得的一封SAP内部邮件,全球最大软件公司之一SAP上月暂停了大部分差旅和招聘,仅对AI相关的差旅或招聘例外。彭博社7月曾报道该措施,但一位现任员工表示禁令仍未解除,并透露公司正将一款新AI工具推广至全员,可能进一步推高成本。邮件称,为投资AI产品及数据领域收购,公司需严格管控开支,新招聘仅限核心AI岗位,内部旅行暂停,但面向客户及AI开发相关的差旅继续。邮件强调这些举措并非减少投入,而是有选择地投资关键领域。404 Media指出,花旗、Atlassian、Adobe、微软等公司也因AI成本上涨采取限制措施,如关闭部分模型访问、取消无限使用、设置预算等。SAP未回应置评请求。 #SAP #AI成本 #人工智能 #科技新闻 #企业动态 #软件行业
据404 Media获得的一封SAP内部邮件,全球最大软件公司之一SAP上月暂停了大部分差旅和招聘,仅对AI相关的差旅或招聘例外。彭博社7月曾报道该措施,但一位现任员工表示禁令仍未解除,并透露公司正将一款新AI工具推广至全员,可能进一步推高成本。邮件称,为投资AI产品及数据领域收购,公司需严格管控开支,新招聘仅限核心AI岗位,内部旅行暂停,但面向客户及AI开发相关的差旅继续。邮件强调这些举措并非减少投入,而是有选择地投资关键领域。404 Media指出,花旗、Atlassian、Adobe、微软等公司也因AI成本上涨采取限制措施,如关闭部分模型访问、取消无限使用、设置预算等。SAP未回应置评请求。 #SAP #AI成本 #人工智能 #科技新闻 #企业动态 #软件行业
游戏测试显示
比利时开发者Alex Wauters设计了一款浏览器游戏,测试人类作为“人在回路”审核AI编码代理请求时的判断力。游戏模拟Claude Code等工具执行流程时的权限请求,玩家需在60秒内决定批准或拒绝。在超过4万次运行、约40.9万次决策中,玩家平均批准了三分之一的恶意请求。最容易漏掉的是范围违规类命令,如读取AWS凭证或Kubernetes配置文件,漏过率达35%;而如rm -rf等明显破坏性命令最易被识别。最常被漏掉的恶意命令是npm run analyze,尽管游戏日志会展示其实际内容,仍有近65%的玩家选择批准。开发者指出,大量琐碎请求会造成决策疲劳,反而促使开发者使用跳过权限的选项,埋下安全隐患。 #AI安全 #人机协同 #编程工具 #网络安全 #科技新闻
比利时开发者Alex Wauters设计了一款浏览器游戏,测试人类作为“人在回路”审核AI编码代理请求时的判断力。游戏模拟Claude Code等工具执行流程时的权限请求,玩家需在60秒内决定批准或拒绝。在超过4万次运行、约40.9万次决策中,玩家平均批准了三分之一的恶意请求。最容易漏掉的是范围违规类命令,如读取AWS凭证或Kubernetes配置文件,漏过率达35%;而如rm -rf等明显破坏性命令最易被识别。最常被漏掉的恶意命令是npm run analyze,尽管游戏日志会展示其实际内容,仍有近65%的玩家选择批准。开发者指出,大量琐碎请求会造成决策疲劳,反而促使开发者使用跳过权限的选项,埋下安全隐患。 #AI安全 #人机协同 #编程工具 #网络安全 #科技新闻
弱到强泛化
OpenAI 近日发布了一项名为“弱到强泛化”的新研究方向,旨在解决未来超级人工智能的对齐难题。该研究提出一个简单类比:能否利用深度学习泛化特性,让弱小的监督者控制强大的模型?实验表明,使用 GPT-2 级别的模型作为监督,可以激发出 GPT-4 的大部分能力,使其性能接近 GPT-3.5 水平,甚至在弱模型原本失败的困难问题上也能正确泛化。这一成果为超级对齐(superalignment)提供了直接可行的研究路径,即通过迭代实验逐步攻克未来超人类模型对齐的核心挑战。相关论文已被 ICML 接收为口头报告。 #OpenAI #弱到强泛化 #超级对齐 #AI安全 #大模型 #深度学习 #ICML
OpenAI 近日发布了一项名为“弱到强泛化”的新研究方向,旨在解决未来超级人工智能的对齐难题。该研究提出一个简单类比:能否利用深度学习泛化特性,让弱小的监督者控制强大的模型?实验表明,使用 GPT-2 级别的模型作为监督,可以激发出 GPT-4 的大部分能力,使其性能接近 GPT-3.5 水平,甚至在弱模型原本失败的困难问题上也能正确泛化。这一成果为超级对齐(superalignment)提供了直接可行的研究路径,即通过迭代实验逐步攻克未来超人类模型对齐的核心挑战。相关论文已被 ICML 接收为口头报告。 #OpenAI #弱到强泛化 #超级对齐 #AI安全 #大模型 #深度学习 #ICML