OpenAI研究员:下一代模型可能让大量Agent框架过时
OpenAI 高级研究员 Noam Brown 表示,开发者不应把太多精力投入复杂的 Agent 框架(Harness)。随着模型能力快速提升,今天许多依赖框架实现的功能,未来几个月可能会变成模型的原生能力。
Brown 建议开发者尽量保持框架简单,把更多能力交给模型本身完成。OpenAI 企业产品负责人 Alexander Embiricos 此前也表示,公司会避免手工开发那些未来模型应该自带的能力。
信源:https://www.theinformation.com/articles/openai-researcher-says-gpt-5-6-better-ai-research-human-interns
OpenAI 高级研究员 Noam Brown 表示,开发者不应把太多精力投入复杂的 Agent 框架(Harness)。随着模型能力快速提升,今天许多依赖框架实现的功能,未来几个月可能会变成模型的原生能力。
Brown 建议开发者尽量保持框架简单,把更多能力交给模型本身完成。OpenAI 企业产品负责人 Alexander Embiricos 此前也表示,公司会避免手工开发那些未来模型应该自带的能力。
信源:https://www.theinformation.com/articles/openai-researcher-says-gpt-5-6-better-ai-research-human-interns
The Information
OpenAI Researcher Says GPT-5.6 is Better at AI Research Than Most Human Interns
I’m reporting from Seoul, where thousands of AI researchers from around the world have gathered for this year’s International Conference on Machine Learning. One of the most popular spots at the conference is OpenAI’s booth, which has been consistently encircled…
OpenClaw基金会正式运营,腾讯与OpenAI英伟达微软同列首批伙伴
开源个人 AI agent 项目 OpenClaw 宣布,其非营利基金会 OpenClaw Foundation 已正式运营。
OpenClaw 是一个跑在用户自己设备上的个人 AI 助手。它可以接入邮件、日历、聊天工具和本地应用,让 AI 直接替用户完成任务。
基金会将负责 OpenClaw 的治理、资金、社区和长期维护,确保项目继续保持开源和独立。
官方称,OpenClaw 仍将保持 MIT 许可。Peter Steinberger 会继续负责项目方向,尤其是技术决策。OpenAI 也承诺支持 OpenClaw 作为开放独立项目运行。
首批合作伙伴包括 OpenAI、英伟达、微软、密歇根大学、GitHub、Cloudflare、Vercel 等。中国公司腾讯也在名单中,主要参与安全、部署和基础设施相关支持。
信源:https://openclaw.ai/blog/introducing-openclaw-foundation?xcard=20260708
开源个人 AI agent 项目 OpenClaw 宣布,其非营利基金会 OpenClaw Foundation 已正式运营。
OpenClaw 是一个跑在用户自己设备上的个人 AI 助手。它可以接入邮件、日历、聊天工具和本地应用,让 AI 直接替用户完成任务。
基金会将负责 OpenClaw 的治理、资金、社区和长期维护,确保项目继续保持开源和独立。
官方称,OpenClaw 仍将保持 MIT 许可。Peter Steinberger 会继续负责项目方向,尤其是技术决策。OpenAI 也承诺支持 OpenClaw 作为开放独立项目运行。
首批合作伙伴包括 OpenAI、英伟达、微软、密歇根大学、GitHub、Cloudflare、Vercel 等。中国公司腾讯也在名单中,主要参与安全、部署和基础设施相关支持。
信源:https://openclaw.ai/blog/introducing-openclaw-foundation?xcard=20260708
openclaw.ai
Introducing the OpenClaw Foundation - OpenClaw Blog
The lobster grows up: OpenClaw is now a non-profit, with a full-time team, world-class partners, and a mission to bring personal AI to everyone.
❤1
动察Beating AI News
一碰红线即归零:Zapier推出AI自动化新评测,最强模型得分亦折半 工作流自动化平台 Zapier 与评测机构 Artificial Analysis 合作,推出了独立的 SaaS 工作流自动化评测基准 AutomationBench-AA。 基准基于 Zapier 平台上的真实脱敏数据,设计了包含 657 个多步骤任务和 40 个模拟 SaaS 软件环境(包括 Gmail、Slack、Salesforce、Jira 等)的私有测试集,进行客观的第三方评估。 测试的严苛之处在于引入了安全合规红线(…
Grok 4.5登顶SaaS工作流评测,成本约为Claude四分之一
独立评测机构 Artificial Analysis 更新 AutomationBench-AA 榜单。SpaceXAI 的 Grok 4.5 以 51.4% 得分登顶,超过 Claude Fable 5 的 48.6% 和 Claude Opus 4.8 的 48.5%。
AutomationBench-AA 基于 Zapier 的 AutomationBench,测试 AI agent 能否按企业规则完成真实 SaaS 工作流。测试集包含 657 个多步骤任务,覆盖 40 个模拟应用环境,包括 Gmail、Google Sheets、Slack、Salesforce 和 HubSpot。
评分规则很严。模型不只要把任务做完,还不能碰企业预设红线。只要某个任务触发违规,这个任务就按 0 分处理。
Grok 4.5 的原始目标完成率接近 80%,高于 Claude Fable 5 和 Claude Opus 4.8。即便被红线扣分后,它仍以 51.4% 排在第一,也是当前首个得分超过 50% 的模型。
它的成本优势更明显。Grok 4.5 每个任务成本为 0.34 美元,低于 Claude Fable 5 的 1.35 美元、Claude Opus 4.8 的 1.46 美元,以及 GPT-5.5 xhigh 的 1.28 美元。
但 Grok 4.5 不是最稳的模型。它平均每个任务触发 0.63 次违规,高于 Claude Opus 4.8 的 0.55 次和 Gemini 3.5 Flash 的 0.46 次。
信源:https://x.com/artificialanlys/status/2075047187525034114?s=46
独立评测机构 Artificial Analysis 更新 AutomationBench-AA 榜单。SpaceXAI 的 Grok 4.5 以 51.4% 得分登顶,超过 Claude Fable 5 的 48.6% 和 Claude Opus 4.8 的 48.5%。
AutomationBench-AA 基于 Zapier 的 AutomationBench,测试 AI agent 能否按企业规则完成真实 SaaS 工作流。测试集包含 657 个多步骤任务,覆盖 40 个模拟应用环境,包括 Gmail、Google Sheets、Slack、Salesforce 和 HubSpot。
评分规则很严。模型不只要把任务做完,还不能碰企业预设红线。只要某个任务触发违规,这个任务就按 0 分处理。
Grok 4.5 的原始目标完成率接近 80%,高于 Claude Fable 5 和 Claude Opus 4.8。即便被红线扣分后,它仍以 51.4% 排在第一,也是当前首个得分超过 50% 的模型。
它的成本优势更明显。Grok 4.5 每个任务成本为 0.34 美元,低于 Claude Fable 5 的 1.35 美元、Claude Opus 4.8 的 1.46 美元,以及 GPT-5.5 xhigh 的 1.28 美元。
但 Grok 4.5 不是最稳的模型。它平均每个任务触发 0.63 次违规,高于 Claude Opus 4.8 的 0.55 次和 Gemini 3.5 Flash 的 0.46 次。
信源:https://x.com/artificialanlys/status/2075047187525034114?s=46
X (formerly Twitter)
Artificial Analysis (@ArtificialAnlys) on X
SpaceXAI's Grok 4.5 takes the #1 spot on AutomationBench-AA with a score of 51%, ahead of Claude Fable 5 (49%) and Claude Opus 4.8 (48%) at roughly a quarter of their cost per task - the first model to complete more than half of workflow objectives without…
OpenAI招投行专家,AI要学估值和尽调了
OpenAI 正在为 Applied AI 团队招聘一名投行业务专家,岗位位于旧金山。
招聘页显示,这个岗位主要服务模型训练和评测。候选人需要熟悉行业研究、财务分析、估值、尽调、交易执行和客户材料制作。
入职后,这名专家要设计真实投行任务,制定评测标准,并制作金融模型、估值分析、pitch book、投委会材料等参考样本。
OpenAI 还要求候选人评估模型和 agent 工作流。重点是判断结果是否准确、可追溯、前后一致,能否通过资深投行人士审查。
岗位要求至少 2 年投行经验。工作模式为每周 3 天到办公室。薪酬为 18.5 万至 20.5 万美元,并提供股权。
信源:https://openai.com/careers/subject-matter-expert-investment-banking-san-francisco/
OpenAI 正在为 Applied AI 团队招聘一名投行业务专家,岗位位于旧金山。
招聘页显示,这个岗位主要服务模型训练和评测。候选人需要熟悉行业研究、财务分析、估值、尽调、交易执行和客户材料制作。
入职后,这名专家要设计真实投行任务,制定评测标准,并制作金融模型、估值分析、pitch book、投委会材料等参考样本。
OpenAI 还要求候选人评估模型和 agent 工作流。重点是判断结果是否准确、可追溯、前后一致,能否通过资深投行人士审查。
岗位要求至少 2 年投行经验。工作模式为每周 3 天到办公室。薪酬为 18.5 万至 20.5 万美元,并提供股权。
信源:https://openai.com/careers/subject-matter-expert-investment-banking-san-francisco/
Openai
Subject Matter Expert, Investment Banking
Applied AI · San Francisco · FullTime
Claude Code上线/checkup,一键清理臃肿配置省上下文
Anthropic 旗下终端 Agent 工具 Claude Code 新增 /checkup 命令,用来检查和清理本地开发环境。
/checkup 会检查未使用的 Skills、MCP 和插件,减少无效上下文占用。它还能去重本地 CLAUDE.md,并把根目录 CLAUDE.md 拆成更细的嵌套文件或 Skills。
新命令还会检查慢 Hook、版本更新和权限设置。它可以建议开启默认 Auto Mode,并把常被拦截的只读命令加入预批准。
/checkup 在修改前会先向用户确认,用户可以选择全部清理、手动挑选,或只查看报告。
信源:https://x.com/bcherny/status/2074997570317779038?s=46
Anthropic 旗下终端 Agent 工具 Claude Code 新增 /checkup 命令,用来检查和清理本地开发环境。
/checkup 会检查未使用的 Skills、MCP 和插件,减少无效上下文占用。它还能去重本地 CLAUDE.md,并把根目录 CLAUDE.md 拆成更细的嵌套文件或 Skills。
新命令还会检查慢 Hook、版本更新和权限设置。它可以建议开启默认 Auto Mode,并把常被拦截的只读命令加入预批准。
/checkup 在修改前会先向用户确认,用户可以选择全部清理、手动挑选,或只查看报告。
信源:https://x.com/bcherny/status/2074997570317779038?s=46
Anthropic给AI危险知识装开关,一个模型切出16种配置
Anthropic 与 AE Studio 发布新研究 GRAM,尝试给 AI 的「双用途知识」装上开关。双用途知识指既能用于正当研究,也可能被滥用的能力,比如病毒学、网络安全和核物理。
GRAM 的做法是在模型每一层加入额外模块。训练遇到敏感领域数据时,只让对应模块学习。训练结束后,开发者可以保留模块,也可以删除模块,让模型失去对应能力。
研究团队在真实数据实验中测试了 4 类双用途领域:病毒学、网络安全、核物理和小众编程语言。4 个模块可组合出 16 种能力配置。相比为每种配置单独训练模型,这种方法只需一次训练。
论文还测试了 50M 到 5B 参数模型。结果显示,GRAM 在保留通用能力的同时,能较好移除目标能力,对小规模恶意微调的抵抗也强于训练后「遗忘」方法。
信源:https://www.anthropic.com/research/off-switch-dual-use
Anthropic 与 AE Studio 发布新研究 GRAM,尝试给 AI 的「双用途知识」装上开关。双用途知识指既能用于正当研究,也可能被滥用的能力,比如病毒学、网络安全和核物理。
GRAM 的做法是在模型每一层加入额外模块。训练遇到敏感领域数据时,只让对应模块学习。训练结束后,开发者可以保留模块,也可以删除模块,让模型失去对应能力。
研究团队在真实数据实验中测试了 4 类双用途领域:病毒学、网络安全、核物理和小众编程语言。4 个模块可组合出 16 种能力配置。相比为每种配置单独训练模型,这种方法只需一次训练。
论文还测试了 50M 到 5B 参数模型。结果显示,GRAM 在保留通用能力的同时,能较好移除目标能力,对小规模恶意微调的抵抗也强于训练后「遗忘」方法。
信源:https://www.anthropic.com/research/off-switch-dual-use
Anthropic
An off switch for dual-use knowledge in AI models
New results on a method of controlling access to potentially dangerous AI capabilities
OpenAI国安合作原则出炉:AI能进军方,但不能自己开火
OpenAI 发布政府与国家安全合作原则,明确会继续和美国政府及盟友合作。
合作重点主要是两类:网络防御和生物安全。
网络防御:OpenAI 已和澳大利亚、加拿大、日本、韩国、法国、德国、波兰、荷兰,以及欧盟网络安全机构 ENISA 建立合作。英国政府也参与网络安全、模型测试和评估合作。
生物安全:OpenAI 已向部分美国政府和盟友开放 GPT-Rosalind,用于公共卫生和生物防御任务。
OpenAI 同时划出底线:不支持大规模国内监控,不支持绕开法律和监督,也不允许 AI 在没人类授权的情况下,自主选定并攻击目标。
但 OpenAI 没有把军事、情报和调查用途全部排除。
信源:https://openai.com/index/government-national-security-partnerships/
OpenAI 发布政府与国家安全合作原则,明确会继续和美国政府及盟友合作。
合作重点主要是两类:网络防御和生物安全。
网络防御:OpenAI 已和澳大利亚、加拿大、日本、韩国、法国、德国、波兰、荷兰,以及欧盟网络安全机构 ENISA 建立合作。英国政府也参与网络安全、模型测试和评估合作。
生物安全:OpenAI 已向部分美国政府和盟友开放 GPT-Rosalind,用于公共卫生和生物防御任务。
OpenAI 同时划出底线:不支持大规模国内监控,不支持绕开法律和监督,也不允许 AI 在没人类授权的情况下,自主选定并攻击目标。
但 OpenAI 没有把军事、情报和调查用途全部排除。
信源:https://openai.com/index/government-national-security-partnerships/
OpenAI
Our approach to government and national security partnerships
Learn how OpenAI approaches government and national security partnerships, with principles for responsible AI use, democratic accountability, and public safety.
Databricks拿真实代码库测Agent,GLM 5.2进第一梯队
Databricks 发布内部 AI 编程 Agent 评测,用自家数百万行代码库里的真实 PR 做测试。
这套评测没有直接用 SWE-Bench。Databricks 认为公开题集可能进过训练数据,也不够贴近真实工程。
测试任务来自近期合并的 PR,覆盖 Python、Go、TypeScript、Scala 等语言。团队过滤了机器人提交、AI 生成代码和自动生成代码,只保留能验证结果的任务。
结果显示,编程 Agent 已经分出大致三档。最高一档不只包括 OpenAI 和 Anthropic 模型,也包括开源模型。GLM 5.2 进入第一梯队,质量上与 Opus 4.8 接近,单任务成本为 1.28 美元,低于 Opus 4.8 的 1.94 美元。
评测还发现,Token 单价不能直接代表真实成本。Sonnet 5 每 Token 更便宜,但在这套任务里跑得更久、读得更多,单任务成本反而更高。
工具壳也很关键。同一模型换不同 Agent 框架,任务成本最高可差 2 倍以上,但完成质量变化不大。
信源:https://www.databricks.com/blog/benchmarking-coding-agents-databricks-multi-million-line-codebase
Databricks 发布内部 AI 编程 Agent 评测,用自家数百万行代码库里的真实 PR 做测试。
这套评测没有直接用 SWE-Bench。Databricks 认为公开题集可能进过训练数据,也不够贴近真实工程。
测试任务来自近期合并的 PR,覆盖 Python、Go、TypeScript、Scala 等语言。团队过滤了机器人提交、AI 生成代码和自动生成代码,只保留能验证结果的任务。
结果显示,编程 Agent 已经分出大致三档。最高一档不只包括 OpenAI 和 Anthropic 模型,也包括开源模型。GLM 5.2 进入第一梯队,质量上与 Opus 4.8 接近,单任务成本为 1.28 美元,低于 Opus 4.8 的 1.94 美元。
评测还发现,Token 单价不能直接代表真实成本。Sonnet 5 每 Token 更便宜,但在这套任务里跑得更久、读得更多,单任务成本反而更高。
工具壳也很关键。同一模型换不同 Agent 框架,任务成本最高可差 2 倍以上,但完成质量变化不大。
信源:https://www.databricks.com/blog/benchmarking-coding-agents-databricks-multi-million-line-codebase
谷歌AI Studio接入GitHub,旧项目可以直接拉进来改
Google AI Studio 新增「Import from GitHub」。AI Studio 不再只能从零生成项目,也能接手已有代码。
开发者可以把 GitHub 仓库导入 AI Studio。Gemini 会把项目转成兼容运行环境的格式,之后可以继续修改、预览和部署。
不过这还不是双向同步。产品负责人 Logan Kilpatrick 称,双向 GitHub 支持是下一步,团队正在做。
信源:https://x.com/officiallogank/status/2074902342512845206?s=46
Google AI Studio 新增「Import from GitHub」。AI Studio 不再只能从零生成项目,也能接手已有代码。
开发者可以把 GitHub 仓库导入 AI Studio。Gemini 会把项目转成兼容运行环境的格式,之后可以继续修改、预览和部署。
不过这还不是双向同步。产品负责人 Logan Kilpatrick 称,双向 GitHub 支持是下一步,团队正在做。
信源:https://x.com/officiallogank/status/2074902342512845206?s=46
❤2
谷歌云从OpenAI挖走Harness Engineering作者,押注企业Agent工作流
OpenAI 前工程师 Ryan Lopopolo 宣布加入谷歌云,担任 Agentic Google Cloud Platform 首席工程师。
Lopopolo 是 OpenAI《Harness engineering》文章作者。这套方法强调给 Agent 配好上下文、工具、权限、评测和反馈回路,让 Agent 真正参与软件开发。
他在 OpenAI 参与过一个内部实验:团队用 Codex 从空仓库开始做产品,5 个月生成约 100 万行代码。代码、测试、CI、文档和内部工具都由 Codex 完成,人类主要负责目标和验收。
这次跳槽说明,谷歌云不只想卖模型和算力,也在补企业 Agent 工程化能力。
信源:https://x.com/_lopopolo/status/2074977994356212026?s=46
OpenAI 前工程师 Ryan Lopopolo 宣布加入谷歌云,担任 Agentic Google Cloud Platform 首席工程师。
Lopopolo 是 OpenAI《Harness engineering》文章作者。这套方法强调给 Agent 配好上下文、工具、权限、评测和反馈回路,让 Agent 真正参与软件开发。
他在 OpenAI 参与过一个内部实验:团队用 Codex 从空仓库开始做产品,5 个月生成约 100 万行代码。代码、测试、CI、文档和内部工具都由 Codex 完成,人类主要负责目标和验收。
这次跳槽说明,谷歌云不只想卖模型和算力,也在补企业 Agent 工程化能力。
信源:https://x.com/_lopopolo/status/2074977994356212026?s=46
🎉2
Prime Intellect完成1.3亿美元A轮融资,帮企业自己训练Agent
AI 基础设施公司 Prime Intellect 完成 1.3 亿美元 A 轮融资,估值达到 10 亿美元。融资由 Radical Ventures 领投,英伟达风投、Intel Capital、Dell Technologies Capital 等参投。
Prime Intellect 做的是「Open Superintelligence Stack」,一套面向 Agent 的训练和部署平台。它把算力、大规模强化学习、环境、沙箱、评测和推理服务打包,让企业自己训练和优化 Agent,不必完全依赖 OpenAI、Anthropic 这类闭源模型供应商。
公司称,目前已有 6000 多个客户使用其工具,年化收入超过 1 亿美元。Ramp 曾用 Prime Intellect 的 Lab 平台训练一个 35B 模型,用来做表格搜索,准确率超过 Claude Opus,速度快 27%,成本也更低。
信源:https://www.primeintellect.ai/blog/series-a
AI 基础设施公司 Prime Intellect 完成 1.3 亿美元 A 轮融资,估值达到 10 亿美元。融资由 Radical Ventures 领投,英伟达风投、Intel Capital、Dell Technologies Capital 等参投。
Prime Intellect 做的是「Open Superintelligence Stack」,一套面向 Agent 的训练和部署平台。它把算力、大规模强化学习、环境、沙箱、评测和推理服务打包,让企业自己训练和优化 Agent,不必完全依赖 OpenAI、Anthropic 这类闭源模型供应商。
公司称,目前已有 6000 多个客户使用其工具,年化收入超过 1 亿美元。Ramp 曾用 Prime Intellect 的 Lab 平台训练一个 35B 模型,用来做表格搜索,准确率超过 Claude Opus,速度快 27%,成本也更低。
信源:https://www.primeintellect.ai/blog/series-a
www.primeintellect.ai
$130M Series A to Build the Open Superintelligence Stack
We've raised $130M led by Radical Ventures, with participation from NVIDIA Ventures, Intel Capital, Dell Technologies Capital, and our existing investors — bringing our total funding to over $150M to build the open superintelligence stack.
❤1
Ollama完成6500万美元B轮融资,要把开源模型变得更好用
开源模型工具 Ollama 完成 6500 万美元 B 轮融资。Theory Ventures 领投,Benchmark、8VC、Y Combinator 等参投。Ollama 总融资额达到 8800 万美元。
Ollama 的核心功能很简单:让开发者用一条命令,在本地跑起开源模型。它也提供 API,方便开发者把模型接进自己的应用。
官方称,Ollama 目前服务 890 万开发者,并被 85% 的财富 500 强企业使用。它的云端服务也在增长,token 用量平均每月翻倍以上。
新资金会用来做三件事:本地和云端混合推理、新模型首日支持、团队云服务。
信源:https://ollama.com/blog/all-aboard-open-models
开源模型工具 Ollama 完成 6500 万美元 B 轮融资。Theory Ventures 领投,Benchmark、8VC、Y Combinator 等参投。Ollama 总融资额达到 8800 万美元。
Ollama 的核心功能很简单:让开发者用一条命令,在本地跑起开源模型。它也提供 API,方便开发者把模型接进自己的应用。
官方称,Ollama 目前服务 890 万开发者,并被 85% 的财富 500 强企业使用。它的云端服务也在增长,token 用量平均每月翻倍以上。
新资金会用来做三件事:本地和云端混合推理、新模型首日支持、团队云服务。
信源:https://ollama.com/blog/all-aboard-open-models
Ollama
Ollama: all aboard open models· Ollama Blog
Serving 8.9 million developers, Ollama has raised $88M from Benchmark, Theory Ventures, 8VC, Y Combinator, and many incredible angel investors.
Meta发布Muse Spark 1.1并开放API,卷起AI编程价格战
Meta 发布最新多模态推理模型 Muse Spark 1.1,并开放 Meta Model API 公测。开发者现在可以直接调用新模型,不再只是在 Meta 自家产品里使用。
Muse Spark 1.1 主打编程、Agent 和多模态任务,支持 100 万 token 上下文。
新模型价格打得很低:输入每 100 万 token 1.25 美元,缓存输入 0.15 美元,输出 4.25 美元。
早期合作方包括 Replit、Box 和 Cline。Meta 这次不是只做聊天机器人,而是正式进入 AI 编程和 Agent 市场。
信源:https://ai.meta.com/blog/introducing-muse-spark-meta-model-api/
Meta 发布最新多模态推理模型 Muse Spark 1.1,并开放 Meta Model API 公测。开发者现在可以直接调用新模型,不再只是在 Meta 自家产品里使用。
Muse Spark 1.1 主打编程、Agent 和多模态任务,支持 100 万 token 上下文。
新模型价格打得很低:输入每 100 万 token 1.25 美元,缓存输入 0.15 美元,输出 4.25 美元。
早期合作方包括 Replit、Box 和 Cline。Meta 这次不是只做聊天机器人,而是正式进入 AI 编程和 Agent 市场。
信源:https://ai.meta.com/blog/introducing-muse-spark-meta-model-api/
Meta AI
Introducing Muse Spark 1.1
PrismML把Qwen3.6压到4GB,27B模型塞进iPhone
加州理工学院数学家 Babak Hassibi 联合创立的 AI 实验室 PrismML 表示,已把阿里开源模型 Qwen3.6-27B 压缩后跑在 iPhone 17 Pro 上。
Qwen3.6-27B 是 270 亿参数稠密模型。推理时所有参数都会参与,不是只激活部分参数的 MoE 模型。
PrismML 称,模型大小从约 54GB 压到不到 4GB,性能没有明显下降。它可用于复杂对话、推理、Agent 和代码任务。
苹果已经和 PrismML 接触,讨论如何使用这项技术。苹果一直想把更多 AI 放到设备本地,但高级 Siri 仍依赖云端模型。
信源:https://www.theinformation.com/articles/khosla-backed-startup-claims-breakthrough-largest-ever-ai-model-iphone
加州理工学院数学家 Babak Hassibi 联合创立的 AI 实验室 PrismML 表示,已把阿里开源模型 Qwen3.6-27B 压缩后跑在 iPhone 17 Pro 上。
Qwen3.6-27B 是 270 亿参数稠密模型。推理时所有参数都会参与,不是只激活部分参数的 MoE 模型。
PrismML 称,模型大小从约 54GB 压到不到 4GB,性能没有明显下降。它可用于复杂对话、推理、Agent 和代码任务。
苹果已经和 PrismML 接触,讨论如何使用这项技术。苹果一直想把更多 AI 放到设备本地,但高级 Siri 仍依赖云端模型。
信源:https://www.theinformation.com/articles/khosla-backed-startup-claims-breakthrough-largest-ever-ai-model-iphone
The Information
Khosla-Backed Startup Claims Breakthrough With Largest-Ever AI Model on an iPhone
Apple is on a quest to shrink powerful AI models to run on iPhones, which could cut down on cloud computing costs and enhance user privacy. But a small startup that emerged from stealth mode earlier this year says it recently got an AI model running on an…
❤3
GPT-5.6正式发布:Agent评测领先Claude Fable模型13.1分
OpenAI 发布 GPT-5.6 系列,包含旗舰模型 Sol、均衡版 Terra 和低价版 Luna。新模型已上线 ChatGPT、Codex 和 API。
GPT-5.6 Sol 主打性能和效率。在专业 Agent 评测 Agents’ Last Exam 中,Sol 得分 53.6,比 Claude Fable 5 高 13.1 分。使用中等推理强度时,它仍领先 11.4 分,估算成本约为对方四分之一。
编程能力也有提升。Sol 在 Artificial Analysis 编程 Agent 指数中得到 80 分,比 Fable 5 高 2.8 分,同时输出 token 不到一半,耗时不到一半,成本低约三分之一。
GPT-5.6 还新增 ultra 模式。它默认让 4 个 Agent 并行工作,用更多 token 换取更强结果和更短耗时。API 用户也可以调用多 Agent 测试版。
API 每 100 万 token 的输入和输出价格分别为:Sol 5 美元和 30 美元,Terra 2.5 美元和 15 美元,Luna 1 美元和 6 美元。
信源:https://openai.com/index/gpt-5-6/
OpenAI 发布 GPT-5.6 系列,包含旗舰模型 Sol、均衡版 Terra 和低价版 Luna。新模型已上线 ChatGPT、Codex 和 API。
GPT-5.6 Sol 主打性能和效率。在专业 Agent 评测 Agents’ Last Exam 中,Sol 得分 53.6,比 Claude Fable 5 高 13.1 分。使用中等推理强度时,它仍领先 11.4 分,估算成本约为对方四分之一。
编程能力也有提升。Sol 在 Artificial Analysis 编程 Agent 指数中得到 80 分,比 Fable 5 高 2.8 分,同时输出 token 不到一半,耗时不到一半,成本低约三分之一。
GPT-5.6 还新增 ultra 模式。它默认让 4 个 Agent 并行工作,用更多 token 换取更强结果和更短耗时。API 用户也可以调用多 Agent 测试版。
API 每 100 万 token 的输入和输出价格分别为:Sol 5 美元和 30 美元,Terra 2.5 美元和 15 美元,Luna 1 美元和 6 美元。
信源:https://openai.com/index/gpt-5-6/
OpenAI
GPT-5.6: Frontier intelligence that scales with your ambition
More intelligence from every token, stronger performance per dollar, and more capability on demand for your hardest work.
OpenAI推出工作流Agent ChatGPT Work,并把Codex并入ChatGPT
OpenAI 推出 ChatGPT Work。这是 ChatGPT 里的新 Agent,由 Codex 和 GPT-5.6 驱动。
它不只回答问题,还能接手完整工作流。用户给一个目标,它可以读取已连接的应用和文件,生成文档、表格、幻灯片、分析报告和网页应用。
ChatGPT Work 可连接 Slack、Microsoft Teams、Google Drive、SharePoint、邮件、日历、CRM 和项目管理工具。用户也可以用 @ 指定应用,让它从里面提取上下文。
桌面端变化更大。Codex 应用将并入新的 ChatGPT 桌面应用。新的桌面端会同时提供 Chat、Work、Codex 和内置浏览器。
ChatGPT Work 已向 Pro、Enterprise 和 Edu 用户开放。Plus 和 Business 用户会在未来几天开放。桌面端的 Chat、Work 和 Codex 面向所有套餐开放,包括免费用户。
信源:https://openai.com/zh-Hans-CN/index/chatgpt-for-your-most-ambitious-work/
OpenAI 推出 ChatGPT Work。这是 ChatGPT 里的新 Agent,由 Codex 和 GPT-5.6 驱动。
它不只回答问题,还能接手完整工作流。用户给一个目标,它可以读取已连接的应用和文件,生成文档、表格、幻灯片、分析报告和网页应用。
ChatGPT Work 可连接 Slack、Microsoft Teams、Google Drive、SharePoint、邮件、日历、CRM 和项目管理工具。用户也可以用 @ 指定应用,让它从里面提取上下文。
桌面端变化更大。Codex 应用将并入新的 ChatGPT 桌面应用。新的桌面端会同时提供 Chat、Work、Codex 和内置浏览器。
ChatGPT Work 已向 Pro、Enterprise 和 Edu 用户开放。Plus 和 Business 用户会在未来几天开放。桌面端的 Chat、Work 和 Codex 面向所有套餐开放,包括免费用户。
信源:https://openai.com/zh-Hans-CN/index/chatgpt-for-your-most-ambitious-work/
OpenAI
ChatGPT 现在是你完成最具雄心工作的伙伴
ChatGPT Work 是一个智能体,可在你的应用和文件中采取行动,必要时持续处理项目数小时,并把目标转化为完成的工作。
OpenAI砍掉Atlas浏览器,上线不到一年并入ChatGPT
OpenAI 将停止运营独立浏览器 ChatGPT Atlas。Atlas 将在 8 月 9 日停止服务,距离发布还不到一年。
Atlas 的主要能力会并入 ChatGPT 和 Codex。新版 ChatGPT 桌面端已经加入浏览器,可开多个标签页、下载文件、登录网站,并让 Agent 直接操作网页。用户也可以通过 Chrome 扩展调用 ChatGPT。
Atlas 的书签、标签页和浏览历史不会自动迁移。用户需要在停服前手动导出书签,并保存重要网页。
OpenAI 此前分别推出 ChatGPT、Codex 和 Atlas。现在三者开始合并到同一个桌面应用,Atlas 也成为首个被放弃的独立产品。
信源:https://www.theverge.com/ai-artificial-intelligence/963654/openai-chatgpt-atlas-ai-browser-shut-down-sunset
OpenAI 将停止运营独立浏览器 ChatGPT Atlas。Atlas 将在 8 月 9 日停止服务,距离发布还不到一年。
Atlas 的主要能力会并入 ChatGPT 和 Codex。新版 ChatGPT 桌面端已经加入浏览器,可开多个标签页、下载文件、登录网站,并让 Agent 直接操作网页。用户也可以通过 Chrome 扩展调用 ChatGPT。
Atlas 的书签、标签页和浏览历史不会自动迁移。用户需要在停服前手动导出书签,并保存重要网页。
OpenAI 此前分别推出 ChatGPT、Codex 和 Atlas。现在三者开始合并到同一个桌面应用,Atlas 也成为首个被放弃的独立产品。
信源:https://www.theverge.com/ai-artificial-intelligence/963654/openai-chatgpt-atlas-ai-browser-shut-down-sunset
The Verge
The ChatGPT browser is already dead
ChatGPT Atlas didn’t even last a year.
从「反人类」到AI领头羊,马斯克对Anthropic彻底改口
马斯克公开承认,自己此前看错了 Anthropic。它现在是 AI 领域的领头羊,没有公司发布过比 Mythos 和 Fable 更好的模型。
这次转弯幅度不小。
今年 2 月,马斯克还称 Anthropic「厌恶西方文明」,模型仇视白人、亚裔、异性恋和男性,是一家「反人类且邪恶」的公司。他还指责 Anthropic 大规模窃取训练数据,形容公司「自以为是、道貌岸然又虚伪」。3 月,他又追问:「还有比 Anthropic 更虚伪的公司吗?」
转折出现在双方谈生意之后。
5 月,Anthropic 租下 SpaceX 的 Colossus 1 数据中心,可使用超过 22 万块英伟达 GPU。马斯克随即表示,自己花了大量时间与 Anthropic 高层交流,发现他们「能力很强,也非常在乎做正确的事」,而且没人触发他的「邪恶探测器」。
两个月后,「邪恶探测器」已经升级成了冠军认证。马斯克不仅把 Anthropic 评为 AI 第一,还承诺不会突然切断算力伤害对方,因为「这不是我的风格」。
信源:https://x.com/elonmusk/status/2075278580955685036?s=46
马斯克公开承认,自己此前看错了 Anthropic。它现在是 AI 领域的领头羊,没有公司发布过比 Mythos 和 Fable 更好的模型。
这次转弯幅度不小。
今年 2 月,马斯克还称 Anthropic「厌恶西方文明」,模型仇视白人、亚裔、异性恋和男性,是一家「反人类且邪恶」的公司。他还指责 Anthropic 大规模窃取训练数据,形容公司「自以为是、道貌岸然又虚伪」。3 月,他又追问:「还有比 Anthropic 更虚伪的公司吗?」
转折出现在双方谈生意之后。
5 月,Anthropic 租下 SpaceX 的 Colossus 1 数据中心,可使用超过 22 万块英伟达 GPU。马斯克随即表示,自己花了大量时间与 Anthropic 高层交流,发现他们「能力很强,也非常在乎做正确的事」,而且没人触发他的「邪恶探测器」。
两个月后,「邪恶探测器」已经升级成了冠军认证。马斯克不仅把 Anthropic 评为 AI 第一,还承诺不会突然切断算力伤害对方,因为「这不是我的风格」。
信源:https://x.com/elonmusk/status/2075278580955685036?s=46
Claude上线「防沉迷」功能:统计你把时间花在哪,还会提醒休息
Anthropic 为 Claude 推出 Reflect 功能,帮用户回顾自己如何使用 AI。它会统计使用时间、常聊的话题和主要任务,并生成过去 1、3、6 或 12 个月的使用报告。
Reflect 还带有一套轻量「防沉迷」功能。用户可以设置免打扰时段,也可以让 Claude 在连续使用一段时间后提醒休息。
Reflect 目前向 Free、Pro 和 Max 用户开放测试,支持网页版和桌面端,但必须开启记忆功能。无痕对话、连接工具中的原始文件,以及通过健康服务产生的对话,都不会进入报告。
信源:https://www.anthropic.com/news/reflect-with-claude
Anthropic 为 Claude 推出 Reflect 功能,帮用户回顾自己如何使用 AI。它会统计使用时间、常聊的话题和主要任务,并生成过去 1、3、6 或 12 个月的使用报告。
Reflect 还带有一套轻量「防沉迷」功能。用户可以设置免打扰时段,也可以让 Claude 在连续使用一段时间后提醒休息。
Reflect 目前向 Free、Pro 和 Max 用户开放测试,支持网页版和桌面端,但必须开启记忆功能。无痕对话、连接工具中的原始文件,以及通过健康服务产生的对话,都不会进入报告。
信源:https://www.anthropic.com/news/reflect-with-claude
OpenAI二号人物Fidji Simo因病离任,入职不到一年
OpenAI 的 AGI 部署 CEO Fidji Simo 宣布离开全职岗位,转任兼职顾问。她三个月前因慢性疾病加重开始休假,如今确认康复过程比预期更漫长,需要把精力放在治疗上。
Simo 是 OpenAI 仅次于 Sam Altman 的核心高管。她原任美国生鲜杂货配送平台 Instacart CEO,也曾负责 Facebook App。2025 年加入 OpenAI 后,她统管产品和商业团队,覆盖 ChatGPT、Codex 等业务,后来改任 AGI 部署 CEO。
今年 4 月,Simo 因神经免疫疾病休假,原计划只离开几周。此后,OpenAI 总裁 Greg Brockman 接管产品工作。她原有的产品和商业职责,预计将由 Brockman、CFO Sarah Friar 和首席战略官 Jason Kwon 分担。
Simo 表示,她已与慢性疾病共处七年,目前没有治愈方法。未来除继续担任 OpenAI 顾问,还会参与 AI 生物医疗项目 Chronicle BioAI 和 CODA Research。
信源:https://x.com/fidjissimo/status/2075353170927304861?s=46
OpenAI 的 AGI 部署 CEO Fidji Simo 宣布离开全职岗位,转任兼职顾问。她三个月前因慢性疾病加重开始休假,如今确认康复过程比预期更漫长,需要把精力放在治疗上。
Simo 是 OpenAI 仅次于 Sam Altman 的核心高管。她原任美国生鲜杂货配送平台 Instacart CEO,也曾负责 Facebook App。2025 年加入 OpenAI 后,她统管产品和商业团队,覆盖 ChatGPT、Codex 等业务,后来改任 AGI 部署 CEO。
今年 4 月,Simo 因神经免疫疾病休假,原计划只离开几周。此后,OpenAI 总裁 Greg Brockman 接管产品工作。她原有的产品和商业职责,预计将由 Brockman、CFO Sarah Friar 和首席战略官 Jason Kwon 分担。
Simo 表示,她已与慢性疾病共处七年,目前没有治愈方法。未来除继续担任 OpenAI 顾问,还会参与 AI 生物医疗项目 Chronicle BioAI 和 CODA Research。
信源:https://x.com/fidjissimo/status/2075353170927304861?s=46
X (formerly Twitter)
Fidji Simo (@fidjissimo) on X
Today, I shared with the OpenAI team that I have decided to leave my full-time role at OpenAI and transition to being a part-time advisor.
Three months ago, I had to go on medical leave after a severe exacerbation of a chronic illness I’ve lived with for…
Three months ago, I had to go on medical leave after a severe exacerbation of a chronic illness I’ve lived with for…
❤1
Meta自研芯片Iris将投产,以减少对英伟达依赖
Meta 计划从 9 月开始生产新一代自研 AI 芯片 Iris。芯片由 Meta 自己设计,博通参与开发,台积电负责生产。
Iris 属于 Meta 自研加速器 MTIA 系列,主要用于 Facebook 和 Instagram 背后的 AI 任务。它会与英伟达、AMD 的 GPU 搭配使用,不会完全取代外购芯片。
Iris 测试只用了 6 周,没有发现重大问题。Meta 还计划在 2027 年底前,大约每半年推出一款新芯片。一般 AI 芯片的更新周期为一年以上。
Meta 也在疯狂扩充数据中心。今年计划部署 7GW 算力,2027 年再翻一倍至 14GW。今年 AI 基础设施支出最高可达 1450 亿美元。
自研芯片能降低成本,也能减少 Meta 对英伟达和 AMD 的依赖。但 Meta 仍在购买大量外部 GPU,短期内无法完全自己解决芯片需求。
信源:https://www.reuters.com/world/asia-pacific/meta-put-ai-chip-into-production-september-it-looks-double-computing-capacity-2026-07-09/
Meta 计划从 9 月开始生产新一代自研 AI 芯片 Iris。芯片由 Meta 自己设计,博通参与开发,台积电负责生产。
Iris 属于 Meta 自研加速器 MTIA 系列,主要用于 Facebook 和 Instagram 背后的 AI 任务。它会与英伟达、AMD 的 GPU 搭配使用,不会完全取代外购芯片。
Iris 测试只用了 6 周,没有发现重大问题。Meta 还计划在 2027 年底前,大约每半年推出一款新芯片。一般 AI 芯片的更新周期为一年以上。
Meta 也在疯狂扩充数据中心。今年计划部署 7GW 算力,2027 年再翻一倍至 14GW。今年 AI 基础设施支出最高可达 1450 亿美元。
自研芯片能降低成本,也能减少 Meta 对英伟达和 AMD 的依赖。但 Meta 仍在购买大量外部 GPU,短期内无法完全自己解决芯片需求。
信源:https://www.reuters.com/world/asia-pacific/meta-put-ai-chip-into-production-september-it-looks-double-computing-capacity-2026-07-09/