Meta在加拿大建首座AI数据中心,130亿加元押注天然气
Meta 宣布在加拿大阿尔伯塔省斯特金县建设新的 AI 数据中心。这是 Meta 在加拿大的首座数据中心,也是其全球第 33 座数据中心。项目投资超过 130 亿加元,规模为 1GW,主要用于支撑 Meta 的 AI 训练和核心产品。
Meta 称,项目高峰期将支持超过 3000 个建筑岗位,建成后提供 300 多个运营岗位。公司还将投入约 6000 万加元,用于当地道路、供水等基础设施和社区项目。
这座数据中心将依赖新建天然气电厂供电。配套的绿光电力中心规模为 932MW,预计 2030 年下半年投运。项目采用闭环冷却系统,Meta 称不会直接取用当地水源。
信源:https://about.fb.com/news/2026/07/breaking-ground-on-metas-first-data-center-in-canada/
Meta 宣布在加拿大阿尔伯塔省斯特金县建设新的 AI 数据中心。这是 Meta 在加拿大的首座数据中心,也是其全球第 33 座数据中心。项目投资超过 130 亿加元,规模为 1GW,主要用于支撑 Meta 的 AI 训练和核心产品。
Meta 称,项目高峰期将支持超过 3000 个建筑岗位,建成后提供 300 多个运营岗位。公司还将投入约 6000 万加元,用于当地道路、供水等基础设施和社区项目。
这座数据中心将依赖新建天然气电厂供电。配套的绿光电力中心规模为 932MW,预计 2030 年下半年投运。项目采用闭环冷却系统,Meta 称不会直接取用当地水源。
信源:https://about.fb.com/news/2026/07/breaking-ground-on-metas-first-data-center-in-canada/
Meta Newsroom
Breaking Ground on Meta’s First Data Center in Canada
We’re breaking ground on a new 1GW, AI-optimized data center in Sturgeon County, Alberta — our first data center in Canada and 33rd in our global fleet.
火山引擎上线Seedream 5.0 Pro API,AI绘图走向局部像素级编辑
火山引擎发布豆包图像创作模型 Seedream 5.0 Pro 的 API 服务。新模型改进了传统 AI 绘图只能靠文字提示词控制的局限,提供像素级局部微调。设计师可以在画面中点选或圈选特定区域,直接调整位置、替换材质或分离图层,无需重绘整张图片。
模型提升了复杂排版与文字呈现质量,能够自动生成科普绘本、复杂 PPT 等高密度信息图。人像与光影质感同样得到强化,逼真还原皮肤肌理和环境折射。出海场景中,模型支持直接生成西班牙语、阿拉伯语等十余种全球常用语言,确保书写与排版符合当地习惯。
信源:https://mp.weixin.qq.com/s/s3vYTUZHZYNpVGSK-W9neA
火山引擎发布豆包图像创作模型 Seedream 5.0 Pro 的 API 服务。新模型改进了传统 AI 绘图只能靠文字提示词控制的局限,提供像素级局部微调。设计师可以在画面中点选或圈选特定区域,直接调整位置、替换材质或分离图层,无需重绘整张图片。
模型提升了复杂排版与文字呈现质量,能够自动生成科普绘本、复杂 PPT 等高密度信息图。人像与光影质感同样得到强化,逼真还原皮肤肌理和环境折射。出海场景中,模型支持直接生成西班牙语、阿拉伯语等十余种全球常用语言,确保书写与排版符合当地习惯。
信源:https://mp.weixin.qq.com/s/s3vYTUZHZYNpVGSK-W9neA
Typeless 2.0上线:边想边说也能直接成稿
AI 语音输入工具 Typeless 发布 2.0 版本。相比旧版,2.0 不只做语音转写和润色,还能把零散口述整理成完整文本。
用户可以边想边说,也可以中途改口、补充说明,比如「这里语气轻一点」「前面那句换个说法」。Typeless 会把这些内容当作写作提示,而不是原样写进正文。
这让 Typeless 更像一个语音写作代理,能把半成品想法快速变成邮件、消息、社媒回复或 AI prompt。
Typeless 支持 Mac、Windows、iOS 和 Android。官方称,语音和有限上下文会在云端实时处理,结果返回设备后立即丢弃,不在服务器保存。
信源:https://x.com/huang_song_/status/2074860776670847388?s=46
AI 语音输入工具 Typeless 发布 2.0 版本。相比旧版,2.0 不只做语音转写和润色,还能把零散口述整理成完整文本。
用户可以边想边说,也可以中途改口、补充说明,比如「这里语气轻一点」「前面那句换个说法」。Typeless 会把这些内容当作写作提示,而不是原样写进正文。
这让 Typeless 更像一个语音写作代理,能把半成品想法快速变成邮件、消息、社媒回复或 AI prompt。
Typeless 支持 Mac、Windows、iOS 和 Android。官方称,语音和有限上下文会在云端实时处理,结果返回设备后立即丢弃,不在服务器保存。
信源:https://x.com/huang_song_/status/2074860776670847388?s=46
AI编程跑分又不准了,OpenAI发现SWE-Bench Pro约三成题目有问题
OpenAI 发布编程评测审计报告,称 SWE-Bench Pro 约三成题目不适合作为有效评测。SWE-Bench Pro 原本用于测试 AI agent 的真实编程能力,也是 OpenAI 此前推荐替代 SWE-bench Verified 的评测集。
OpenAI 审计了 SWE-Bench Pro 的 731 道公开题。自动流程标出 200 道问题题目,占 27.4%;人工标注发现 249 道,占 34.1%。
主要问题包括:题目描述不完整、测试要求过严、隐藏测试检查了额外要求,以及测试覆盖不足。这会让模型跑分失真:失败不一定是模型不会,通过也不一定是真修好了问题。
OpenAI 称,前沿模型在这组公开题上的通过率,8 个月内从 23.3% 升到 80.3%。但在题目本身存在噪声的情况下,这类涨分需要更谨慎解读。
OpenAI 已撤回此前采用 SWE-Bench Pro 的建议,并呼吁社区重新构建更可信的编程评测。
信源:https://openai.com/index/separating-signal-from-noise-coding-evaluations/
OpenAI 发布编程评测审计报告,称 SWE-Bench Pro 约三成题目不适合作为有效评测。SWE-Bench Pro 原本用于测试 AI agent 的真实编程能力,也是 OpenAI 此前推荐替代 SWE-bench Verified 的评测集。
OpenAI 审计了 SWE-Bench Pro 的 731 道公开题。自动流程标出 200 道问题题目,占 27.4%;人工标注发现 249 道,占 34.1%。
主要问题包括:题目描述不完整、测试要求过严、隐藏测试检查了额外要求,以及测试覆盖不足。这会让模型跑分失真:失败不一定是模型不会,通过也不一定是真修好了问题。
OpenAI 称,前沿模型在这组公开题上的通过率,8 个月内从 23.3% 升到 80.3%。但在题目本身存在噪声的情况下,这类涨分需要更谨慎解读。
OpenAI 已撤回此前采用 SWE-Bench Pro 的建议,并呼吁社区重新构建更可信的编程评测。
信源:https://openai.com/index/separating-signal-from-noise-coding-evaluations/
OpenAI
Separating signal from noise in coding evaluations
A new analysis from OpenAI reveals issues in SWE-Bench Pro, a popular coding benchmark, raising concerns about reliability and accuracy in evaluating AI models.
传GPT-6改用更大底座对标Fable5.1,DeepSeek V4 GA或超GLM-5.2
AI 爆料账号 leo 称,OpenAI 的 GPT-5.6 将是 5.x 系列最后一代,GPT-6 预计约一个月内发布,甚至可能更早。
GPT-6 将基于一个新的、更大的预训练底座,而不是继续沿用 GPT-5.5 / GPT-5.6 传闻中的 Spud 底座。Spud 规模约为 4T 参数。OpenAI 原本计划将 Spud 用到 GPT-6,但最终改用更大底座。
OpenAI 内部对新底座很兴奋,认为它更适合对抗 Anthropic 的 Fable 5 和即将推出的 Fable 5.1。
同一爆料还提到,DeepSeek 正准备推出 V4 GA,表现可能对标或超过 GLM-5.2。DeepSeek 也已开始研发更大规模模型,用来对抗 MiniMax 计划推出的 2.7 万亿参数 MiniMax Pro / M3 Pro。
信源:https://x.com/synthwavedd/status/2074886230018568582?s=46
AI 爆料账号 leo 称,OpenAI 的 GPT-5.6 将是 5.x 系列最后一代,GPT-6 预计约一个月内发布,甚至可能更早。
GPT-6 将基于一个新的、更大的预训练底座,而不是继续沿用 GPT-5.5 / GPT-5.6 传闻中的 Spud 底座。Spud 规模约为 4T 参数。OpenAI 原本计划将 Spud 用到 GPT-6,但最终改用更大底座。
OpenAI 内部对新底座很兴奋,认为它更适合对抗 Anthropic 的 Fable 5 和即将推出的 Fable 5.1。
同一爆料还提到,DeepSeek 正准备推出 V4 GA,表现可能对标或超过 GLM-5.2。DeepSeek 也已开始研发更大规模模型,用来对抗 MiniMax 计划推出的 2.7 万亿参数 MiniMax Pro / M3 Pro。
信源:https://x.com/synthwavedd/status/2074886230018568582?s=46
OpenAI研究员:多数AI研究任务,我会选GPT-5.6而不是人类实习生
OpenAI 高级研究员 Noam Brown 表示,如果是在今天的大多数 AI 研究任务中,他会选择 GPT-5.6,而不是一名人类研究实习生。
Brown 是在 ICML 2026 期间回应「AI 是否已达到 AI 研究实习生水平」时作出上述表态。他同时承认,目前还没有公认方法衡量 AI 是否真正达到人类研究实习生水平。
另一位 OpenAI 研究员 Yash Pande 提出一个更现实的衡量方式:研究人员愿意给 Codex 分配多少 GPU 去完成科研任务。如果 AI 真比人更强,公司理论上会投入更多算力。
信源:https://www.theinformation.com/articles/openai-researcher-says-gpt-5-6-better-ai-research-human-interns
OpenAI 高级研究员 Noam Brown 表示,如果是在今天的大多数 AI 研究任务中,他会选择 GPT-5.6,而不是一名人类研究实习生。
Brown 是在 ICML 2026 期间回应「AI 是否已达到 AI 研究实习生水平」时作出上述表态。他同时承认,目前还没有公认方法衡量 AI 是否真正达到人类研究实习生水平。
另一位 OpenAI 研究员 Yash Pande 提出一个更现实的衡量方式:研究人员愿意给 Codex 分配多少 GPU 去完成科研任务。如果 AI 真比人更强,公司理论上会投入更多算力。
信源:https://www.theinformation.com/articles/openai-researcher-says-gpt-5-6-better-ai-research-human-interns
The Information
OpenAI Researcher Says GPT-5.6 is Better at AI Research Than Most Human Interns
I’m reporting from Seoul, where thousands of AI researchers from around the world have gathered for this year’s International Conference on Machine Learning. One of the most popular spots at the conference is OpenAI’s booth, which has been consistently encircled…
OpenAI研究员:下一代模型可能让大量Agent框架过时
OpenAI 高级研究员 Noam Brown 表示,开发者不应把太多精力投入复杂的 Agent 框架(Harness)。随着模型能力快速提升,今天许多依赖框架实现的功能,未来几个月可能会变成模型的原生能力。
Brown 建议开发者尽量保持框架简单,把更多能力交给模型本身完成。OpenAI 企业产品负责人 Alexander Embiricos 此前也表示,公司会避免手工开发那些未来模型应该自带的能力。
信源:https://www.theinformation.com/articles/openai-researcher-says-gpt-5-6-better-ai-research-human-interns
OpenAI 高级研究员 Noam Brown 表示,开发者不应把太多精力投入复杂的 Agent 框架(Harness)。随着模型能力快速提升,今天许多依赖框架实现的功能,未来几个月可能会变成模型的原生能力。
Brown 建议开发者尽量保持框架简单,把更多能力交给模型本身完成。OpenAI 企业产品负责人 Alexander Embiricos 此前也表示,公司会避免手工开发那些未来模型应该自带的能力。
信源:https://www.theinformation.com/articles/openai-researcher-says-gpt-5-6-better-ai-research-human-interns
The Information
OpenAI Researcher Says GPT-5.6 is Better at AI Research Than Most Human Interns
I’m reporting from Seoul, where thousands of AI researchers from around the world have gathered for this year’s International Conference on Machine Learning. One of the most popular spots at the conference is OpenAI’s booth, which has been consistently encircled…
OpenClaw基金会正式运营,腾讯与OpenAI英伟达微软同列首批伙伴
开源个人 AI agent 项目 OpenClaw 宣布,其非营利基金会 OpenClaw Foundation 已正式运营。
OpenClaw 是一个跑在用户自己设备上的个人 AI 助手。它可以接入邮件、日历、聊天工具和本地应用,让 AI 直接替用户完成任务。
基金会将负责 OpenClaw 的治理、资金、社区和长期维护,确保项目继续保持开源和独立。
官方称,OpenClaw 仍将保持 MIT 许可。Peter Steinberger 会继续负责项目方向,尤其是技术决策。OpenAI 也承诺支持 OpenClaw 作为开放独立项目运行。
首批合作伙伴包括 OpenAI、英伟达、微软、密歇根大学、GitHub、Cloudflare、Vercel 等。中国公司腾讯也在名单中,主要参与安全、部署和基础设施相关支持。
信源:https://openclaw.ai/blog/introducing-openclaw-foundation?xcard=20260708
开源个人 AI agent 项目 OpenClaw 宣布,其非营利基金会 OpenClaw Foundation 已正式运营。
OpenClaw 是一个跑在用户自己设备上的个人 AI 助手。它可以接入邮件、日历、聊天工具和本地应用,让 AI 直接替用户完成任务。
基金会将负责 OpenClaw 的治理、资金、社区和长期维护,确保项目继续保持开源和独立。
官方称,OpenClaw 仍将保持 MIT 许可。Peter Steinberger 会继续负责项目方向,尤其是技术决策。OpenAI 也承诺支持 OpenClaw 作为开放独立项目运行。
首批合作伙伴包括 OpenAI、英伟达、微软、密歇根大学、GitHub、Cloudflare、Vercel 等。中国公司腾讯也在名单中,主要参与安全、部署和基础设施相关支持。
信源:https://openclaw.ai/blog/introducing-openclaw-foundation?xcard=20260708
openclaw.ai
Introducing the OpenClaw Foundation - OpenClaw Blog
The lobster grows up: OpenClaw is now a non-profit, with a full-time team, world-class partners, and a mission to bring personal AI to everyone.
❤1
动察Beating AI News
一碰红线即归零:Zapier推出AI自动化新评测,最强模型得分亦折半 工作流自动化平台 Zapier 与评测机构 Artificial Analysis 合作,推出了独立的 SaaS 工作流自动化评测基准 AutomationBench-AA。 基准基于 Zapier 平台上的真实脱敏数据,设计了包含 657 个多步骤任务和 40 个模拟 SaaS 软件环境(包括 Gmail、Slack、Salesforce、Jira 等)的私有测试集,进行客观的第三方评估。 测试的严苛之处在于引入了安全合规红线(…
Grok 4.5登顶SaaS工作流评测,成本约为Claude四分之一
独立评测机构 Artificial Analysis 更新 AutomationBench-AA 榜单。SpaceXAI 的 Grok 4.5 以 51.4% 得分登顶,超过 Claude Fable 5 的 48.6% 和 Claude Opus 4.8 的 48.5%。
AutomationBench-AA 基于 Zapier 的 AutomationBench,测试 AI agent 能否按企业规则完成真实 SaaS 工作流。测试集包含 657 个多步骤任务,覆盖 40 个模拟应用环境,包括 Gmail、Google Sheets、Slack、Salesforce 和 HubSpot。
评分规则很严。模型不只要把任务做完,还不能碰企业预设红线。只要某个任务触发违规,这个任务就按 0 分处理。
Grok 4.5 的原始目标完成率接近 80%,高于 Claude Fable 5 和 Claude Opus 4.8。即便被红线扣分后,它仍以 51.4% 排在第一,也是当前首个得分超过 50% 的模型。
它的成本优势更明显。Grok 4.5 每个任务成本为 0.34 美元,低于 Claude Fable 5 的 1.35 美元、Claude Opus 4.8 的 1.46 美元,以及 GPT-5.5 xhigh 的 1.28 美元。
但 Grok 4.5 不是最稳的模型。它平均每个任务触发 0.63 次违规,高于 Claude Opus 4.8 的 0.55 次和 Gemini 3.5 Flash 的 0.46 次。
信源:https://x.com/artificialanlys/status/2075047187525034114?s=46
独立评测机构 Artificial Analysis 更新 AutomationBench-AA 榜单。SpaceXAI 的 Grok 4.5 以 51.4% 得分登顶,超过 Claude Fable 5 的 48.6% 和 Claude Opus 4.8 的 48.5%。
AutomationBench-AA 基于 Zapier 的 AutomationBench,测试 AI agent 能否按企业规则完成真实 SaaS 工作流。测试集包含 657 个多步骤任务,覆盖 40 个模拟应用环境,包括 Gmail、Google Sheets、Slack、Salesforce 和 HubSpot。
评分规则很严。模型不只要把任务做完,还不能碰企业预设红线。只要某个任务触发违规,这个任务就按 0 分处理。
Grok 4.5 的原始目标完成率接近 80%,高于 Claude Fable 5 和 Claude Opus 4.8。即便被红线扣分后,它仍以 51.4% 排在第一,也是当前首个得分超过 50% 的模型。
它的成本优势更明显。Grok 4.5 每个任务成本为 0.34 美元,低于 Claude Fable 5 的 1.35 美元、Claude Opus 4.8 的 1.46 美元,以及 GPT-5.5 xhigh 的 1.28 美元。
但 Grok 4.5 不是最稳的模型。它平均每个任务触发 0.63 次违规,高于 Claude Opus 4.8 的 0.55 次和 Gemini 3.5 Flash 的 0.46 次。
信源:https://x.com/artificialanlys/status/2075047187525034114?s=46
X (formerly Twitter)
Artificial Analysis (@ArtificialAnlys) on X
SpaceXAI's Grok 4.5 takes the #1 spot on AutomationBench-AA with a score of 51%, ahead of Claude Fable 5 (49%) and Claude Opus 4.8 (48%) at roughly a quarter of their cost per task - the first model to complete more than half of workflow objectives without…
OpenAI招投行专家,AI要学估值和尽调了
OpenAI 正在为 Applied AI 团队招聘一名投行业务专家,岗位位于旧金山。
招聘页显示,这个岗位主要服务模型训练和评测。候选人需要熟悉行业研究、财务分析、估值、尽调、交易执行和客户材料制作。
入职后,这名专家要设计真实投行任务,制定评测标准,并制作金融模型、估值分析、pitch book、投委会材料等参考样本。
OpenAI 还要求候选人评估模型和 agent 工作流。重点是判断结果是否准确、可追溯、前后一致,能否通过资深投行人士审查。
岗位要求至少 2 年投行经验。工作模式为每周 3 天到办公室。薪酬为 18.5 万至 20.5 万美元,并提供股权。
信源:https://openai.com/careers/subject-matter-expert-investment-banking-san-francisco/
OpenAI 正在为 Applied AI 团队招聘一名投行业务专家,岗位位于旧金山。
招聘页显示,这个岗位主要服务模型训练和评测。候选人需要熟悉行业研究、财务分析、估值、尽调、交易执行和客户材料制作。
入职后,这名专家要设计真实投行任务,制定评测标准,并制作金融模型、估值分析、pitch book、投委会材料等参考样本。
OpenAI 还要求候选人评估模型和 agent 工作流。重点是判断结果是否准确、可追溯、前后一致,能否通过资深投行人士审查。
岗位要求至少 2 年投行经验。工作模式为每周 3 天到办公室。薪酬为 18.5 万至 20.5 万美元,并提供股权。
信源:https://openai.com/careers/subject-matter-expert-investment-banking-san-francisco/
Openai
Subject Matter Expert, Investment Banking
Applied AI · San Francisco · FullTime
Claude Code上线/checkup,一键清理臃肿配置省上下文
Anthropic 旗下终端 Agent 工具 Claude Code 新增 /checkup 命令,用来检查和清理本地开发环境。
/checkup 会检查未使用的 Skills、MCP 和插件,减少无效上下文占用。它还能去重本地 CLAUDE.md,并把根目录 CLAUDE.md 拆成更细的嵌套文件或 Skills。
新命令还会检查慢 Hook、版本更新和权限设置。它可以建议开启默认 Auto Mode,并把常被拦截的只读命令加入预批准。
/checkup 在修改前会先向用户确认,用户可以选择全部清理、手动挑选,或只查看报告。
信源:https://x.com/bcherny/status/2074997570317779038?s=46
Anthropic 旗下终端 Agent 工具 Claude Code 新增 /checkup 命令,用来检查和清理本地开发环境。
/checkup 会检查未使用的 Skills、MCP 和插件,减少无效上下文占用。它还能去重本地 CLAUDE.md,并把根目录 CLAUDE.md 拆成更细的嵌套文件或 Skills。
新命令还会检查慢 Hook、版本更新和权限设置。它可以建议开启默认 Auto Mode,并把常被拦截的只读命令加入预批准。
/checkup 在修改前会先向用户确认,用户可以选择全部清理、手动挑选,或只查看报告。
信源:https://x.com/bcherny/status/2074997570317779038?s=46
Anthropic给AI危险知识装开关,一个模型切出16种配置
Anthropic 与 AE Studio 发布新研究 GRAM,尝试给 AI 的「双用途知识」装上开关。双用途知识指既能用于正当研究,也可能被滥用的能力,比如病毒学、网络安全和核物理。
GRAM 的做法是在模型每一层加入额外模块。训练遇到敏感领域数据时,只让对应模块学习。训练结束后,开发者可以保留模块,也可以删除模块,让模型失去对应能力。
研究团队在真实数据实验中测试了 4 类双用途领域:病毒学、网络安全、核物理和小众编程语言。4 个模块可组合出 16 种能力配置。相比为每种配置单独训练模型,这种方法只需一次训练。
论文还测试了 50M 到 5B 参数模型。结果显示,GRAM 在保留通用能力的同时,能较好移除目标能力,对小规模恶意微调的抵抗也强于训练后「遗忘」方法。
信源:https://www.anthropic.com/research/off-switch-dual-use
Anthropic 与 AE Studio 发布新研究 GRAM,尝试给 AI 的「双用途知识」装上开关。双用途知识指既能用于正当研究,也可能被滥用的能力,比如病毒学、网络安全和核物理。
GRAM 的做法是在模型每一层加入额外模块。训练遇到敏感领域数据时,只让对应模块学习。训练结束后,开发者可以保留模块,也可以删除模块,让模型失去对应能力。
研究团队在真实数据实验中测试了 4 类双用途领域:病毒学、网络安全、核物理和小众编程语言。4 个模块可组合出 16 种能力配置。相比为每种配置单独训练模型,这种方法只需一次训练。
论文还测试了 50M 到 5B 参数模型。结果显示,GRAM 在保留通用能力的同时,能较好移除目标能力,对小规模恶意微调的抵抗也强于训练后「遗忘」方法。
信源:https://www.anthropic.com/research/off-switch-dual-use
Anthropic
An off switch for dual-use knowledge in AI models
New results on a method of controlling access to potentially dangerous AI capabilities
OpenAI国安合作原则出炉:AI能进军方,但不能自己开火
OpenAI 发布政府与国家安全合作原则,明确会继续和美国政府及盟友合作。
合作重点主要是两类:网络防御和生物安全。
网络防御:OpenAI 已和澳大利亚、加拿大、日本、韩国、法国、德国、波兰、荷兰,以及欧盟网络安全机构 ENISA 建立合作。英国政府也参与网络安全、模型测试和评估合作。
生物安全:OpenAI 已向部分美国政府和盟友开放 GPT-Rosalind,用于公共卫生和生物防御任务。
OpenAI 同时划出底线:不支持大规模国内监控,不支持绕开法律和监督,也不允许 AI 在没人类授权的情况下,自主选定并攻击目标。
但 OpenAI 没有把军事、情报和调查用途全部排除。
信源:https://openai.com/index/government-national-security-partnerships/
OpenAI 发布政府与国家安全合作原则,明确会继续和美国政府及盟友合作。
合作重点主要是两类:网络防御和生物安全。
网络防御:OpenAI 已和澳大利亚、加拿大、日本、韩国、法国、德国、波兰、荷兰,以及欧盟网络安全机构 ENISA 建立合作。英国政府也参与网络安全、模型测试和评估合作。
生物安全:OpenAI 已向部分美国政府和盟友开放 GPT-Rosalind,用于公共卫生和生物防御任务。
OpenAI 同时划出底线:不支持大规模国内监控,不支持绕开法律和监督,也不允许 AI 在没人类授权的情况下,自主选定并攻击目标。
但 OpenAI 没有把军事、情报和调查用途全部排除。
信源:https://openai.com/index/government-national-security-partnerships/
OpenAI
Our approach to government and national security partnerships
Learn how OpenAI approaches government and national security partnerships, with principles for responsible AI use, democratic accountability, and public safety.
Databricks拿真实代码库测Agent,GLM 5.2进第一梯队
Databricks 发布内部 AI 编程 Agent 评测,用自家数百万行代码库里的真实 PR 做测试。
这套评测没有直接用 SWE-Bench。Databricks 认为公开题集可能进过训练数据,也不够贴近真实工程。
测试任务来自近期合并的 PR,覆盖 Python、Go、TypeScript、Scala 等语言。团队过滤了机器人提交、AI 生成代码和自动生成代码,只保留能验证结果的任务。
结果显示,编程 Agent 已经分出大致三档。最高一档不只包括 OpenAI 和 Anthropic 模型,也包括开源模型。GLM 5.2 进入第一梯队,质量上与 Opus 4.8 接近,单任务成本为 1.28 美元,低于 Opus 4.8 的 1.94 美元。
评测还发现,Token 单价不能直接代表真实成本。Sonnet 5 每 Token 更便宜,但在这套任务里跑得更久、读得更多,单任务成本反而更高。
工具壳也很关键。同一模型换不同 Agent 框架,任务成本最高可差 2 倍以上,但完成质量变化不大。
信源:https://www.databricks.com/blog/benchmarking-coding-agents-databricks-multi-million-line-codebase
Databricks 发布内部 AI 编程 Agent 评测,用自家数百万行代码库里的真实 PR 做测试。
这套评测没有直接用 SWE-Bench。Databricks 认为公开题集可能进过训练数据,也不够贴近真实工程。
测试任务来自近期合并的 PR,覆盖 Python、Go、TypeScript、Scala 等语言。团队过滤了机器人提交、AI 生成代码和自动生成代码,只保留能验证结果的任务。
结果显示,编程 Agent 已经分出大致三档。最高一档不只包括 OpenAI 和 Anthropic 模型,也包括开源模型。GLM 5.2 进入第一梯队,质量上与 Opus 4.8 接近,单任务成本为 1.28 美元,低于 Opus 4.8 的 1.94 美元。
评测还发现,Token 单价不能直接代表真实成本。Sonnet 5 每 Token 更便宜,但在这套任务里跑得更久、读得更多,单任务成本反而更高。
工具壳也很关键。同一模型换不同 Agent 框架,任务成本最高可差 2 倍以上,但完成质量变化不大。
信源:https://www.databricks.com/blog/benchmarking-coding-agents-databricks-multi-million-line-codebase
谷歌AI Studio接入GitHub,旧项目可以直接拉进来改
Google AI Studio 新增「Import from GitHub」。AI Studio 不再只能从零生成项目,也能接手已有代码。
开发者可以把 GitHub 仓库导入 AI Studio。Gemini 会把项目转成兼容运行环境的格式,之后可以继续修改、预览和部署。
不过这还不是双向同步。产品负责人 Logan Kilpatrick 称,双向 GitHub 支持是下一步,团队正在做。
信源:https://x.com/officiallogank/status/2074902342512845206?s=46
Google AI Studio 新增「Import from GitHub」。AI Studio 不再只能从零生成项目,也能接手已有代码。
开发者可以把 GitHub 仓库导入 AI Studio。Gemini 会把项目转成兼容运行环境的格式,之后可以继续修改、预览和部署。
不过这还不是双向同步。产品负责人 Logan Kilpatrick 称,双向 GitHub 支持是下一步,团队正在做。
信源:https://x.com/officiallogank/status/2074902342512845206?s=46
❤2
谷歌云从OpenAI挖走Harness Engineering作者,押注企业Agent工作流
OpenAI 前工程师 Ryan Lopopolo 宣布加入谷歌云,担任 Agentic Google Cloud Platform 首席工程师。
Lopopolo 是 OpenAI《Harness engineering》文章作者。这套方法强调给 Agent 配好上下文、工具、权限、评测和反馈回路,让 Agent 真正参与软件开发。
他在 OpenAI 参与过一个内部实验:团队用 Codex 从空仓库开始做产品,5 个月生成约 100 万行代码。代码、测试、CI、文档和内部工具都由 Codex 完成,人类主要负责目标和验收。
这次跳槽说明,谷歌云不只想卖模型和算力,也在补企业 Agent 工程化能力。
信源:https://x.com/_lopopolo/status/2074977994356212026?s=46
OpenAI 前工程师 Ryan Lopopolo 宣布加入谷歌云,担任 Agentic Google Cloud Platform 首席工程师。
Lopopolo 是 OpenAI《Harness engineering》文章作者。这套方法强调给 Agent 配好上下文、工具、权限、评测和反馈回路,让 Agent 真正参与软件开发。
他在 OpenAI 参与过一个内部实验:团队用 Codex 从空仓库开始做产品,5 个月生成约 100 万行代码。代码、测试、CI、文档和内部工具都由 Codex 完成,人类主要负责目标和验收。
这次跳槽说明,谷歌云不只想卖模型和算力,也在补企业 Agent 工程化能力。
信源:https://x.com/_lopopolo/status/2074977994356212026?s=46
🎉2
Prime Intellect完成1.3亿美元A轮融资,帮企业自己训练Agent
AI 基础设施公司 Prime Intellect 完成 1.3 亿美元 A 轮融资,估值达到 10 亿美元。融资由 Radical Ventures 领投,英伟达风投、Intel Capital、Dell Technologies Capital 等参投。
Prime Intellect 做的是「Open Superintelligence Stack」,一套面向 Agent 的训练和部署平台。它把算力、大规模强化学习、环境、沙箱、评测和推理服务打包,让企业自己训练和优化 Agent,不必完全依赖 OpenAI、Anthropic 这类闭源模型供应商。
公司称,目前已有 6000 多个客户使用其工具,年化收入超过 1 亿美元。Ramp 曾用 Prime Intellect 的 Lab 平台训练一个 35B 模型,用来做表格搜索,准确率超过 Claude Opus,速度快 27%,成本也更低。
信源:https://www.primeintellect.ai/blog/series-a
AI 基础设施公司 Prime Intellect 完成 1.3 亿美元 A 轮融资,估值达到 10 亿美元。融资由 Radical Ventures 领投,英伟达风投、Intel Capital、Dell Technologies Capital 等参投。
Prime Intellect 做的是「Open Superintelligence Stack」,一套面向 Agent 的训练和部署平台。它把算力、大规模强化学习、环境、沙箱、评测和推理服务打包,让企业自己训练和优化 Agent,不必完全依赖 OpenAI、Anthropic 这类闭源模型供应商。
公司称,目前已有 6000 多个客户使用其工具,年化收入超过 1 亿美元。Ramp 曾用 Prime Intellect 的 Lab 平台训练一个 35B 模型,用来做表格搜索,准确率超过 Claude Opus,速度快 27%,成本也更低。
信源:https://www.primeintellect.ai/blog/series-a
www.primeintellect.ai
$130M Series A to Build the Open Superintelligence Stack
We've raised $130M led by Radical Ventures, with participation from NVIDIA Ventures, Intel Capital, Dell Technologies Capital, and our existing investors — bringing our total funding to over $150M to build the open superintelligence stack.
❤1
Ollama完成6500万美元B轮融资,要把开源模型变得更好用
开源模型工具 Ollama 完成 6500 万美元 B 轮融资。Theory Ventures 领投,Benchmark、8VC、Y Combinator 等参投。Ollama 总融资额达到 8800 万美元。
Ollama 的核心功能很简单:让开发者用一条命令,在本地跑起开源模型。它也提供 API,方便开发者把模型接进自己的应用。
官方称,Ollama 目前服务 890 万开发者,并被 85% 的财富 500 强企业使用。它的云端服务也在增长,token 用量平均每月翻倍以上。
新资金会用来做三件事:本地和云端混合推理、新模型首日支持、团队云服务。
信源:https://ollama.com/blog/all-aboard-open-models
开源模型工具 Ollama 完成 6500 万美元 B 轮融资。Theory Ventures 领投,Benchmark、8VC、Y Combinator 等参投。Ollama 总融资额达到 8800 万美元。
Ollama 的核心功能很简单:让开发者用一条命令,在本地跑起开源模型。它也提供 API,方便开发者把模型接进自己的应用。
官方称,Ollama 目前服务 890 万开发者,并被 85% 的财富 500 强企业使用。它的云端服务也在增长,token 用量平均每月翻倍以上。
新资金会用来做三件事:本地和云端混合推理、新模型首日支持、团队云服务。
信源:https://ollama.com/blog/all-aboard-open-models
Ollama
Ollama: all aboard open models· Ollama Blog
Serving 8.9 million developers, Ollama has raised $88M from Benchmark, Theory Ventures, 8VC, Y Combinator, and many incredible angel investors.
Meta发布Muse Spark 1.1并开放API,卷起AI编程价格战
Meta 发布最新多模态推理模型 Muse Spark 1.1,并开放 Meta Model API 公测。开发者现在可以直接调用新模型,不再只是在 Meta 自家产品里使用。
Muse Spark 1.1 主打编程、Agent 和多模态任务,支持 100 万 token 上下文。
新模型价格打得很低:输入每 100 万 token 1.25 美元,缓存输入 0.15 美元,输出 4.25 美元。
早期合作方包括 Replit、Box 和 Cline。Meta 这次不是只做聊天机器人,而是正式进入 AI 编程和 Agent 市场。
信源:https://ai.meta.com/blog/introducing-muse-spark-meta-model-api/
Meta 发布最新多模态推理模型 Muse Spark 1.1,并开放 Meta Model API 公测。开发者现在可以直接调用新模型,不再只是在 Meta 自家产品里使用。
Muse Spark 1.1 主打编程、Agent 和多模态任务,支持 100 万 token 上下文。
新模型价格打得很低:输入每 100 万 token 1.25 美元,缓存输入 0.15 美元,输出 4.25 美元。
早期合作方包括 Replit、Box 和 Cline。Meta 这次不是只做聊天机器人,而是正式进入 AI 编程和 Agent 市场。
信源:https://ai.meta.com/blog/introducing-muse-spark-meta-model-api/
Meta AI
Introducing Muse Spark 1.1
PrismML把Qwen3.6压到4GB,27B模型塞进iPhone
加州理工学院数学家 Babak Hassibi 联合创立的 AI 实验室 PrismML 表示,已把阿里开源模型 Qwen3.6-27B 压缩后跑在 iPhone 17 Pro 上。
Qwen3.6-27B 是 270 亿参数稠密模型。推理时所有参数都会参与,不是只激活部分参数的 MoE 模型。
PrismML 称,模型大小从约 54GB 压到不到 4GB,性能没有明显下降。它可用于复杂对话、推理、Agent 和代码任务。
苹果已经和 PrismML 接触,讨论如何使用这项技术。苹果一直想把更多 AI 放到设备本地,但高级 Siri 仍依赖云端模型。
信源:https://www.theinformation.com/articles/khosla-backed-startup-claims-breakthrough-largest-ever-ai-model-iphone
加州理工学院数学家 Babak Hassibi 联合创立的 AI 实验室 PrismML 表示,已把阿里开源模型 Qwen3.6-27B 压缩后跑在 iPhone 17 Pro 上。
Qwen3.6-27B 是 270 亿参数稠密模型。推理时所有参数都会参与,不是只激活部分参数的 MoE 模型。
PrismML 称,模型大小从约 54GB 压到不到 4GB,性能没有明显下降。它可用于复杂对话、推理、Agent 和代码任务。
苹果已经和 PrismML 接触,讨论如何使用这项技术。苹果一直想把更多 AI 放到设备本地,但高级 Siri 仍依赖云端模型。
信源:https://www.theinformation.com/articles/khosla-backed-startup-claims-breakthrough-largest-ever-ai-model-iphone
The Information
Khosla-Backed Startup Claims Breakthrough With Largest-Ever AI Model on an iPhone
Apple is on a quest to shrink powerful AI models to run on iPhones, which could cut down on cloud computing costs and enhance user privacy. But a small startup that emerged from stealth mode earlier this year says it recently got an AI model running on an…
❤3