动察Beating AI News
2.98K subscribers
783 photos
2 videos
3.22K links
AI新闻信息流
Download Telegram
OpenAI招投行专家,AI要学估值和尽调了

OpenAI 正在为 Applied AI 团队招聘一名投行业务专家,岗位位于旧金山。

招聘页显示,这个岗位主要服务模型训练和评测。候选人需要熟悉行业研究、财务分析、估值、尽调、交易执行和客户材料制作。

入职后,这名专家要设计真实投行任务,制定评测标准,并制作金融模型、估值分析、pitch book、投委会材料等参考样本。

OpenAI 还要求候选人评估模型和 agent 工作流。重点是判断结果是否准确、可追溯、前后一致,能否通过资深投行人士审查。

岗位要求至少 2 年投行经验。工作模式为每周 3 天到办公室。薪酬为 18.5 万至 20.5 万美元,并提供股权。

信源:https://openai.com/careers/subject-matter-expert-investment-banking-san-francisco/
Claude Code上线/checkup,一键清理臃肿配置省上下文

Anthropic 旗下终端 Agent 工具 Claude Code 新增 /checkup 命令,用来检查和清理本地开发环境。

/checkup 会检查未使用的 Skills、MCP 和插件,减少无效上下文占用。它还能去重本地 CLAUDE.md,并把根目录 CLAUDE.md 拆成更细的嵌套文件或 Skills。

新命令还会检查慢 Hook、版本更新和权限设置。它可以建议开启默认 Auto Mode,并把常被拦截的只读命令加入预批准。

/checkup 在修改前会先向用户确认,用户可以选择全部清理、手动挑选,或只查看报告。

信源:https://x.com/bcherny/status/2074997570317779038?s=46
Anthropic给AI危险知识装开关,一个模型切出16种配置

Anthropic 与 AE Studio 发布新研究 GRAM,尝试给 AI 的「双用途知识」装上开关。双用途知识指既能用于正当研究,也可能被滥用的能力,比如病毒学、网络安全和核物理。

GRAM 的做法是在模型每一层加入额外模块。训练遇到敏感领域数据时,只让对应模块学习。训练结束后,开发者可以保留模块,也可以删除模块,让模型失去对应能力。

研究团队在真实数据实验中测试了 4 类双用途领域:病毒学、网络安全、核物理和小众编程语言。4 个模块可组合出 16 种能力配置。相比为每种配置单独训练模型,这种方法只需一次训练。

论文还测试了 50M 到 5B 参数模型。结果显示,GRAM 在保留通用能力的同时,能较好移除目标能力,对小规模恶意微调的抵抗也强于训练后「遗忘」方法。

信源:https://www.anthropic.com/research/off-switch-dual-use
OpenAI国安合作原则出炉:AI能进军方,但不能自己开火

OpenAI 发布政府与国家安全合作原则,明确会继续和美国政府及盟友合作。

合作重点主要是两类:网络防御和生物安全。

网络防御:OpenAI 已和澳大利亚、加拿大、日本、韩国、法国、德国、波兰、荷兰,以及欧盟网络安全机构 ENISA 建立合作。英国政府也参与网络安全、模型测试和评估合作。

生物安全:OpenAI 已向部分美国政府和盟友开放 GPT-Rosalind,用于公共卫生和生物防御任务。

OpenAI 同时划出底线:不支持大规模国内监控,不支持绕开法律和监督,也不允许 AI 在没人类授权的情况下,自主选定并攻击目标。

但 OpenAI 没有把军事、情报和调查用途全部排除。

信源:https://openai.com/index/government-national-security-partnerships/
Databricks拿真实代码库测Agent,GLM 5.2进第一梯队

Databricks 发布内部 AI 编程 Agent 评测,用自家数百万行代码库里的真实 PR 做测试。

这套评测没有直接用 SWE-Bench。Databricks 认为公开题集可能进过训练数据,也不够贴近真实工程。

测试任务来自近期合并的 PR,覆盖 Python、Go、TypeScript、Scala 等语言。团队过滤了机器人提交、AI 生成代码和自动生成代码,只保留能验证结果的任务。

结果显示,编程 Agent 已经分出大致三档。最高一档不只包括 OpenAI 和 Anthropic 模型,也包括开源模型。GLM 5.2 进入第一梯队,质量上与 Opus 4.8 接近,单任务成本为 1.28 美元,低于 Opus 4.8 的 1.94 美元。

评测还发现,Token 单价不能直接代表真实成本。Sonnet 5 每 Token 更便宜,但在这套任务里跑得更久、读得更多,单任务成本反而更高。

工具壳也很关键。同一模型换不同 Agent 框架,任务成本最高可差 2 倍以上,但完成质量变化不大。

信源:https://www.databricks.com/blog/benchmarking-coding-agents-databricks-multi-million-line-codebase
谷歌AI Studio接入GitHub,旧项目可以直接拉进来改

Google AI Studio 新增「Import from GitHub」。AI Studio 不再只能从零生成项目,也能接手已有代码。

开发者可以把 GitHub 仓库导入 AI Studio。Gemini 会把项目转成兼容运行环境的格式,之后可以继续修改、预览和部署。

不过这还不是双向同步。产品负责人 Logan Kilpatrick 称,双向 GitHub 支持是下一步,团队正在做。

信源:https://x.com/officiallogank/status/2074902342512845206?s=46
2
谷歌云从OpenAI挖走Harness Engineering作者,押注企业Agent工作流

OpenAI 前工程师 Ryan Lopopolo 宣布加入谷歌云,担任 Agentic Google Cloud Platform 首席工程师。

Lopopolo 是 OpenAI《Harness engineering》文章作者。这套方法强调给 Agent 配好上下文、工具、权限、评测和反馈回路,让 Agent 真正参与软件开发。

他在 OpenAI 参与过一个内部实验:团队用 Codex 从空仓库开始做产品,5 个月生成约 100 万行代码。代码、测试、CI、文档和内部工具都由 Codex 完成,人类主要负责目标和验收。

这次跳槽说明,谷歌云不只想卖模型和算力,也在补企业 Agent 工程化能力。

信源:https://x.com/_lopopolo/status/2074977994356212026?s=46
🎉2
Prime Intellect完成1.3亿美元A轮融资,帮企业自己训练Agent

AI 基础设施公司 Prime Intellect 完成 1.3 亿美元 A 轮融资,估值达到 10 亿美元。融资由 Radical Ventures 领投,英伟达风投、Intel Capital、Dell Technologies Capital 等参投。

Prime Intellect 做的是「Open Superintelligence Stack」,一套面向 Agent 的训练和部署平台。它把算力、大规模强化学习、环境、沙箱、评测和推理服务打包,让企业自己训练和优化 Agent,不必完全依赖 OpenAI、Anthropic 这类闭源模型供应商。

公司称,目前已有 6000 多个客户使用其工具,年化收入超过 1 亿美元。Ramp 曾用 Prime Intellect 的 Lab 平台训练一个 35B 模型,用来做表格搜索,准确率超过 Claude Opus,速度快 27%,成本也更低。

信源:https://www.primeintellect.ai/blog/series-a
1
Ollama完成6500万美元B轮融资,要把开源模型变得更好用

开源模型工具 Ollama 完成 6500 万美元 B 轮融资。Theory Ventures 领投,Benchmark、8VC、Y Combinator 等参投。Ollama 总融资额达到 8800 万美元。

Ollama 的核心功能很简单:让开发者用一条命令,在本地跑起开源模型。它也提供 API,方便开发者把模型接进自己的应用。

官方称,Ollama 目前服务 890 万开发者,并被 85% 的财富 500 强企业使用。它的云端服务也在增长,token 用量平均每月翻倍以上。

新资金会用来做三件事:本地和云端混合推理、新模型首日支持、团队云服务。

信源:https://ollama.com/blog/all-aboard-open-models
Meta发布Muse Spark 1.1并开放API,卷起AI编程价格战

Meta 发布最新多模态推理模型 Muse Spark 1.1,并开放 Meta Model API 公测。开发者现在可以直接调用新模型,不再只是在 Meta 自家产品里使用。

Muse Spark 1.1 主打编程、Agent 和多模态任务,支持 100 万 token 上下文。

新模型价格打得很低:输入每 100 万 token 1.25 美元,缓存输入 0.15 美元,输出 4.25 美元。

早期合作方包括 Replit、Box 和 Cline。Meta 这次不是只做聊天机器人,而是正式进入 AI 编程和 Agent 市场。

信源:https://ai.meta.com/blog/introducing-muse-spark-meta-model-api/
PrismML把Qwen3.6压到4GB,27B模型塞进iPhone

加州理工学院数学家 Babak Hassibi 联合创立的 AI 实验室 PrismML 表示,已把阿里开源模型 Qwen3.6-27B 压缩后跑在 iPhone 17 Pro 上。

Qwen3.6-27B 是 270 亿参数稠密模型。推理时所有参数都会参与,不是只激活部分参数的 MoE 模型。

PrismML 称,模型大小从约 54GB 压到不到 4GB,性能没有明显下降。它可用于复杂对话、推理、Agent 和代码任务。

苹果已经和 PrismML 接触,讨论如何使用这项技术。苹果一直想把更多 AI 放到设备本地,但高级 Siri 仍依赖云端模型。

信源:https://www.theinformation.com/articles/khosla-backed-startup-claims-breakthrough-largest-ever-ai-model-iphone
3
GPT-5.6正式发布:Agent评测领先Claude Fable模型13.1分

OpenAI 发布 GPT-5.6 系列,包含旗舰模型 Sol、均衡版 Terra 和低价版 Luna。新模型已上线 ChatGPT、Codex 和 API。

GPT-5.6 Sol 主打性能和效率。在专业 Agent 评测 Agents’ Last Exam 中,Sol 得分 53.6,比 Claude Fable 5 高 13.1 分。使用中等推理强度时,它仍领先 11.4 分,估算成本约为对方四分之一。

编程能力也有提升。Sol 在 Artificial Analysis 编程 Agent 指数中得到 80 分,比 Fable 5 高 2.8 分,同时输出 token 不到一半,耗时不到一半,成本低约三分之一。

GPT-5.6 还新增 ultra 模式。它默认让 4 个 Agent 并行工作,用更多 token 换取更强结果和更短耗时。API 用户也可以调用多 Agent 测试版。

API 每 100 万 token 的输入和输出价格分别为:Sol 5 美元和 30 美元,Terra 2.5 美元和 15 美元,Luna 1 美元和 6 美元。

信源:https://openai.com/index/gpt-5-6/
OpenAI推出工作流Agent ChatGPT Work,并把Codex并入ChatGPT

OpenAI 推出 ChatGPT Work。这是 ChatGPT 里的新 Agent,由 Codex 和 GPT-5.6 驱动。

它不只回答问题,还能接手完整工作流。用户给一个目标,它可以读取已连接的应用和文件,生成文档、表格、幻灯片、分析报告和网页应用。

ChatGPT Work 可连接 Slack、Microsoft Teams、Google Drive、SharePoint、邮件、日历、CRM 和项目管理工具。用户也可以用 @ 指定应用,让它从里面提取上下文。

桌面端变化更大。Codex 应用将并入新的 ChatGPT 桌面应用。新的桌面端会同时提供 Chat、Work、Codex 和内置浏览器。

ChatGPT Work 已向 Pro、Enterprise 和 Edu 用户开放。Plus 和 Business 用户会在未来几天开放。桌面端的 Chat、Work 和 Codex 面向所有套餐开放,包括免费用户。

信源:https://openai.com/zh-Hans-CN/index/chatgpt-for-your-most-ambitious-work/
OpenAI砍掉Atlas浏览器,上线不到一年并入ChatGPT

OpenAI 将停止运营独立浏览器 ChatGPT Atlas。Atlas 将在 8 月 9 日停止服务,距离发布还不到一年。

Atlas 的主要能力会并入 ChatGPT 和 Codex。新版 ChatGPT 桌面端已经加入浏览器,可开多个标签页、下载文件、登录网站,并让 Agent 直接操作网页。用户也可以通过 Chrome 扩展调用 ChatGPT。

Atlas 的书签、标签页和浏览历史不会自动迁移。用户需要在停服前手动导出书签,并保存重要网页。

OpenAI 此前分别推出 ChatGPT、Codex 和 Atlas。现在三者开始合并到同一个桌面应用,Atlas 也成为首个被放弃的独立产品。

信源:https://www.theverge.com/ai-artificial-intelligence/963654/openai-chatgpt-atlas-ai-browser-shut-down-sunset
从「反人类」到AI领头羊,马斯克对Anthropic彻底改口

马斯克公开承认,自己此前看错了 Anthropic。它现在是 AI 领域的领头羊,没有公司发布过比 Mythos 和 Fable 更好的模型。

这次转弯幅度不小。

今年 2 月,马斯克还称 Anthropic「厌恶西方文明」,模型仇视白人、亚裔、异性恋和男性,是一家「反人类且邪恶」的公司。他还指责 Anthropic 大规模窃取训练数据,形容公司「自以为是、道貌岸然又虚伪」。3 月,他又追问:「还有比 Anthropic 更虚伪的公司吗?」

转折出现在双方谈生意之后。

5 月,Anthropic 租下 SpaceX 的 Colossus 1 数据中心,可使用超过 22 万块英伟达 GPU。马斯克随即表示,自己花了大量时间与 Anthropic 高层交流,发现他们「能力很强,也非常在乎做正确的事」,而且没人触发他的「邪恶探测器」。

两个月后,「邪恶探测器」已经升级成了冠军认证。马斯克不仅把 Anthropic 评为 AI 第一,还承诺不会突然切断算力伤害对方,因为「这不是我的风格」。

信源:https://x.com/elonmusk/status/2075278580955685036?s=46
Claude上线「防沉迷」功能:统计你把时间花在哪,还会提醒休息

Anthropic 为 Claude 推出 Reflect 功能,帮用户回顾自己如何使用 AI。它会统计使用时间、常聊的话题和主要任务,并生成过去 1、3、6 或 12 个月的使用报告。

Reflect 还带有一套轻量「防沉迷」功能。用户可以设置免打扰时段,也可以让 Claude 在连续使用一段时间后提醒休息。

Reflect 目前向 Free、Pro 和 Max 用户开放测试,支持网页版和桌面端,但必须开启记忆功能。无痕对话、连接工具中的原始文件,以及通过健康服务产生的对话,都不会进入报告。

信源:https://www.anthropic.com/news/reflect-with-claude
OpenAI二号人物Fidji Simo因病离任,入职不到一年

OpenAI 的 AGI 部署 CEO Fidji Simo 宣布离开全职岗位,转任兼职顾问。她三个月前因慢性疾病加重开始休假,如今确认康复过程比预期更漫长,需要把精力放在治疗上。

Simo 是 OpenAI 仅次于 Sam Altman 的核心高管。她原任美国生鲜杂货配送平台 Instacart CEO,也曾负责 Facebook App。2025 年加入 OpenAI 后,她统管产品和商业团队,覆盖 ChatGPT、Codex 等业务,后来改任 AGI 部署 CEO。

今年 4 月,Simo 因神经免疫疾病休假,原计划只离开几周。此后,OpenAI 总裁 Greg Brockman 接管产品工作。她原有的产品和商业职责,预计将由 Brockman、CFO Sarah Friar 和首席战略官 Jason Kwon 分担。

Simo 表示,她已与慢性疾病共处七年,目前没有治愈方法。未来除继续担任 OpenAI 顾问,还会参与 AI 生物医疗项目 Chronicle BioAI 和 CODA Research。

信源:https://x.com/fidjissimo/status/2075353170927304861?s=46
1
Meta自研芯片Iris将投产,以减少对英伟达依赖

Meta 计划从 9 月开始生产新一代自研 AI 芯片 Iris。芯片由 Meta 自己设计,博通参与开发,台积电负责生产。

Iris 属于 Meta 自研加速器 MTIA 系列,主要用于 Facebook 和 Instagram 背后的 AI 任务。它会与英伟达、AMD 的 GPU 搭配使用,不会完全取代外购芯片。

Iris 测试只用了 6 周,没有发现重大问题。Meta 还计划在 2027 年底前,大约每半年推出一款新芯片。一般 AI 芯片的更新周期为一年以上。

Meta 也在疯狂扩充数据中心。今年计划部署 7GW 算力,2027 年再翻一倍至 14GW。今年 AI 基础设施支出最高可达 1450 亿美元。

自研芯片能降低成本,也能减少 Meta 对英伟达和 AMD 的依赖。但 Meta 仍在购买大量外部 GPU,短期内无法完全自己解决芯片需求。

信源:https://www.reuters.com/world/asia-pacific/meta-put-ai-chip-into-production-september-it-looks-double-computing-capacity-2026-07-09/
Meta同时建5座GW级AI集群,年底算力或超OpenAI和Anthropic

知名半导体分析机构 SemiAnalysis 称,Meta 正同时建设 5 座功率超过 1GW 的大型 AI 集群。按其估算,Meta 的总算力可能在今年底超过 OpenAI 和 Anthropic。

其中,路易斯安那州 Hyperion 正建设约 1GW 设施,未来可扩展至 5GW。俄亥俄州 Prometheus 已部分投运,规划规模超过 3GW。

Prometheus 由 6 个园区、27 座数据中心组成。Meta 用高速网络把它们连成一个集群,后续还计划连接相距超过 2000 公里的园区。

由于远距离网络延迟较高,Meta 会把预训练放在单一区域,把强化学习任务分散到不同园区运行。

Meta 还组建了约 3000 人的团队,专门制作强化学习任务和训练环境。公司此前也开始记录部分员工的屏幕、键盘和鼠标操作,用真实工作流程训练 AI Agent,但相关计划因隐私和数据管理问题一度暂停。

SemiAnalysis 判断,Meta 已经同时备齐人才、数据和算力,是目前最有机会追上 OpenAI 和 Anthropic 的公司之一。

信源:https://newsletter.semianalysis.com/p/the-future-of-meta-superintelligence
Meta利好连发,投研机构Citrini押注复刻「谷歌150美元」行情

「AI 末日报告」发布机构 Citrini 表示,Meta 可能迎来一轮猛烈上涨。等行情走完后,市场会把它说成「早就显而易见」,并假装自己一直在低位买入。

Citrini 把这种情况称为「谷歌 150 美元现象」:没涨时争议不断,涨完后人人都说自己早就看懂了。

Meta 昨天连续放出利好。新一代自研 AI 芯片 Iris 将于 9 月投产,公司计划把算力从今年的 7GW 增至 2027 年的 14GW。Muse Spark 1.1 也开始通过 API 收费,Meta 首次直接向开发者出售大模型服务。

Meta 股价随后上涨 4.7%。市场此前最担心巨额 AI 投入难以回本,现在开始押注自研芯片降本、广告业务增收和模型 API 变现。

信源:https://x.com/citrini/status/2075338534576103568?s=46
传Meta内部模型已到Mythos 5水平,数月内或上线

Critini Research 分析师 Jukan 称,他在 ICML 现场听到传闻:Meta 已完成一款内部模型,能力大致达到 Anthropic Mythos 5 水平,未来几个月可能部署。

Mythos 5 是 Anthropic 目前最强的模型。它与公开版 Fable 5 使用同一底座,但在部分高风险领域解除安全限制。

Meta 刚发布 Muse Spark 1.1,主打编程、Agent 和多模态任务。如果传闻属实,Meta 手里还有一款尚未公开的前沿模型。

信源:https://x.com/jukan05/status/2075347152503788006?s=46