动察Beating AI News
2.99K subscribers
787 photos
2 videos
3.24K links
AI新闻信息流
Download Telegram
无需Mac中转与自托管,开源智能体Hermes接入iMessage

开源 AI 智能体框架 Hermes Agent 发布 v0.17.0 版本,核心打通了无需 Mac 硬件中转的 iMessage 接入通道。新版本集成基于 Photon Spectrum 托管线路池的 iMessage 平台插件,允许用户通过设备码直接登录,彻底摆脱了必须自托管 Mac 设备或配置 BlueBubbles 等中转网关的限制。

除通信渠道扩展外,新版本引入了异步子智能体设计,支持通过 delegate_task(background=true) 将繁重的研究或构建任务派发至后台运行,主智能体可在任务执行期间与用户继续交互而不被阻塞。在模型支持方面,xAI 订阅授权新增了对最新 grok-composer-2.5-fast 模型(具备 200k 上下文)的支持,用户无需独立 API 密钥即可直接获取 Cursor 同款 Composer 快速编程能力。

桌面端新增了子智能体实时监视窗口 watch-windows,允许用户以独立窗格流式观测后台任务的执行轨迹,并支持直接安装任何 VS Code 插件市场主题。在底层机制上,升级后的 memory 内存工具支持在单次调用中原子化执行添加、替换和删除操作,从而在有限的字符预算内更高效地释放和管理内存,显著降低了多轮对话中因内存空间溢出导致交互失败的概率。

信源:https://github.com/NousResearch/hermes-agent/releases/tag/v2026.6.19
微信原生AI助手「小微」开启灰度测试,支持一句话生成小程序

微信在主界面左上角灰度上线原生 AI 助手「小微」,支持用户通过文字或语音操作微信原生功能、调起小程序等任务。根据用户测试,「小微」不仅能根据对话生成可播放的音乐歌单,还支持在一句对话中生成包含图表与按钮的专属小工具,或在群聊中生成聊天总结。

腾讯客服回应确认,「小微」是微信团队在小范围内测的原生 AI 助手。助理底层主模型采用腾讯自研的 WeLM 大模型,并由 DeepSeek 提供部分回答兜底。

在具体功能上,「小微」深度整合了微信生态内的连接能力。用户直接发送 PDF 文件,助手可给出结构化内容摘要并展示思考过程。当用户设置 5 分钟提醒时,系统会直接在对话中生成待办提醒。用户还能在「小微」中通过输入文本需求,在几秒内生成包含页面、按钮和统计图表的小工具。目前生成的小工具仅限个人使用,不支持分享给他人。

与独立运行的第三方大模型助手不同,「小微」长在微信主界面左上角,直接与用户的关系链、公众号、视频号、文件和微信支付等原生生态打通。

目前助手仍处于灰度测试阶段,部分功能细节较为粗糙,腾讯尚未公布更大规模的上线计划。

信源:https://mp.weixin.qq.com/s/BDzdeivM7bDya00C1Loj6g
1
桑德斯提案对AI巨头征50%股权税,背后推手为DeepMind科学家之妻

美国参议员伯尼·桑德斯 (Bernie Sanders) 提交法案,提议对年销售额超 2 亿美元的 AI 公司征收 50% 股权税建主权财富基金。法案起草顾问为加州大学戴维斯分校法学教授萨拉·波尔茨 (Sarah Polcz),波尔茨的丈夫亚当·布朗 (Adam Brown) 领衔谷歌 DeepMind 旗下 Blueshift 团队。

根据提案,符合条件的 AI 公司须将半数股权注入基金,由总统提名并经参议院确认的 7 人跨党派委员会管理。委员会不仅有权为 AI 公司任命董事参与重大决策,还将以基金名义每年向全体公民发放约 5% 的股息,预计每人每年可得约 1000 美元。

强制收缴半数股权的要求让风投圈普遍感到焦虑,批评者指出重税会吓跑训练模型所需的私募资本。但波尔茨与合著者杰里米·贝勒-弗伦德 (Jeremy Bearer-Friend) 认为,既然大模型是拿全人类的万亿 Token 数据训练出来的,公众就理应以所有者身份分享价值。法案在部分 AI 开发人员中也得到了支持。前谷歌研究员、前 Deep Genomics 机器学习负责人约尔·绍尔 (Joel Shor) 对此表示赞同,称技术人员内部已在反思大模型的构建方式与财富集中问题。

波尔茨与布朗的社交圈深度融入硅谷中心。谷歌联合创始人谢尔盖·布林 (Sergey Brin) 曾在一场波尔茨家举办的聚会中决定重返谷歌。提案公布后,布朗陪同波尔茨前往被誉为硅谷风险投资大本营的沙丘路,在罗斯伍德酒店开香槟庆祝。

尽管布朗本人拒绝对法案发表评论,波尔茨代布朗澄清,布朗在谷歌 DeepMind 仅专注于提升 AI 的科学与推理能力,对社会如何应对技术冲击没有任何政策立场。

信源:https://www.theinformation.com/articles/law-professor-behind-bernies-ai-sovereign-wealth-fund-idea
万斯主张国家入股AI巨头,马斯克公开唱反调:直接给民众发钱,未来是大通缩

美国副总统万斯 (JD Vance) 在接受《CEO 日记》采访时表示,特朗普支持美国建立主权财富基金,并持有多家前沿 AI 巨头的股权。万斯认为,绝不能任由大模型企业成长为数万亿美元且不受控的垄断者,否则富人将变得更富,穷人则沦为附庸。他主张通过国家持股,并引入工会集体谈判一类的「预分配」机制,让劳动者在决策桌上占有一席之地,在初次分配中直接分享技术红利,避免穷人最终沦为依赖富人施舍的附庸,而非依靠传统的税收再分配。

马斯克 (Elon Musk) 随后在 X 平台公开唱反调,提出相较于政府入股更优的替代方案,即直接由财政部向民众发钱。马斯克解释,在 AI 与机器人技术支撑下,商品和服务的产出增速将远超货币供应,直接发钱并不会引发通货膨胀,相反,人类未来需要竭力对抗大通缩。

两人的核心分歧在于应对财富分化的路径:万斯倾向于国家入股与劳工谈判的生产端介入,防止资产收益被少数人垄断;马斯克则倾向于货币政策层面的直接干预,反对国家干预生产资料所有权,主张利用技术带来的物质充裕进行消费端发钱兜底。

信源:https://x.com/elonmusk/status/2068427440473452739
👍3
前OpenAI研究员称中国已掌握美AI巨头所有代码,遭业内群嘲

前 OpenAI 研究员 Will Depue 宣称,中国今天已完全掌握 OpenAI 与 Anthropic 的所有 GitHub 代码库、Slack 聊天记录和内部文档。他还扬言,如果在中国的开源模型中看到「可合理推诿」的被盗架构,自己不会感到惊讶。

由于拿不出任何实锤证据,Depue 辩称这些判断主要源于自己同安全研究人员的交流,指责外界高估了前沿实验室的防线。作为经常在社交平台发布离谱言论的博主,Depue 还曾在愚人节当天发帖宣称自己将加盟 DeepSeek。

这番言论在 AI 社区迅速沦为笑柄。AI 学者 Nathan Lambert 批评前沿实验室频繁发表自利型废话,并指出技术的流转本质上是通过硅谷的人才流动、酒吧聚会以及缺乏竞业限制自发实现的,真正的核心优势是算力和工程资源,而不是 Slack 里的聊天记录。

AI 研究员 Elie Bakouch 则用完全相同的格式反讽道,毫无疑问,今天所有的前沿实验室也全盘掌握了 DeepSeek、Kimi、GLM 和 MiniMax 的技术报告与模型,讽刺美前沿实验室一边天天免费参考中国开源的成果,一边又在整天陷入被迫害幻想。

信源:https://x.com/willdepue/status/2068118253633737077
特斯拉AI工程师:算法调优不是万能药,数据质量决定AI上限

特斯拉 AI 高级主任工程师蔡云达指出,外界常以为机器学习项目 99% 的工作都在跑训练,实际上真正用于模型参数训练的时间仅占 2%。相比之下,50% 的精力花在评估测试上,40% 花在清洗数据上,另外 8% 是系统集成。

蔡云达强调,数据清洗和评估决定了 AI 能够学到的极限。如果原始数据定义模糊、标注前后矛盾,就会在源头上引入噪声。任何算法魔法或调参技巧都无法消除背景噪声,因为模型无法自己纠正错误的课本,最终的精度上限完全取决于数据本身的有效信息量(即香农编码极限)。

为了从源头确保数据标准统一,蔡云达表示自己每天都在重新审视数据概念的定义与分类体系(即本体论,Ontology),甚至要反复审核历史标签。无论是强化学习的规则设定,还是模型微调的精准标注,决定 AI 表现的始终是数据质量和评测水平,而非模型架构本身。

信源:https://x.com/yunta_tsai/status/2068364559698780520
1👎1
智谱GLM-5.2登顶DeepSWE开源第一:解决44%复杂开发任务,力压主力闭源模型

智谱 AI 开源模型 GLM-5.2 正式进驻长程软件工程基准 DeepSWE。在最大思考力度模式下,复杂开发任务的一次成功率达到 44%,在开源模型中排名第一。对比此前入榜的 Kimi K2.7 Code,成功率高出 13 个百分点。

GLM-5.2 解决每项任务的平均成本为 3.92 美元,略高于 Kimi K2.7 Code 的 2.82 美元,成功率却超越了多款主流闭源模型在特定思考配置下的表现,包括 Claude Sonnet 4.6 [high] (30%)、Gemini 3.5 Flash [medium] (37%),以及 Claude Opus 4.8 [low] (41%)。

评测发起方 Datacurve 设计的 DeepSWE 基准专门测试 AI 智能体解决长任务的能力。测试包含 113 个真实编程问题,覆盖 5 种语言。与只修改单处代码的传统测试不同,DeepSWE 要求 AI 协同修改多个文件,平均修复代码超过 600 行。评测在隔离容器中运行,严格限制 CPU 和内存资源。

信源:https://deepswe.datacurve.ai/
字节Seed 2.1 Pro预览版亮相:冲进Code Arena前端前八,直追Claude Opus 4.6

基准测试平台 Arena.ai 官方公布了字节跳动尚未公开的新模型 Seed 2.1 Pro Preview 的评测成绩。在专门评估 AI 构建真实网页应用与多文件协同修改能力的 Code Arena: Frontend 基准测试中,该模型以 1539 分的成绩位列全球第 8 名,与 Anthropic 的旗舰模型 Claude Opus 4.6 表现相当。

该模型在 React 开发和前端 UI 交互设计上展现出极强实力,在 7 个子类别中有 5 个冲进全球前 10(包括 React 排名第 7、HTML 排名第 14、品牌与营销排名第 6、内容创作工具与数据分析排名第 9、基于参考的设计与消费产品排名第 10)。在这些强项中,排名领先于它的只有极少数头部模型,如 Anthropic 的 Claude 系列以及智谱 AI 刚刚开源的 GLM-5.2。

官方透露,Seed 2.1 Pro 将在未来几周内正式对公众发布。这也是继今年 2 月中旬推出 Seed 2.0 Pro 之后,字节跳动在代码生成和智能体构建领域的最新进展。

信源:https://x.com/arena/status/2068864523499638996
1
传Anthropic已完成新版Mythos训练,Sonnet5发布在即

知名 AI 观察者 Andrew Curran 透露,Anthropic 已经完成了性能更强大的新版 Mythos 模型训练,但目前尚不确定新模型会被命名为 Mythos 5.1 还是 Mythos 6,也可能被 Anthropic 留在内部以加速后续开发。

同时,随着 Anthropic 合作伙伴服务商平台上出现名为 claude-sonnet-5 的模型标识,开发者社区普遍猜测 Sonnet 5 即将在本周正式发布。

信源:https://x.com/AndrewCurran_/status/2068748019030483365
2
豆包APP灰测对话式一键打车,携手曹操出行补齐字节出行业态

对话式一键打车服务已在豆包 APP 开启灰度测试,由曹操出行提供具体运力。获得灰测资格的北京和杭州用户,无需手动输入起讫地址或筛选车型,只需在对话框中口述出行人数、用车偏好和目的地,系统即可自动匹配曹操出行的车型与价格,用户一键确认即可完成派单。

司机端也已完成配套对接。多位曹操出行司机确认,平台已开始推送「豆包服务订单」专属标签,并为提供服务的司机发放每单 2 元的惊喜服务费。功能上线源于双方今年 6 月达成的 AI 出行战略合作。

信源:https://mp.weixin.qq.com/s/KLRjy49Do4JgXk_YE0m5jw
智谱AI与MiniMax等中国AI企业估值倍数高企,PS比率高出美国同行数十倍

根据投资人 Tommy Shaughnessy 披露的对比数据,已在港股上市的智谱AI与MiniMax等中国大模型企业,其估值与营收的比例(市销率PS)远超美国同行。

其中,智谱AI在港股市值已达1370亿美元左右,但其2025财年营收仅约1.07亿美元,市销率高达1280倍;MiniMax在港股市值约230亿美元,2025财年营收约7900万美元,市销率约290倍。

与此相比,未上市的美国头部大模型企业OpenAI与Anthropic的市销率分别仅为34倍和21倍左右。作为另一参照,包含非AI业务的阿里巴巴(通义千问背后公司)市销率仅为1.6倍。

分析指出,除非中国AI企业营收能在短期内迎来数十倍的爆发式增长,或者通过投资入股美国第三方推理提供商来换取收入分成,否则其当前的高估值倍数将难以为继;而美国前沿 AI 实验室凭借庞大的营收规模,在未来IPO后估值倍数仍有进一步扩张的空间。

信源:https://x.com/Shaughnessy119/status/2068899158442782732
🤡3😁2
传字节跳动推迟上市计划,场外灰市估值逼近1万亿美元

据外媒报道,字节跳动董事会已于 2026 年 5 月初达成共识,决定推迟首次公开募股 IPO 计划。创始人张一鸣认为估值仍有上涨空间,现阶段上市会向后期无风险投资者让渡过多利益。

目前,字节跳动在场外灰市的交易估值已超过 6000 亿美元。美银集团的资深技术投资银行家表示,公司市值有望逼近 1 万亿美元,并树立新的行业标杆。

政策与地缘政治风险有所缓解。在 2026 年年初,甲骨文公司与投资者财团达成协议,共同收购 TikTok 美国实体 80% 的股权,令相关监管压力基本出清。

在 AI 业务方面,豆包 APP 作为国内用户规模最大的聊天助手,正在免费服务基础上增设付费等级。

信源:https://asia.nikkei.com/opinion/bytedance-sidelines-listing-as-china-s-first-1-trillion-valuation-nears
3
Sand.ai获超亿美元融资:坚持自回归视频路线,计划7月发布开源MoE大模型

视频生成大模型公司 Sand.ai(成立于 2024 年 1 月)宣布完成两轮合计超亿美元的融资。投资方包括 Look Capital、Lollapalooza Capital(王慧文家办)、九坤创投、经纬创投、和玉资本(MSA Capital)、创新工场、源码资本、IDG、百度风投等多家一线机构。本轮融资由星涵资本担任财务顾问。

Sand.ai 创始人曹越在接受采访时表示,团队一直坚持被视作非共识的自回归(Autoregressive)视频生成路线,而非主流的 Diffusion 路线。其此前发布的 Magi-1 模型在 Google DeepMind 的 Physics-IQ 物理真实性测试榜单中保持第一。

为突破视频生成「成本、速度、效果」的不可能三角,Sand.ai 于去年转向探索 MoE(混合专家)架构,并计划在 2026 年 7 月(Q3)发布新一代采用 MoE 架构的视频生成模型,兼顾高效推理与目前开源领域最大的参数规模,并将该模型开源。

在商业化方面,Sand.ai 采取模型与产品双轮驱动策略。其今年 1 月上线的音乐 Agent 产品 VidMuse,仅用 2 个月已实现 1000 万美元 ARR。此外,其开源的 MagiAttention 算子库已被国内几乎所有多模态模型团队使用,并获得英伟达官方推荐。

针对行业热议的「世界模型」概念,曹越认为其目前仍处于前 GPT 时代(GPT-1 出现之前),数据与路线均未收敛。他指出,视频是走向世界模型最重要的数据模态,应当通过预测视频原始观测数据(Pixels/Frames)来让模型自主习得物理规律,而非引入人类先验去显式建模状态变量。

信源:https://mp.weixin.qq.com/s/MYILbBHvUZn6hP-Ebq1QnQ
Sakana AI发布多智能体系统Fugu,多项推理与编程评测击败Fable 5

日本 AI 初创公司 Sakana AI 推出多智能体协同系统 Sakana Fugu,通过单个 API 接口实现多模型动态编排。在学术、推理与编程等多个行业权威基准测试中,顶配版本 Fugu Ultra 的跑分击败了 Anthropic 的旗舰模型 Fable 5 及 Mythos Preview。

值得注意的是,Fable 5 等受控模型并未包含在 Fugu 的底层模型池中。Fugu 纯粹通过编排 GPT-5.5、Gemini-3.1-Pro 和 Claude-Opus-4.8 等公开模型,以集体智能实现了超越单一顶尖模型的越级性能。

评测数据显示,Fugu Ultra 在 LiveCodeBench 编程测试中取得 93.2 分(Fable 5 为 89.8 分),在 GPQA Diamond 科学推理测试中取得 95.5 分(Mythos Preview 为 94.6 分)。在 Terminal Bench 2.1 智能体测试中,Fugu Ultra 以 82.1 分领先于 Fable 5 的 80.4 分。即使是兼顾低延迟的普通版 Fugu,也在多项测试中逼近或超越了传统的单一闭源大模型。

性能的突破源于系统底层的动态角色分工。例如在常识问答中,Fugu Ultra 会调度 Gemini-3.1-Pro 担任聚合器,并由 GPT-5.5 与 第二台 Gemini 作叶节点各自解题,在数学计算中则切换 GPT-5.5 作聚合器以纠正 Gemini 与 Opus 的计算分歧。在多轮编码任务中,Fugu Ultra 会交替让 GPT-5.5 负责编写代码,并调度 Claude-Opus-4.8 承担安全审计与调试。模型之间细粒度的动态互补,使系统整体表现大幅超越了单个智能体。

信源:https://sakana.ai/fugu-release/
OpenAI Codex曝严重日志缺陷,疯狂磨损硬盘甚至强删用户文件

OpenAI 终端编码智能体 Codex 近期被曝光存在严重的本地日志持续写入缺陷。由于内部组件默认开启了过度的全局 TRACE 级别调试信息输出,Codex 会疯狂向本地数据库 (~/.codex/logs_2.sqlite) 写入低价值日志。

实测显示,在活跃使用状态下,设备在 21 天内写入了约 37 TB 数据,折合年写入量可达 640 TB,极易在一年内将普通固态硬盘 (SSD) 直接磨损报废,同时高强度的 I/O 占用还会引发编辑器卡顿。

更严重的是,频繁的物理磨损并非源于数据库总体积变大,而是因为程序在不断重复「写入日志再立即剪裁 (Insert-and-Prune)」的操作,导致底层的预写日志 (WAL) 产生严重的写放大。

另外,有用户警告称,若磁盘因日志被彻底写满,Codex 在 /goal 模式下为释放空间可能触发危险动作,盲目删除用户电脑上的其他文件与文件夹,带来数据丢失风险。

目前 GitHub Issue 仍处于挂起状态,尚未看到官方修复。在临时缓解方案中,定期执行 PRAGMA wal_checkpoint(TRUNCATE); 指令能直接压缩 WAL 文件、降低日志占用并规避写满磁盘,但无法从源头阻止高频写入与剪裁循环。

如果优先考虑硬盘写入寿命,可在本地创建 SQLite 触发器阻断写入,并配合定时截断,代价是诊断日志完全不可用。至于强杀后台进程并清理数据库残留,则更适合作为磁盘快满或句柄被锁死时的应急方案,不宜作为常规手段。

信源:https://github.com/openai/codex/issues/28224
摩根大通预测智谱8月发布万亿参数GLM-5.5

摩根大通在研报中预测,智谱将于 8 月发布下一代旗舰模型 GLM-5.5,且参数量可能突破万亿(>1T)级别。

智谱于 6 月中旬刚刚开源总参数为 744B 的 GLM-5.2 模型,目前在多项长程编程基准中表现亮眼。即将到来的万亿参数模型发布,将成为评估智谱能否持续保持技术曲线向上移动的下一个核心指标。

信源:https://x.com/zerohedge/status/2068839763285569758
Reddit扩大「社区智能」广告策略,推出多广告主卡片与自由格式广告生成器

Reddit 在戛纳狮子国际创意节宣布推出多款基于「社区智能」的全新广告产品。随着 AI 问答引擎在购物与推荐领域普及,Reddit 致力于将平台定位为消费者进行消费决策和真实研究的首选之地,作为 AI 问答的「人类智慧伴侣」。

新工具包含三项。Shopping List Ads 作为首个多广告主广告格式,在用户对比选项和寻求建议的讨论旁展示产品。自由格式广告生成器(Free-form ad generator)利用品牌网站及相关的讨论,自动生成符合社区风格的原生广告,并针对特定社区与受众画像推荐标题及图片。Reddit 用户高光广告(Redditor Highlights)现已向所有品牌开放,允许在广告中展示用户对产品或公司的正面发帖与总结。

自上市以来,Reddit 广告业务增长显著,今年第一季度广告营收达 6.25 亿美元,同比增长 74%。首席运营官 Jen Wong 表示,与以个人创作者为核心的平台不同,Reddit 的权威源自集体智慧。平台拥有超过 250 亿条帖子和评论,通过社区结构、审核机制和讨论质量等信号来理解有价值的讨论。Wong 指出,在 Reddit 上,「社区就是网红」,是集体创造了帮助他人的智慧宝库。

信源:https://www.axios.com/2026/06/22/reddit-ads-shopping-community-intelligence
阿里HappyHorse 1.1上线,9图参考瞄准短剧广告

阿里巴巴发布视频生成模型 HappyHorse 1.1,并在阿里云百炼、千问及相关平台同步上线。相比 1.0 版本,新模型主要针对动态不稳定、主体漂移和画面质感不一致等问题做了优化,在指令跟随、画面稳定性和整体生成质量上有提升。

新版本支持最多 9 张参考图输入,用于锁定人物、商品或场景,从而提升视频生成中的一致性表现。在实际应用中更偏向短剧、电商和广告等需要稳定角色输出的场景。同时,模型已在阿里云百炼与部分第三方平台提供 API 调用能力,支持 1080p 输出,并覆盖音频与口型同步生成能力。

此外,官方同步启动 HorsePower AI Cinema Awards,并发布共创短片《Are You Happy》,用于推动社区侧的内容生成与案例展示。

信源:https://x.com/HappyHorseATH/status/2068941160584974753
1
「末日警告」玩脱了?数据实锤Anthropic话痨式风险营销,喜提地缘断供大礼包

英国《金融时报》的一项数据分析,实锤了 Anthropic 在风险营销上的「碎嘴」。

统计显示,在 Anthropic 全年公开言论中,平均每 1000 个单词中就有 5 个词在谈论风险、监管或限制(包括 336 次提及「risk」和 121 次提及「safeguard」)。相比之下,OpenAI 与 Sam Altman 的这一比例仅为每千字 0.6 个词,相差近 8 倍。

巨大反差让 Anthropic 的安全公关被业界普遍嘲讽为「奥本海默式营销」。Sam Altman 早在今年 4 月的播客中就公开吐槽过这种套路:「这显然是一种令人难以置信的营销手段,四处大喊:『我们造出了一个炸弹,现在我们要把它砸到你们头上了!』」

这种以「行业安全良心」自居的风险叙事,最终沦为作茧自缚的催化剂。由于大股东亚马逊因资本利益反水告密,向白宫通报了 Fable 5 的安全漏洞,直接招致了白宫「90分钟物理断网通牒」。讽刺的是,正是因为 Anthropic 此前反复在政客面前将 AI 风险比作「原子弹」,并宣扬 Mythos 具有「网络武器级」破坏力,才让白宫在决定封网时显得顺理成章。Dario Amodei 苦心经营的恐惧营销,到头来反倒为砸向自己的制裁铁锤递上了最趁手的把柄。

信源:https://www.ft.com/content/16ace46c-aeac-40c9-8598-3c01fa4481cb?syn-25a6b1a6=1
港大开源AgentSpace,支持将Claude与OpenClaw路由为数字员工

香港大学数据智能实验室(HKUDS)开源多智能体协作平台 AgentSpace。为了打破单人终端与零散对话的限制,AgentSpace 将 AI 智能体定义为「数字员工」,提供支持多角色权限分配、工作流协同和审计监控的团队共享空间。

架构设计中,标准化路由层 AgentRouter 负责在不改变业务队列的前提下,将同一个智能体调度至 Claude Code、Codex CLI、OpenClaw 或 Hermes Agent 等不同运行时,统一规范运行状态、执行结果和异常诊断。配套的数字员工看板支持智能体借调申请,并为所有者和管理员提供了技能绑定与工具审批通道。

安全和权限控制覆盖工作区成员、通道准入、私聊隐私和远程守护进程等多个维度。AgentSpace 接入了面向智能体的 Google Workspace OAuth 授权代理,支持智能体自主创建或读写云端文档,并在缺失权限时自动触发审批工作流。

后续路线图规划了更强的 AgentRouter 会话管理、多智能体沙箱隔离策略以及运行时工具市场。

信源:https://github.com/HKUDS/AgentSpace
动察Beating AI News
OpenAI发布网安套件Daybreak,开放最高权限模型用于渗透测试 OpenAI 发布网络防御套件 Daybreak。该平台结合了 OpenAI 前沿模型与 Codex(作为智能体运行框架),允许安全团队在代码库中直接生成安全补丁、测试并验证修复。 为了平衡强大能力与潜在被滥用的风险,Daybreak 将模型访问权限严格分为三级: - 常规版 GPT-5.5 遵循标准安全护栏。 - 带有「可信访问(Trusted Access)」的 GPT-5.5 拥有更精准的护栏,面向恶意软件分析和漏洞分流等日常防御。…
OpenAI发布GPT-5.5-Cyber完整版,跑分85.6%超Mythos 5

OpenAI 宣布升级 Daybreak 网络防御工具链,并正式推出面向防御者的 GPT-5.5-Cyber 完整版模型。在评估智能体复现已知漏洞能力的 CyberGym 基准测试中,GPT-5.5-Cyber 取得 85.6% 的单模型最高跑分,超越了 GPT-5.5 的 81.8% 和竞品 Mythos 5 的 83.8%。

随着 AI 的普及使漏洞发现效率大幅提升,防御端的瓶颈已从「寻找漏洞」转向「自动修复」。为了将检测结果转化为实际修复,配套的 Codex Security 插件迎来升级,允许开发人员在 Codex 环境内自动分析并生成修复补丁。自 3 月发布预览版至今,Codex Security 已累计扫描超 3000 万次提交,自动确认修复了 50 万个安全缺陷。最新版本支持集成 CodeQL 查询和导出 SARIF 标准文件,支持在软件上线前拦截潜在漏洞。

同时,OpenAI 联合 Trail of Bits 和 HackerOne 等机构发起 Patch the Planet 开源安全项目,为 cURL、Go 等 30 多个主流开源项目提供 ChatGPT Pro 订阅及 API 额度,由专家团队人工验证补丁以减轻维护者负担。在 Daybreak 合作伙伴计划中,Palo Alto Networks 和 Wiz 等安全厂商已首批接入,致力于在商业化安全产品中落地高级防御能力。

信源:https://x.com/OpenAI/status/2069104283824640023