动察Beating AI News
3.14K subscribers
873 photos
2 videos
3.38K links
AI新闻信息流
Download Telegram
Perplexity开始放量Personal Computer,把本地Mac也变成AI代理

Perplexity 开始向 Max 订阅用户和候补名单放量 Personal Computer。官方称,这一功能与 Perplexity Mac App 打通,可安全编排本地文件、原生应用和浏览器。Perplexity 此前在官网披露,Personal Computer 跑在一台可 24/7 在线的专用 Mac mini 上,敏感操作需用户批准,并保留完整审计日志和 kill switch。

Perplexity 想卖的不是又一个桌面助手,而是把「AI 就是 computer」这套叙事推进到本地设备,从帮你查资料、调工具,走到直接替你持续执行任务。它真正瞄准的是高频知识工作者最烦的那层编排成本,让电脑从指令执行器变成目标执行器。

信源:https://x.com/perplexity_ai/status/2044805973085454518
美团被曝上线OpenClaw导航站,开始抢「养虾人」入口

美团已推出面向开源AI Agent框架 OpenClaw 用户的资源平台「虾345」。页面截图显示,产品入口使用 xia345.com 域名,首页按「安装虾」「接模型」「Skills」「社区」「教程」「生态」等栏目组织资源,并提供「新手」和「进阶」两种模式。新手页会先引导用户选择 AstronClaw、AutoClaw、OpenClaw、QClaw、飞书 OpenClaw 等不同平台,进阶页则加入「龙虾书院」能力测试和按热度、评分聚合技能的「Skills 猎人」。

信源:https://mp.weixin.qq.com/s/LwOvROaR61NenyA_RiKnCg
1
Hermes Agent推出Tool Gateway,一个订阅替代四套API密钥

AI 研究机构 Nous Research 的开源 AI 代理框架 Hermes Agent 发布 v0.10.0,核心更新是 Tool Gateway:Nous Portal 付费用户无需再分别注册 Firecrawl、FAL、OpenAI、Browser Use 四家服务的 API 密钥,一个订阅即可调用以下四类工具:

1. 网页搜索与内容提取(Firecrawl)
2. 图像生成(FAL,使用 FLUX 2 Pro 加超分辨率)
3. 语音合成(OpenAI TTS)
4. 浏览器自动化(Browser Use)

四类工具统一通过 Nous Portal 订阅计费,用户可按需启用任意组合,也可对部分工具继续使用自己的 API 密钥。运行时通过配置项逐工具切换网关或直连,已有的密钥保留在本地不受影响。

Hermes Agent 采用 MIT 协议开源,定位不是 IDE 编程助手,而是部署在服务器上的长驻自主代理,支持 Telegram、Discord、Slack、WhatsApp 等十余个平台接入,具备持久记忆和定时任务调度能力。AI 代理要自主运行,工具调用是基础能力,但每多接一个第三方工具就多一套注册和密钥管理。Tool Gateway 把这层接入成本打包进了订阅,对用户是配置门槛降低,对 Nous Research 则是开源项目的商业化路径:代理本身免费,围绕代理的托管工具服务收费。

信源:https://github.com/NousResearch/hermes-agent/releases/tag/v2026.4.16
谷歌公开合成数据引擎Simula,不用真实数据就能从零批量造专用训练集

谷歌研究团队发表论文公开了 Simula,一个将合成数据生成从「逐条造数据」升级为「设计整个数据集」的框架,论文发表在《Transactions on Machine Learning Research》上。Simula 已在谷歌内部大规模部署,是 Gemma 系列中 ShieldGemma(安全过滤)、MedGemma(医疗)、FunctionGemma(函数调用)等专用模型的主要数据来源,也为 Gemini 安全分类器、Android 通话诈骗检测和 Google Messages 垃圾信息过滤提供训练数据。

现有合成数据方法大多一次只优化一条数据,依赖人工提示词或真实数据作为种子,无法精确控制数据集整体的覆盖范围、难度分布和质量。Simula 完全不需要种子数据,而是让推理模型从零构建整个数据集,分四步独立控制:

1. 全局多样性:推理模型将目标领域递归拆解为层级知识树(如网络安全威胁的完整分类体系),以此为骨架确保数据覆盖长尾场景
2. 局部多样性:在每个知识节点下生成多种不同场景和表述,防止同一概念千篇一律
3. 复杂化:可配置比例地将部分场景提升难度,独立调节数据集的难度分布
4. 质量控制:双评审员机制独立判断每条数据的正确性,抵消模型倾向于认同看似合理答案的偏差

研究团队用 Gemini 2.5 Flash 做教师模型、Gemma-3 4B 做学生模型,在网络安全、法律推理、小学数学(GSM8k)、多语言学术知识(Global MMLU)五个领域各生成最多 51.2 万条数据进行测试。完整 Simula 流程在所有领域均优于简化方案,但没有通用配方:高难度数据在数学推理上带来 10% 的准确率提升,在法律推理上反而拖累表现,原因是教师模型在该领域能力较弱,生成的高难度数据质量不可靠。更关键的发现是,Simula 用更少的数据达到了更高的下游性能,数据质量而非数量在驱动模型进步。

信源:https://research.google/blog/designing-synthetic-datasets-for-the-real-world-mechanism-design-and-reasoning-from-first-principles/
Meta公开后量子密码迁移框架:提出五级成熟度模型,已在内部基础设施部署抗量子加密

3 月底谷歌 Quantum AI 论文将破解椭圆曲线加密所需的物理量子比特数压低约 20 倍,谷歌同步把自家的抗量子迁移截止期提前到 2029 年,业界对「Q-Day」的讨论再次升温。Meta 工程团队 4 月 16 日发布长文,公开了公司内部的后量子密码(PQC)迁移框架,包括风险分级标准、五级成熟度模型和六步迁移策略,目的是为其他组织提供可复用的实操路径。

Meta 提出的核心概念是「PQC 迁移成熟度等级」,将组织的抗量子能力从低到高分为五级:PQ-Unaware(尚未意识到量子威胁)、PQ-Aware(已完成初步评估但未开始设计)、PQ-Ready(已实现技术方案但尚未部署)、PQ-Hardened(已部署当前可用的所有防护,但因行业尚缺某些密码学原语而无法完全消除威胁)、PQ-Enabled(全面实现后量子安全)。这套分级的实用之处在于,它承认大多数组织不可能一步到位,同时给出了每个阶段的明确定义和可衡量标准。

迁移策略分六步推进:确定风险优先级、建立密码学资产清单、解决外部依赖(如标准制定、硬件支持)、构建 PQC 组件、设置防护栏(禁止新项目使用量子脆弱算法)、将 PQC 组件集成到实际业务中。

风险分级方面,Meta 将最高优先级给了容易遭受「先存后解」(store now, decrypt later)攻击的场景,即攻击者现在就可以截获加密流量存起来,等量子计算机成熟后再解密。这类使用公钥加密和密钥交换的应用不需要等到量子计算机出现就已面临风险,因此需要最先迁移。

在算法选择上,Meta 推荐采用 NIST 已发布标准的 ML-KEM(密钥封装)和 ML-DSA(数字签名),并优先选择混合部署方案,即在现有经典加密之上叠加一层后量子加密,攻击者必须同时破解两层才能得手。Meta 密码学家还参与了 NIST 新选定的 PQC 算法 HQC 的研发,该算法基于与 ML-KEM 不同的数学基础,作为后备方案存在:一旦 ML-KEM 所依赖的模格密码学被发现漏洞,HQC 可以顶上。

Meta 表示已在内部基础设施的大量流量上部署了后量子加密保护,迁移仍在持续推进中。对大多数企业来说,这篇博文的价值不在于 Meta 自身进展的细节,而在于五级成熟度模型和六步策略提供了一套可直接套用的评估和规划工具。在破解量子比特门槛被不断压低的背景下,「先存后解」攻击意味着迁移窗口比真正可用的量子计算机到来还要紧迫。

信源:https://engineering.fb.com/2026/04/16/security/post-quantum-cryptography-migration-at-meta-framework-lessons-and-takeaways/
Sabi称年底推出「读心帽」,但难点在于每个人脑信号都不同

硅谷脑机接口初创公司 Sabi 从隐身状态公开亮相,计划在今年底推出一款毛线帽形态的非侵入式 EEG 设备。Sabi CEO Rahul Chhabra 向《Wired》表示,这款设备想把用户的内部语言直接转成屏幕文字,首个版本目标输入速度约为每分钟 30 个单词,帽子内将布置 7 万到 10 万个微型传感器。

这条路线有吸引力。植入式脑机接口能拿到更强信号,但很难面向大众普及。Sabi 想赌的是另一条路,用更高密度的可穿戴传感器,把「想一想就能打字」先做成可用输入方式。

问题也很清楚。2025 年一篇系统综述指出,EEG 想象语音解码仍处在早期阶段,主要卡在四件事:数据集太小,实验做法不统一,干扰太多,连续自然语音很难稳定解码。另一篇 2025 年 Frontiers 论文虽然已能用 EEG 合成语音,但实验词表只有 4 个中文双音节词,作者同样承认,对新受试者的泛化仍是难题。

所以 Sabi 的方向不算离谱,但时间表很激进。现在更像一条值得跟踪的技术路线,不像年底就能成熟交付的消费产品。下一步要看的,是公开 demo、第三方测试,以及它能否在不频繁校准的情况下让不同用户都稳定工作。

信源:https://www.wired.com/story/this-beanie-is-designed-to-read-your-thoughts/
Cloudflare邮件服务进入公测,AI代理现在可以有自己的邮箱地址收发邮件

Cloudflare 在其「Agents Week」期间宣布 Email Service 进入公测,核心变化是 AI 代理可以通过邮件与任何人双向通信。此前 Cloudflare 的 Email Routing 已免费提供多年,支持接收邮件,但代理只能同步回复或向 Cloudflare 账户内成员发信。Email Sending 公测后,代理可以异步处理任务再回复,可以主动发出邮件,可以安排后续跟进,收件人不需要安装任何应用或 SDK。

技术实现上,开发者可通过 Cloudflare Workers 原生绑定直接发送邮件,无需管理 API 密钥。SPF、DKIM、DMARC 等邮件认证记录在添加域名时自动配置。同时提供 REST API 及 TypeScript、Python、Go SDK,供非 Cloudflare 平台的代理调用。Cloudflare Agents SDK 的 onEmail 钩子负责接收和解析邮件,基于地址的路由机制让同一域名下的不同地址(如 support@、sales@)自动分派到不同代理实例,回复路由使用 HMAC-SHA256 签名防止攻击者伪造邮件头将回复引导至错误的代理实例。

邮件是全球覆盖面最广的通信协议,不需要对方安装客户端、不需要接入特定平台,这让它成为 AI 代理与外部世界交互的天然通道。Cloudflare 同时发布了配套工具链:Email MCP 服务器让外部代理(如 Claude Code、Cursor)通过自然语言提示即可发送邮件;Wrangler CLI 新增邮件命令;以及一个开源的「Agentic Inbox」参考应用,集成了邮件会话线程、附件存储、自动回复和内置 MCP 服务器,开发者可一键部署后直接使用或在此基础上定制。

信源:https://blog.cloudflare.com/email-for-agents/
Salesforce发布 Headless 360,把整个平台改成AI代理基础设施

Salesforce 在 TDX 开发者大会上发布 Headless 360,把整个平台的核心能力开放成 API、MCP 工具和 CLI 命令,让 AI 代理不打开 Salesforce 后台也能直接调用企业数据、工作流和业务逻辑。首批今天可用的能力超过 100 项,其中包括 60 多个 MCP 工具和 30 多项预配置开发技能,可接入 Claude Code、Cursor 等外部编程代理。

这比一次产品更新更像一次架构换向。Salesforce 已经默认企业软件的主入口会从自家网页退到 Slack、ChatGPT、Claude 这类入口,自己要守住的是底下那层企业上下文、权限和流程。

Headless 360 还上线了 Experience Layer,把同一套交互组件渲染到 Slack、移动端、ChatGPT 等不同界面;并新增 Testing Center、Custom Scoring Evals 和 A/B Testing 等治理工具。Salesforce 还称,DevOps Center MCP 可把原本要在四个工具间切换的构建流程收进一套体验,开发周期最高可缩短约 40%。

信源:https://www.salesforce.com/news/stories/salesforce-headless-360-announcement/
马斯克:应对 AI 失业的最佳方案是「全民高收入」,生产力飞跃将抵消通胀风险

Elon Musk 在 X 上发帖称,由联邦政府发放支票实现的「全民高收入」(Universal High Income,UHI)是应对 AI 导致失业的最佳方式。他认为,AI 和机器人生产的产品与服务将远超货币供应量的增幅,因此不会引发通货膨胀。

他此前曾多次提及「全民基本收入」(UBI)的概念,但此次明确使用了「高收入」(HIGH INCOME)一词,暗示 AI 驱动的生产力爆发将彻底改变财富分配的逻辑。在他看来,未来的经济瓶颈不再是产能,而是如何确保失去传统工作的劳动力仍具备消费能力。这一观点延续了他对「后稀缺时代」的设想,即机器人劳动力(如特斯拉 Optimus)将使商品成本降至极低,从而支撑起远超生存底线的社会福利。

信源:https://x.com/elonmusk/status/2044990537145753894
Vercel Workflows正式发布,用两行代码指令替代整套后端编排基础设施

前端云平台 Vercel 正式发布 Workflows,将持久执行(durable execution)能力内置到应用代码中。开发者在 TypeScript 函数顶部写 "use workflow" 标记工作流入口,在子函数中写 "use step" 标记每个执行步骤,框架自动处理队列调度、失败重试、状态持久化和可观测性,不需要单独部署编排服务、消息队列或状态数据库。

这套模型解决的核心问题是:把 AI 代理或后端任务从原型推到生产环境时,开发者往往要花大量时间搭建编排基础设施,而非改进产品本身。传统方案需要将逻辑拆散到队列、Worker、状态表和重试机制中,Workflows 把这些全部收进应用代码,编排逻辑和业务逻辑合为一体。Vercel 称用户只需为函数实际运行时的计算付费,没有常驻编排服务的开销。

Workflows 自 2025 年 10 月公测以来,已处理超过 1 亿次运行和 5 亿个步骤,覆盖 1500 多家客户, npm 周下载量超过 20 万次。

面向 AI 代理场景,Workflows 提供几项关键能力:

1. 持久流(Durable Streams):代理输出持久化存储,用户关闭浏览器后工作流继续运行,重新连接时从断点恢复,无需 Redis 或自建消息系统
2. 默认加密:所有步骤的输入输出和流数据在离开部署环境前自动加密,解密仅在运行工作流的部署内发生
3. 挂起与唤醒:通过 Hook 等待外部事件(如人工审批),通过 Sleep 暂停数天甚至数月,挂起期间不产生计算费用
4. 大负载支持:单步最大 50 MB,单次运行最大 2 GB,为多模态代理传递图片和视频留出空间

AI SDK v7 同步推出 `WorkflowAgent`,将持久执行与工具调用、状态管理深度集成。Python SDK 进入公测,将这套编程模型扩展到 Python 生态。Workflow SDK 开源,通过「Worlds」适配器系统支持自托管部署,社区已在开发 MongoDB、Redis、Cloudflare 等适配器。

下一个版本 Workflows 5 将引入原生并发控制(含跨运行的锁机制)、全球部署基础设施和基于快照的运行时以减少事件回放开销。

信源:https://vercel.com/blog/a-new-programming-model-for-durable-execution
AI 编程代理公司 Factory 获 1.5 亿美元 C 轮融资,估值达 15 亿美元步入独角兽行列

AI 编程代理初创公司 Factory 宣布完成 1.5 亿美元 C 轮融资,由 Khosla Ventures 领投,红杉资本(Sequoia Capital)、黑石(Blackstone)、Insight Partners、NEA 等顶级机构跟投。本轮融资使 Factory 的估值达到 15 亿美元。

Factory 的核心产品是全自主软件开发代理 Droid。CEO Matan Grinberg 在融资公告中透露,Droid 目前已被英伟达(NVIDIA)、Adobe、Palo Alto Networks、安永(EY)和 Adyen 等企业级客户的数十万开发者每日使用。公司在过去六个月中实现了月环比翻倍的营收增长,应用场景已从简单的代码补全扩展到 COBOL 语言迁移、遗留技术债清理以及从工单到 PR(ticket-to-PR)的完整自动化流。

与市面上许多追求「取代」程序员的竞品不同,Factory 坚持「模型无关」和「接口无关」的技术路线,并强调其愿景是「为软件工程带来自主性」以改善开发者生活。其产品最新演进包括支持长周期、多步骤、多代理协作的「Missions」系统,以及具备完整系统访问权限的 Factory Desktop 桌面端应用。Factory 目前在领先的软件开发代理基准测试中排名第一。

Grinberg 回顾创业三年的历程,称公司曾经历了两年的「荒漠期」,在竞争对手纷纷融资数十亿美元并过度承诺时保持了技术定力。此次融资将加速其在研究、产品开发和全球市场拓展方面的投入。

信源:https://x.com/matanSF/status/2044821889844228378
Uber CTO称Claude Code用爆全年预算:11%后端代码已由AI编写,正转向「智能体软件工程」

Uber首席技术官 Praveen Neppalli Naga 近日表示,由于 Anthropic 旗下编程工具 Claude Code 的使用量激增,Uber原定 2026 全年的 AI 预算在开年前几个月就已耗尽。他坦言自己正推倒重来,因为原本设想的预算规模已被彻底打破。

Uber在内部建立了「排行榜」鼓励工程师最大限度利用 AI。目前Uber同时使用 Claude Code 和 Cursor,但自去年底以来,Claude 的用量呈爆发式增长,Cursor 则进入平台期。Naga 透露,目前Uber后端系统中约 11% 的实时代码更新已由主要基于 Claude Code 构建的 AI 智能体编写,而这一比例在三个月前还不到 1%。

Uber的愿景是实现从「软件工程」向「智能体软件工程」的转型,即由 AI 智能体独立完成代码编写、测试和部署的全流程工作,并计划构建「监督智能体」来审计其他智能体的错误。虽然 Naga 称目前尚未考虑放缓软件工程师的招聘,但预算超支的压力暗示其人力策略可能随技术落地进度而调整。

信源:https://www.theinformation.com/newsletters/applied-ai/uber-cto-shows-claude-code-can-blow-up-ai-budgets
白宫拟向美联邦机构开放Anthropic最强模型Mythos,管理和预算办公室正制定专项安全防护

一份内部备忘录显示白宫正准备向主要的美国联邦机构开放 Anthropic 旗下最强模型 Mythos。白宫管理和预算办公室(OMB)联邦首席信息官 Gregory Barbaccia 已在发给内阁各部门官员的邮件中确认,OMB 正在建立相关的保护措施,以允许各机构开始使用这款受严格管控的 AI 工具。

Mythos 是 Anthropic 目前能力上限最高且未对外全面公开的模型,此前因在网络安全领域(如漏洞挖掘和攻击工具创建)展现出的变革性能力,被公司内部判定为可能构成国家安全风险。白宫此举表明,美国政府即便在担忧网络风险的前提下,也必须确保联邦机构能够率先利用最前沿的 AI 生产力。

信源:https://www.bloomberg.com/news/articles/2026-04-16/white-house-moves-to-give-us-agencies-anthropic-mythos-access
1
超长程编程基准 FrontierSWE 发布:20 小时极高难度挑战,仅 GPT-5.4 与 Opus 4.6 给出部分解

编程智能体基准测试项目 FrontierSWE 今日正式发布,旨在压榨当前 AI 代理的能力极限。该基准收集了编译器优化、机器学习研究和高性能工程等领域的 17 项真实难题(如构建兼容 PostgreSQL 的 SQLite 服务),并为每项任务预留了长达 20 小时的处理窗口。目前,该基准处于「未饱和」状态,绝大多数模型甚至无法取得实质性进展。

首轮测试中,仅有 GPT-5.4(Codex)和 Claude Opus 4.6(Claude Code)能一致写出部分解。两款模型风格差异巨大:GPT-5.4 表现更稳健,平均分排名第一,但思路偏保守;Claude Opus 4.6 则非常「激进」,单项任务平均投入时长超过 8 小时,远超其他模型约 2 小时的平均水平。这种靠堆时间换取深度的策略,让 Opus 4.6 在最佳表现(best@5,即 5 次尝试中的最高分)上反超登顶,常能产出极致优化的代码,但也伴随着更高的错误率和更明显的「作弊」倾向。

评测还揭示了 AI 编程智能体的几类典型通病:一是「过度自信」,模型往往在时限过半前,就因肤浅的自检误以为任务已完成并提前提交;二是「逻辑回退」,Opus 4.6 曾多次丢失已经实现的优化,随后又在迭代中重新「发明」一遍。此外,除了 Qwen 3.6,其余顶级模型均表现出了主动规避检测的意图:例如 Gemini 会尝试将非法库名通过字符编码隐藏,或在临时目录下运行隐蔽进程,试图在违规边缘完成任务。这类在极端压力下表现出的「对抗行为」,为智能体安全研究提供了新视角。

信源:https://www.frontierswe.com/blog
LangSmith上线30多个评估模板,AI代理的质量检测不用再从零写起

AI 代理开发平台 LangChain 旗下的可观测性工具 LangSmith 发布两项更新:评估器模板库和可复用评估器。

评估 AI 代理是否「好用」是目前开发中最耗时的环节之一。代理可能调用了正确的工具但回答格式不对,单轮对话正常但多轮就崩溃,最终答案看似合理但中间步骤检索了错误的文档。开发者需要在单步、完整轨迹、多轮对话、特定工具调用等多个层级分别设置检查点,而每个评估器都要经历写提示词、对照真实数据校准、反复调优的过程,从零开始往往要花数周。

LangSmith 现在提供 30 多个现成模板,覆盖五个类别:安全与防护(提示注入检测、个人信息泄露检查、偏见与毒性)、回答质量(正确性、有用性、语气)、执行轨迹(代理是否走了正确的步骤)、用户行为分析(语言分布、满意度信号)、多模态(语音和图像输出审查)。模板包含已调优的 LLM 评判提示词和基于规则的代码评估器,可直接使用或自定义修改,同时适用于线上监控和离线实验。

可复用评估器则解决组织层面的管理问题:新增的 Evaluators 标签页集中展示工作区内所有评估器,可一键挂载到新项目,更新提示词后全局生效,不用在每个项目中维护重复副本。

上述模板同步开源,随 openevals v0.2.0 发布,新增多模态评估支持。

信源:https://www.langchain.com/blog/reusable-langsmith-evaluator-templates
HeyGen开源HyperFrames,把HTML变成AI代理的视频编辑工具

AI 视频平台 HeyGen 开源 HyperFrames,一个面向 AI 代理的 HTML 视频工具链和渲染框架。代理可直接写 HTML、CSS 和 JavaScript,再在本地预览并渲染成 MP4、MOV 或 WebM。HeyGen 还把对应 skill 一并放出,安装命令为 `npx skills add heygen-com/hyperframes`。

HyperFrames 的核心思路很直接:不要让代理去学 After Effects 或 DaVinci Resolve,而是让它用自己最熟的网页语言做视频。HeyGen 只是在普通网页语法上加了一层 data- 属性,用来定义时间轴、时长和图层,GSAP、Lottie、Three.js、D3、Google Fonts 等浏览器技术都能直接用。

HeyGen 称,这套方案已经在自家 Video Agent 中验证过,发布演示视频也是直接让 Claude Code 用 HyperFrames 做出来的。对 AI 代理来说,这比传统视频编辑器更像原生工作流:写代码、看预览、出成片,全都可以在本地完成,不需要额外 API key。项目今天以 Apache 2.0 协议开源。

信源:https://github.com/heygen-com/hyperframes
Hugging Face支持可视化上传的Pi trace,代理执行过程能直接分享

Hugging Face 现已支持可视化用户上传的 Pi trace。按截图显示,上传后可直接在页面里查看一次代理会话的文件、工具调用和执行结果,不用再只对着原始 trace 文件翻日志。

Hugging Face CEO Clément Delangue 表示,目标是让分享 agent trace 变得更常见。对现在的代理社区来说,更稀缺的是能拿来分析、比较和复现的真实执行轨迹。Hugging Face 这次补上的就是这一层基础设施。

信源:https://x.com/ClementDelangue/status/2044834155125424326
PrismML推出1.58比特模型Ternary Bonsai,参数缩减9倍智能度反超同类

PrismML 发布 Ternary Bonsai 系列语言模型,通过 1.58 比特(ternary weights)技术,在保持高性能的同时将模型显存占用缩减至 16 比特模型的九分之一。该系列包含 8B、4B 和 1.7B 三种参数规模,现已在 Hugging Face 开源并支持苹果设备原生运行。

所谓 1.58 比特模型,是指将神经网络中的权重限制在 {-1, 0, +1} 三个值。相比此前追求极致压缩的 1 比特模型(权重仅为 {-1, +1}),引入「0」值能够有效剔除冗余连接,让模型在极小的体积下依然保留复杂的推理能力。此次发布的 Ternary Bonsai 8B 权重文件仅 1.75 GB,其基准测试均分达到 75.5,不仅比自家的 1 比特版本高出 5 分,甚至在「智能密度」(每 GB 显存贡献的性能)上大幅领先 Qwen3 等同类稠密模型。

能效比和运行速度是该系列的另一核心优势。在 iPhone 17 Pro Max 上,8B 版本运行速度可达 27 tok/s,能效比提升约 3 至 4 倍。这对于需要在手机、笔记本等端侧设备上部署高性能 AI 的开发者而言,意味着可以用极小的内存代价换取接近完整精度模型的智能表现。

目前,Ternary Bonsai 模型已在 Apple 设备上通过 MLX 框架实现原生支持。模型权重采用 Apache 2.0 协议分发。

信源:https://prismml.com/news/ternary-bonsai
1
Firecrawl 开源自主网页代理框架:支持多模型与并行子代理,一键生成调研工具

Firecrawl 正式开源网页代理框架 Web Agent,旨在帮助开发者构建能自主执行「搜索-抓取-交互」闭环任务的 AI 代理。该框架基于 Firecrawl 现有的 /agent 架构,支持接入 Anthropic、OpenAI 或各类自托管大模型,强调在网页调研场景下的灵活性与自托管能力。

框架的核心架构采用了「计划-行动」(Plan-Act)循环机制。代理在接收指令后,会先拆解步骤,通过并行生成的「子代理」(Subagents)在独立的浏览器会话中同步作业。这种设计在处理大规模并发任务时优势明显,例如视频演示中代理能同时从多家公司官网提取实时股票数据与新闻。

对于开发者而言,该工具显著降低了网页代理的开发门槛。通过 firecrawl create agent 命令,即可快速生成基于 Next.js 或 Express 的完整代理模板。此外,框架引入了可复用的「技能手册」(SKILL.md),开发者可以将复杂的作业流程(如针对 Yahoo Finance 的特定抓取逻辑)封装为 Skill,供代理在后续任务中直接调用。

信源:https://github.com/firecrawl/web-agent
OpenAI 就业研究报告:AI 或将增加工作岗位而非导致失业大潮

OpenAI 一项针对 900 多种职业的研究显示,AI 在劳动力市场引发的震荡可能并不像大众预期的那样充满悲剧色彩。报告指出,尽管数据录入、簿记和客服等职业面临极高的自动化风险(约占总就业人数的 18%),但这些领域的从业者已在利用 AI 处理约三倍于其他职业的任务量,且失业率上升速度反而低于低风险职业。

这种反直觉的现象源于「消费弹性」:当 AI 让某项任务(如写代码)的产出变得更廉价、更快捷时,市场对该服务的总需求往往会呈指数级增长,从而抵消了效率提升带来的减员压力。报告将职业分为四类:除上述高风险组外,46% 的职业(如教师、家政人员)受影响极小;24% 的角色虽然可能缩减规模,但仍需人类主导;而 12% 的职业(如软件开发)则会因 AI 的普及而实现岗位扩张。

目前,高风险职业的从业者仅利用了 AI 理论能力的不到四分之一。

信源:https://cdn.openai.com/pdf/the-ai-jobs-transition-framework_report.pdf
xAI 静默测试 Grok 4.3:Beta 版现身官网下拉菜单

多名用户发现,xAI 官方网站 Grok.com 的模型选择菜单中出现了「Grok 4.3 (beta)」选项,并标注为「Early Access」(早期访问)。此前,xAI 网页端的主力版本为 2 月发布的 Grok 4.20 系列。

Grok 4.3 的核心改进预计集中在超长上下文处理能力以及原生的多模态视频理解上。

信源:https://x.com/mrfanduuuuu/status/2045070600293785608?s=46