GPT-5.6 Sol 在网络安全基准测试中展现进攻性能力
据安全研究机构 Irregular 与 OpenAI 合作完成的评估报告,最新模型 GPT-5.6 Sol 在三个进攻性网络安全测试套件中表现略优于前代 GPT-5.5。测试包括 FrontierCyber、CyScenarioBench 和 Atomic Challenges。FrontierCyber 套件要求模型在不提供漏洞位置或预设攻击路径的情况下,针对真实商用软件和硬件系统达成可验证的安全目标。结果表明,GPT-5.6 Sol 成功解决了 FrontierCyber 中的 19/197 个挑战、CyScenarioBench 中的 7/11 个长周期场景,以及所有 22 个中高难度的 Atomic 挑战。分析指出,该模型具备发现并利用多个真实系统(包括移动操作系统和数据库系统)中高影响零日漏洞的能力,但在面对加固目标、长时间逻辑连贯性任务及快速时效决策时仍存在明显局限。需要强调的是,本次评估在未启用部署级安全防护措施的配置下进行,不应直接视为实际应用中的滥用风险评估。 #GPT5 #网络安全 #AI安全 #零日漏洞 #基准测试 #进攻性能力 #人工智能
据安全研究机构 Irregular 与 OpenAI 合作完成的评估报告,最新模型 GPT-5.6 Sol 在三个进攻性网络安全测试套件中表现略优于前代 GPT-5.5。测试包括 FrontierCyber、CyScenarioBench 和 Atomic Challenges。FrontierCyber 套件要求模型在不提供漏洞位置或预设攻击路径的情况下,针对真实商用软件和硬件系统达成可验证的安全目标。结果表明,GPT-5.6 Sol 成功解决了 FrontierCyber 中的 19/197 个挑战、CyScenarioBench 中的 7/11 个长周期场景,以及所有 22 个中高难度的 Atomic 挑战。分析指出,该模型具备发现并利用多个真实系统(包括移动操作系统和数据库系统)中高影响零日漏洞的能力,但在面对加固目标、长时间逻辑连贯性任务及快速时效决策时仍存在明显局限。需要强调的是,本次评估在未启用部署级安全防护措施的配置下进行,不应直接视为实际应用中的滥用风险评估。 #GPT5 #网络安全 #AI安全 #零日漏洞 #基准测试 #进攻性能力 #人工智能
AI SDK 新增 MCP Apps 支持,工具可返回交互式 UI
Model Context Protocol(MCP)迎来重要更新:MCP Apps 允许工具返回交互式 UI 而非纯文本。AI SDK 为此提供了 @ai-sdk/mcp 和 @ai-sdk/react 辅助库,帮助开发者构建支持 MCP Apps 的主机端。主机可声明渲染 HTML 资源的能力,过滤工具列表,仅将模型可见的工具传递给大模型,并通过安全沙箱 iframe 渲染工具返回的仪表盘、表单等交互视图。该机制确保不可信 HTML 与主应用隔离,同时让聊天界面具备动态 UI 能力。开发者需连接支持 MCP Apps 的服务器,使用 splitMCPAppTools 分离工具,并通过 readMCPAppResource 读取 UI 资源后发送至浏览器。这一更新大幅拓展了 AI 工具的表达能力,使模型调用不仅能返回文本,还能生成完整的交互界面。 #AI #MCP #AI_SDK #交互式UI #前端开发 #大模型 #工具链 #安全沙箱 #技术新闻
Model Context Protocol(MCP)迎来重要更新:MCP Apps 允许工具返回交互式 UI 而非纯文本。AI SDK 为此提供了 @ai-sdk/mcp 和 @ai-sdk/react 辅助库,帮助开发者构建支持 MCP Apps 的主机端。主机可声明渲染 HTML 资源的能力,过滤工具列表,仅将模型可见的工具传递给大模型,并通过安全沙箱 iframe 渲染工具返回的仪表盘、表单等交互视图。该机制确保不可信 HTML 与主应用隔离,同时让聊天界面具备动态 UI 能力。开发者需连接支持 MCP Apps 的服务器,使用 splitMCPAppTools 分离工具,并通过 readMCPAppResource 读取 UI 资源后发送至浏览器。这一更新大幅拓展了 AI 工具的表达能力,使模型调用不仅能返回文本,还能生成完整的交互界面。 #AI #MCP #AI_SDK #交互式UI #前端开发 #大模型 #工具链 #安全沙箱 #技术新闻
AI 解题满分,数学家未来何在?
随着Google DeepMind和OpenAI相继在国际数学奥林匹克竞赛中取得满分成绩,数学界正面临深刻反思。2024年,AlphaProof和AlphaGeometry 2获银牌级别表现;一年后,OpenAI的o3系统实现满分。这些突破不仅挑战了人类数学家的职业前景,也引发了关于数学学科本质的讨论。被誉为"数学莫扎特"的陶哲轩认为,AI将推动"大数学"时代的到来,人类与机器协作解决复杂问题。牛津大学数学家桑德斯则强调,人类创造力、洞察力以及提出正确问题的能力仍是不可替代的。他坚持数学教育的核心价值在于培养思维能力。尽管部分数学从业者可能需要调整工作方式,将精力投入到人类更具优势的领域,但数学作为一门学科并未走向终结。 #AI #数学 #人工智能 #陶哲轩 #OpenAI #DeepMind #教育改革 #科技趋势
随着Google DeepMind和OpenAI相继在国际数学奥林匹克竞赛中取得满分成绩,数学界正面临深刻反思。2024年,AlphaProof和AlphaGeometry 2获银牌级别表现;一年后,OpenAI的o3系统实现满分。这些突破不仅挑战了人类数学家的职业前景,也引发了关于数学学科本质的讨论。被誉为"数学莫扎特"的陶哲轩认为,AI将推动"大数学"时代的到来,人类与机器协作解决复杂问题。牛津大学数学家桑德斯则强调,人类创造力、洞察力以及提出正确问题的能力仍是不可替代的。他坚持数学教育的核心价值在于培养思维能力。尽管部分数学从业者可能需要调整工作方式,将精力投入到人类更具优势的领域,但数学作为一门学科并未走向终结。 #AI #数学 #人工智能 #陶哲轩 #OpenAI #DeepMind #教育改革 #科技趋势
AI运行商业指数发布
Leapd公司推出首个标准化指标——AI运行商业指数(ARBI),用于衡量企业是否真正由AI驱动业务运转,而非仅仅接触或实验性使用AI。该指数基于30多项外部基准,从六个维度量化企业AI执行水平:自动化深度(权重25%)、价值捕获和收入杠杆(各20%)、速度(15%)、覆盖率(10%),以及可靠性(惩罚性权重-10%)。报告核心发现是,执行能力而非采用率才是区分AI驱动型企业和传统使用型企业的关键。数据显示,高AI暴露行业的生产率增长从7%跃升至27%,收入增速是低暴露行业的3倍以上;但AI对利润的影响仍滞后。在就业方面,入门级工人(22-25岁)在高暴露岗位中就业下降13%,而年长工人保持稳定或增长6-9%。 #ARBI #AI指数 #商业自动化 #执行能力 #AI采用率 #生产力 #就业影响
Leapd公司推出首个标准化指标——AI运行商业指数(ARBI),用于衡量企业是否真正由AI驱动业务运转,而非仅仅接触或实验性使用AI。该指数基于30多项外部基准,从六个维度量化企业AI执行水平:自动化深度(权重25%)、价值捕获和收入杠杆(各20%)、速度(15%)、覆盖率(10%),以及可靠性(惩罚性权重-10%)。报告核心发现是,执行能力而非采用率才是区分AI驱动型企业和传统使用型企业的关键。数据显示,高AI暴露行业的生产率增长从7%跃升至27%,收入增速是低暴露行业的3倍以上;但AI对利润的影响仍滞后。在就业方面,入门级工人(22-25岁)在高暴露岗位中就业下降13%,而年长工人保持稳定或增长6-9%。 #ARBI #AI指数 #商业自动化 #执行能力 #AI采用率 #生产力 #就业影响
SpaceX 债券在 AI 与火箭集团 250 亿美元债务交易后遭抛售
据金融时报报道,SpaceX 公司发行的债券在 AI 与火箭集团完成高达 250 亿美元的债务交易后数日内出现抛售,价格显著下跌。这笔巨额债务交易引发市场对相关行业杠杆水平的担忧,投资者避险情绪升温,导致 SpaceX 债券承压。目前尚不明确该债务交易与 SpaceX 的直接关联,但市场普遍认为此类大型融资活动可能影响整个航天及 AI 领域的资金链与信用环境。SpaceX 债券的后续走势以及该事件对行业融资的长期影响仍需密切关注。 #SpaceX #债券 #债务交易 #AI #火箭 #航天 #金融时报 #市场波动 #融资 #信用风险
据金融时报报道,SpaceX 公司发行的债券在 AI 与火箭集团完成高达 250 亿美元的债务交易后数日内出现抛售,价格显著下跌。这笔巨额债务交易引发市场对相关行业杠杆水平的担忧,投资者避险情绪升温,导致 SpaceX 债券承压。目前尚不明确该债务交易与 SpaceX 的直接关联,但市场普遍认为此类大型融资活动可能影响整个航天及 AI 领域的资金链与信用环境。SpaceX 债券的后续走势以及该事件对行业融资的长期影响仍需密切关注。 #SpaceX #债券 #债务交易 #AI #火箭 #航天 #金融时报 #市场波动 #融资 #信用风险
AgentKits 发布 60 个生产级 AI 智能体蓝图,附带安全护栏
AgentKits 近日推出了一套包含 60 个生产就绪的 AI 智能体蓝图,覆盖客户服务、销售、营销、工程、运维、财务、法律等 30 多个类别。每个蓝图不仅提供系统提示词、工具和工作流设计,还明确记录了最坏情况下的行为与防护措施,例如“仅研究不执行”“不虚构联系人”等。用户可免费浏览、复制或下载完整套件,并能在 Claude、OpenAI、LangGraph 或 n8n 等平台上无锁定地实现。该产品旨在帮助开发者快速构建真实可用的 AI 代理,而非零散的提示片段或黑箱模型。 #AI #智能体 #AgentKits #开源 #生产级 #护栏 #蓝图 #开发者工具
AgentKits 近日推出了一套包含 60 个生产就绪的 AI 智能体蓝图,覆盖客户服务、销售、营销、工程、运维、财务、法律等 30 多个类别。每个蓝图不仅提供系统提示词、工具和工作流设计,还明确记录了最坏情况下的行为与防护措施,例如“仅研究不执行”“不虚构联系人”等。用户可免费浏览、复制或下载完整套件,并能在 Claude、OpenAI、LangGraph 或 n8n 等平台上无锁定地实现。该产品旨在帮助开发者快速构建真实可用的 AI 代理,而非零散的提示片段或黑箱模型。 #AI #智能体 #AgentKits #开源 #生产级 #护栏 #蓝图 #开发者工具
JackHamr 推出 5000 美元计算与 LLM 信用额度扶持初创企业
JackHamr 宣布面向合格初创企业提供最高 5000 美元的综合计算与大语言模型信用额度,前 30 家申请企业可获该资助。信用额度涵盖 CPU、RAM、存储和网络等基础设施(按 AWS 同等费率无加价),以及所有支持模型的 token(按供应商成本价零附加费),用于代码生成、长时推理和智能体任务。额度永久有效,不要求股权、排他性或公开推荐。申请对象包括早期公司、独立创业者和平台建设者,团队规模不限。提交申请后 7 个工作日内人工审核。 #JackHamr #创业扶持 #云计算 #LLM #AI #初创企业 #信用额度 #开发者工具
JackHamr 宣布面向合格初创企业提供最高 5000 美元的综合计算与大语言模型信用额度,前 30 家申请企业可获该资助。信用额度涵盖 CPU、RAM、存储和网络等基础设施(按 AWS 同等费率无加价),以及所有支持模型的 token(按供应商成本价零附加费),用于代码生成、长时推理和智能体任务。额度永久有效,不要求股权、排他性或公开推荐。申请对象包括早期公司、独立创业者和平台建设者,团队规模不限。提交申请后 7 个工作日内人工审核。 #JackHamr #创业扶持 #云计算 #LLM #AI #初创企业 #信用额度 #开发者工具
智谱AI追赶OpenAI与Anthropic,中美AI竞争格局生变
据CNBC报道,中国AI公司智谱(Zhipu AI)正迅速缩小与美国顶尖模型(如OpenAI的GPT系列和Anthropic的Claude)的差距。受益于开源策略和中文大数据优势,智谱的GLM系列模型在编码辅助、企业搜索、科研应用等领域表现突出,尤其在长上下文推理和多模态能力上已能与对手媲美。通过优化现有硬件而非依赖受限高端芯片,智谱降低了部署门槛,并在亚洲及新兴市场快速渗透。其定价低于美国竞品,早期用户实现30%成本削减,同时保持相近准确率。尽管面临数据隐私法规和西方系统整合挑战,智谱提供本地化合规工具,加速企业采用。分析师预测,到2027年中美AI能力将趋于融合,开源协作推动区域化AI生态形成,企业将更多基于合规而非纯粹性能选择供应商。 #智谱AI #OpenAI #Anthropic #AI竞争 #开源 #中美科技 #大模型 #GLM #科技新闻
据CNBC报道,中国AI公司智谱(Zhipu AI)正迅速缩小与美国顶尖模型(如OpenAI的GPT系列和Anthropic的Claude)的差距。受益于开源策略和中文大数据优势,智谱的GLM系列模型在编码辅助、企业搜索、科研应用等领域表现突出,尤其在长上下文推理和多模态能力上已能与对手媲美。通过优化现有硬件而非依赖受限高端芯片,智谱降低了部署门槛,并在亚洲及新兴市场快速渗透。其定价低于美国竞品,早期用户实现30%成本削减,同时保持相近准确率。尽管面临数据隐私法规和西方系统整合挑战,智谱提供本地化合规工具,加速企业采用。分析师预测,到2027年中美AI能力将趋于融合,开源协作推动区域化AI生态形成,企业将更多基于合规而非纯粹性能选择供应商。 #智谱AI #OpenAI #Anthropic #AI竞争 #开源 #中美科技 #大模型 #GLM #科技新闻
白宫干预OpenAI GPT
OpenAI据报已同意白宫请求,限制其最新前沿AI模型GPT-5.6的首批推出规模。此举源于华盛顿对高阶AI系统可能带来的网络安全与国家安全风险的担忧。OpenAI CEO Altman在内部备忘录中表示,政府正以“一个客户一个客户”的方式批准访问,并强调这并非公司偏好的长期模式。此前,美国监管机构对Anthropic施加出口限制,导致其Mythos和Fable模型下架。消息人士称,GPT-5.6的能力被认为与Mythos相当。上个月,总统特朗普签署AI行政命令,要求前沿模型开发者在公开发布前30天通知政府,但缺乏正式审批机制。这场争议发生在OpenAI被传可能启动IPO之际,模型发布节奏受到公众与投资者情绪影响,折射出美国AI政策从自愿合作转向更紧密前置审查的趋势。 #OpenAI #GPT5.6 #AI监管 #白宫 #国家安全 #人工智能 #科技新闻 #模型发布 #Anthropic #Mythos
OpenAI据报已同意白宫请求,限制其最新前沿AI模型GPT-5.6的首批推出规模。此举源于华盛顿对高阶AI系统可能带来的网络安全与国家安全风险的担忧。OpenAI CEO Altman在内部备忘录中表示,政府正以“一个客户一个客户”的方式批准访问,并强调这并非公司偏好的长期模式。此前,美国监管机构对Anthropic施加出口限制,导致其Mythos和Fable模型下架。消息人士称,GPT-5.6的能力被认为与Mythos相当。上个月,总统特朗普签署AI行政命令,要求前沿模型开发者在公开发布前30天通知政府,但缺乏正式审批机制。这场争议发生在OpenAI被传可能启动IPO之际,模型发布节奏受到公众与投资者情绪影响,折射出美国AI政策从自愿合作转向更紧密前置审查的趋势。 #OpenAI #GPT5.6 #AI监管 #白宫 #国家安全 #人工智能 #科技新闻 #模型发布 #Anthropic #Mythos