GPT-5.6 Luna 在网络安全基准测试中展现更优性价比
OpenAI 发布 GPT-5.6 系统卡,推出旗舰 Sol、中端 Terra 及经济型 Luna 三款推理模型,均通过其“高”网络安全能力门槛,具备自动化端到端攻击与漏洞发现能力。其中 Luna 以每真实阳性成本最低脱颖而出,性价比是其他型号的六倍,F1 调和平均值仅略有牺牲。不过,官方 CTF 测试分数(96.7%)高度依赖特定框架,脱离辅助环境后成绩不具可比性。CVE-Bench 等基准显示提升仅“略好于”GPT-5.5,部分原因可能是训练数据与测试数据重叠。作者指出,通过结合安全工具链(如 Semgrep 多模态)在完整工作流中能取得更优效果。总体而言,全系模型在网络安全能力上较前代稳定提升。 #OpenAI #GPT5.6 #Luna #网络安全 #AI #大模型 #基准测试 #ROI #模型评估 #安全能力
OpenAI 发布 GPT-5.6 系统卡,推出旗舰 Sol、中端 Terra 及经济型 Luna 三款推理模型,均通过其“高”网络安全能力门槛,具备自动化端到端攻击与漏洞发现能力。其中 Luna 以每真实阳性成本最低脱颖而出,性价比是其他型号的六倍,F1 调和平均值仅略有牺牲。不过,官方 CTF 测试分数(96.7%)高度依赖特定框架,脱离辅助环境后成绩不具可比性。CVE-Bench 等基准显示提升仅“略好于”GPT-5.5,部分原因可能是训练数据与测试数据重叠。作者指出,通过结合安全工具链(如 Semgrep 多模态)在完整工作流中能取得更优效果。总体而言,全系模型在网络安全能力上较前代稳定提升。 #OpenAI #GPT5.6 #Luna #网络安全 #AI #大模型 #基准测试 #ROI #模型评估 #安全能力
Apple Watch 的 Siri AI 升级
在最新的 watchOS 27 开发者测试版中,苹果为 Apple Watch 带来了 Siri AI 的重大升级。此前,Siri 在手表上主要用于设置计时器等简单操作,实用性有限。但新的 Siri AI 显著提升了智能处理和响应能力,使其更像一台真正的腕上电脑。尽管这一变化不会立即普及所有人,但它标志着苹果等科技公司对智能手表使用方式的重新思考,有望彻底改变用户与手表交互的方式。 #AppleWatch #SiriAI #智能手表 #苹果 #watchOS
在最新的 watchOS 27 开发者测试版中,苹果为 Apple Watch 带来了 Siri AI 的重大升级。此前,Siri 在手表上主要用于设置计时器等简单操作,实用性有限。但新的 Siri AI 显著提升了智能处理和响应能力,使其更像一台真正的腕上电脑。尽管这一变化不会立即普及所有人,但它标志着苹果等科技公司对智能手表使用方式的重新思考,有望彻底改变用户与手表交互的方式。 #AppleWatch #SiriAI #智能手表 #苹果 #watchOS