四大AI模型同台竞技
近日,一场别开生面的AI创意比拼引发关注。Anthropic的Claude Fable 5、OpenAI的GPT-5与GPT-5 mini、Google的Gemini 3.1 Pro四款顶级AI模型,在完全相同的条件下接受挑战:使用21种材料和48x48x48体素网格,一次性建造自己最想居住的家园。每个模型仅有一次机会,不得修改,并需用一句话解释设计理念。结果显示,三款模型不约而同选择了海边悬崖作为场景,而另一款则独辟蹊径。这场测试不仅展示了各模型的空间构建能力,更折射出它们对"理想家园"的独特理解。所有模型均采用相同的渲染管线,确保唯一变量是AI的创意选择。 #AI #大模型 #创意比拼 #Claude #GPT5 #Gemini #人工智能 #科技新闻
近日,一场别开生面的AI创意比拼引发关注。Anthropic的Claude Fable 5、OpenAI的GPT-5与GPT-5 mini、Google的Gemini 3.1 Pro四款顶级AI模型,在完全相同的条件下接受挑战:使用21种材料和48x48x48体素网格,一次性建造自己最想居住的家园。每个模型仅有一次机会,不得修改,并需用一句话解释设计理念。结果显示,三款模型不约而同选择了海边悬崖作为场景,而另一款则独辟蹊径。这场测试不仅展示了各模型的空间构建能力,更折射出它们对"理想家园"的独特理解。所有模型均采用相同的渲染管线,确保唯一变量是AI的创意选择。 #AI #大模型 #创意比拼 #Claude #GPT5 #Gemini #人工智能 #科技新闻
AI网站扫描报告:视觉特征并非关键,结构残留才是真正信号
一项针对131个AI生成网站的审计显示,人们普遍认为的“AI网站外观”——如渐变背景、圆角卡片、模糊文案等视觉特征,实际上并非区分AI网站与人工网站的有效指标。SiteBlob团队对五个AI建站工具生成的网站与10个人工构建的现代开源网站进行了对比扫描,发现传统视觉质量评分在两组间差异极小:AI网站平均得分为45.0,人工网站为43.6,视觉模板特征的出现率也几乎相同(50.4%对50.0%)。真正的差异隐藏在界面之下,被称为“结构残留”——包括HTML和CSS结构、内联样式、布局规律性、元数据行为、可访问性基线等底层信号。这些痕迹反映了网站是如何被组装、导出或快速生成的,即使外观看起来现代且专业,仍可能暴露出AI辅助工作流的特征。该研究强调,仅凭肉眼判断AI网站是无效的,需要深入分析浏览器实际接收和渲染的结构数据。 #AI网站 #网站审计 #结构残留 #技术分析 #AI检测 #网页开发 #数字取证
一项针对131个AI生成网站的审计显示,人们普遍认为的“AI网站外观”——如渐变背景、圆角卡片、模糊文案等视觉特征,实际上并非区分AI网站与人工网站的有效指标。SiteBlob团队对五个AI建站工具生成的网站与10个人工构建的现代开源网站进行了对比扫描,发现传统视觉质量评分在两组间差异极小:AI网站平均得分为45.0,人工网站为43.6,视觉模板特征的出现率也几乎相同(50.4%对50.0%)。真正的差异隐藏在界面之下,被称为“结构残留”——包括HTML和CSS结构、内联样式、布局规律性、元数据行为、可访问性基线等底层信号。这些痕迹反映了网站是如何被组装、导出或快速生成的,即使外观看起来现代且专业,仍可能暴露出AI辅助工作流的特征。该研究强调,仅凭肉眼判断AI网站是无效的,需要深入分析浏览器实际接收和渲染的结构数据。 #AI网站 #网站审计 #结构残留 #技术分析 #AI检测 #网页开发 #数字取证
DARPA 发布“AI Forge”计划,聚焦国家安全关键AI挑战
美国国防高级研究计划局(DARPA)联合国家科学基金会(NSF)及国家标准与技术研究院(CAISI)发布“AI Forge”计划指南,旨在弥合商业AI发展与国家安全需求之间的战略鸿沟。该计划将组建由大学、前沿AI公司及美国政府国防安全代表参与的论坛,重点攻克AI可解释性、AI控制及对抗鲁棒性三大优先领域。由于国家安全场景要求AI系统在生死攸关环境中运行、超越传统人类监督速度、保护隐私边界并满足严格认证标准,而商业领域缺乏相关投入,AI Forge将通过提供前沿算力与模型访问,加速大学研究,构建持久研究生态,并促进人才与思想交流。该计划旨在降低关键挑战风险,为前沿AI公司投资国家安全研究方向创造可行路径,确保美国AI优势建立在安全可靠且能力强大的系统之上。 #DARPA #AIForge #国家安全 #AI可解释性 #AI控制 #对抗鲁棒性 #美国AI行动计划
美国国防高级研究计划局(DARPA)联合国家科学基金会(NSF)及国家标准与技术研究院(CAISI)发布“AI Forge”计划指南,旨在弥合商业AI发展与国家安全需求之间的战略鸿沟。该计划将组建由大学、前沿AI公司及美国政府国防安全代表参与的论坛,重点攻克AI可解释性、AI控制及对抗鲁棒性三大优先领域。由于国家安全场景要求AI系统在生死攸关环境中运行、超越传统人类监督速度、保护隐私边界并满足严格认证标准,而商业领域缺乏相关投入,AI Forge将通过提供前沿算力与模型访问,加速大学研究,构建持久研究生态,并促进人才与思想交流。该计划旨在降低关键挑战风险,为前沿AI公司投资国家安全研究方向创造可行路径,确保美国AI优势建立在安全可靠且能力强大的系统之上。 #DARPA #AIForge #国家安全 #AI可解释性 #AI控制 #对抗鲁棒性 #美国AI行动计划
AI Agent 遭攻陷
据 Trend Micro 旗下 TrendAI 研究团队披露,一种名为“返回工具”(Return-to-Tool, RTT)的新型攻击模式正对数据库连接的 AI Agent 构成严重威胁。该攻击属于间接提示注入的子类,攻击者通过向系统提交看似无害的文本(如支持工单或文档),当 AI Agent 读取这些内容时,恶意指令被触发,进而调用其已被授权的工具对系统本身发起攻击。研究团队指出,一个存在漏洞的 PostgreSQL MCP 镜像在 Docker Hub 上已被拉取超过 10 万次。传统安全防线如 Web 应用防火墙、容器隔离和基于角色的访问控制均无法检测或阻止此类攻击,因为攻击完全发生在信任边界内部,是 Agent 与其自身工具之间的“对话”。该攻击被类比为 AI 时代的返回导向编程,Agent 的授权工具成为“小工具”,攻击者的提示则是串联它们的“链条”。 #AI安全 #提示注入 #返回工具 #网络安全 #AIAgent #趋势科技 #漏洞
据 Trend Micro 旗下 TrendAI 研究团队披露,一种名为“返回工具”(Return-to-Tool, RTT)的新型攻击模式正对数据库连接的 AI Agent 构成严重威胁。该攻击属于间接提示注入的子类,攻击者通过向系统提交看似无害的文本(如支持工单或文档),当 AI Agent 读取这些内容时,恶意指令被触发,进而调用其已被授权的工具对系统本身发起攻击。研究团队指出,一个存在漏洞的 PostgreSQL MCP 镜像在 Docker Hub 上已被拉取超过 10 万次。传统安全防线如 Web 应用防火墙、容器隔离和基于角色的访问控制均无法检测或阻止此类攻击,因为攻击完全发生在信任边界内部,是 Agent 与其自身工具之间的“对话”。该攻击被类比为 AI 时代的返回导向编程,Agent 的授权工具成为“小工具”,攻击者的提示则是串联它们的“链条”。 #AI安全 #提示注入 #返回工具 #网络安全 #AIAgent #趋势科技 #漏洞
利用LLM代理黑客攻击Salesforce网站
安全研究公司Reco开发了一款基于大语言模型(LLM)的AI代理,能够完全自主地对Salesforce Experience Cloud网站进行端到端安全评估。该代理只需提供一个URL,即可自动发现攻击面、分析每个暴露端点、识别漏洞、编写并执行工作漏洞。研究人员将其指向多家大型科技公司的真实Salesforce网站,结果令人震惊:代理在那些投入大量安全资源的网站上发现了高危漏洞,从零编写了可运行的漏洞利用脚本,提取了真实数据,甚至自主从公共来源检索数据以构建有效载荷。该代理并非单一脚本,而是一个由LLM控制的智能管道,涵盖侦察、分析、利用和验证等阶段,无需人工干预即可推理、调整策略并做出判断。它首先通过Salesforce Aura框架枚举所有可访问的对象、Apex控制器方法、路由和内容,构建完整的攻击面地图,随后对每个对象进行敏感性分类,识别可能包含敏感数据的表。 #网络安全 #AI代理 #LLM #Salesforce #漏洞利用 #黑客攻击 #安全研究
安全研究公司Reco开发了一款基于大语言模型(LLM)的AI代理,能够完全自主地对Salesforce Experience Cloud网站进行端到端安全评估。该代理只需提供一个URL,即可自动发现攻击面、分析每个暴露端点、识别漏洞、编写并执行工作漏洞。研究人员将其指向多家大型科技公司的真实Salesforce网站,结果令人震惊:代理在那些投入大量安全资源的网站上发现了高危漏洞,从零编写了可运行的漏洞利用脚本,提取了真实数据,甚至自主从公共来源检索数据以构建有效载荷。该代理并非单一脚本,而是一个由LLM控制的智能管道,涵盖侦察、分析、利用和验证等阶段,无需人工干预即可推理、调整策略并做出判断。它首先通过Salesforce Aura框架枚举所有可访问的对象、Apex控制器方法、路由和内容,构建完整的攻击面地图,随后对每个对象进行敏感性分类,识别可能包含敏感数据的表。 #网络安全 #AI代理 #LLM #Salesforce #漏洞利用 #黑客攻击 #安全研究
GPU 利用率谎言
凌晨两点,某基础设施团队因推理延迟突然飙升60%而收到警报。仪表盘显示GPU利用率看似正常,自动扩展启动后添加了更多节点,但延迟几乎没有改善,云账单却不断攀升。一小时后,真正的问题被发现:三个节点悄然进入降级RAID重建状态,存储吞吐量骤降,导致推理工作负载因数据饥饿而停滞。调度器仍将这些节点视为“足够健康”,因为GPU和内存指标尚可。这种故障在现代AI基础设施中日益常见,暴露了生成式AI系统下的深层幻觉:GPU可能忙碌却无产出。从表面看,用户向ChatGPT、Claude或Gemini发送提示后能迅速获得答案,但背后是巨大的协调难题——GPU执行张量运算,CPU处理请求和移动数据,HBM存储激活值和KV缓存,SSD流式传输嵌入和检索上下文,网络跨节点混洗梯度和推理流量,存储系统吸收重建、重试和后台工作。调度器决定工作负载运行位置,它悄然决定了集群是像连贯计算系统还是昂贵交通堵塞。GPU利用率是AI基础设施中最被过度信任的指标之一,高利用率可能掩盖资源以不可用组合存在的真相,导致有效容量低下。这不仅是调度算法问题,更是系统问题,也是经济问题。 #AI基础设施 #GPU利用率 #系统性能 #调度器 #存储瓶颈 #生成式AI #云计算
凌晨两点,某基础设施团队因推理延迟突然飙升60%而收到警报。仪表盘显示GPU利用率看似正常,自动扩展启动后添加了更多节点,但延迟几乎没有改善,云账单却不断攀升。一小时后,真正的问题被发现:三个节点悄然进入降级RAID重建状态,存储吞吐量骤降,导致推理工作负载因数据饥饿而停滞。调度器仍将这些节点视为“足够健康”,因为GPU和内存指标尚可。这种故障在现代AI基础设施中日益常见,暴露了生成式AI系统下的深层幻觉:GPU可能忙碌却无产出。从表面看,用户向ChatGPT、Claude或Gemini发送提示后能迅速获得答案,但背后是巨大的协调难题——GPU执行张量运算,CPU处理请求和移动数据,HBM存储激活值和KV缓存,SSD流式传输嵌入和检索上下文,网络跨节点混洗梯度和推理流量,存储系统吸收重建、重试和后台工作。调度器决定工作负载运行位置,它悄然决定了集群是像连贯计算系统还是昂贵交通堵塞。GPU利用率是AI基础设施中最被过度信任的指标之一,高利用率可能掩盖资源以不可用组合存在的真相,导致有效容量低下。这不仅是调度算法问题,更是系统问题,也是经济问题。 #AI基础设施 #GPU利用率 #系统性能 #调度器 #存储瓶颈 #生成式AI #云计算
玩家再次怀疑游戏使用了AI,这次轮到了《1666
开发商Panache Digital Games在Steam上发布了《1666:阿姆斯特丹》的可玩序章,玩家很快发现游戏画面中存在AI生成的痕迹。工作室在Reddit上承认,序章中的部分游戏内肖像和外部营销素材确实使用了早期版本的AI生成资产。他们表示正在审查相关资产,并将很快发布由人类艺术家重新制作的版本,同时承诺正式版游戏不会包含任何AI生成内容。然而,这种“先使用AI再替换”的做法引发了争议,玩家认为即便最终替换,AI仍被用于游戏开发过程。PC Gamer评论指出,随着夏季游戏节等大型活动到来,此类AI争议将越来越常见,开发商道歉后仍继续使用AI,让玩家不得不对每个新预告片进行AI侦探工作。尽管《1666:阿姆斯特丹》看起来确实很酷,但AI的使用已削弱了部分玩家的期待。 #游戏 #AI #争议 #1666阿姆斯特丹 #游戏开发 #玩家反应 #PC游戏
开发商Panache Digital Games在Steam上发布了《1666:阿姆斯特丹》的可玩序章,玩家很快发现游戏画面中存在AI生成的痕迹。工作室在Reddit上承认,序章中的部分游戏内肖像和外部营销素材确实使用了早期版本的AI生成资产。他们表示正在审查相关资产,并将很快发布由人类艺术家重新制作的版本,同时承诺正式版游戏不会包含任何AI生成内容。然而,这种“先使用AI再替换”的做法引发了争议,玩家认为即便最终替换,AI仍被用于游戏开发过程。PC Gamer评论指出,随着夏季游戏节等大型活动到来,此类AI争议将越来越常见,开发商道歉后仍继续使用AI,让玩家不得不对每个新预告片进行AI侦探工作。尽管《1666:阿姆斯特丹》看起来确实很酷,但AI的使用已削弱了部分玩家的期待。 #游戏 #AI #争议 #1666阿姆斯特丹 #游戏开发 #玩家反应 #PC游戏