利用LLM代理黑客攻击Salesforce网站
安全研究公司Reco开发了一款基于大语言模型(LLM)的AI代理,能够完全自主地对Salesforce Experience Cloud网站进行端到端安全评估。该代理只需提供一个URL,即可自动发现攻击面、分析每个暴露端点、识别漏洞、编写并执行工作漏洞。研究人员将其指向多家大型科技公司的真实Salesforce网站,结果令人震惊:代理在那些投入大量安全资源的网站上发现了高危漏洞,从零编写了可运行的漏洞利用脚本,提取了真实数据,甚至自主从公共来源检索数据以构建有效载荷。该代理并非单一脚本,而是一个由LLM控制的智能管道,涵盖侦察、分析、利用和验证等阶段,无需人工干预即可推理、调整策略并做出判断。它首先通过Salesforce Aura框架枚举所有可访问的对象、Apex控制器方法、路由和内容,构建完整的攻击面地图,随后对每个对象进行敏感性分类,识别可能包含敏感数据的表。 #网络安全 #AI代理 #LLM #Salesforce #漏洞利用 #黑客攻击 #安全研究
安全研究公司Reco开发了一款基于大语言模型(LLM)的AI代理,能够完全自主地对Salesforce Experience Cloud网站进行端到端安全评估。该代理只需提供一个URL,即可自动发现攻击面、分析每个暴露端点、识别漏洞、编写并执行工作漏洞。研究人员将其指向多家大型科技公司的真实Salesforce网站,结果令人震惊:代理在那些投入大量安全资源的网站上发现了高危漏洞,从零编写了可运行的漏洞利用脚本,提取了真实数据,甚至自主从公共来源检索数据以构建有效载荷。该代理并非单一脚本,而是一个由LLM控制的智能管道,涵盖侦察、分析、利用和验证等阶段,无需人工干预即可推理、调整策略并做出判断。它首先通过Salesforce Aura框架枚举所有可访问的对象、Apex控制器方法、路由和内容,构建完整的攻击面地图,随后对每个对象进行敏感性分类,识别可能包含敏感数据的表。 #网络安全 #AI代理 #LLM #Salesforce #漏洞利用 #黑客攻击 #安全研究
GPU 利用率谎言
凌晨两点,某基础设施团队因推理延迟突然飙升60%而收到警报。仪表盘显示GPU利用率看似正常,自动扩展启动后添加了更多节点,但延迟几乎没有改善,云账单却不断攀升。一小时后,真正的问题被发现:三个节点悄然进入降级RAID重建状态,存储吞吐量骤降,导致推理工作负载因数据饥饿而停滞。调度器仍将这些节点视为“足够健康”,因为GPU和内存指标尚可。这种故障在现代AI基础设施中日益常见,暴露了生成式AI系统下的深层幻觉:GPU可能忙碌却无产出。从表面看,用户向ChatGPT、Claude或Gemini发送提示后能迅速获得答案,但背后是巨大的协调难题——GPU执行张量运算,CPU处理请求和移动数据,HBM存储激活值和KV缓存,SSD流式传输嵌入和检索上下文,网络跨节点混洗梯度和推理流量,存储系统吸收重建、重试和后台工作。调度器决定工作负载运行位置,它悄然决定了集群是像连贯计算系统还是昂贵交通堵塞。GPU利用率是AI基础设施中最被过度信任的指标之一,高利用率可能掩盖资源以不可用组合存在的真相,导致有效容量低下。这不仅是调度算法问题,更是系统问题,也是经济问题。 #AI基础设施 #GPU利用率 #系统性能 #调度器 #存储瓶颈 #生成式AI #云计算
凌晨两点,某基础设施团队因推理延迟突然飙升60%而收到警报。仪表盘显示GPU利用率看似正常,自动扩展启动后添加了更多节点,但延迟几乎没有改善,云账单却不断攀升。一小时后,真正的问题被发现:三个节点悄然进入降级RAID重建状态,存储吞吐量骤降,导致推理工作负载因数据饥饿而停滞。调度器仍将这些节点视为“足够健康”,因为GPU和内存指标尚可。这种故障在现代AI基础设施中日益常见,暴露了生成式AI系统下的深层幻觉:GPU可能忙碌却无产出。从表面看,用户向ChatGPT、Claude或Gemini发送提示后能迅速获得答案,但背后是巨大的协调难题——GPU执行张量运算,CPU处理请求和移动数据,HBM存储激活值和KV缓存,SSD流式传输嵌入和检索上下文,网络跨节点混洗梯度和推理流量,存储系统吸收重建、重试和后台工作。调度器决定工作负载运行位置,它悄然决定了集群是像连贯计算系统还是昂贵交通堵塞。GPU利用率是AI基础设施中最被过度信任的指标之一,高利用率可能掩盖资源以不可用组合存在的真相,导致有效容量低下。这不仅是调度算法问题,更是系统问题,也是经济问题。 #AI基础设施 #GPU利用率 #系统性能 #调度器 #存储瓶颈 #生成式AI #云计算
玩家再次怀疑游戏使用了AI,这次轮到了《1666
开发商Panache Digital Games在Steam上发布了《1666:阿姆斯特丹》的可玩序章,玩家很快发现游戏画面中存在AI生成的痕迹。工作室在Reddit上承认,序章中的部分游戏内肖像和外部营销素材确实使用了早期版本的AI生成资产。他们表示正在审查相关资产,并将很快发布由人类艺术家重新制作的版本,同时承诺正式版游戏不会包含任何AI生成内容。然而,这种“先使用AI再替换”的做法引发了争议,玩家认为即便最终替换,AI仍被用于游戏开发过程。PC Gamer评论指出,随着夏季游戏节等大型活动到来,此类AI争议将越来越常见,开发商道歉后仍继续使用AI,让玩家不得不对每个新预告片进行AI侦探工作。尽管《1666:阿姆斯特丹》看起来确实很酷,但AI的使用已削弱了部分玩家的期待。 #游戏 #AI #争议 #1666阿姆斯特丹 #游戏开发 #玩家反应 #PC游戏
开发商Panache Digital Games在Steam上发布了《1666:阿姆斯特丹》的可玩序章,玩家很快发现游戏画面中存在AI生成的痕迹。工作室在Reddit上承认,序章中的部分游戏内肖像和外部营销素材确实使用了早期版本的AI生成资产。他们表示正在审查相关资产,并将很快发布由人类艺术家重新制作的版本,同时承诺正式版游戏不会包含任何AI生成内容。然而,这种“先使用AI再替换”的做法引发了争议,玩家认为即便最终替换,AI仍被用于游戏开发过程。PC Gamer评论指出,随着夏季游戏节等大型活动到来,此类AI争议将越来越常见,开发商道歉后仍继续使用AI,让玩家不得不对每个新预告片进行AI侦探工作。尽管《1666:阿姆斯特丹》看起来确实很酷,但AI的使用已削弱了部分玩家的期待。 #游戏 #AI #争议 #1666阿姆斯特丹 #游戏开发 #玩家反应 #PC游戏
大模型校对能力评测
一项针对大语言模型校对能力的最新评测显示,Claude Fable 5 和 Claude Opus 4.6 在词汇选择、混淆词识别和习语用法等任务中表现突出,均取得满分成绩。评测数据集包含5个样本,主要考察模型对复杂英文文本中语法、用词和表达习惯的纠错能力。结果显示,Claude 系列多个版本(包括高、中、低配置)均达到100%正确率,Gemini 3.1 Pro Preview 也获得满分,而部分 Claude Opus 4.8 和 4.7 版本正确率在80%至86.7%之间。该评测为选择适合文本校对场景的AI模型提供了参考依据。 #大语言模型 #AI评测 #文本校对 #Claude #Gemini #自然语言处理
一项针对大语言模型校对能力的最新评测显示,Claude Fable 5 和 Claude Opus 4.6 在词汇选择、混淆词识别和习语用法等任务中表现突出,均取得满分成绩。评测数据集包含5个样本,主要考察模型对复杂英文文本中语法、用词和表达习惯的纠错能力。结果显示,Claude 系列多个版本(包括高、中、低配置)均达到100%正确率,Gemini 3.1 Pro Preview 也获得满分,而部分 Claude Opus 4.8 和 4.7 版本正确率在80%至86.7%之间。该评测为选择适合文本校对场景的AI模型提供了参考依据。 #大语言模型 #AI评测 #文本校对 #Claude #Gemini #自然语言处理
OpenAI 研究员揭示AI评测真相
OpenAI研究员Noam Brown发表长文,直指当前AI行业评测体系的根本缺陷。他指出,所有AI跑分排行榜都忽略了一个关键变量:推理计算量。同一个模型,在1美元和1万美元的推理预算下,表现天差地别。例如,GPT-5.5在100万token长度测试中得分74%,而GPT-5.4仅36.6%,但在标准benchmark中这一差异被完全掩盖。Brown认为,正确的评测方式应是绘制“性能vs推理计算量”曲线,而非给出单一分数。他警告,随着推理时计算成为标配,AI能力上限可能远超想象,但测量成本极高。这一观点颠覆了传统评估范式,暗示“超级智能”可能不是质变节点,而是资源投入的连续函数。 #AI评测 #推理计算 #OpenAI #GPT5 #人工智能 #科技新闻 #大模型 #算力
OpenAI研究员Noam Brown发表长文,直指当前AI行业评测体系的根本缺陷。他指出,所有AI跑分排行榜都忽略了一个关键变量:推理计算量。同一个模型,在1美元和1万美元的推理预算下,表现天差地别。例如,GPT-5.5在100万token长度测试中得分74%,而GPT-5.4仅36.6%,但在标准benchmark中这一差异被完全掩盖。Brown认为,正确的评测方式应是绘制“性能vs推理计算量”曲线,而非给出单一分数。他警告,随着推理时计算成为标配,AI能力上限可能远超想象,但测量成本极高。这一观点颠覆了传统评估范式,暗示“超级智能”可能不是质变节点,而是资源投入的连续函数。 #AI评测 #推理计算 #OpenAI #GPT5 #人工智能 #科技新闻 #大模型 #算力