Pseudorandom Thoughts
732 subscribers
108 photos
1 video
8 files
383 links
我将开口,同时爽到爆。
Download Telegram
Pseudorandom Thoughts
盘了几天,这玩意是真的好使,个人认为可以是甲方构建自己起夜级AI代码安全审计设施的playbook 而且同样是vulnerability harness,甲方和乙方关注点是不一样的,如果你接触过别的一些厂商的设计,不难发现 实际上cf这一套harness里面也没有什么过人之处(我反而觉得wishlist是最有亮点的设计),但它面面俱到该考虑的都考虑到了,所以我觉得它是衡量起夜ai代码审计流的及格线,甲方该补足的可以对着补足,而安全公司的产品如果低于这条线可以重开了
一个月过去了,眼看网安类bench上不断发生一些涌现,我更加怀疑乙方给甲方企业推销的VDH和PTS产品的意义。
Workflow:你做的workflow和工具适配是很好,但很快AI就要带着agentic RSI杀过来了(哪怕DSH因为过度的FP洁癖区了,这个概念也已经被验证成立,下一批模型会把定制agent runtime和pi的能力训进去);
漏洞知识:你攒的漏洞知识库是很棒,但思维下一个版本就会OPD训进模型里面再给你涌现点奇迹;
也就是乙方交付慢慢从定制workflow,到定制agent(知识+技能),接下来可能不得不去定制高速小模型(带着自己的场景OPD,譬如找大模型摇一点CoT再拿点小MoE跑SFT然后交付出去做固定任务)。定制高速小模型唯一可能的原因是模型厂懒得做这么低利润的生意。
面对完全不懂安全的甲方,可能你可以让FDE去给甲方部署好了跑数据飞轮,把甲方特定场景数据攥在自己手上,这是你面对别的厂商所拥有的壁垒;
但FDE和数据飞轮假定的是AI对场景的适应速度不如人类,飞出来的数据本质上是通过上下文注入的方式假装AI学会了Continuous Learning;然而我们不知道真正的Continuous Learning还有多远,真要来了马上给FDE全杀了
固然信息安全永远是攻防相长的,但这一轮范式转变不知道要血洗多少人,也不知道自己会不会被血洗掉。暂时没想到下一代的范式长什么样;漏洞可能会从组件转移到投毒上,或者研发出一些抗AI审计的新打法。
💊4🎉1
哦对了,秘封新作《灵长新益京》发布了,请支持秘封俱乐部
🎉3
之前有一个思路是用单机Spark跑REAP过的v4-flash-0731,实测了下答案是不建议。REAP完就像是被大运创过的朗道,尽管有40tok/s,但思维链开始为了缺失的专家权重苦苦挣扎,最终输出的幻觉和失误也很严重;让它用Rust写个双链表能长考10分钟然后写炸返工好几次。
还没测IQ2_XSS,看IQ2在48K上下文衰减到20tok以下估计也没必要测。
答案还是双机Spark跑v4的nvfp4-dspark,或者许愿百灵发力给Ling 3.0来点蒸汽的后训练,100BA5B已经有着相对甜点的世界知识和够用的思维。
明明校园日常题材的作品里大家动不动就翘课请假,到校园连环凶杀推理作品里,大家突然无视已经连着死了几个人的事实,非得化身做题区,全员满出勤
🎉13💊4
只谈真百,阅读みかみてれん的作品(代表作:《屑粉毛》)时,很难不羡慕那种热烈厚重的百合笔触,就是我觉得一些作品构思不应该像同人女在社交平台发的那种比较同质化的轻浮幻想,但如果自己去推敲百合桥段的话,往往只能描述出类似つくみず作品里那种淡淡的氛围,像莲梅莉的居家感或者仁科鸟子和纸越空鱼那种磨磨蹭蹭在里世界打个炮的剧情都实属不易;总之又要追求热烈同时又要感情厚重不轻浮同时不能靠扭曲去描述真的很难,到底为什么みかみてれん那么能写《牡蛎牡蛎》那种热烈百合气氛
尤其是她和竹嶋えく这两届CM出的《恋人不行》同人本,喜欢看屑粉毛消费女色的有福了
难绷你们国内一些Lab是不是AI时代没活整了开始跟网信部门嗯蹭,按这个逻辑,我是不是可以说PowerShell存在任意代码执行漏洞(输入whoami即可触发whoami),存在执行绕过漏洞(输入powershell -ep bypass即可绕过脚本签名),存在远程代码执行漏洞(输入 irm ... | iex即可触发),大家避免在生产环境或公网部署
💊23🎉1
在双机GB10上,新出的glm-5.3-flash和qwen3.8-flash-next都未能肘赢deepseek-v4-flash-0731-dspark。
前者至少要做EXL3量化才能塞得下,问题是EXL3会降智到流口水,而Ox Alpha本身并没有比v4flash聪明多少;其次是激活参数稍微高一点,tg就降下来了
而后者,在实际工作场景智力不如v4的前提下,平均tg也没有比v4 dspark好多少,遇到n-gram缓不住的场景,速度就会像在塞车路段带动能回收的纯电一样狠狠晃晕你。
💊9
This media is not supported in your browser
VIEW IN TELEGRAM
三个月以来,尝试诸多西医养生方法来调控血糖,目前在缺乏运动的情况下实现-5kg,效果还可以。
1、最好用的还是控制主食的糖分摄入,蒸红薯(烤的不行)、糙米饭、豆饭等替代精米面,吃米只吃一碗底。广西妈喽不吃果是很痛苦的事情,但水果确实严重升糖,并没有直觉中这么健康。
2、tk推荐的烤鹰嘴豆的问题在于鹰嘴豆太硬,给我积蓄已久的牙周问题崩出来了。
3、tk推荐的饭前苹果醋效果也不错,唯一的问题在于无糖苹果醋一勺下去能让人怀疑人生,直接把吃饭的胃口都干没了是否算一种GLP-1的廉价平替?
4、大杯无糖柠檬水以及罗汉果茶平替甜味饮料是可行的。注:无糖甜味饮料中常见的合成甜味剂在研究中同样不利于健康。
5、一到周末就瘦,说明摧残代谢的根本原因还是在于工作过劳。
感觉小米拿米家空气净化器壳子OEM个GB10集群散热器或者DGX Station整机效果应该不错
Pseudorandom Thoughts
在双机GB10上,新出的glm-5.3-flash和qwen3.8-flash-next都未能肘赢deepseek-v4-flash-0731-dspark。 前者至少要做EXL3量化才能塞得下,问题是EXL3会降智到流口水,而Ox Alpha本身并没有比v4flash聪明多少;其次是激活参数稍微高一点,tg就降下来了 而后者,在实际工作场景智力不如v4的前提下,平均tg也没有比v4 dspark好多少,遇到n-gram缓不住的场景,速度就会像在塞车路段带动能回收的纯电一样狠狠晃晕你。
我悟了,正常前后端开发等工作场景下GLM5.3F确实比v4聪明,问题是我不正常,我会有许多很神经病的架构设计和SRE Ops扔给AI来做,这种时候靠后训练形成肌肉记忆的模型就会流口水,只能靠喜欢多想多试的大肥鱼来解决
即便如此,GLM5.3F在双机GB10上依然慢到近乎不可用(单道 20+到30+ tps,多道也区区60;而v4单道就能60+)
Forwarded from 鳖频道 (⑨BIE|上善若水)
最高指示:安全软件一定要安全
🎉6