多看了一眼以前SPEC17的成绩也是较多的子项里macOS表现比较差,但是因为没有统一malloc所以macOS跑523.xalancbmk_r相比glibc malloc有非常大的优势可以扳回一部分甚至综合反超Linux。现在新测试SPEC26统一用mimalloc之后这个差距似乎就暴露无遗了。
https://benchview.hjc.im/#dataset=data%2FSPECrate2017_int_base.csv&view=compare&theme=system&single.data=Total&single.color=Vendor&single.sort=Total&single.order=desc&single.filterValue=&compare.test=M2+Pro+%28P-core%2C+16K+page%29&compare.test=M2+Pro+%28P-core%2C+macOS+15.1%2C+16K+page%29&compare.hidden=
https://benchview.hjc.im/#dataset=data%2FSPECrate2017_int_base.csv&view=compare&theme=system&single.data=Total&single.color=Vendor&single.sort=Total&single.order=desc&single.filterValue=&compare.test=M2+Pro+%28P-core%2C+16K+page%29&compare.test=M2+Pro+%28P-core%2C+macOS+15.1%2C+16K+page%29&compare.hidden=
😁7❤4🤡1
想用TSME阻止针对TPM+Bitlocker冷启动攻击需要将TSME联动PCR。
我从来没见过哪个DIY主板正确配置TSME。DIY主板的TSME通常是不影响PCR/TPM unseal的独立开关,这样的TSME只是个价值10ns内存延迟的装饰品。
作为对比,HP/ThinkPad商用平台关TSME直接把PCR也干没了,开机需要Bitlocker恢复。这样才算有用。
https://www.landian.news/archives/113487.html
我从来没见过哪个DIY主板正确配置TSME。DIY主板的TSME通常是不影响PCR/TPM unseal的独立开关,这样的TSME只是个价值10ns内存延迟的装饰品。
作为对比,HP/ThinkPad商用平台关TSME直接把PCR也干没了,开机需要Bitlocker恢复。这样才算有用。
https://www.landian.news/archives/113487.html
蓝点网
AMD悄悄从消费级处理器中禁用TSME透明安全内存加密技术引起忠实用户的不满 - 蓝点网
#硬件设备 AMD 悄悄从消费级处理器中移除 TSME 透明内存加密功能引起忠实用户的不满,用户花费几个月时间调查后提交漏洞报告,结…
👍9
感觉onnx runtime这么多年来不搞个Vulkan之类的通用EP也是件挺逆天的事情。。想给Linux桌面app弄点通用且开箱即用的小模型加速难如登天,恨不得要打包100G的runtime dependency进去还不能支持全😅
😁19
David's random thoughts
这东西被Apple先做出来是让人没想到的一个事情。 相比之下Linux的usb4-net就是个玩具,Strix halo跑多机tp还得装个nvidia网卡而不是用现在很多深圳小主机厂展示过的雷电/usb4互联方案。Intel前些年做的tb share也是走的雷电以太网套壳。根本没人认真想过这些消费级硬件的真正潜力,简直拉完了😅 https://x.com/ivanfioravanti/status/1999874264129065190
最近才发现Linux终于也有人做了IB/RDMA over USB4 https://github.com/hellas-ai/thunderbolt-ibverbs
等这类方案逐渐稳定之后大概DGX Spark那种走独立网卡的互联就是徒增成本了吧。
等这类方案逐渐稳定之后大概DGX Spark那种走独立网卡的互联就是徒增成本了吧。
GitHub
GitHub - hellas-ai/thunderbolt-ibverbs: experimental linux kernel modules and userspace drivers for RDMA-over-usb4/thunderbolt…
experimental linux kernel modules and userspace drivers for RDMA-over-usb4/thunderbolt on consumer hardware - hellas-ai/thunderbolt-ibverbs
👍1
前几天还在因为拿LLM把某玩具项目里的ORM给干掉了而想着AI coding会不会逐渐演变成消灭一切为了方便人类使用产生的中间件,最后回归本源直接操作最底层。现在还真看到个更极端的例子。
https://www.phoronix.com/news/Frame-X11-Server-Assembly
https://www.phoronix.com/news/Frame-X11-Server-Assembly
Phoronix
Frame: A New X11 Server Implementation Written Entirely In x86_64 Assembly
Previously we covered YSERVER as an X11 server written in the Rust programming language with the help of Claude Code
🤯20👍2❤1👎1
首发那点时间根本不够深度体验一个模型的适用场景和能力好坏,到目前为止k3我看到的键政人讨论远比真正的使用体验要多。(不管是中国还是海外)
别问,问就是oneshot前端审美决定国运。
https://x.com/__oQuery/status/2079298132794659244
别问,问就是oneshot前端审美决定国运。
https://x.com/__oQuery/status/2079298132794659244
X (formerly Twitter)
拾一.max-fast (@__oQuery) on X
Kimi K3 在我这里真的是一坨。Thinking 时间慢得要死,token 烧得老快,事情啥都干不好,分支管理也不行。那些说 K3 好用的人,我感觉全是收了钱的。我这几天用下来,感觉就是拉完了。
😁25
感觉至少有一百万人对RDMA组cluster跑LLM的负载特性毛都不懂一个就知道复读Spark有200GbE,不得不说NVIDIA的营销能力深入人心😅
https://x.com/FrameworkPuter/status/2080005377434005756
https://x.com/FrameworkPuter/status/2080005377434005756
X (formerly Twitter)
Framework (@FrameworkPuter) on X
@trout_kilg31775 For tensor parallelism, the constraint is latency more than throughput. As long as you get RDMA (RoCE), you can get latency lower enough t o enable that.
😁19
我用最直接、最真相、最不绕弯的方式来告诉你,如果一个跑分软件3年大改3次评分标准,那不如大家都别测试了,直接找厂商搞竞价排名。
😁35⚡3