标签: #cpu
关于 GPU、LLM、MLOps、Kubernetes 以及心态的文章 · 5 篇
「x86 硬件后门」这句话的准确范围 —— 按作者写下的样子来读 rosenbridge
仓库标题写的是 x86 CPU 的硬件后门,但 README 正文明确写着:受影响的被认为只有 VIA C3,而此后的世代已经不再具备这项功能。作者在免责声明里写道,他认为这是为嵌入式市场出于善意做出来的一项有用功能,只是在早期若干世代里被无意间保留成了启用状态,并明言这不含任何恶意的意味。本文先把这条边界线准确地搬过来,再讨论真正被一般化的其实不是这个发现,而是方法:sandsifter 为寻找未文档化指令而系统性扫描整个 x86 指
2026-08-09 · 15 分钟阅读 #security#hardware#x86#cpu#fuzzing一条指令可能要跑 62 秒 —— 延迟是路径的属性,不是指令的属性
Assembly Hall of Shame 是一份「把单条指令跑到最慢」的比赛排行榜。垫底的 nop 是 1 个周期,第一名 fxrstor64 是 1,980 亿个周期,也就是 62 秒。把这份榜单从下往上读,它就成了现代 CPU 所有可能停顿之处的清单,并分成三个区段:微码辅助路径、跨缓存行的原子操作、TLB 失效、熵池枯竭,以及片外的 PCIe 总线。这张表真正证明的是,指令延迟这个概念离开周边状态就无法定义,而由此可以得出关于
2026-08-09 · 15 分钟阅读 #os-concepts#performance#cpu#microarchitecture#benchmarkCPU steal time 与限流 — 如何区分 top 的 st、可突发型积分和 CFS 配额
CPU 使用率只有 40%,p99 延迟却在飙升,top 的 st 列显示 20%。这些看起来相似的症状背后,藏着三个完全不同的原因:Hypervisor 不把物理 CPU 交给 vCPU 的 CPU steal time、可突发型实例的 CPU 积分耗尽,以及在 top 里根本看不到的 cgroup CFS 配额限流。本文梳理 st 从百分之几开始算问题、怎么读 nrthrottled 和 throttledusec,以及"移除 Ku
2026-07-26 · 23 分钟阅读 #linux#cpu#cgroups#kubernetes#cloudMechanical Sympathy(机械同感):写硬件喜欢的代码
同样时间复杂度的代码,实际运行速度却能相差数十倍,原因就藏在硬件里。CPU 缓存(L1/L2/L3)与缓存行、数组和链表的数据局部性、分支预测、伪共享、内存层级的延迟数字,以及为什么数组结构体(SoA)如此重要 — 本文带你进入写硬件喜欢的代码的机械同感(mechanical sympathy)世界。
2026-06-18 · 25 分钟阅读 #performance#systems#cpu计算机体系结构完全指南:从 ISA 到 GPU 并行架构
涵盖计算机体系结构方方面面的完全指南:从 ISA、数据通路、流水线、缓存、虚拟内存、RISC-V 到 GPU 并行架构,配有示例代码。
2026-03-17 · 32 分钟阅读 #computer-architecture#cpu#gpu#pipeline#cache