标签: #debugging
关于 GPU、LLM、MLOps、Kubernetes 以及心态的文章 · 10 篇
人人可懂的 AI 第3篇 — 损失0.0017却只有7.5%正确率,元凶是一格填充
我们用148万参数做了一个 VQA 模型:同时接收图像和问题并给出答案。训练损失降到 0.0017,正确率却只有 7.5%,比随机猜还差。原因不在模型,而在生成标签的一行代码;改掉之后变成 99.5%。本文用真实输出说明:为什么低损失并不保证好模型,以及如何识破这个陷阱。
2026-08-21 · 10 分钟阅读 #ai#vqa#multimodal#debugging#pytorchFDE 故障诊断手册 — 从访问权限到报告的六个步骤
自家服务的故障与客户现场的故障,决定性区别在于后者从一无所知开始。所以对 Forward Deployed Engineer(FDE)来说,比本事更先需要的是一套固定顺序。确认访问与权限、复现症状、切分层级、建立原因假设、验证、写报告——六个步骤,用「支付 API 下午起间歇性返回 504」这一个构造的示例贯穿始终,每一步都附上真正会敲的 kubectl、curl、grep 命令。还包括 FDE 特有的评分规则:诊断正确但报告迟到,仍然
2026-08-12 · 8 分钟阅读 #career#fde#forward-deployed-engineer#incident-response#debuggingGo 1.26 的 goroutineleak profile — 用 GC 的标记阶段抓 goroutine 泄漏
Go 1.26(2026 年 2 月 10 日发布)在 runtime/pprof 中新增了 goroutineleak profile 作为实验性功能。思路是复用 GC 的标记阶段 — 只把可运行的 goroutine 当作根来标记,然后把阻塞在任何 goroutine 都无法到达的并发原语上的 goroutine 报告为泄漏。核心在于内存可达性是 goroutine 存活性的一个可靠的过近似(over-approximation),
2026-07-16 · 26 分钟阅读 #go#goroutine#garbage-collection#profiling#debuggingeBPF Verifier 只告诉你它在哪儿停下 — 复现 235 例拒绝后测出的诊断落差
用过 eBPF 的人都经历过这种事。Verifier 拒绝了你的程序,而错误信息指向的那一行看起来完全没有问题。2026 年 7 月发表的一篇论文首次把这种挫败感量化了出来。作者从 Stack Overflow、GitHub issue、修复提交和内核自测中收集了 936 个候选案例,在一套固定工具链 — 内核 6.15.11 + clang 18 — 上复现,分析了实际被拒绝的 235 例。结论是 — 47% 的拒绝只返回一个 EIN
2026-07-16 · 29 分钟阅读 #ebpf#linux#kernel#debugging#developer-experience当代码生成变得廉价,哪些技能会升值 — 贬值的与升值的
当代码生成变得廉价而充裕,价值不会消失,而是会转移 — 转移到仍然是瓶颈的那一侧。眼下这个瓶颈是验证、判断与集成。本文基于 Jason Wei 的「验证的不对称性」、DORA 2025(吞吐量上去了,但交付不稳定性仍在持续攀升)、LinearB 对 810 万个 PR 的分析(AI 生成的 PR 等待评审的时间长 4.6 倍)、Stack Overflow 2025(66% 的开发者把「几乎正确但又不完全正确」列为头号困扰),梳理了什么
2026-07-12 · 22 分钟阅读 #career#software-engineering#ai#skills#code-review像科学家一样调试:假设驱动的调试
与其盯着 bug 把代码改来改去,不如像科学家那样先立假设、做预测,再用实验去验证。把问题空间用二分搜索一点点缩小,搭出最小可复现示例,用 git bisect 揪出元凶提交,并且真正把错误信息读完。一份把「瞎猜」变成方法论的实战调试指南。
2026-07-03 · 22 分钟阅读 #debugging#engineering#productivity#fundamentals像侦探一样读懂日志和堆栈跟踪
堆栈跟踪是案发现场,日志是目击者证词。从上到下读懂堆栈跟踪的方法(一端是出事的地方,一端是起因)、追踪 "caused by" 链条、结构化·JSON 日志、关联 ID 与 traceid、用 grep·jq·ripgrep 挖掘日志,直到日志级别与采样。把日志和跟踪当作证据来对待的侦探技术。
2026-06-28 · 19 分钟阅读 #logging#debugging#stack-trace#observability深度学习调试完全指南:从训练失败诊断到性能优化
系统性诊断和解决深度学习模型训练失败的完全指南。涵盖 Loss NaN、梯度消失/爆炸、过拟合、收敛缓慢、显存不足等所有常见问题的原因与解决方案,并配有实战代码。
2026-03-17 · 30 分钟阅读 #deep-learning#debugging#pytorch#training#optimization分语言调试实战指南:在 Python · JavaScript/TypeScript · Go · Java 中从断点、运行到性能剖析
以 Python、JavaScript/TypeScript(Node.js)、Go、Java 为基准,一次性梳理调试的运行方式、断点策略,以及各语言代表性的剖析工具(py-spy、cProfile、--inspect、pprof、JFR/async-profiler)。
2026-03-07 · 17 分钟阅读 #devops#debugging#python#javascript#typescript各框架调试实战:Spring Boot · Django/FastAPI · React/Next.js 中的断点、运行与性能分析
以后端(Spring Boot、Django、FastAPI)和前端(React、Next.js)中真正高频出现的故障为线索,梳理断点位置、运行与复现方法,以及 APM 和性能分析的观测点。
2026-03-07 · 19 分钟阅读 #devops#debugging#spring#django#fastapi