标签: #software-engineering
关于 GPU、LLM、MLOps、Kubernetes 以及心态的文章 · 10 篇
AI 代码评审到底能不能用 — 测量证据揭示的准确率与误报
AI 代码评审工具的营销话术里充斥着「80% 的 PR 不需要人类评论」这样的数字,但真正把精确率和误报率一起公开的地方几乎没有。把公开的测量结果收集起来看,方向大体一致 — 在开源 PR 上,AI 评审评论真正带来代码变更的比例因工具而异,只有 0.9~19.2%,远低于人类评论的 60%(Gan 等,GitHub Actions 16 款·仓库 178 个·评论 22,326 条)。而在一家把评论解决写进政策强制执行的企业案例里,同
2026-07-17 · 38 分钟阅读 #ai#code-review#static-analysis#evaluation#software-engineeringForward Deployed Engineer 的手艺 — 需求发掘、领域建模,以及面向「采用」的优化
前一篇文章整理了 FDE 所需的知识地图 — Linux、网络、Kubernetes、DB、安全。那张地图只是替你把门打开,却不会告诉你走进客户大楼之后实际要做什么。这篇文章讲的正是那个「动词」。本文以 Palantir 亲自撰写的 Delta、Deployment Strategist 角色文档、The Pragmatic Engineer 的报道,以及当前正在招聘的 Anthropic、OpenAI FDE 职位为依据,梳理构成这份
2026-07-15 · 17 分钟阅读 #career#fde#solutions-engineering#software-engineering#palantir当代码生成变得廉价,哪些技能会升值 — 贬值的与升值的
当代码生成变得廉价而充裕,价值不会消失,而是会转移 — 转移到仍然是瓶颈的那一侧。眼下这个瓶颈是验证、判断与集成。本文基于 Jason Wei 的「验证的不对称性」、DORA 2025(吞吐量上去了,但交付不稳定性仍在持续攀升)、LinearB 对 810 万个 PR 的分析(AI 生成的 PR 等待评审的时间长 4.6 倍)、Stack Overflow 2025(66% 的开发者把「几乎正确但又不完全正确」列为头号困扰),梳理了什么
2026-07-12 · 22 分钟阅读 #career#software-engineering#ai#skills#code-review什么该学深,什么该略过 — AI 什么都能答的时代,如何制定学习策略
AI 3 秒就能答出几乎一切的时代,什么该学深,什么该略过。认知心理学给出的答案并不讨喜。造就记忆的不是看见信息这一行为,而是自己把它提取出来这一行为。在 Roediger 与 Karpicke 的实验中,把文章平均通读 14.2 遍的一组,一周后只记住了 40%,而只读了 3.4 遍、却靠自己回想的一组记住了 61%。而且,记得更少的那一组反而对自己更有信心。把提取外包给 AI,最后留下的恰恰只有那份信心。本文提出的不是一份书单,而是
2026-07-12 · 20 分钟阅读 #career#learning#ai#software-engineering从 Senior 到 Staff — 工程师的成长中,真正被评估的是什么
很多工程师相信,写得更多、更快就能晋升。可当你真的翻开公开的工程师职级阶梯 — Dropbox、CircleCI、Rent the Runway — 会发现哪里都没有“产出量”这个轴。有的是范围(Scope)、协作半径(Collaborative Reach)和影响力杠杆(Levers for Impact)。本文以 Will Larson 归纳的 Staff 工程师四种原型(Tech Lead、Architect、Solver、Rig
2026-07-12 · 19 分钟阅读 #career#software-engineering#growth#staff-engineerAI 真的让开发者更快了吗 — 被测量出来的数字说了什么
两项随机对照试验给出了截然相反的答案。一项说用了 AI 的开发者快了 55.8%,另一项说慢了 19%。可是给出后一个数字的 METR,在 2026 年 2 月发布后续研究的同时,亲手在 2025 年的结果上挂起了一条警告横幅:它已经不再反映当下 AI 模型的影响。故事并没有就此消失,反而变得更锋利 — 因为连后续实验都被参与者的自我选择偏差绊住,无法确定效应的符号。而且有一项发现始终没有被撤回:那些慢了 19% 的开发者,在做完实验之
2026-07-12 · 29 分钟阅读 #career#ai#productivity#software-engineering#developer-experience2026 年开发者招聘市场 — 数据说了什么,又没说什么
体感是最差的,BLS 却预测未来十年增长 15%。两者都是真的。我直接取来 Indeed 招聘广告指数的原始数据(2020 年 2 月 = 100,2022 年 2 月高点 233.87,2026 年 6 月 72.51)、layoffs.fyi(截至 2026 年 7 月共 120,936 人)、BLS 2024–34 年预测、报告初级岗位下降 16% 的 Stanford 论文,以及正面反驳它的 EIG 报告,逐一对照。核心结论是:
2026-07-12 · 16 分钟阅读 #career#job-market#software-engineering#hiring与 AI 编程工具良好协作的五个习惯
同一件工具,在一个实验里带来了 55.8% 的收益,在另一个实验里造成了 19% 的损失。改变符号的不是工具,而是用法。从 METR、GitHub Copilot 的 RCT、Stack Overflow 调查以及 Anthropic 的智能体设计文档中提炼出的五个习惯 — 任务选择、评审预算、机器护栏、上下文设计、自我度量。每一个都以一条你能亲手验证的规则收尾。
2026-07-12 · 16 分钟阅读 #ai#productivity#software-engineering#developer-experience编程基准与智能体时代脱节 — 排行榜错误比较智能体的三个原因
Tessl 团队于 2026 年 6 月投稿到 arXiv 的立场论文主张,如今的编程基准与智能体式软件工程存在根本性的脱节。因为基准本是为衡量单个模型而造的,我们却拿它来比较由模型、执行框架(harness)、上下文、环境、反馈相互交织而成的整个系统。论文指出了三处具体的脱节 — 把模型与执行框架混为一谈的分数、单一正解评分惩罚了正当的替代方案、缺乏组件级信号因而无法引导改进。本文梳理这一论证,并推敲更好的评测应如何朝着组件级、多正解
2026-07-11 · 10 分钟阅读 #ai#agents#evaluation#software-engineering#coding-benchmarksForward Deployed Engineer(FDE)备战 — 你需要掌握的软件知识地图
Forward Deployed Engineer(FDE)是 Palantir 创造的职位,工程师直接进驻客户公司,把产品部署、集成到他们的真实环境中。最近 OpenAI、Anthropic 这类 AI 公司为了把自家模型搭载到客户基础设施上,大量招聘这一职位,让它重新受到关注。本文写给准备做 FDE 的人,梳理了这个角色的真实面貌(基于真实资料),以及真正重要的软件知识 — Linux、网络、容器/Kubernetes、数据库、AP
2026-07-11 · 10 分钟阅读 #career#fde#software-engineering#palantir#solutions-engineering