标签: #ai-coding
关于 GPU、LLM、MLOps、Kubernetes 以及心态的文章 · 3 篇
pgrust: 用 Rust 重写 Postgres 并 100% 通过回归测试 — 它真正意味着什么
Malcolm Matis(malisper)公开了用 Rust 重写 Postgres 的 pgrust。它以兼容 Postgres 18.3 为目标,通过了四万六千多个回归测试查询,并能在真实的 18.3 数据目录上启动。本文诚实地剖析这个里程碑为何真的令人印象深刻,以及"100% 通过回归测试"这句话证明了什么、又没有证明什么。我们还会一并审视用 AI 智能体写出的代码、性能主张,以及它距离生产级 Postgres 还有多远。
2026-07-11 · 10 分钟阅读 #postgresql#rust#pgrust#database#regression-tests在 AI 编程模型评测中分辨信号与噪声 — SWE-bench 为何开始动摇
OpenAI 评测团队指出,最广泛使用的编程基准 SWE-bench Verified 因为污染和设计缺陷,已经无法再给出有意义的信号。用信号(区分模型的能力)和噪声(每次运行都会摇摆的变动)这两个维度重新审视,就会发现排行榜上相当一部分名次其实站在噪声之上。本文梳理污染、测试框架差异、无法评分的任务与过拟合是如何把分数抬高的,并结合 eval-first 原则,说明团队在挑选编程助手时为何应当用自己的任务、而非排行榜来评测。
2026-07-11 · 10 分钟阅读 #llm-evaluation#coding-benchmarks#swe-bench#benchmarks#ai-codingCursor 实战指南:把 Background Agent、Memories、Bugbot、worktree 变成团队习惯的方法
Cursor 实战指南 — 围绕 Background Agent、Memories、Bugbot、worktree,把 Cursor 真正落地到日常开发中。涵盖引入判断、团队规则、rollout 策略。
2026-04-12 · 7 分钟阅读 #cursor#background-agent#bugbot#memories#worktree