标签: #cost
关于 GPU、LLM、MLOps、Kubernetes 以及心态的文章 · 5 篇
推理强度不是选模型,而是逐请求决定的部署参数
ARC Prize 公开的 DeepSeek V4 Flash 0731 结果页上,分数不是一个,而是按推理强度列了三个。本文计算的是从这三个数字里真正能读出来的东西:同样一次强度上调,在简单基准上买到 5 个百分点,在困难基准上买到 15 个百分点;既然如此,强度就该被当成逐请求决定的值,而不是模型配置。文中用代码梳理了逐级上调的结构,以及这个结构成立所需要的条件。
2026-08-09 · 12 分钟阅读 #llm#benchmark#arc-agi#inference#cost编码智能体的开销不是靠额度管住的,而是靠摩擦
Databricks 在 2026 年 7 月和 8 月接连发布的两篇工程文章表明,处理编码智能体开销的方式正在从预算额度转向网关加渐进式摩擦。本文拆解这套设计:为什么硬预算是最后的手段,为什么要把日常暴走防护与月度治理分开,为什么单次增量的大小就是设计的全部,以及为什么真正主导账单的不是模型单价而是上下文 —— 全部整理成可以计算的形式。
2026-08-09 · 12 分钟阅读 #mlops#llm#cost#ai-gateway#developer-productivity「便宜 100 倍」这个主张,只有在任务被收窄时才成立 —— 验证与盈亏平衡
2026 年 8 月公开的一篇案例文章称,他们把一个 40 亿参数级的开源模型用强化学习做了后训练,在检索任务上与前沿模型打平,而单次请求成本降了一个数量级。本文不是转述这个主张,而是去验证它:区分原文里真正能确认的数字与确认不了的数字,梳理这套做法只在窄任务上成立的条件,并附上一段可以自己算「后训练何时优于路由」盈亏平衡点的代码。
2026-08-09 · 12 分钟阅读 #llm#cost#fine-tuning#retrieval#open-models把观测数据放进 ClickHouse 意味着什么 — schema、rollup、TTL 与职责划分
当 trace 和日志每天膨胀到数 TB 规模,单靠一个搜索引擎或时序数据库就很难撑住了。本文从列式存储、压缩与排序键的角度,梳理 ClickHouse 为什么适合观测数据,并用真实的 DDL 设计 trace 表和日志表。文中讲清属性该用 Map 还是 JSON 类型的判断标准、如何用物化视图做 rollup、如何用分区和 TTL 控制成本。最后整理在已经用着 Prometheus 和 OpenSearch 的前提下,三者的职责该怎么
2026-08-02 · 22 分钟阅读 #observability#clickhouse#opentelemetry#data-modeling#cost让日志可搜索,同时别把公司搜穷 — 结构化、映射爆炸、保留期与真实成本
日志成本超过计算成本的那一天,会降临在大多数组织身上。真正决定这一天能推迟多久的,不是压缩率,而是「把什么定义成字段」这个决策。本文讲结构化日志的字段设计、OpenSearch 映射爆炸拖垮集群的真实路径、用索引模板和 ISM 控制生命周期的方法,以及有原则的采样和保留分层。最后用数字算一算,用日志去模拟指标到底要付出多大代价。内容以 OpenSearch 3.5 和 OpenTelemetry Collector v0.157.0 为
2026-08-02 · 21 分钟阅读 #observability#logging#opensearch#elasticsearch#cost