标签: #inference-cost
关于 GPU、LLM、MLOps、Kubernetes 以及心态的文章 · 3 篇
用 500 美元微调的 9B 赢过前沿模型的条件 — 以及这些条件有多窄
2026 年 7 月 28 日,Hacker News 上有一篇拿到 336 分的文章。Fermisense 用 GRPO 训练 Qwen3.5-9B,只花了约 500 美元的 GPU 时间,就在电商目录审核任务上,用同样的工具和同样的评分器,赢过了五套前沿模型配置。可达成分数的 87.3% 对最高前沿配置的 76.9%,处理 1,000 条的成本约 0.50 美元,对 19 到 172 美元。本文既不否定也不放大这个结果,而是把条件拆
2026-07-31 · 16 分钟阅读 #ai#llm#fine-tuning#reinforcement-learning#inference-costGPT-5.6 与性价比的极限 — 如何在曲线上找到自己负载的位置
OpenAI 在 2026 年 7 月 30 日把 GPT-5.6 Luna 降价 80%、Terra 降价 20%。距离 7 月 9 日正式发布只有三周,而最顶端的 Sol 价格不变。Luna 从每 100 万 token 输入 1 美元、输出 6 美元,变成输入 0.20 美元、输出 1.20 美元。本文不介绍降价幅度,而是计算这条曲线 — 降价后三个档位的单价比在两个轴上都恰好锁定为 25 比 10 比 1,因此在同一系列内部 t
2026-07-31 · 17 分钟阅读 #ai#llm#openai#inference-cost#prompt-cachingDeepSeek V4 Flash 真正改变的是什么 — 这是每单位能力成本的问题,不是排行榜的问题
2026 年 7 月 31 日,DeepSeek 把 V4-Flash API 转为公开测试版。架构和 4 月的预览版完全一样 — 284B 总参数、13B 激活的 MoE,1M 上下文 — 变的只有后训练。官方更新日志公布的分数是 Terminal Bench 2.1 上 82.7、Toolathlon verified 上 70.3,但首先要说清楚的是:这些数字是 DeepSeek 用自家 harness 测出来的厂商自测值。本文不
2026-07-31 · 16 分钟阅读 #ai#llm#deepseek#inference-cost#moe