标签: #pre-training
关于 GPU、LLM、MLOps、Kubernetes 以及心态的文章 · 2 篇
GPT 系列论文完全解析:从 GPT-1 到 GPT-4,语言模型改变世界的历程
按代际完整解析 OpenAI 的 GPT 系列。从 GPT-1 的无监督预训练、GPT-2 的 Zero-shot 学习、GPT-3 的 In-context Learning 与 Scaling Law、InstructGPT 的 RLHF,到 GPT-4 的多模态 — 用公式梳理每篇论文的核心贡献与架构演进。
2026-03-01 · 54 分钟阅读 #gpt#openai#language-model#transformer#pre-trainingBERT 论文完全解析:双向 Transformer 如何改变 NLP 格局
深入分析 Google 的 BERT 论文。通过公式与代码示例,梳理 Masked Language Model(MLM)与 Next Sentence Prediction(NSP)实现的双向预训练、微调策略,以及横扫 11 个 NLP 基准的架构核心原理。
2026-03-01 · 37 分钟阅读 #bert#nlp#transformer#pre-training#fine-tuning