LabHub

ブログ

GPTシリーズ論文完全分析:GPT-1からGPT-4まで、言語モデルが世界を変えるまでの軌跡

한국어English日本語中文


1. GPTシリーズの概要と年表

GPT(Generative Pre-trained Transformer)は、OpenAIが2018年から発表してきた一連の大規模言語モデル(Large Language Model, LLM)シリーズである。「事前学習済み生成型Transformer」という名前の通り、Transformer Decoderアーキテクチャを基盤として大規模テキストデータで教師なし事前学習(Unsupervised Pre-training)を行った後、さまざまなDownstream Taskに適用するパラダイムを確立した。

GPTシリーズは単にモデルサイズが大きくなっただけではなく、各世代ごとに言語モデルの活用方法そのものを再定義してきた。その軌跡を年代順に整理すると以下の通りである。

世代発表時期論文タイトル核心キーワードパラメータ数
GPT-12018.06Improving Language Understanding by Generative Pre-TrainingUnsupervised Pre-training + Supervised Fine-tuning117M
GPT-22019.02Language Models are Unsupervised Multitask LearnersZero-shot Transfer, WebText1.5B
GPT-32020.05Language Models are Few-Shot LearnersIn-context Learning, Scaling Laws175B
InstructGPT2022.03Training Language Models to Follow Instructions with Human FeedbackRLHF, Human Alignment1.3B~175B
GPT-42023.03GPT-4 Technical ReportMultimodal, Predictable Scaling非公開

各世代の論文タイトル自体が核心的メッセージを含んでいる点が印象的である。GPT-1は「生成型事前学習で言語理解を改善する」と宣言し、GPT-2は「言語モデルは教師なしマルチタスク学習器である」と主張し、GPT-3は「言語モデルはFew-shot学習器である」とさらに一歩踏み込んだ。InstructGPTは「人間のフィードバックで指示に従うように訓練する」という実用的方向を示し、GPT-4は簡潔に「技術報告書」とだけ発表して商業的転換を示唆した。

本記事では、各論文の核心的貢献、アーキテクチャの詳細、学習方法論、そして後続研究への影響を数式とともに分析する。


2. GPT-1 (2018): Generative Pre-Trainingの始まり

2.1 論文概要

論文: "Improving Language Understanding by Generative Pre-Training" 著者: Alec Radford, Karthik Narasimhan, Tim Salimans, Ilya Sutskever (OpenAI) 発表: 2018年6月

GPT-1の核心的アイデアは驚くほどシンプルである。ラベルのない大規模テキストで言語モデルを事前学習した後、少量のラベルデータで特定タスクにファインチューニング(Fine-tuning)する。 この2段階アプローチ(Semi-supervised Learning)が当時のNLPの勢力図を塗り替えた。

2018年当時のNLPはTask-specificアーキテクチャが支配する時代であった。感情分析、質問応答、テキスト含意(Textual Entailment)など各タスクごとに個別のモデルを設計し、そのタスクのラベルデータのみで学習するのが標準であった。GPT-1はこのパラダイムに「汎用事前学習」という新しい道を提示した。

2.2 アーキテクチャの詳細

GPT-1はTransformerのDecoderブロックのみを使用するアーキテクチャを採用した。元のTransformer(Vaswani et al., 2017)はEncoder-Decoder構造であったが、GPT-1はAuto-regressive言語モデリングに適したDecoder-only構造を選択した。

モデル構成:

元のTransformerで使用された固定Sinusoidal Positional Encodingの代わりに、GPT-1は学習可能な位置埋め込みを採用した。これにより、モデルが位置情報をデータから直接学習でき、さまざまなタスクにより柔軟に適応できた。

2.3 Stage 1: Unsupervised Pre-training

事前学習段階では、ラベルのない大規模テキストコーパス U={u1,u2,...,un}\mathcal{U} = \{u_1, u_2, ..., u_n\} に対して標準的な言語モデリング目的関数を最適化する。

L1(U)=ilogP(uiuik,...,ui1;Θ)L_1(\mathcal{U}) = \sum_i \log P(u_i \mid u_{i-k}, ..., u_{i-1}; \Theta)

ここで kk はコンテキストウィンドウサイズ、Θ\Theta はモデルパラメータである。すなわち、前の kk 個のトークンが与えられた時に次のトークンの確率を最大化する、典型的なAuto-regressive Language Modelingである。

具体的に各トークンの表現は以下のように計算される。

h0=UWe+Wph_0 = UW_e + W_p hl=transformer_block(hl1),l[1,n]h_l = \text{transformer\_block}(h_{l-1}), \quad l \in [1, n] P(u)=softmax(hnWeT)P(u) = \text{softmax}(h_n W_e^T)

ここで U=(uk,...,u1)U = (u_{-k}, ..., u_{-1}) はコンテキストトークンベクトル、WeW_e はトークン埋め込み行列、WpW_p は位置埋め込み行列である。出力確率はトークン埋め込み行列 WeW_e を再利用(Weight Tying)して計算する。

学習データ: BooksCorpusデータセットを使用した。約7,000冊の未出版書籍で構成され、約5GBのテキストを含む。長編テキストが多く、Long-range Dependencyの学習に適していた。

トークン化: BPE(Byte Pair Encoding)を使用し、40,000回のMergeを実行して語彙を構成した。

最適化: Adam Optimizerを使用し、Learning Rateは最初の2,000ステップで0から 2.5×1042.5 \times 10^{-4} まで線形増加(Linear Warmup)した後、Cosine Annealingで減少させた。Batch Sizeは64、100エポック学習した。

2.4 Stage 2: Supervised Fine-tuning

事前学習済みモデルを特定タスクに適用するため、ラベルデータ C\mathcal{C} でファインチューニングする。入力トークンシーケンス x1,...,xmx_1, ..., x_m に対応するラベル yy が与えられると、以下の目的関数を最適化する。

L2(C)=(x,y)logP(yx1,...,xm)L_2(\mathcal{C}) = \sum_{(x,y)} \log P(y \mid x_1, ..., x_m)

ここで P(yx1,...,xm)=softmax(hlmWy)P(y \mid x_1, ..., x_m) = \text{softmax}(h_l^m W_y) であり、hlmh_l^m は最後のTransformerブロックの最後のトークン出力、WyW_y はタスク別Linear Headの重みである。

核心技法 — Auxiliary Language Modeling Objective: GPT-1はFine-tuning時にも元の言語モデリング目的関数を補助損失として併用した。これにより汎化性能が向上し、収束が加速された。

L3(C)=L2(C)+λL1(C)L_3(\mathcal{C}) = L_2(\mathcal{C}) + \lambda \cdot L_1(\mathcal{C})

ここで λ\lambda は補助損失の重みで、論文では λ=0.5\lambda = 0.5 を使用した。

2.5 Task-specific Input Transformation

GPT-1のもう一つの重要な貢献は、さまざまなタスクを一つのTransformerアーキテクチャで処理するための入力変換技法を提示したことである。アーキテクチャ自体を変更せず、入力形式だけを変えて複数のタスクに適用した。

このアプローチはモデルアーキテクチャの変更を最小化しながら多様なタスクに適用できるという点で非常に実用的であった。追加パラメータはDelimiterトークンの埋め込みと最終Linear Layerの重み WyW_y のみである。

2.6 実験結果と意義

GPT-1は12個のNLPベンチマーク中9個でState-of-the-artを達成した。特にCommonsense Reasoning(Stories Cloze Testで86.5%精度)、Semantic Similarity(QQPで70.3 F1)、Question Answering(RACEで59.0%精度)など多様なタスクで既存モデルを大幅に上回った。

しかしGPT-1の真の意義は個別のベンチマーク性能ではなく、「大規模教師なし事前学習 + 少量教師ありファインチューニング」というパラダイムを確立したことである。このパラダイムはその後BERT、RoBERTa、T5などに受け継がれ、NLPの標準となった。


3. GPT-2 (2019): Zero-shot Learningの可能性

3.1 論文概要

論文: "Language Models are Unsupervised Multitask Learners" 著者: Alec Radford, Jeffrey Wu, Rewon Child, David Luan, Dario Amodei, Ilya Sutskever (OpenAI) 発表: 2019年2月

GPT-2の論文タイトルは大胆な主張を含んでいる。「言語モデルは教師なしマルチタスク学習器である。」 すなわち、言語モデリングという単一の目的関数で学習しただけなのに、別途のファインチューニングなしでも複数のタスクを実行できるということである。

GPT-1が「事前学習後にファインチューニング」の2段階を必要としたのに対し、GPT-2はファインチューニングなしでZero-shotでタスクを実行できることを示した。これは根本的なパラダイム転換であった。

3.2 核心アイデア: Task as Language Modeling

GPT-2の核心的洞察は、すべてのNLPタスクを条件付き言語モデリングとして再構成できるということである。

既存の教師あり学習は条件付き確率 P(outputinput)P(\text{output} \mid \text{input}) を学習する。GPT-2はこれを P(outputinput,task)P(\text{output} \mid \text{input}, \text{task}) の形に拡張し、task情報を自然言語で提供する。

例えば:

このアイデアの核心は、十分に大きな言語モデルが十分に多様なテキストを学習すれば、タスク実行能力が自然に創発(Emerge)するということである。

3.3 アーキテクチャの詳細

GPT-2はGPT-1のアーキテクチャを基本としつつ、いくつかの重要な変更を加えた。

主な変更点:

GPT-2は4つのサイズのモデルを学習した。

モデルパラメータレイヤーHidden DimHead数Head Dim
Small117M127681264
Medium345M241,0241664
Large762M361,2802064
XL1,542M481,6002564

すべてのモデルでHead Dimensionは64に固定されており、Feed-forward Layerの次元は常にHidden Dimensionの4倍(dff=4×dmodeld_{ff} = 4 \times d_{model})というパターンが維持されている。

3.4 WebTextデータセット

GPT-2のもう一つの核心的貢献はWebTextという新しい学習データセットである。

データ構築方法:

  1. Redditで3 Karma以上を獲得した外部リンクを収集(人間が品質を検証したことに相当)
  2. 約4,500万個のリンクを収集
  3. DragnetとNewspaperライブラリでHTMLからテキストを抽出
  4. 重複除去およびヒューリスティックベースの精製

データセット特性:

WebTextの設計哲学は「人間のキュレーションを活用しつつ、明示的ラベリングコストは回避する」ということであった。RedditのKarmaシステムを一種の品質フィルターとして活用するアイデアは、その後の多くのデータセット構築にインスピレーションを与えた。

3.5 Byte-level BPE

GPT-2はトークン化でも重要な革新を導入した。既存のBPEがUnicode文字レベルで動作するのに対し、GPT-2はバイトレベルでBPEを適用した。

このアプローチの利点:

ただし単純なByte-level BPEは非効率的なMergeを多く生成するため、GPT-2は異なるカテゴリの文字をMergeできないようにするルールを追加した。最終語彙サイズは50,257個である。

3.6 Zero-shot性能とScaling

GPT-2のZero-shot性能はモデルサイズに応じて着実に向上した。これはその後のScaling Laws研究の前兆となる観察であった。

主なZero-shot結果:

3.7 「Too Dangerous to Release」論争

GPT-2は技術的成果だけでなく公開ポリシーでも大きな注目を集めた。OpenAIは当初1.5Bパラメータモデルを公開しないことを決定し、最も小さい117Mモデルのみを公開した。理由は「悪意ある使用(フェイクニュース、スパムなど)のリスクが大きい」というものであった。

この決定はAIコミュニティで激しい論争を巻き起こした。

支持側の論拠:

批判側の論拠:

結局OpenAIは2019年11月に全モデルを公開し、懸念されていた大規模悪用事例は発生しなかった。しかしこの論争はその後のAI SafetyとResponsible AI議論の重要な契機となった。


4. GPT-3 (2020): In-context LearningとScalingの力

4.1 論文概要

論文: "Language Models are Few-Shot Learners" 著者: Tom B. Brown, Benjamin Mann, Nick Ryder 他多数 (OpenAI) 発表: 2020年5月 (NeurIPS 2020)

GPT-3は1,750億(175B)パラメータという前例のない規模の言語モデルである。しかしGPT-3の真の革新は規模ではなく、In-context Learningという新しいパラダイムを確立したことである。モデルの重みを一切更新せず、プロンプトにいくつかの例を含めるだけで多様なタスクを実行できることを実証した。

4.2 In-context Learningパラダイム

GPT-3論文は3つの評価条件を体系的に比較した。

Zero-shot: タスクの説明のみを自然言語で提供

Translate English to French:
cheese =>

One-shot: タスクの説明 + 1つの例を提供

Translate English to French:
sea otter => loutre de mer
cheese =>

Few-shot: タスクの説明 + 10~100個の例を提供(コンテキストウィンドウが許容する範囲内)

Translate English to French:
sea otter => loutre de mer
peppermint => menthe poivrée
plush giraffe => girafe en peluche
cheese =>

これら3つの条件すべてでGradient Updateは一切行われない。 モデルは純粋にForward Passのみでタスクを実行する。これがFine-tuningとの決定的な違いである。

In-context Learningが機能する理由について論文は、事前学習の過程でモデルが自然にさまざまなタスクパターンを学習し、プロンプトの例がモデル内部に既に存在する関連能力を「活性化(Locate and Activate)」する役割を果たすと解釈している。

4.3 アーキテクチャの詳細

GPT-3はGPT-2と基本的に同一のアーキテクチャを使用しつつ、Sparse Transformer(Child et al., 2019)から着想を得てDenseとLocally Banded Sparse Attentionパターンを交互に使用した。

GPT-3は8つのサイズのモデルを学習してScaling効果を体系的に分析した。

モデル名パラメータレイヤーdmodeld_{model}Head数dheadd_{head}Batch SizeLearning Rate
GPT-3 Small125M1276812640.5M6.0×1046.0 \times 10^{-4}
GPT-3 Medium350M241,02416640.5M3.0×1043.0 \times 10^{-4}
GPT-3 Large760M241,53616960.5M2.5×1042.5 \times 10^{-4}
GPT-3 XL1.3B242,048241281M2.0×1042.0 \times 10^{-4}
GPT-3 2.7B2.7B322,56032801M1.6×1041.6 \times 10^{-4}
GPT-3 6.7B6.7B324,096321282M1.2×1041.2 \times 10^{-4}
GPT-3 13B13.0B405,140401282M1.0×1041.0 \times 10^{-4}
GPT-3 175B175.0B9612,288961283.2M0.6×1040.6 \times 10^{-4}

すべてのモデルは2,048トークンのContext Windowを使用し、合計300B(3,000億)トークンを学習した。モデルが大きくなるほどLearning Rateは低くし、Batch Sizeは大きくするパターンが一貫して適用された。

4.4 学習データ構成

GPT-3の学習データは複数のソースを混合したもので、各ソースの品質に応じて学習比重を差別的に適用したという点が特徴的である。

データセットトークン数 (B)学習比重Epoch
Common Crawl (フィルタリング)41060%0.44
WebText21922%2.9
Books1128%1.9
Books2558%0.43
Wikipedia33%3.4

注目すべき点は、Common Crawlが全トークンの大部分を占めているが、学習比重は60%に制限したことである。一方、高品質データであるWebText2は19Bトークンしかないが22%の高い比重を付与した。これはデータの品質が量よりも重要だという判断を反映している。

Common Crawlフィルタリング過程:

  1. 高品質参照コーパス(WebText, Books, Wikipedia)との類似度に基づくドキュメントフィルタリング
  2. ドキュメント間のFuzzy Deduplication実行
  3. 参照コーパスを学習データに追加して最終構成

4.5 ベンチマーク性能

GPT-3 175BのFew-shot性能はさまざまなベンチマークで印象的であった。

言語モデリング:

Question Answering:

翻訳:

SuperGLUE:

算術推論:

これらの結果はモデルサイズが大きくなるほど、また提供される例が多いほど性能が向上する明確なScaling効果を示した。

4.6 GPT-3の限界認識

論文はGPT-3の限界も率直に記述した。

テキスト生成品質: 長文生成時の繰り返し、一貫性の喪失、非論理的な記述などの問題 Few-shotの限界: 自然言語推論(NLI)、一部のReading ComprehensionタスクでFine-tuningベースのモデルに及ばない 双方向コンテキストの欠如: Auto-regressiveモデルの本質的限界で、BERTなどBidirectionalモデルが有利なタスクが存在 Sample Efficiency: 人間は1、2個の例で新しいタスクを学習するが、GPT-3は数十~数百個の例が必要 解釈可能性の不足: モデルの意思決定過程を理解しにくく、In-context Learningの正確なメカニズムも不明確


5. InstructGPT / ChatGPT (2022): 人間の意図に合わせる

5.1 論文概要

論文: "Training Language Models to Follow Instructions with Human Feedback" 著者: Long Ouyang, Jeff Wu, Xu Jiang 他多数 (OpenAI) 発表: 2022年3月 (NeurIPS 2022)

GPT-3までの言語モデルには根本的な問題があった。「次のトークン予測」という学習目的関数と「ユーザーの指示を有用かつ安全に従う」という実際の使用目的が一致していなかった。 大規模言語モデルがどれほど優れていても、質問に的外れな回答をしたり、有害なコンテンツを生成したり、事実と異なる情報を自信を持って記述する問題が頻発した。

InstructGPTはこのAlignment ProblemをRLHF(Reinforcement Learning from Human Feedback)で解決した画期的な研究である。そしてこの技術がまさにChatGPTの基盤となった。

5.2 Alignment問題の定義

論文は既存の言語モデルの問題を3つに分類した。

  1. Helpfulness(有用性)の不足: ユーザーの指示に従わず、関連のないテキストを生成
  2. Truthfulness(真実性)の不足: 事実と異なる情報を生成(Hallucination)
  3. Harmlessness(無害性)の不足: 有害または偏ったコンテンツを生成

この3つを合わせてHHH(Helpful, Honest, Harmless)基準と呼び、InstructGPTは人間のフィードバックを活用してこの基準に合わせてモデルを整合(Align)することを目標とした。

5.3 RLHF 3段階パイプライン

InstructGPTのRLHFパイプラインは3段階で構成される。

Step 1: Supervised Fine-Tuning (SFT)

第1段階は伝統的な教師あり学習である。人間のラベラーがプロンプトに対する理想的な応答を直接作成し、このデータでGPT-3をファインチューニングする。

SFTモデルは基本的な指示従事能力を付与するが、まだ完全ではない。次の段階で人間の好みを学習する。

Step 2: Reward Model (RM) Training

第2段階では人間の好みを数値化する報酬モデル(Reward Model)を学習する。

データ収集過程:

  1. SFTモデルで1つのプロンプトに対して KK 個の異なる応答を生成(KK は4~9)
  2. 人間のラベラーが KK 個の応答を好み順にランキング
  3. (K2)\binom{K}{2} 個の比較ペアを生成

Reward Model損失関数:

loss(θ)=1(K2)E(x,yw,yl)D[logσ(rθ(x,yw)rθ(x,yl))]\text{loss}(\theta) = -\frac{1}{\binom{K}{2}} E_{(x, y_w, y_l) \sim D} \left[ \log \sigma(r_\theta(x, y_w) - r_\theta(x, y_l)) \right]

ここで rθ(x,y)r_\theta(x, y) はプロンプト xx と応答 yy に対するReward Modelのスカラー出力、ywy_w は好まれた応答、yly_l は好まれなかった応答、σ\sigma はSigmoid関数である。

この損失関数はBradley-Terryモデルに基づくもので、好まれた応答の報酬が好まれなかった応答よりも高くなるように学習する。1つのプロンプトから (K2)\binom{K}{2} 個の比較ペアを作り、単一のForward Passで計算することで効率性を高めた。

Step 3: Reinforcement Learning with PPO

第3段階では学習済みReward Modelを報酬信号として使用し、SFTモデルをPPO(Proximal Policy Optimization)アルゴリズムで最適化する。

PPO最適化目的関数:

objective(ϕ)=E(x,y)DπϕRL[rθ(x,y)βDKL(πϕRL(yx)πSFT(yx))]\text{objective}(\phi) = E_{(x, y) \sim D_{\pi_\phi^{RL}}} \left[ r_\theta(x, y) - \beta \cdot D_{KL}(\pi_\phi^{RL}(y \mid x) \| \pi^{SFT}(y \mid x)) \right]

ここで:

KL Divergence Penaltyの役割:

KL Divergence項はRL学習中にモデルがSFTモデルから離れすぎることを防止する。この制約がないとモデルがReward Modelの抜け穴を悪用して高い報酬を得るが、実際には無意味なテキストを生成するReward Hacking現象が発生する可能性がある。

KL Divergenceの正確な形は以下の通りである。

DKL(πϕRL(x)πSFT(x))=yπϕRL(yx)logπϕRL(yx)πSFT(yx)D_{KL}(\pi_\phi^{RL}(\cdot \mid x) \| \pi^{SFT}(\cdot \mid x)) = \sum_y \pi_\phi^{RL}(y \mid x) \log \frac{\pi_\phi^{RL}(y \mid x)}{\pi^{SFT}(y \mid x)}

実際の実装ではこのKL Divergenceを報酬から直接差し引く方式で適用する。すなわち、修正された報酬は以下の通りである。

R(x,y)=rθ(x,y)βlogπϕRL(yx)πSFT(yx)R(x, y) = r_\theta(x, y) - \beta \cdot \log \frac{\pi_\phi^{RL}(y \mid x)}{\pi^{SFT}(y \mid x)}

PPO-ptx: Pre-training Mix

InstructGPTは追加でPPO-ptx変形を提案した。RL学習中に元の事前学習データに対するLanguage Modeling目的関数を補助損失として混合する。

objective(ϕ)=E(x,y)DπϕRL[rθ(x,y)βDKL(πϕRLπSFT)]+γExDpretrain[logπϕRL(x)]\text{objective}(\phi) = E_{(x, y) \sim D_{\pi_\phi^{RL}}} \left[ r_\theta(x, y) - \beta \cdot D_{KL}(\pi_\phi^{RL} \| \pi^{SFT}) \right] + \gamma \cdot E_{x \sim D_{\text{pretrain}}} \left[ \log \pi_\phi^{RL}(x) \right]

ここで γ\gamma は事前学習損失の重みである。この項はRL学習過程でモデルの一般的な言語能力が退化すること(「Alignment Tax」)を防止する。

5.4 驚くべき結果:小さなモデルが大きなモデルに勝つ

InstructGPTの最も驚くべき結果は、1.3Bパラメータの InstructGPTが175BパラメータのGPT-3よりも人間評価で好まれたということである。パラメータ数が100倍以上少ないモデルが、より有用で、より真実で、より無害な応答を生成した。

主な実験結果:

この結果はモデルサイズよりも学習方法論が重要であることを示した。「より大きくすること」が唯一の答えではなく、「人間の意図に合わせて整合すること」が核心であるという教訓である。

5.5 InstructGPTからChatGPTへ

InstructGPTの技術は2022年11月にリリースされたChatGPTの核心的基盤となった。ChatGPTはGPT-3.5(GPT-3の改良版)に対話形式のRLHFを適用したモデルである。

ChatGPTのリリースはAI史の分岐点であった。リリースから5日で100万ユーザー、2ヶ月で1億ユーザーを達成し、AIが一般大衆に直接届く時代を開いた。InstructGPT論文の技術的貢献がなければ、この革命は不可能であったであろう。


6. GPT-4 (2023): マルチモーダルと予測可能なスケーリング

6.1 論文概要

論文: "GPT-4 Technical Report" 著者: OpenAI 発表: 2023年3月 (arXiv: 2303.08774)

GPT-4 Technical Reportはこれまでの GPT論文とは根本的に異なる。アーキテクチャ、モデルサイズ、学習データ、学習コストなど核心情報の大部分が非公開である。OpenAIは「競争環境と安全性の考慮」を理由にこれらの情報を公開しなかった。これはOpen AIという名前との乖離をめぐり多くの批判を受けた。

それにもかかわらず、論文はいくつかの重要な技術的貢献を含んでいる。

6.2 マルチモーダル入力

GPT-4の最も目立つ新しい能力は画像とテキストを同時に入力として受け取れるということである。出力は依然としてテキストのみ可能である。

マルチモーダル能力の例:

このマルチモーダル能力はその後GPT-4V(Vision)に発展し、実際のサービスに適用された。

6.3 Predictable Scaling

GPT-4論文の最も重要な技術的貢献はPredictable Scaling方法論である。

核心的アイデアは、小さなモデルの性能から大きなモデルの性能を正確に予測できるということである。OpenAIはGPT-4と同一の方法論で学習した小規模モデルの性能を測定し、そこからGPT-4の最終性能を予測した後、実際の学習結果と比較した。

Loss予測: 1,000倍から10,000倍小さいComputeを使用するモデルの学習から、GPT-4の最終LossをPower Lawで予測した。実際の学習結果は予測と非常に近かった。

HumanEval Coding性能予測: コーディングベンチマークでのPass Rateも小規模モデルの結果から予測できた。これはLossだけでなく特定タスクの性能も予測可能であることを示唆する。

このPredictable Scaling方法論の実用的価値は非常に大きい。数千万~数億ドルが必要な大規模モデル学習に着手する前に、小規模実験で最終性能を予測して投資対効果を事前に評価できるためである。

ただし論文はInverse Scalingや突然の能力創発(Emergent Abilities)のような予測困難な現象も存在することを認めた。特に特定の能力が特定の規模で突然現れるEmergent AbilitiesはPredictable Scalingの主な例外事項である。

6.4 専門試験性能

GPT-4は人間のために設計されたさまざまな専門試験で印象的な性能を示した。モデルはこれらの試験のための別途の学習を受けていない。

試験GPT-4 成績/パーセンタイルGPT-3.5 成績/パーセンタイル備考
Uniform Bar Exam (MBE+MEE+MPT)~298/400 (上位10%)~213/400 (下位10%)米国弁護士試験
LSAT163 (上位12%)149 (下位40%)ロースクール入試
SAT Evidence-Based R&W710/800 (93rd)670/800 (87th)米国大学入試
SAT Math700/800 (89th)590/800 (70th)米国大学入試
GRE Quantitative163/170 (80th)157/170 (62nd)大学院入試
GRE Verbal169/170 (99th)154/170 (63rd)大学院入試
AP Biology5 (85~100th)4 (62~85th)AP生物学
AP Chemistry4 (71~88th)2 (22~46th)AP化学
AP Calculus BC4 (43~59th)1 (0~7th)AP微積分
AP English Literature2 (8~22nd)2 (8~22nd)AP英文学

いくつかの注目すべきパターン:

6.5 SafetyとAlignment改善

GPT-4は安全性面でもGPT-3.5比で大幅に改善された。

RLHFベースの安全訓練:

定量的改善:

専門家Red-teaming:

6.6 GPT-4の限界

論文で明示的に認めた限界は以下の通りである。


7. Scaling Laws深層分析

7.1 Kaplan Scaling Laws (2020)

GPT-3と同時期にOpenAIのJared Kaplanらが発表した "Scaling Laws for Neural Language Models" は大規模言語モデル研究の理論的基盤を提供した。

核心的発見 — Power Law関係:

言語モデルのCross-entropy Loss LL はモデルパラメータ数 NN、データセットサイズ DD、学習に使用したCompute CC とそれぞれPower Law関係を持つ。

L(N)NαN,αN0.076L(N) \propto N^{-\alpha_N}, \quad \alpha_N \approx 0.076 L(D)DαD,αD0.095L(D) \propto D^{-\alpha_D}, \quad \alpha_D \approx 0.095 L(C)CαC,αC0.050L(C) \propto C^{-\alpha_C}, \quad \alpha_C \approx 0.050

この関係は7 Orders of Magnitude以上にわたって成立し、非常に安定したトレンドラインを示す。

Compute-optimal Allocation(Kaplanバージョン):

固定されたCompute Budget CC でLossを最小化するには、モデルサイズを大きくしつつデータは相対的に少なく使用するのが最適であると結論づけた。具体的には、Computeが10倍増加するとモデルサイズは5.5倍大きくし、データは1.8倍だけ増やすのが効率的だとした。

NoptC0.73,DoptC0.27N_{\text{opt}} \propto C^{0.73}, \quad D_{\text{opt}} \propto C^{0.27}

この結果は「モデルを大きくすることがデータを増やすことよりも効率的である」という解釈につながり、GPT-3の175Bパラメータというスケールを正当化する根拠となった。

7.2 Chinchilla Scaling Laws (2022)

KaplanのScaling Lawsに対する重要な修正が2022年にDeepMindの "Training Compute-Optimal Large Language Models"(通称Chinchilla論文)で提示された。

核心的発見:既存モデルはUnder-trainedである。

Chinchilla論文はKaplanの結論とは異なり、モデルサイズと学習データをほぼ同等の比率で増やすべきだと主張した。具体的には、パラメータ1個あたり約20個の学習トークンがCompute-optimalであるということである。

NoptC0.50,DoptC0.50N_{\text{opt}} \propto C^{0.50}, \quad D_{\text{opt}} \propto C^{0.50}

この基準で見ると、GPT-3(175Bパラメータ、300Bトークン)は学習データが不足していた。Compute-optimalに学習するには約3.5T(3兆5,000億)トークンが必要であった。

Chinchilla vs. GPT-3:

項目GPT-3Chinchilla
パラメータ175B70B
学習トークン300B1.4T
トークン/パラメータ比1.720
MMLU性能70.0%73.4%
Compute~3,640 PF-days~5,200 PF-days

ChinchillaはGPT-3よりも2.5倍小さいモデルだが、4.7倍多いデータを学習してより高い性能を達成した。この結果はその後の大規模モデル学習の方向に根本的な影響を与えた。

7.3 Scaling LawsがGPT-4に与えた影響

GPT-4のPredictable Scalingはこれらの Scaling Laws研究の直接的な応用である。小さなモデルのLossがPower Lawに従うなら、そのトレンドラインを外挿(Extrapolate)して大きなモデルのLossを予測できる。

GPT-4論文が示したのは、この予測が驚くほど正確であるということである。これはScaling Lawsが単なる経験的観察ではなく、言語モデルの学習過程に関する深い構造的特性を反映していることを示唆する。

ただしこの予測可能性には重要な限界がある。


8. 全体アーキテクチャ比較

8.1 世代別アーキテクチャ比較表

項目GPT-1GPT-2 (XL)GPT-3 (175B)InstructGPTGPT-4
発表時期2018.062019.022020.052022.032023.03
パラメータ数117M1,542M175,000M1,300M~175,000M非公開
レイヤー数12489696 (175B基準)非公開
Hidden Dim7681,60012,28812,288 (175B基準)非公開
Attention Head数12259696 (175B基準)非公開
Head Dimension6464128128 (175B基準)非公開
Context Window5121,0242,0482,0488,192 / 32,768
Vocabulary Size40,00050,25750,25750,257~100,000 (推定)
学習データBooksCorpus (5GB)WebText (40GB)混合 (570GB)GPT-3 + 人間のフィードバック非公開
学習トークン数~1B (推定)~10B (推定)300B300B + RLHF非公開
トークン化BPE (40K merges)Byte-level BPEByte-level BPEByte-level BPE非公開
Positional Enc.LearnedLearnedLearnedLearned非公開
活性化関数GELUGELUGELUGELU非公開
LayerNormPost-normPre-normPre-normPre-norm非公開
学習方法LM + Fine-tuningLM onlyLM onlyLM + SFT + RLHFLM + SFT + RLHF
マルチモーダルNoNoNoNoYes (Image Input)
Sparse AttentionNoNoYes (部分的)Yes (部分的)非公開

8.2 パラダイムの進化

アーキテクチャ自体よりも重要なのはパラダイムの進化である。

GPT-1: Pre-train → Fine-tune (各タスクごとにファインチューニング必要)
GPT-2: Pre-train → Zero-shot (ファインチューニングなしで直接使用)
GPT-3: Pre-train → In-context Learning (例示のみでタスク実行)
InstructGPT: Pre-train → SFTRLHF (人間のフィードバックで整合)
GPT-4: Pre-train → SFTRLHF + Multimodal (マルチモーダル + 安全性強化)

この進化の一貫した方向はユーザーの介入を減らすことである。GPT-1は各タスクごとに学習データとファインチューニングが必要であったが、GPT-4に至ってはは自然言語の指示のみでほぼすべてのタスクを実行できるようになった。


9. GPTの影響:AIエコシステムの変革

9.1 ChatGPTとAIの大衆化

GPTシリーズの最も直接的な影響はChatGPTを通じたAIの大衆化である。

ChatGPT成長指標:

ChatGPTは「AI」という概念を研究者と開発者の専有物から一般大衆の日常ツールへと転換させた。この転換はInstructGPTのRLHF技術なしには不可能であった。

9.2 API EconomyとAI-nativeサービス

GPT-3のAPI公開(2020年6月)はAI API Economyの始まりを告げた。

新しいビジネスモデル:

9.3 学術的影響

GPTシリーズは学術研究の方向にも根本的な影響を与えた。

新しい研究分野の誕生:

研究方法論の変化:

9.4 産業と社会への影響


10. 限界と批判

10.1 Hallucination(幻覚)

GPTシリーズの最も深刻な限界は事実と異なる情報を確信を持って生成するHallucination問題である。

Hallucinationの類型:

根本原因:

GPT-4はRLHFによりHallucinationをGPT-3.5比で約40%削減したが、完全な解決はまだ遠い。これは現在のLLM研究の最も活発な分野の一つである。

10.2 Bias(偏り)

大規模言語モデルは学習データに内在する社会的偏りを反映し、時には増幅する。

偏りの類型:

GPT-3論文はこれを明示的に認め、Gender、Race、Religionに関連する偏り分析を含めた。InstructGPTとGPT-4はRLHFで偏りを減らそうとしたが、学習データ自体の偏りを完全に除去することは根本的に困難な問題である。

10.3 Environmental Cost(環境コスト)

大規模モデル学習の環境的コストはますます大きな懸念となっている。

学習炭素排出推定:

水資源消費:

批判と反論:

10.4 透明性と再現可能性

GPTシリーズに対する最も持続的な批判の一つは透明性の不足である。

この傾向は「Open」AIという組織名との乖離を深め、学術コミュニティの再現可能性(Reproducibility)を深刻に阻害した。これに対する反発としてMetaのLLaMA、Mistral AIのMistral/Mixtralなどオープンモデルの重要性がさらに浮き彫りになった。

10.5 経済的不平等とCompute Divide

大規模モデル学習に必要なリソースの集中はAI研究の経済的不平等を深化させる。


11. まとめ:GPTが残した遺産

GPTシリーズの5編の論文を貫く核心的洞察を整理すると以下の通りである。

1. Scale is (almost) all you need

GPT-1(117M) → GPT-2(1.5B) → GPT-3(175B)へのScalingは単に「同じものをより大きく」ではなく、質的に新しい能力の創発につながった。Zero-shot、In-context Learning、複雑な推論などは十分な規模でのみ現れるEmergent Abilitiesであった。

2. Alignment changes everything

InstructGPTはモデルサイズよりも学習方法論が重要であり得ることを示した。1.3B InstructGPTが175B GPT-3に勝ったことは、単なる能力(Capability)と有用性(Usefulness)の間に大きな隔たりがあり、RLHFがこの隔たりを埋められることを実証した。

3. The bitter lesson revisited

Rich Suttonの "The Bitter Lesson" — 汎用的な方法 + より多くのComputeが特化された方法に勝つ — がGPTシリーズで繰り返し確認された。Task-specificアーキテクチャの代わりに汎用Transformer + 大規模事前学習が圧倒的に効果的であった。

4. Data is the new bottleneck

Chinchillaの教訓以降、モデルサイズとともに学習データの量と質が核心的ボトルネックとして浮上した。インターネットの高品質テキストは有限であり、Synthetic Dataの生成が新しい研究方向として浮上している。

5. Safety is not optional

GPT-2の「too dangerous to release」論争からGPT-4のRed-teamingまで、安全性は選択ではなく必須となった。AIモデルが強力になるほど、安全で責任ある開発の重要性も比例して大きくなる。

GPTシリーズはまだ終わっていない。GPT-5、そしてその先のモデルがどのような能力を示すかは不明だが、一つだけは明確である。GPTシリーズが確立した「大規模事前学習 + 人間フィードバック整合」のパラダイムは現代AIの根幹として定着し、これを理解することはAIの未来を理解するために不可欠であるということだ。


12. References

  1. GPT-1: Radford, A., Narasimhan, K., Salimans, T., & Sutskever, I. (2018). "Improving Language Understanding by Generative Pre-Training." OpenAI Paper

  2. GPT-2: Radford, A., Wu, J., Child, R., Luan, D., Amodei, D., & Sutskever, I. (2019). "Language Models are Unsupervised Multitask Learners." OpenAI Paper

  3. GPT-3: Brown, T. B., Mann, B., Ryder, N., et al. (2020). "Language Models are Few-Shot Learners." NeurIPS 2020. arXiv:2005.14165

  4. InstructGPT: Ouyang, L., Wu, J., Jiang, X., et al. (2022). "Training Language Models to Follow Instructions with Human Feedback." NeurIPS 2022. arXiv:2203.02155

  5. GPT-4: OpenAI. (2023). "GPT-4 Technical Report." arXiv:2303.08774

  6. Scaling Laws: Kaplan, J., McCandlish, S., Henighan, T., et al. (2020). "Scaling Laws for Neural Language Models." arXiv:2001.08361

  7. Chinchilla: Hoffmann, J., Borgeaud, S., Mensch, A., et al. (2022). "Training Compute-Optimal Large Language Models." arXiv:2203.15556

  8. Transformer: Vaswani, A., Shazeer, N., Parmar, N., et al. (2017). "Attention Is All You Need." NeurIPS 2017. arXiv:1706.03762

  9. PPO: Schulman, J., Wolski, F., Dhariwal, P., Radford, A., & Klimov, O. (2017). "Proximal Policy Optimization Algorithms." arXiv:1707.06347

  10. RLHF: Christiano, P. F., Leike, J., Brown, T., et al. (2017). "Deep Reinforcement Learning from Human Preferences." NeurIPS 2017. arXiv:1706.03741

  11. Sparse Transformer: Child, R., Gray, S., Radford, A., & Sutskever, I. (2019). "Generating Long Sequences with Sparse Transformers." arXiv:1904.10509

  12. BPE: Sennrich, R., Haddow, B., & Birch, A. (2016). "Neural Machine Translation of Rare Words with Subword Units." ACL 2016. arXiv:1508.07909

  13. Carbon Footprint: Patterson, D., Gonzalez, J., Le, Q., et al. (2021). "Carbon Emissions and Large Neural Network Training." arXiv:2104.10350

関連シリーズ & おすすめ記事

GitHub

コメント

まだコメントはありません。

ログインするとコメントできます