タグ: #training-data
GPU・LLM・MLOps・Kubernetes、そしてマインドセット · 2 件
オープンソースAI学習データセット2026 — Common Crawl / FineWeb (HF) / RedPajama-V2 / Dolma / SlimPajama / The Stack v2 / LAION / COYO-700M (Kakao) 深掘りガイド
2026年のオープンソースAI学習データセットの全体地図を描く。すべてのLLMの基盤となるCommon Crawl、それを精製したRefinedWeb / RedPajama-V2 / FineWeb / FineWeb-Edu / Dolma / SlimPajama、学術系のThe Pile / S2ORC / arXiv、コード系のThe Stack v2 / StarCoder、マルチモーダルのLAION-5B / DataCo
2026-05-16 · 27 分で読めます #ai-datasets#training-data#common-crawl#refinedweb#redpajama韓国語LLM学習データ制作完全ガイド:Hugging Faceデータセット、前処理、品質管理まで
LLM学習データ制作の全て!Hugging Faceデータセット(種類/ローディング/変換)、韓国語データ収集(クローリング/合成/翻訳)、前処理(トークン化/クリーニング/重複除去)、Instruction Tuningフォーマット(Alpaca/ShareGPT/OpenAI)、品質管理、RLHF/DPOデータセット。
2026-03-25 · 28 分で読めます #llm#training-data#huggingface#dataset#korean-nlp