タグ: #grpo
GPU・LLM・MLOps・Kubernetes、そしてマインドセット · 2 件
LLMファインチューニングフレームワーク2026 — Axolotl / Unsloth / LLaMA-Factory / TRL / PEFT / TorchTune 徹底ガイド
2026年のLLMファインチューニング生態系を一気に整理する。Axolotl・Unsloth・LLaMA-Factory・TRL・PEFT・TorchTuneといったオープンソースフレームワークから、LLM Foundry(MosaicML、Databricksが買収)、Modal・Together・OpenAI・Anthropic・Cohereのクラウドファインチューニング API まで。QLoRA・FSDP・DeepSpeed Ze
2026-05-16 · 37 分で読めます #llm#finetuning#axolotl#unsloth#llama-factoryAI 安全 & アライメント 2026 完全ガイド - Constitutional AI · RLHF · DPO · GRPO · Mechanistic Interpretability · AISI Evals · Red Team 徹底解説
2026年のAI安全とアライメントの全体地形を一気に整理する。outer/inner アライメントや mesa-optimization といった概念的基盤から、RLHF・DPO・GRPO・Constitutional AI に至る学習時アライメント手法、Anthropic RSP や OpenAI Preparedness Framework、Google DeepMind Frontier Safety Framework といった
2026-05-16 · 30 分で読めます #ai-safety#ai-alignment#constitutional-ai#rlhf#dpo