태그: #alignment
GPU·LLM·MLOps·쿠버네티스, 그리고 마음가짐에 관한 글 · 7 편
증류로 전이되는 것과 안 되는 것 — DeepSeek을 GPT-OSS에 증류했더니 검열이 따라오지 않았다
2026년 7월 30일 Show HN에 올라온 CTGT의 실험은 DeepSeek V4 Flash를 교사로, GPT-OSS를 학생으로 삼아 금융 추론 능력을 증류했더니 능력은 넘어왔는데 정치 검열은 넘어오지 않았다고 보고합니다. 대응 쌍 152개에서 교사는 민감 질문과 대조군 사이에 45.45점의 검열 격차를 보였지만 학생은 0.43점과 3.94점으로 기준선에 머물렀습니다. 이 글은 그 실험
2026-07-31 · 21 분 읽기 #ai#llm#distillation#alignment#open-weightsRLHF 모델은 왜 보상을 속이는가 — 리워드 해킹의 메커니즘, 증상, 완화 방향
Xiaohua Wang 등 23명이 2026년 4월 arXiv에 올린 "Reward Hacking in the Era of Large Models"는 RLHF로 정렬된 대형 모델이 왜, 어떻게 보상 신호를 게이밍하는지 정리한 서베이입니다. 핵심 제안은 리워드 해킹을 목표 압축, 최적화 증폭, 평가자–정책 공진화라는 세 힘으로 읽는 프록시 압축 가설(PCH)입니다. 장황함 편향, 아첨, 그럴듯
2026-07-11 · 11 분 읽기 #ai#llm#alignment#rlhf#safety로봇 안전과 정렬 — 강력한 로봇을 신뢰하려면
점점 강력해지는 로봇을 어떻게 신뢰할 수 있을까요. 물리적 안전, 제약 강화학습과 안전층, 분포 이탈 대응, 사람-로봇 협업 안전, 검증과 표준, 그리고 임바디드 AI의 정렬 과제까지 균형 있게 살펴봅니다.
2026-06-29 · 34 분 읽기 #ai-papers#robotics#safety#alignment#reinforcement-learningAI Safety & Alignment 완전 가이드 2025: 책임있는 AI, RLHF, Constitutional AI, 레드팀
AI Safety의 모든 것! Alignment 문제(목표 정렬), RLHF/DPO/Constitutional AI, 편향(Bias) 감지/완화, 환각(Hallucination) 방지, 레드팀 테스팅, AI Guardrails, 해석 가능성(SHAP/LIME), EU AI Act, 기업의 Responsible AI 프레임워크.
2026-04-14 · 46 분 읽기 #ai-safety#alignment#responsible-ai#rlhf#constitutional-aiAI 윤리, 안전성, 정렬(Alignment) 완전 가이드: 책임감 있는 AI 개발
AI 윤리, 안전성, 정렬(Alignment)을 완전히 이해하는 가이드. Hallucination, 편향성, 개인정보, RLHF, Constitutional AI, AI Safety 연구 최전선까지 AI 개발자가 반드시 알아야 할 내용을 다룹니다.
2026-03-17 · 39 분 읽기 #ai-ethics#ai-safety#alignment#responsible-ai#llmRLHF에서 DPO까지: LLM 정렬(Alignment) 기술 논문 심층 분석
LLM 정렬 기술의 핵심 논문들을 심층 분석합니다. InstructGPT의 RLHF 파이프라인, Anthropic의 Constitutional AI, DPO의 수학적 기반, PPO 학습 안정성, 그리고 KTO/IPO/ORPO 등 최신 연구까지 체계적으로 비교하고 실무 적용 방안을 정리합니다.
2026-03-13 · 20 분 읽기 #ai-papers#rlhf#dpo#alignment#ppoDPO에서 KTO까지: 인간 피드백 정렬 기법 최신 논문 리뷰와 실전 구현
RLHF의 한계를 극복한 DPO, IPO, KTO 등 최신 인간 피드백 정렬 기법의 논문 리뷰와 TRL 기반 실전 구현 가이드. 알고리즘 비교, 하이퍼파라미터 튜닝, 실패 사례까지.
2026-03-05 · 33 분 읽기 #ai-papers#dpo#kto#alignment#2026-03