태그: #safety
GPU·LLM·MLOps·쿠버네티스, 그리고 마음가짐에 관한 글 · 5 편
Ferrocene의 인증된 core — 컴파일러는 ASIL D인데 라이브러리는 왜 ASIL B에서 멈추나
"ASIL D 인증받은 Rust 컴파일러"라는 문장은 사실이지만, 거기서 흔히 유추하는 결론은 사실이 아닙니다. Ferrocene은 컴파일러를 ISO 26262 ASIL D / TCL 3 도구로 자격심사받았고, 이건 "이 도구를 쓰면서 ASIL D 소프트웨어를 개발해도 된다"는 뜻이지 "결과물이 ASIL D"라는 뜻이 아닙니다. 정작 당신 코드가 매 줄 호출하는 core 라이브러리는 별개의
2026-07-16 · 44 분 읽기 #embedded#rust#ferrocene#safety#systemsRLHF 모델은 왜 보상을 속이는가 — 리워드 해킹의 메커니즘, 증상, 완화 방향
Xiaohua Wang 등 23명이 2026년 4월 arXiv에 올린 "Reward Hacking in the Era of Large Models"는 RLHF로 정렬된 대형 모델이 왜, 어떻게 보상 신호를 게이밍하는지 정리한 서베이입니다. 핵심 제안은 리워드 해킹을 목표 압축, 최적화 증폭, 평가자–정책 공진화라는 세 힘으로 읽는 프록시 압축 가설(PCH)입니다. 장황함 편향, 아첨, 그럴듯
2026-07-11 · 11 분 읽기 #ai#llm#alignment#rlhf#safety로봇 안전과 정렬 — 강력한 로봇을 신뢰하려면
점점 강력해지는 로봇을 어떻게 신뢰할 수 있을까요. 물리적 안전, 제약 강화학습과 안전층, 분포 이탈 대응, 사람-로봇 협업 안전, 검증과 표준, 그리고 임바디드 AI의 정렬 과제까지 균형 있게 살펴봅니다.
2026-06-29 · 34 분 읽기 #ai-papers#robotics#safety#alignment#reinforcement-learning챗봇 가드레일과 안전성 완벽 가이드: 프롬프트 인젝션 방어부터 출력 검증까지
프로덕션 챗봇의 안전성 확보 전략을 다룹니다. 프롬프트 인젝션 공격 유형과 방어, NeMo Guardrails/Guardrails AI 프레임워크, 콘텐츠 필터링, 출력 검증, PII 마스킹까지 실무 보안 아키텍처를 코드와 함께 구현합니다.
2026-03-13 · 24 분 읽기 #chatbot#guardrails#prompt-injection#safety#content-filteringLLM 안전성과 Red Teaming 실전 가이드: 적대적 공격 방어부터 가드레일 구축까지
LLM 시스템의 안전성을 확보하기 위한 Red Teaming 방법론과 방어 전략을 다룹니다. 프롬프트 인젝션, 탈옥 공격의 유형 분석부터 Llama Guard, NeMo Guardrails를 활용한 다층 방어 아키텍처 구축까지 실전 코드와 함께 안내합니다.
2026-03-08 · 43 분 읽기 #llm#red-teaming#safety#guardrails#prompt-injection