태그: #operator
GPU·LLM·MLOps·쿠버네티스, 그리고 마음가짐에 관한 글 · 22 편
CloudNativePG로 쿠버네티스에 Postgres 띄우고 죽여보기 — 페일오버 23초 실측
실제 8노드 쿠버네티스 클러스터에 CloudNativePG(CNPG) v1.30.0을 설치하고, 3인스턴스 Postgres 클러스터를 띄운 뒤, 정말로 프라이머리를 죽여봤습니다. 부트스트랩부터 복제 확인, 프라이머리 강제 삭제 후 페일오버(23.1초 만에 레플리카 승격, 데이터 무손실), 그리고 죽은 노드가 레플리카로 자가 복구되어 3/3으로 돌아오기까지 — 전 과정을 실측 로그와 함께 기록
2026-07-11 · 9 분 읽기 #cloudnativepg#postgresql#kubernetes#operator#databaseRust로 쿠버네티스 GPU 오퍼레이터 만들기 — kube-rs로 실제 클러스터를 진단하다
8노드 실운영 홈랩 클러스터(k8s v1.32.5)를 상대로, kube-rs를 써서 GPU 오퍼레이터를 Rust로 직접 만들어 돌렸습니다. GpuInventory 커스텀 리소스를 정의하고, 두 개의 컨트롤러(노드 스캔→CR 상태 기록, 노드 감시→ConfigMap 갱신)를 한 바이너리로 띄워 클러스터 밖에서 실행했습니다. 그리고 오퍼레이터가 실제로 뱉은 결과 — GPU 노드 4개 중 Read
2026-07-11 · 10 분 읽기 #rust#kubernetes#operator#gpu#kube-rsRust로 쿠버네티스 Operator 만들기 (kube-rs)
쿠버네티스 Operator는 운영 지식을 코드로 옮긴 컨트롤러입니다. 이 글은 Operator 패턴(CRD + 컨트롤러 + reconcile 루프)의 원리부터 kube-rs로 실제 오퍼레이터를 만드는 법까지 다룹니다. CustomResource 파생 매크로로 CRD 정의, Api와 Controller, watcher, reconcile 함수와 requeue, 파이널라이저(finalizer)로
2026-06-25 · 22 분 읽기 #rust#kubernetes#operator#kube-rsOperator vs Helm vs GitOps — 무엇을 언제 쓰나
같은 듯 다른 세 가지 운영 도구를 본질부터 구분합니다. Helm은 패키징, GitOps는 선언적 동기화, Operator는 능동적 컨트롤러입니다. 정적 배포와 지속적 reconcile의 차이, Day-1과 Day-2의 경계, 셋을 조합하는 실전 패턴, 의사결정 테이블과 마이그레이션 경로까지 깊이 있게 다룹니다.
2026-06-15 · 35 분 읽기 #kubernetes#operator#helm#gitops#argocdOperator 보안 — 최소권한 RBAC, 멀티테넌시, 공급망
Operator는 클러스터 전역에서 강력한 권한으로 동작하기 때문에 한 번 탈취되면 클러스터 전체가 위험해집니다. RBAC 마커로 최소권한을 생성하는 방법, Role과 ClusterRole 선택 기준, kube-rbac-proxy 제거 이후의 메트릭 보안, 웹훅 TLS, 권한 상승 방지, 멀티테넌시 격리, 이미지 서명과 SBOM, Secret 처리와 감사까지 Operator 보안 전반을 깊이
2026-06-15 · 38 분 읽기 #kubernetes#operator#rbac#security#supply-chainOperator 관측성 — 메트릭, 이벤트, 로깅, 그리고 SLO
Kubebuilder 기반 Operator의 관측성을 메트릭, 이벤트, 로깅, 트레이싱, status/conditions, 그리고 SLO 관점에서 깊이 있게 다룹니다. controller-runtime 기본 메트릭의 의미부터 커스텀 메트릭 추가, Prometheus/Grafana 연동, 알림 규칙, 그리고 reconcile가 동작하지 않을 때의 디버깅 런북까지 실무 코드와 함께 정리합니다.
2026-06-15 · 32 분 읽기 #kubernetes#operator#observability#prometheus#controller-runtimeCRD 설계와 버저닝 — 스키마, 검증, conversion webhook
CustomResourceDefinition은 한 번 설계하면 오래 살아남는 API 계약입니다. OpenAPI v3 스키마 설계와 CEL 검증, 다중 버전 전략과 storage version, conversion webhook 구현, 하위호환과 마이그레이션까지 운영 가능한 CRD를 만드는 전 과정을 깊이 있게 다룹니다.
2026-06-15 · 27 분 읽기 #kubernetes#operator#crd#versioning#conversion-webhookOperator 프로덕션 업그레이드와 마이그레이션 — 무중단으로 진화시키기
Operator를 프로덕션에서 안전하게 업그레이드하는 전체 흐름을 다룹니다. 컨트롤러 Deployment 롤링과 리더 선출, 다중 버전 CRD와 conversion webhook, 관리 워크로드의 단계적 롤아웃, 롤백 전략, 대규모 CR 마이그레이션, 그리고 장애 대응까지 working code와 함께 정리했습니다.
2026-06-15 · 36 분 읽기 #kubernetes#operator#kubebuilder#controller-runtime#crdReconcile 루프 심화 — 멱등성, 에러 처리, 큐, 그리고 성능
reconcile 요청 흐름(informer→workqueue→reconcile), Result와 requeue, 멱등 구현 패턴, status와 conditions, predicate 이벤트 필터, rate limiting과 동시성, 캐시와 클라이언트, 관측, 흔한 버그, 성능 튜닝까지 reconcile 루프를 깊이 있게 해부합니다.
2026-06-15 · 33 분 읽기 #kubernetes#operator#reconcile#controller-runtime#performanceGo 말고도 — Kopf, Metacontroller, Shell Operator로 Operator 만들기
Operator는 반드시 Go와 kubebuilder로 만들어야 한다는 통념을 깹니다. Python의 Kopf, 선언적 훅 방식의 Metacontroller, shell-operator와 Ansible Operator까지 비-Go 선택지를 코드와 함께 비교합니다. 프로토타이핑과 프로덕션의 경계, 언어 선택 기준, 마이그레이션, 생태계 성숙도와 함정을 다룹니다.
2026-06-15 · 35 분 읽기 #kubernetes#operator#kopf#metacontroller#pythonOperator 베스트 프랙티스와 안티패턴
좋은 Operator의 특징과 흔한 안티패턴을 코드 수준에서 정리합니다. 작은 API와 멱등 reconcile, 관측 가능성, 안전한 업그레이드 같은 원칙부터 부수효과 남발·status 오용·무한 requeue·광범위 RBAC 같은 함정, 멀티테넌시와 보안, 리소스 효율, 테스트 문화, SRE 관점 운영, 성숙도 로드맵과 체크리스트까지 다룹니다.
2026-06-15 · 25 분 읽기 #kubernetes#operator#best-practices#reconcile#rbacKubebuilder로 첫 Operator 만들기 — 프로젝트 생성부터 배포까지
Kubebuilder로 실제 동작하는 Operator를 처음부터 끝까지 만듭니다. 사전 준비, init/create api 흐름, API 타입 정의, Deployment·Service를 조정하는 reconcile 전체 코드, RBAC 마커, CRD 생성, 로컬 실행과 클러스터 배포, 테스트 개념, 흔한 실수까지 다룹니다.
2026-06-15 · 16 분 읽기 #kubernetes#kubebuilder#operator#controller-runtime#goOperator 테스트와 배포 — envtest, e2e, OLM, 번들 패키징
Kubernetes Operator를 안전하게 테스트하고 배포하는 방법을 다룹니다. 테스트 피라미드(unit reconcile·envtest·e2e)부터 OLM의 CSV·번들·카탈로그, 업그레이드 그래프, 최소권한 RBAC, 멀티테넌트 설치 모드, 프로덕션 체크리스트까지 코드와 함께 정리합니다.
2026-06-15 · 25 분 읽기 #kubernetes#operator#testing#envtest#olmOperator로 만들 수 있는 것들 — 실전 사례 카탈로그
Operator가 빛나는 영역을 데이터베이스부터 메시징, 캐시, 모니터링, 인증서, 시크릿, GitOps, 백업, 서비스메시, ML까지 카탈로그로 정리합니다. 각 사례의 동작 원리와 대표 CRD 예시, 무엇을 자동화하는지 비교 테이블, 직접 만들 만한 사내 Operator 아이디어 10선, 그리고 만들 가치를 판단하는 기준까지 한 번에 훑습니다.
2026-06-15 · 21 분 읽기 #kubernetes#operator#crd#cncf#platform-engineeringOperator 고급 — Finalizer, Admission Webhook, Status·Conditions 설계
Kubernetes Operator를 프로덕션 수준으로 끌어올리는 세 가지 핵심 주제인 Finalizer를 통한 외부 리소스 정리, Validating·Mutating Admission Webhook, 그리고 Status 서브리소스와 Conditions 표준 설계를 다룹니다. controller-runtime v0.24.x와 Kubebuilder 최신 버전 기준의 실전 Go 코드와 함정, 테
2026-06-15 · 22 분 읽기 #kubernetes#operator#finalizer#webhook#kubebuilder쿠버네티스 Operator 패턴 완전 이해 — 컨트롤러, 리컨실, 그리고 운영 지식의 코드화
Operator 패턴이 무엇을 푸는지, 컨트롤 루프와 reconcile 원리, CRD와 컨트롤러의 결합, 컨트롤 플레인 확장 메커니즘, Capability Level, 그리고 언제 쓰고 언제 쓰지 말아야 하는지까지 운영 관점에서 깊이 있게 정리합니다.
2026-06-15 · 38 분 읽기 #kubernetes#operator#controller#reconcile#crd데이터베이스 Operator 만들기 — 백업·페일오버·스케일을 코드로
스테이트풀 데이터베이스 운영의 어려움을 reconcile 루프로 풀어내는 과정을 코드로 따라갑니다. CR 스펙 설계부터 StatefulSet·Service·PVC 조정, 주기적 백업, 페일오버와 리더 선출 개념, 순차 롤링 업그레이드, status 헬스 노출과 관측까지 다룹니다. 기성 Operator를 참고하되 직접 구현의 트레이드오프와 함정도 짚습니다.
2026-06-15 · 25 분 읽기 #kubernetes#operator#database#kubebuilder#controller-runtimeKubernetes가 왜 이렇게 복잡한가 심화 가이드 — 아키텍처, Service Mesh, GitOps, Platform Engineering, Ambient Mesh, eBPF, Gateway API까지 (2025)
2014년 Google이 Borg 경험을 기반으로 공개한 Kubernetes는 10년 만에 클라우드의 운영 체제가 됐다. 하지만 그 복잡도는 악명 높고, "K8s는 정말 필요한가"라는 질문은 매년 반복된다. etcd부터 Ambient Mesh, ArgoCD, Backstage, Karpenter, WASM까지 — K8s 생태계의 전 지형도와 실전 운영 트레이드오프를 정리한다.
2026-04-15 · 23 분 읽기 #kubernetes#service-mesh#istio#linkerd#ciliumKubernetes 내부 완전 가이드 2025: Scheduler, Controller, etcd, API Machinery, CRD/Operator 심층 분석
kubectl apply 뒤에서 무슨 일이 일어나는가? API Server부터 etcd, Scheduler, Controller, kubelet까지 — Kubernetes의 모든 내부 구조를 720줄로 완전 분석한다. Informer 패턴, Reconciliation, Operator 개발까지 다룬다.
2026-04-15 · 66 분 읽기 #kubernetes#scheduler#controller#etcd#api-serverKubernetes DB 심화 가이드 2025: Operator 패턴, HA 구성, 백업/복구, 성능 튜닝 실전
K8s DB 운영 심화! CloudNativePG vs Percona Operator 비교, Primary-Replica 자동 Failover, pgBackRest/Velero 백업, WAL 아카이빙, Connection Pooling(PgBouncer), 리소스 튜닝(CPU/Memory/IOPS), Affinity/Topology Spread, 프로덕션 체크리스트.
2026-04-13 · 31 분 읽기 #kubernetes#database#operator#cloudnativepg#percona