태그: #text-processing
GPU·LLM·MLOps·쿠버네티스, 그리고 마음가짐에 관한 글 · 2 편
Unicode & UTF-8 완벽 정복 — 코드포인트, 그래핌, 정규화, 이모지, 한글 NFD/NFC 끝장 가이드 (2025)
"한글이 깨진다", "이모지가 2글자로 세진다", "맥에서 복사한 파일명이 윈도우에서 다르다" — 이 모든 괴현상의 범인은 Unicode다. 8비트 ASCII에서 UTF-8 가변 길이 인코딩까지의 진화, 코드포인트와 그래핌 클러스터의 차이, NFC/NFD/NFKC/NFKD 4가지 정규화, 이모지 ZWJ 시퀀스의 놀라운 구조, 그리고 한글이 특별한 이유까지 — 현대 소프트웨어의 기반인 Unic
2026-04-15 · 34 분 읽기 #unicode#utf-8#encoding#text-processing#i18n정규표현식 완전 정복 2025: 기초부터 고급 패턴, 실전 활용까지 — 더 이상 두렵지 않다
정규표현식의 모든 것! 기초 문법(., , +, ?), 그룹과 캡처, Lookahead/Lookbehind, 탐욕적 vs 게으른 매칭, 실전 패턴 30선(이메일/URL/IP/전화번호), 성능 최적화(ReDoS 방지), 언어별 차이까지.
2026-03-23 · 23 분 읽기 #regex#regular-expression#pattern-matching#text-processing#validation