태그: #utf-8
GPU·LLM·MLOps·쿠버네티스, 그리고 마음가짐에 관한 글 · 2 편
Rust 문자열이 까다로운 이유, 그리고 한글에서 그 선택이 옳은 이유
Rust에서 문자열이 어렵다는 말은 대개 인덱싱이 안 된다는 뜻입니다. 그런데 한글을 다루면 그 제약이 방어 장치였다는 게 드러납니다. "커널 파라미터 튜닝"은 26바이트이고 10글자입니다. str::find가 돌려주는 7과 사람이 세는 4가 다른 이유, len()이 바이트인 이유, 그리고 실제 검색 도구에서 이 차이가 어떻게 버그가 되는지를 실행 결과와 테스트 코드로 확인합니다.
2026-08-19 · 14 분 읽기 #rust#string#utf-8#cjk#koreanUnicode & UTF-8 완벽 정복 — 코드포인트, 그래핌, 정규화, 이모지, 한글 NFD/NFC 끝장 가이드 (2025)
"한글이 깨진다", "이모지가 2글자로 세진다", "맥에서 복사한 파일명이 윈도우에서 다르다" — 이 모든 괴현상의 범인은 Unicode다. 8비트 ASCII에서 UTF-8 가변 길이 인코딩까지의 진화, 코드포인트와 그래핌 클러스터의 차이, NFC/NFD/NFKC/NFKD 4가지 정규화, 이모지 ZWJ 시퀀스의 놀라운 구조, 그리고 한글이 특별한 이유까지 — 현대 소프트웨어의 기반인 Unic
2026-04-15 · 34 분 읽기 #unicode#utf-8#encoding#text-processing#i18n