태그: #ai-papers
GPU·LLM·MLOps·쿠버네티스, 그리고 마음가짐에 관한 글 · 78 편
음성 인식·합성 기술 리포트, 무엇을 읽을 것인가 — WER 한 숫자로는 안 보이는 것
음성 인식과 합성 기술 리포트 열 편을 arXiv 원문 초록에서 직접 확인해 정리했습니다. Whisper와 Omnilingual ASR, Qwen3-ASR, Open ASR Leaderboard, Seed-TTS와 F5-TTS, CosyVoice 2, Qwen3-TTS, Fish Audio S2, Moshi, Qwen2.5-Omni와 MOSS-Audio가 각각 무엇을 새로 했고 저자들이 어떤
2026-08-12 · 14 분 읽기 #ai-papers#paper-review#technical-report#speech-recognition#text-to-speech이미지 생성·이해 기술 리포트, 무엇을 읽을 것인가 — 샘플 이미지 대신 설계를 읽기
이미지 생성과 이해 기술 리포트 열한 편을 arXiv 원문 초록에서 직접 확인해 정리했습니다. 정류 흐름 트랜스포머와 VAR, Emu3, SANA, Janus-Pro, FLUX.1 Kontext, Qwen-Image 계열, Seedream 4.0, Z-Image와 Mage-Flow, InternVL3, 그리고 평가 쪽 Qwen-Image-Bench까지 각각 무엇을 새로 했고 저자들이 어떤 한
2026-08-12 · 14 분 읽기 #ai-papers#paper-review#technical-report#image-generation#diffusion-transformer토크나이저 내부 — 한국어가 토큰을 더 먹는 이유와 그 비용
바이트 수준 BPE가 어떻게 동작하는지 설명하고, Qwen3와 DeepSeek-V3, Mixtral의 실제 토크나이저 파일을 내려받아 같은 뜻의 영어와 한국어 문장을 직접 토큰화해 비교합니다. 어휘 크기의 트레이드오프, config의 vocabsize와 실제 어휘 수가 다른 이유, 그리고 토큰 수가 비용과 문맥 창에 미치는 영향을 정리합니다.
2026-08-12 · 11 분 읽기 #ai-papers#model-internals#tokenizer#bpe#korean-nlp정규화와 활성화 — 학습을 무너뜨리지 않는 법
RMSNorm과 프리노름, SwiGLU가 왜 지금의 표준이 되었는지 config 값으로 확인하고, Qwen3의 QK-Norm과 Kimi K2의 QK-Clip처럼 어텐션 로짓 폭주를 막는 최신 장치를 실제 리포트의 수치와 함께 정리합니다. 안정성을 위해 무엇을 추가하고 무엇을 감수하는지 다룹니다.
2026-08-12 · 11 분 읽기 #ai-papers#model-internals#rmsnorm#swiglu#training-stability어텐션 변형 — MHA에서 MLA까지, KV 캐시는 어떻게 줄어드는가
MHA, MQA, GQA, MLA를 실제 config 값으로 비교합니다. Qwen3, Mixtral, GLM-4.5의 그룹 쿼리 어텐션과 DeepSeek-V3, Kimi K2의 잠재 어텐션이 토큰당 KV 캐시를 몇 배 줄이는지 공식과 숫자로 계산하고, 그 대가로 무엇을 내주는지 정리합니다.
2026-08-12 · 10 분 읽기 #ai-papers#model-internals#attention#gqa#mlaOCR·문서 이해 기술 리포트, 무엇을 읽을 것인가 — 파싱은 왜 아직 안 끝났나
OCR과 문서 이해 기술 리포트 열 편을 arXiv 원문 초록에서 직접 확인해 정리했습니다. Donut과 Nougat에서 GOT-OCR2.0, olmOCR, DeepSeek-OCR과 그 후속, GLM-OCR, Qianfan-OCR, MinerU2.5-Pro, HunyuanOCR-1.5까지 각각 무엇을 새로 했고 저자들이 어떤 한계를 밝혔는지 읽습니다. 순위는 다루지 않습니다. 문서 파싱 점수
2026-08-12 · 14 분 읽기 #ai-papers#paper-review#technical-report#ocr#document-ai리더보드와 벤치마크를 읽는 법 — SOTA는 왜 유통기한이 짧은가
벤치마크 방법론 논문 열두 편을 arXiv 원문 초록에서 직접 확인해, 리더보드 숫자를 어떻게 읽어야 하는지 정리했습니다. 데이터 오염, 프롬프트 형식 민감도, 평가 하네스 차이, 자체 보고, 리더보드의 표집 비대칭, LLM 심사자의 편향, 그리고 오차 막대를 붙이는 통계적 접근까지 다룹니다. 영역별 최신 기술 리포트 읽기 시리즈의 마지막 편이자, 앞선 다섯 편을 읽는 방법에 대한 안내입니다
2026-08-12 · 13 분 읽기 #ai-papers#paper-review#technical-report#benchmark#evaluation기술 리포트 비판적으로 읽기 — 무엇이 적히고 무엇이 빠지는가
모델 기술 리포트에서 검증 가능한 항목과 검증 불가능한 항목을 구분하는 법을 정리합니다. 자체 보고 벤치마크의 한계, config와 리포트가 어긋나는 지점, 게이트된 저장소에서 확인할 수 없는 값, 그리고 시리즈 전체에서 쓴 확인 절차를 실제 사례로 보여 줍니다.
2026-08-12 · 13 분 읽기 #ai-papers#model-internals#tech-report#benchmarks#evaluationMoE 라우팅 — 전문가는 어떻게 뽑히는가
전문가 혼합 계층의 config 필드를 실제 모델로 읽습니다. Mixtral의 8개 중 2개, Qwen3의 128개 중 8개, DeepSeek-V3의 256개 라우팅 전문가와 공유 전문가, Kimi K2의 희소도 48을 비교하고, 활성 파라미터와 전체 파라미터가 왜 다른 비용을 만드는지, 로드 밸런싱 손실과 보조 손실 없는 편향 방식이 무엇을 맞바꾸는지 정리합니다.
2026-08-12 · 11 분 읽기 #ai-papers#model-internals#mixture-of-experts#moe#routing비디오 생성·이해 기술 리포트, 무엇을 읽을 것인가 — 데모가 아니라 제약을 읽기
비디오 생성과 이해 기술 리포트 열 편을 arXiv 원문 초록에서 직접 확인해 정리했습니다. CogVideoX, Movie Gen, HunyuanVideo, LTX-Video, Wan, Seedance 1.0과 2.0, 그리고 이해 쪽의 Qwen2.5-VL, VideoLLaMA 3, HY-Himmel까지 무엇을 새로 했고 저자들이 어떤 한계를 밝혔는지 읽습니다. 순위는 다루지 않고, 대신 길
2026-08-12 · 13 분 읽기 #ai-papers#paper-review#technical-report#video-generation#diffusion-transformer텍스트 LLM 기술 리포트, 무엇을 읽을 것인가 — 순위 대신 설계 결정 읽기
텍스트 LLM 기술 리포트 9편을 arXiv 원문 초록에서 직접 확인해 정리했습니다. DeepSeek-V3와 DeepSeek-R1, Qwen3, Gemma 3, Olmo 3, Kimi K2, MiniMax-01, Mellum2, s1이 각각 무엇을 새로 했고 저자들이 어떤 한계를 스스로 밝혔는지 읽습니다. 모델 순위는 다루지 않습니다. 리더보드는 계속 바뀌고 리포트의 점수는 대부분 자체 보고
2026-08-12 · 13 분 읽기 #ai-papers#paper-review#technical-report#llm#moe학습 레시피 — 사전학습에서 후학습까지, 리포트는 무엇을 적는가
Llama 3의 세 단계와 여섯 번의 컨텍스트 확장, Qwen3의 세 단계 사전학습, DeepSeek-V3의 학습률 스케줄과 두 단계 YaRN 확장, Kimi K2의 데이터 재작성 실험을 리포트에 적힌 그대로 비교하고, 학습 단계 기술을 읽는 법을 정리합니다.
2026-08-12 · 12 분 읽기 #ai-papers#model-internals#pretraining#training-recipe#data-mixture위치 인코딩 — RoPE와 컨텍스트 확장의 대가
ropetheta 하나가 문맥 길이에 어떻게 작용하는지 파장 계산으로 보여 주고, Llama 3의 500000, Qwen3의 ABF, DeepSeek-V3와 Kimi K2의 YaRN 설정, GLM-4.5의 부분 회전을 실제 config로 비교합니다. 긴 컨텍스트가 왜 공짜가 아닌지 프리필 연산량과 캐시 비용으로 정리합니다.
2026-08-12 · 11 분 읽기 #ai-papers#model-internals#rope#positional-encoding#long-contextconfig.json 완전 해부 — 설정 파일 한 장으로 모델 구조 읽기
hiddensize, numhiddenlayers, numattentionheads와 numkeyvalueheads, headdim, intermediatesize, ropetheta, vocabsize, tiewordembeddings까지 config.json의 모든 필드가 메모리와 속도에 어떻게 나타나는지 설명하고, Qwen3-8B와 Mixtral-8x7B의 파라미터 수를 손으로 세어 공
2026-08-12 · 10 분 읽기 #ai-papers#model-internals#config-json#transformer#llm-architectureSOTA 텍스트 임베딩 모델 분석 — 검색과 RAG의 심장
텍스트 임베딩은 검색과 RAG 시스템의 심장입니다. 대조학습과 InfoNCE, 이중 인코더, 하드 네거티브, E5/BGE/GTE 계열, Matryoshka 표현학습, MTEB 벤치마크까지 최신 임베딩 모델의 원리와 실무 적용을 정리합니다.
2026-06-30 · 35 분 읽기 #ai-papers#embedding#retrieval#rag#contrastive-learningSOTA 3D 비전 분석 — 단안 깊이와 3D 가우시안 스플래팅
3D 비전의 SOTA 흐름을 정리합니다. 단안 깊이 추정(상대·미터 깊이)과 Depth Anything 계열의 개념, 스테레오·MVS 개요, 그리고 NeRF에서 3D 가우시안 스플래팅으로 이어지는 실시간 렌더링의 발전을 표현·학습·응용 관점에서 아키텍처 원리 중심으로 살펴봅니다.
2026-06-30 · 44 분 읽기 #ai-papers#3d-vision#monocular-depth#gaussian-splatting#nerfSOTA 음악·오디오 생성 분석 — 뉴럴 코덱과 생성 모델
오디오 표현(파형·스펙트로그램·뉴럴 코덱)부터 오토리그레시브 오디오 언어모델과 확산 기반 오디오, 텍스트-음악 조건화까지 계보 중심으로 정리합니다. EnCodec, MusicGen, AudioLM 계열의 원리와 상용 모델, 평가·저작권 쟁점을 아키텍처 관점에서 분석합니다.
2026-06-30 · 16 분 읽기 #ai-papers#audio-generation#music-generation#neural-codec#audio-language-modelSOTA 분할·검출 모델 분석 — SAM과 DETR, YOLO의 계보
객체 검출과 이미지 분할의 SOTA 계보를 정리합니다. 2단계 R-CNN에서 1단계 YOLO/SSD, 트랜스포머 기반 DETR로 이어지는 검출의 흐름과, 시맨틱·인스턴스·판옵틱 분할, 그리고 프롬프트 가능 분할을 연 Segment Anything(SAM)까지 아키텍처 원리 중심으로 살펴봅니다.
2026-06-30 · 41 분 읽기 #ai-papers#computer-vision#object-detection#segmentation#samSOTA 비디오 생성 모델 분석 — 시공간 확산 트랜스포머
비디오 생성의 근본 난제인 시간 일관성과 연산 비용을 시공간 라텐트 패치와 확산 트랜스포머 관점에서 정리합니다. Sora가 제시한 개념과 후속 모델 계열, 조건화·평가·물리 일관성 한계를 아키텍처 중심으로 분석합니다.
2026-06-30 · 16 분 읽기 #ai-papers#video-generation#diffusion-transformer#spatiotemporal#text-to-videoSOTA 이미지 생성 모델 분석 — 확산모델에서 FLUX까지
텍스트-이미지 생성의 최전선을 확산모델 원리부터 라텐트 확산, DiT, rectified flow, 그리고 FLUX 계열까지 계보 중심으로 정리합니다. 아키텍처 원리와 비교표, 다이어그램으로 SOTA 모델들의 공통 구조와 차이를 분석합니다.
2026-06-30 · 19 분 읽기 #ai-papers#diffusion-models#text-to-image#latent-diffusion#rectified-flow