태그: #audio
GPU·LLM·MLOps·쿠버네티스, 그리고 마음가짐에 관한 글 · 3 편
SOTA 멀티모달 LLM 분석 — 하나의 모델로 보고 듣고 말하다
텍스트 하나로 학습된 LLM이 어떻게 이미지, 오디오, 비디오까지 이해하고 생성하게 되었는지 살펴봅니다. 모달별 인코더와 프로젝터, 통합 토큰 공간, any-to-any 흐름, 네이티브 멀티모달과 어댑터 접합 방식, 그리고 학습 전략과 벤치마크·한계까지 정리합니다.
2026-06-30 · 47 분 읽기 #multimodal-llm#any-to-any#vision-language#audio#architectureWebRTC 완전 가이드 2025: 실시간 비디오/오디오 통신, P2P, STUN/TURN, 시그널링, SFU/MCU
WebRTC의 모든 것! 핵심 API(getUserMedia/RTCPeerConnection), NAT 트래버설(STUN/TURN/ICE), 시그널링, SFU vs MCU vs P2P, mediasoup/Janus/LiveKit, Adaptive Bitrate, 음성 처리, 보안(DTLS/SRTP), 프로덕션 운영.
2026-04-15 · 19 분 읽기 #webrtc#realtime#video#audio#p2ptorchaudio 완전 가이드 — 오디오 처리부터 음성인식, TTS, 음악 분석까지
torchaudio로 오디오 로드, 스펙트로그램 변환, Mel 필터뱅크, MFCC, 음성인식(Wav2Vec2/Whisper), TTS, 화자 분리, 노이즈 제거까지. 오디오 AI의 모든 것을 PyTorch로 다룹니다.
2026-03-02 · 11 분 읽기 #ai-platform#pytorch#torchaudio#audio#speech-recognition