LabHub
开始
学习 学习路径 课程

语音 AI 智能体 — 会听、会查、会说的流水线

전화 예약 비서를 GPU 없이 파드 하나에서 만듭니다. 소리의 모양(샘플레이트·프레임·dBFS), VAD 와 턴 끝 판정·끼어들기, 스트리밍 ASR 과 WER, LLM 스트리밍과 첫 토큰 지연, 오인식된 질의의 RAG, 확인·재시도·넘기기가 있는 에이전트, 문장 단위 TTS 와 읽을 글 만들기, 파이프라인 지연 예산, 평가와 관측, 음성으로 들어오는 주입과 개인정보까지 열 개 모듈을 실제 모델로 잽니다. 채점기는 같은 모델을 다시 돌려 여러분의 결과와 대조합니다. LLM 엔지니어링과 AI 에이전트 코스를 먼저 보면 더 잘 읽힙니다.

고급 · 레슨 30 · 实验 10

开始实验

커리큘럼

音频基础 — PCM·帧·重采样

VAD 与话轮转换 — 语音结束判定与插话

流式 ASR — 部分结果·最终结果·WER

LLM 响应流式输出与首 token 延迟

语音查询的 RAG — 改写·拒答阈值·引用校验

智能体工作流 — 工具·确认·重试·转人工

流式 TTS — 分句与首个声音延迟

延迟预算 — 让流水线重叠运行

评估与可观测性 — 质量·失败率·SLO·关卡

安全 — 通过语音进来的注入与个人信息

参考文档