더 큰 모델이 더 빨리 답했다: 실시간 Voice Agent의 Latency 교훈
이 글은 한국어 전화 Voice Agent 현장 노트 7부작 중 3부다. 내가 리드했던 프로젝트 — 공공 서비스 전화 상담용 실시간 한국어 voice agent(STT → LLM → TTS) — 를 만들면서 겪은 일을 정리한다. 1부는 STT 평가가 나를 어떻게 속였는지, 2부는 rule이 모델을 이기는 지점을 다뤘다. 이번 글은 latency 이야기다: 시간이 어디로 새고 있었는지, 그리고 실제로 효과가 있었던 처방이 왜 거의 한 번도 “더 작은 모델 쓰기"가 아니었는지. 첫 latency 작업에 들어가기 전, 응답 하나가 end-to-end로 평균 4.5초 걸렸다. 전화에서 4.5초는 “느리다"가 아니라 “고장 났다"로 들린다. 그 정도 침묵이면 발신자는 전화가 끊겼나 싶어 “여보세요?“를 하고, 하필 agent가 막 대답을 시작하는 순간에 말이 겹친다. ...