<?xml version="1.0" encoding="utf-8" standalone="yes"?>
<rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom" xmlns:content="http://purl.org/rss/1.0/modules/content/">
  <channel>
    <title>Tensorrt on 노준탁 — AI 노트</title>
    <link>https://ai.klavierhye.cc/ko/tags/tensorrt/</link>
    <description>Recent content in Tensorrt on 노준탁 — AI 노트</description>
    <generator>Hugo -- 0.147.7</generator>
    <language>ko</language>
    <lastBuildDate>Tue, 30 Jun 2026 00:00:00 +0000</lastBuildDate>
    <atom:link href="https://ai.klavierhye.cc/ko/tags/tensorrt/index.xml" rel="self" type="application/rss+xml" />
    <item>
      <title>더 큰 모델이 더 빨리 답했다: 실시간 Voice Agent의 Latency 교훈</title>
      <link>https://ai.klavierhye.cc/ko/posts/bigger-model-faster-voice-latency/</link>
      <pubDate>Tue, 30 Jun 2026 00:00:00 +0000</pubDate>
      <guid>https://ai.klavierhye.cc/ko/posts/bigger-model-faster-voice-latency/</guid>
      <description>&lt;p&gt;&lt;em&gt;이 글은 한국어 전화 Voice Agent 현장 노트 7부작 중 &lt;strong&gt;3부&lt;/strong&gt;다. 내가 리드했던 프로젝트 — 공공 서비스 전화 상담용 실시간 한국어 voice agent(STT → LLM → TTS) — 를 만들면서 겪은 일을 정리한다. &lt;a href=&#34;https://ai.klavierhye.cc/ko/posts/stt-eval-real-calls/&#34;&gt;1부&lt;/a&gt;는 STT 평가가 나를 어떻게 속였는지, &lt;a href=&#34;https://ai.klavierhye.cc/ko/posts/dont-let-the-llm-read-numbers/&#34;&gt;2부&lt;/a&gt;는 rule이 모델을 이기는 지점을 다뤘다. 이번 글은 latency 이야기다: 시간이 어디로 새고 있었는지, 그리고 실제로 효과가 있었던 처방이 왜 거의 한 번도 &amp;ldquo;더 작은 모델 쓰기&amp;quot;가 아니었는지.&lt;/em&gt;&lt;/p&gt;
&lt;hr&gt;
&lt;p&gt;첫 latency 작업에 들어가기 전, 응답 하나가 end-to-end로 평균 &lt;strong&gt;4.5초&lt;/strong&gt; 걸렸다. 전화에서 4.5초는 &amp;ldquo;느리다&amp;quot;가 아니라 &amp;ldquo;고장 났다&amp;quot;로 들린다. 그 정도 침묵이면 발신자는 전화가 끊겼나 싶어 &amp;ldquo;여보세요?&amp;ldquo;를 하고, 하필 agent가 막 대답을 시작하는 순간에 말이 겹친다.&lt;/p&gt;</description>
    </item>
  </channel>
</rss>
