<?xml version="1.0" encoding="utf-8" standalone="yes"?>
<rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom" xmlns:content="http://purl.org/rss/1.0/modules/content/">
  <channel>
    <title>Text-Normalization on 노준탁 — AI 노트</title>
    <link>https://ai.klavierhye.cc/ko/tags/text-normalization/</link>
    <description>Recent content in Text-Normalization on 노준탁 — AI 노트</description>
    <generator>Hugo -- 0.147.7</generator>
    <language>ko</language>
    <lastBuildDate>Tue, 09 Jun 2026 00:00:00 +0000</lastBuildDate>
    <atom:link href="https://ai.klavierhye.cc/ko/tags/text-normalization/index.xml" rel="self" type="application/rss+xml" />
    <item>
      <title>LLM에게 숫자 읽기를 맡기지 마라: Voice Pipeline에서 Rule이 모델을 이기는 곳</title>
      <link>https://ai.klavierhye.cc/ko/posts/dont-let-the-llm-read-numbers/</link>
      <pubDate>Tue, 09 Jun 2026 00:00:00 +0000</pubDate>
      <guid>https://ai.klavierhye.cc/ko/posts/dont-let-the-llm-read-numbers/</guid>
      <description>&lt;p&gt;&lt;em&gt;이 글은 한국어 전화 Voice Agent 현장 노트 7부작 중 &lt;strong&gt;2부&lt;/strong&gt;다. 내가 리드했던 프로젝트 — 공공 서비스 전화 상담용 실시간 한국어 voice agent(STT → LLM → TTS) — 를 만들면서 겪은 일을 정리한다. &lt;a href=&#34;https://ai.klavierhye.cc/ko/posts/stt-eval-real-calls/&#34;&gt;1부&lt;/a&gt;에서는 STT 평가가 나를 어떻게 속였는지를 다뤘다. 이번에는 LLM을 둘러싼 텍스트 이야기다: 들어오고 나가는 숫자, STT가 &lt;em&gt;거의&lt;/em&gt; 맞게 듣는 이름, 그리고 LLM 호출이 latency를 감수할 만한 자리.&lt;/em&gt;&lt;/p&gt;
&lt;hr&gt;
&lt;p&gt;3월의 어느 금요일 새벽 2시 17분, TTS normalizer 버그 하나를 고쳤다. 27,000원 같은 금액을 &amp;ldquo;이, 칠, 공, 공, 공 원&amp;quot;처럼 한 자리씩 읽어 버리는 버그였다. 그리고 30분쯤 뒤, 한국어 숫자 읽는 rule을 손으로 짜는 건 그만두고 그 일을 LLM에게 넘겼다. 어차피 한국어는 내 regex보다 LLM이 더 잘하니까. (새벽 세 시를 앞둔 사람의 논리였다.)&lt;/p&gt;</description>
    </item>
  </channel>
</rss>
