<?xml version="1.0" encoding="utf-8" standalone="yes"?>
<rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom" xmlns:content="http://purl.org/rss/1.0/modules/content/">
  <channel>
    <title>Llm-as-Judge on 노준탁 — AI 노트</title>
    <link>https://ai.klavierhye.cc/ko/tags/llm-as-judge/</link>
    <description>Recent content in Llm-as-Judge on 노준탁 — AI 노트</description>
    <generator>Hugo -- 0.147.7</generator>
    <language>ko</language>
    <lastBuildDate>Tue, 01 Sep 2026 00:00:00 +0000</lastBuildDate>
    <atom:link href="https://ai.klavierhye.cc/ko/tags/llm-as-judge/index.xml" rel="self" type="application/rss+xml" />
    <item>
      <title>평가 지표가 아키텍처를 골랐다: 정답지 기반 QA가 Guardrail에 점수를 몰아준 방식</title>
      <link>https://ai.klavierhye.cc/ko/posts/llm-eval-metric-chose-architecture/</link>
      <pubDate>Tue, 01 Sep 2026 00:00:00 +0000</pubDate>
      <guid>https://ai.klavierhye.cc/ko/posts/llm-eval-metric-chose-architecture/</guid>
      <description>&lt;p&gt;&lt;em&gt;이 글은 한국어 전화 Voice Agent 현장 노트 7부작 중 &lt;strong&gt;6부&lt;/strong&gt;다. 내가 리드했던 프로젝트 — 공공 서비스 전화 상담용 실시간 한국어 voice agent(STT → LLM → TTS) — 를 만들면서 겪은 일을 정리한다. STT 평가 → Rule vs 모델 → Latency → 조용한 실패 → Guardrail → &lt;strong&gt;평가 지표&lt;/strong&gt; → 단순화. &lt;a href=&#34;https://ai.klavierhye.cc/ko/posts/how-guardrails-pile-up/&#34;&gt;5부&lt;/a&gt;에서는 실패한 QA row 하나마다 dialog layer에 규칙이 하나씩 쌓인 과정을 다뤘다. 이번 글은 그 규칙들에 계속 점수를 몰아준 평가 이야기다.&lt;/em&gt;&lt;/p&gt;</description>
    </item>
  </channel>
</rss>
