Search
LLM Judge는 하나의 대형 모델을 심판으로 세워 다른 모델의 출력 품질을 평가하는 방식이다. 평가 기준을 프롬프트로 넘겨 주면 모델이 그 기준에 따라 점수를 매긴다. 정확한가, 빠진 내용은 없는가, 요구사항을 지켰는가 같은 항목을 판정한다.
위치 편향(Position Bias)
길이 편향(Length Bias)
# 채점 기준 설명 답변의 품질은 길이와 무관하다 채점 원칙 간결하고 정확한 답변 -> 높은 점수 장황하고 늘어지는 답변 -> 낮은 점수
자기 선호(Self-preference Bias)
문체 편향(Style Bias)
지식 경계(Knowledge Boundary)