ToolNavs 유용한 AI 도구 찾기
도구 제출 로그인
돌아가기 AI 백과사전
퍼플렉시티란? 숫자가 낮을수록 모델이 정말 더 잘 답할까

퍼플렉시티란? 숫자가 낮을수록 모델이 정말 더 잘 답할까

AI 백과사전 • Admin • • 6 회 조회

퍼플렉시티, 즉 혼란도는 언어 모델이 다음 단어를 얼마나 확신하지 못하는지를 나타내는 숫자입니다. 문장을 이어 쓸 때 실제로 등장한 단어에 모델이 놀랄수록 수치는 높아지고, 당연하게 느낄수록 낮아집니다. 제조사들은 새 모델의 사양표에 이 숫자를 즐겨 넣지만, 이것은 모델의 지능 성적표가 아닙니다. 답하는 질문이 아주 좁다는 점을 이해하는 것이 숫자 자체보다 중요합니다.

계산 방식은 직관으로만

모델은 단어를 쓸 때마다 어휘 후보들에 확률을 배분합니다. 자신 있을수록 소수의 후보에 높은 확률을 몰아줍니다. 테스트는 훈련에 쓰지 않은 텍스트를 주고, 실제로 등장한 단어에 얼마나 높은 확률을 줬는지를 확인하는 방식입니다. 실제 단어가 계속 높은 확률을 받으면 그 종류의 텍스트에 익숙하다는 뜻이고 혼란도는 낮아집니다. 훈련에서 쓰는 교차 엔트로피 손실과 같은 것의 다른 표현이며, 공식은 필요 없습니다. 혼란도란 한 걸음마다 평균 몇 개의 그럴듯한 선택지 사이에서 갈등하는지를 나타낸다고 보면 됩니다.

전제도 중요합니다. 혼란도는 고정된 텍스트 위에서 재야 의미가 있습니다. 소설과 코드는 전혀 다른 시험이고, 정돈되고 반복이 많은 글일수록 숫자가 예뻐집니다.

낮은 수치가 말하는 것과 말하지 않는 것

말해 주는 것은 그 종류의 텍스트 언어 패턴에 잘 맞고, 흔한 표현을 안정적으로 이어 간다는 점입니다. 같은 모델의 훈련 전후 비교에서는 하락이 곧 숙련의 증거가 됩니다.

말해 주지 않는 것은 질문에 답하는 능력입니다. 혼란도는 추론도, 사실의 정확성도, 자신만만하게 지어내는 경향도 재지 않습니다. 말은 매끄럽고 확률적으로 그럴듯한데 내용은 완전히 틀린 경우가 있습니다. 상투적인 표현에 능한 모델은 좋은 숫자를 내도 검증과 계산과 판단이 필요한 과제에서는 실패합니다.

정확도, 벤치마크 점수와는 다른 것

정확도는 정답이 있는 문제의 맞고 틀림을 세고, 벤치마크는 수학, 코드 같은 구체적 과제의 성적을 봅니다. 혼란도는 언어 차원의 놀라움만 봅니다. 교과서를 유창하게 외우는 학생과 시험에서 고득점하는 학생은 관련이 있지만 서로를 대신할 수는 없습니다.

흔한 세 가지 오해

첫째, 혼란도가 낮을수록 똑똑하다는 오해입니다. 측정된 텍스트 범위 안에서만 성립하고, 분야가 바뀌면 숫자는 달라집니다. 둘째, 서로 다른 모델의 혼란도를 직접 비교할 수 있다는 오해입니다. 토큰화 방식, 테스트 텍스트, 문맥 길이가 다르면 비교가 성립하지 않습니다. 8과 12의 차이는 치른 시험이 달랐기 때문일 수 있습니다. 셋째, 혼란도가 낮으면 답이 믿을 만하다는 오해입니다. 유창함은 정확함이 아닙니다. 널리 퍼진 오류를, 데이터에 자주 등장한다는 이유로 낮은 혼란도로 안정적으로 내놓을 수도 있습니다.

발표 숫자를 읽는 법

어떤 텍스트로 쟀는지, 누구와 비교했는지, 조건이 같았는지를 물어보세요. 같은 테스트 집합에서 자사 이전 세대와 비교한 하락에만 참고 가치가 있습니다. 제조사 간 순위는 의심하고 실제 과제 성과를 확인하세요. 대부분의 사람에게 혼란도는 훈련 품질의 보조 증거일 뿐, 구매나 선택의 결정 요인이 아닙니다. 결국 자기 질문으로 직접 써 보는 것이 답입니다.

추천 도구

더보기