테스트 시간 확장은 모델이 실제로 질문에 답할 때 더 많은 추론 예산, 더 많은 시도 또는 사고 공간을 부여하는 것으로 이해할 수 있으며, 그 대가로 더 나은 결과를 얻습니다. 이 방법이 인기가 많은 이유는 많은 사람들이 모델의 능력이 훈련 시점의 크기뿐만 아니라 "순간에 답하고 일정 기간 계산할 의지가 있는지"에 달려 있다는 것을 발견했기 때문입니다.
무엇이 팽창하는 걸까요?
- 모델이 너무 빨리 결론에 도달하지 않도록 추론 단계가 더 길어질 수 있습니다.
- 여러 번 샘플링하고, 여러 후보 경로를 선택하고, 더 나은 경로를 선택하는 경우일 수 있습니다.
- 또한 모델이 생각하는 대로 오류를 수정하기 위한 외부 도구, 검증기 또는 자가 점검일 수도 있습니다.
이것이 전통적인 "힙 파라미터"와 왜 다른가요?
전통적인 아이디어는 훈련 중에 모델을 더 크게 만드는 것과 비슷합니다; 테스트 시간 확장은 기존 모델의 잠재력을 억제하기 위해 추론 단계에서 더 많은 연산 능력을 사용하는 방법에 관한 것입니다. 이는 훈련 대체물은 아니지만, 단순한 질문 답변에서는 비슷하지만 복잡한 추론에서는 뒤처지는 왜 어떤 모델이 왜 비슷한지에 대한 현실적인 판단에 영향을 준다.
그 가치와 비용
| 장점 | 비용 |
|---|---|
| 복잡한 질문은 보통 더 안정적입니다 | 더 느리고 비용도 더 비싸요 |
| 자기 성찰이 더 쉽습니다 | 추론 링크는 제어가 더 어렵습니다 |
| 중간 모델을 약간 '끌어올릴' 수 있습니다 | 모든 질문이 가치 있다는 뜻은 아닙니다 |
따라서 테스트 시간 스케일링이 매우 인기가 있는 이유는 모두가 갑자기 대형 모델을 좋아하지 않아서가 아니라, 업계가 더 심각한 문제에 직면하기 시작했기 때문입니다: 능력은 단순히 훈련되는 것뿐만 아니라 "조금 더 많은 컴퓨팅 파워와 시간을 조금 더 쓸 수 있다"는 논리적 판단입니다. 그래서 '조금 더 생각하면 모델이 강해진다'는 말이 마법처럼 들리지만, 실제로는 점점 더 공동적으로 변하고 있습니다.