Latest notes

최근 글

모든 글 보기

LLM 추론의 나침반, 프로세스 보상 모델 PRM

추론 연산량을 늘리는 것만으로는 충분하지 않다. PRM이 추론 단계를 평가하고 Best-of-N 후보를 다시 정렬하며 탐색 경로를 고르는 원리를 살펴본다.