Archive · 01

생각과 경험을
글로 정리합니다.

문제를 해결한 결과보다, 어떤 질문과 기준으로 선택했는지를 남깁니다.

LLM 추론의 나침반, 프로세스 보상 모델 PRM

추론 연산량을 늘리는 것만으로는 충분하지 않다. PRM이 추론 단계를 평가하고 Best-of-N 후보를 다시 정렬하며 탐색 경로를 고르는 원리를 살펴본다.