버려진 후보 하나가 −8.6%p를 뒤집었다: SELF-POT 테스트타임 스케일링 리뷰
저가 모델에 테스트타임 연산을 더해 고가 모델을 따라잡을 수 있다는 서사를, 5개 모델·4개 도메인에 걸친 비용-정확도 통제 실험으로 검증했습니다.
- 코딩 Parallel@4의 정답 제출은 500개 예정 셀 기준 376건(−8.6%p)이었지만, 선택 실패 시 후보를 버리지 않는 규칙만 적용하자 437건(+3.6%p), 공개 예제 선택으로 바꾸면 453건(+6.8%p)까지 올랐습니다(비용은 모델별 12~49% 절감).
- 같은 저가 모델 5종·같은 예산 배수라도 효과는 도메인마다 반대 방향이었습니다 — 수학 Parallel@4 평균 +4.0%p(95% 구간 [+0.3,+7.7]), 코딩 −8.6%p([−11.8,−5.4]), 워크플로 −4.6%p([−7.4,−1.9]).
- 워크플로·터미널에서는 Claude Opus 5.5의 1회 응답(Direct)이 저가 모델의 모든 테스트타임 기법을 압도했습니다(워크플로 148/160 대 최고 78/160, 터미널 13/30 대 최고 3/30).
























































