나만의 의사결정 모델 만들기

1 hour ago 2

LLM의 출력을 고정된 선택지 토큰으로 제한하면 한 번의 순전파로 답을 선택하는 의사결정 모델을 구현할 수 있음 출력 제약은 선택지 밖의 응답을 막지만 정답을 보장하지 않으며, 토큰 확률도 추가 학습 없이는 실제 정답 확률과 다를 수 있음 Qwen/Qwen3-1.7B로 구현한 모델은 CommonsenseQA 홀드아웃 평가에서 정확도 59.38%를 기록했고, 간단한 미세 조정 후 62.41%로 높아짐 모델은 모호한 질문에도 높은 확률을 부여했으며, 평가에서 평균 신뢰도 98.55% 인 구간의 실제 정확도는 70.09%에 그침 온도 스케일링으로 확률 분포를 완만하게 조정해 신뢰도와 정확도의 차이를 줄였으며, 데이터셋 구성부터 평가, 미세 조정, 보정까지 실험할 수 있는 스크립트를 공개함 고정 선택지로 한 번에 답 선택하기 System one 의사결정 모델은 허용된 각 답에 대해 보정된 확률을 추론하고 반환하는 모델임 일반적인 언어 모델은 구조화된 출력으로 유효한 JSON을 보장할 수 있지만, 입력을 한 번에 프리필한 뒤에도 응답 토큰마다 순전파를 수행해야 함 하늘 색을 묻는 예시에서 최종 JSON 출력까지 11번의 순전파가 필요함 이 비교에서는 추측 디코딩과 기타 추론 최적화 기법을 고려하지 않음 Jev 같은 의사결정 모델은 선택지가 고정되어 있다는 전제로 한 번의 순전파에서 답을 고름 가능한 출력을 A, B, C, D, E로 제한하고, 어휘의 나머지 토큰을 마스킹함 허용된 토큰 중 확률이 가장 높은 것을 답으로 선택함 선택지 제한과 정답 여부는 별개임 모델이 선택지 밖의 답을 내지 못하게 할 뿐, 선택한 답이 맞다고 보장하지는 않음 출력 토큰 확률을 신뢰도 점수로 쓰기도 하지만, 추가 학습 없이는 정답 확률보다 다음 토큰에 대한 확신을 반영할 가능성이 큼 Qwen으로 구현하고 평가하기 Qwen/Qwen3-1.7B 와 PyTorch, Transformers를 사용해 출력 토큰을 제한하는 동작을 구현함 질문과 다섯 선택지, Answer:를 프롬프트로 구성하고 채팅 템플릿에서 enable_thinking=False로 설정함 각 선택지의 토큰 ID를 구한 뒤, 한 번의 모델 실행에서 마지막 위치의 로짓만 가져옴 선택지 토큰의 로짓에만 소프트맥스(softmax)를 적용하고, 최댓값을 가진 선택지와 각 선택지의 확률을 출력함 하늘 색 질문에서는 B: Blue를 선택해 타당한 답을 냄 선택지는 Red, Blue, Green,...

Read Entire Article