Jeeves - 추론으로 Jev 계열 의사결정 모델 개선하기

5 hours ago 3

Jeeves는 Qwen3.5-9B에 LoRA와 포인터 헤드를 결합하고, SFT와 CISPO로 판단 전에 추론하도록 학습한 의사결정 분류 모델임 추론 사용 시 테스트 종합 정확도 0.889, JevBench 공개 문항 정확도 0.935를 기록함. 다만 JevBench 이외의 Kev/Jev 비교는 같은 데이터 출처의 서로 다른 문항을 사용함 Jev 호환 API로 예/아니요(noul), 객관식(choice), 평점(score) 질문을 한 요청에서 처리하며, 선택지별 확률과 선택적인 추론 텍스트를 반환함 확산 드래프터(diffusion drafter) 로 추론 생성을 가속하며, H100 한 대에서 추론 미사용 요청은 약 0.3초, 전체 추론 사용 시 지연 중앙값은 3.3초임. 추론 길이와 신뢰도 임계값으로 속도와 정확도를 조절할 수 있음 9B 가중치, 전체 학습 코드, 학습/개발/테스트 데이터를 제공함. 지식 질문 성능은 Jev보다 낮고, 긴 추론의 꼬리 지연과 추론 텍스트의 해석 가능성에 한계가 있음 해결하려는 문제와 모델 구성 Jev 계열 모델은 보정된 의사결정 확률을 제공하지만 정확도가 낮아, 많은 파이프라인이 추론 모델을 대체 수단으로 사용함 Jeeves는 Qwen3.5-9B, LoRA, 포인터 헤드를 결합한 모델에 CISPO를 적용해 판단 전에 추론하도록 학습함 학습 도메인 밖의 과제에서 성능을 개선하고, JevBench 공개 hard 문항에서 Jev를 앞섬 Kev에서 영감을 얻었으며, Jev의 아키텍처를 따름 9B 가중치와 전체 학습 코드 및 데이터를 공개하며, 저장소 라이선스는 MIT 임 공개 데이터셋은 각각의 원래 라이선스를 따름 평가 결과와 비교 조건 주요 비교는 추론 사용, 탐욕적 디코딩, 최대 2,560토큰 조건의 정확도이며, Kev-9B와 Jev 수치는 Kev가 공개한 결과를 사용함 학습 도메인 밖 문항과 별도 보류 문항을 문항 수로 가중한 테스트 종합 점수는 Jeeves 0.889, Kev-9B 0.822, Jev 0.857임 MMLU-Pro와 buried state를 묶은 전이 평가에서는 Jeeves 0.746, Kev-9B 0.579, Jev 0.800임 JevBench 공개 231문항에서는 Jeeves 0.935, Jev 0.866, Kev-8B 0.715를 기록함 공개 hard 111문항에서는 각각 0.865, 0.730, 0.451임 공개 문항의 ECE는 Jeeves 0.037, Jev...

Read Entire Article