Jeeves는 Qwen3.5-9B에 LoRA와 포인터 헤드를 결합하고, SFT와 CISPO로 판단 전에 추론하도록 학습한 의사결정 분류 모델임 추론 사용 시 테스트 종합 정확도 0.889, JevBench 공개 문항 정확도 0.935를 기록함. 다만 JevBench 이외의 Kev/Jev 비교는 같은 데이터 출처의 서로 다른 문항을 사용함 Jev 호환 API로 예/아니요(noul), 객관식(choice), 평점(score) 질문을 한 요청에서 처리하며, 선택지별 확률과 선택적인 추론 텍스트를 반환함 확산 드래프터(diffusion drafter) 로 추론 생성을 가속하며, H100 한 대에서 추론 미사용 요청은 약 0.3초, 전체 추론 사용 시 지연 중앙값은 3.3초임. 추론 길이와 신뢰도 임계값으로 속도와 정확도를 조절할 수 있음 9B 가중치, 전체 학습 코드, 학습/개발/테스트 데이터를 제공함. 지식 질문 성능은 Jev보다 낮고, 긴 추론의 꼬리 지연과 추론 텍스트의 해석 가능성에 한계가 있음 해결하려는 문제와 모델 구성 Jev 계열 모델은 보정된 의사결정 확률을 제공하지만 정확도가 낮아, 많은 파이프라인이 추론 모델을 대체 수단으로 사용함 Jeeves는 Qwen3.5-9B, LoRA, 포인터 헤드를 결합한 모델에 CISPO를 적용해 판단 전에 추론하도록 학습함 학습 도메인 밖의 과제에서 성능을 개선하고, JevBench 공개 hard 문항에서 Jev를 앞섬 Kev에서 영감을 얻었으며, Jev의 아키텍처를 따름 9B 가중치와 전체 학습 코드 및 데이터를 공개하며, 저장소 라이선스는 MIT 임 공개 데이터셋은 각각의 원래 라이선스를 따름 평가 결과와 비교 조건 주요 비교는 추론 사용, 탐욕적 디코딩, 최대 2,560토큰 조건의 정확도이며, Kev-9B와 Jev 수치는 Kev가 공개한 결과를 사용함 학습 도메인 밖 문항과 별도 보류 문항을 문항 수로 가중한 테스트 종합 점수는 Jeeves 0.889, Kev-9B 0.822, Jev 0.857임 MMLU-Pro와 buried state를 묶은 전이 평가에서는 Jeeves 0.746, Kev-9B 0.579, Jev 0.800임 JevBench 공개 231문항에서는 Jeeves 0.935, Jev 0.866, Kev-8B 0.715를 기록함 공개 hard 111문항에서는 각각 0.865, 0.730, 0.451임 공개 문항의 ECE는 Jeeves 0.037, Jev...
Jeeves - 추론으로 Jev 계열 의사결정 모델 개선하기
5 hours ago
3
Related
AI, 데이터센터 투자 붐 정당화하려면 연 매출 6조 달러 필요
33 minutes ago
0
PS5 Relapse 익스플로잇
36 minutes ago
0
Google, ChromeOS 지원을 2년 일찍 종료
39 minutes ago
0
Tcl/Tk 9.1
42 minutes ago
0
DevDay 2026 총정리
56 minutes ago
1
1993년에 부팅한 서버, 아직 가동 중이지만 은퇴가 머지않음 (2017)
2 hours ago
0
전 세계 암 8건 중 1건은 감염이 원인이라는 연구 결과
3 hours ago
2
DraftKings, AI로 상습 도박 이용자를 행동 기반 타기팅
3 hours ago
2
Tips
click
Popular
손흥민 선제골 발판·골대 불운…LAFC, 7경기 만에 승리
2 weeks ago
54
[르포] '더 똑똑해진 전동 칫솔' 다이슨, 카메라젯 첫 공개···AI 탑재로 또 한 번 혁신
4 weeks ago
44
OpenAI 에이전트들이 RubyGems에 공개되지 않은 공격을 수행함
2 weeks ago
44
© Clint IT 2026. All rights are reserved






English (US) ·