Show GN: oh-my-jev - Jev-Style 판단 모델을 벤치마크하고 테스트하고 직접 파인튜닝까지 가능한 오픈소스 도구

5 days ago 13

소개

  • 판단 모델이란 "어느 팀으로 보낼까", "규정 위반인가" 같은 정해진 질문에 문장 대신 선택지별 확률로 답하는 모델임. TypeSafe의 Jev가 대표적이고, 공개 이후 오픈 복제 모델이 빠르게 늘어남
  • oh-my-jev는 이런 모델을 한곳에서 서빙, 비교, 학습하는 CLI와 웹 UI임(Apache-2.0)

주요 기능

  • omj serve: 로컬 오픈 가중치, 원격 API, mock 위에 TypeSafe 호환 /v1/systemone 엔드포인트를 띄움. 공식 SDK에서 base_url만 바꾸면 연결됨
  • omj bench: 정확도와 함께 보정(ECE, Brier, 위험 5% 기준 커버리지), 95% 신뢰구간, 태그별 약점을 보고함. 모든 결과를 Jev 1.13과 나란히 비교함
  • omj train: JSONL 파일 하나와 TOML 레시피로 LoRA/QLoRA 미세조정. 레이블 한정 교차엔트로피에 Brier 항을 더해 보정까지 학습함
  • omj ui: 같은 상황을 여러 모델에 보내 확률과 임계값 정책 판정을 비교하는 웹 플레이그라운드, 실행 리포트 화면
  • 로컬 모델은 선택지 레이블 로짓을 순전파 1회로 읽음. 문장을 생성하지 않음
  • mock 백엔드가 있어 GPU나 API 키 없이 모든 명령을 먼저 돌려 볼 수 있음

내장 벤치마크

  • JevBench 공개 231문항, MASSIVE 1.1 한국어/영어 고정 표본(한영 격차 측정), 분포 밖 holdout, 정답 없는 문항(과신 측정), 선택지 순서 견고성

참고

  • Windows 11, Linux에서 확인(Linux 테스트 594건 통과). macOS는 미검증
  • TypeSafe AI와 제휴하거나 보증받은 프로젝트가 아님. 호환 인터페이스를 구현한 독립 프로젝트임
  • 모델: https://huggingface.co/corners-ai/CoCo-Decision-4B-Ko
Read Entire Article