공개 및 비공개 데이터로 Jev 테스트하기: 분류기인가, 필터인가?

2 weeks ago 17

Jev는 텍스트를 생성하지 않고 고정된 선택지별 확률을 반환하는 모델로, 약 1만 6,000회 호출한 평가에서는 기존 분류기를 대체하기보다 확신도 기반 필터로 쓸 때 유용했음 공개 데이터셋 4개 중 3개에서 gpt-5.4-mini와 gpt-5.6-luna에 비슷하거나 높은 정확도를 보였으며, 선택지별 확률을 요구한 조건에서 비용은 5~56배 저렴하고 지연시간 중앙값은 1초 미만이었음 짧은 입력과 명확한 레이블에는 강하지만, 긴 문서나 모호한 레이블, 업무 규칙을 해석해야 하는 질문에서는 정확도와 확신도가 함께 떨어졌음 실제 문서 파이프라인에서는 낮은 확률의 페이지를 먼저 제외해 최종 출력을 유지하면서 호출량을 줄였음. 반면 이메일에서는 실제 요청을 확신 있게 거절하는 사례가 있어 유용한 무손실 임계값을 찾지 못했음 확률의 양 끝 구간만 직접 처리하고 중간 구간은 기존 모델에 넘기는 방식이 적합하며, 임계값은 자체 정답 데이터로 설정하고 별도 데이터로 검증해야 함 Jev의 출력 방식과 평가 조건 TypeSafe는 9월 15일 Jev의 얼리 액세스를 시작함 출시 당시 비교 대상은 텍스트를 생성하는 프런티어 모델이었지만, 실제 파이프라인의 반복 분류는 대체로 소형 고속 모델이 담당함 이번 평가는 그에 맞춰 gpt-5.4-mini와 gpt-5.6-luna를 비교 대상으로 삼고, 이틀 동안 약 1만 6,000회 호출함 Jev는 텍스트를 생성하지 않으며, 입력 텍스트와 고정된 답변 후보를 받아 각 답변의 확률을 반환함 choice는 최대 255개 선택지를 지원하고, 선택 결과와 선택지별 확률, confidence를 반환함 TypeSafe가 예/아니요 질문에 붙인 이름인 noul은 예일 확률 하나를 반환하므로, 0.05는 확신 있는 아니요, 0.95는 확신 있는 예에 해당함 한 번의 호출에 여러 질문을 담을 수 있음 영화 리뷰 감성 분류 예제에서 jev-latest의 실제 응답 모델은 jev-1.13.0 이었음 입력은 336토큰이며, 노트북에서 측정한 응답시간은 850ms, 비용은 0.000014달러였음 입력 가격은 100만 토큰당 0.042달러이며, 출력 토큰이 없어 출력 비용도 없음 confidence의 계산 방식은 비공개이며, 가장 높은 선택지 확률과도 다름 예제에서는 선택지 확률이 0.97인데 confidence는 0.93이었음 공개 데이터셋에서 최고 확률로 필터링해도 결과 차이는 1%포인트 이내였음 평가상 ‘확신 ...

Read Entire Article