Jev는 텍스트를 생성하지 않고 고정된 선택지별 확률을 반환하는 모델로, 약 1만 6,000회 호출한 평가에서는 기존 분류기를 대체하기보다 확신도 기반 필터로 쓸 때 유용했음 공개 데이터셋 4개 중 3개에서 gpt-5.4-mini와 gpt-5.6-luna에 비슷하거나 높은 정확도를 보였으며, 선택지별 확률을 요구한 조건에서 비용은 5~56배 저렴하고 지연시간 중앙값은 1초 미만이었음 짧은 입력과 명확한 레이블에는 강하지만, 긴 문서나 모호한 레이블, 업무 규칙을 해석해야 하는 질문에서는 정확도와 확신도가 함께 떨어졌음 실제 문서 파이프라인에서는 낮은 확률의 페이지를 먼저 제외해 최종 출력을 유지하면서 호출량을 줄였음. 반면 이메일에서는 실제 요청을 확신 있게 거절하는 사례가 있어 유용한 무손실 임계값을 찾지 못했음 확률의 양 끝 구간만 직접 처리하고 중간 구간은 기존 모델에 넘기는 방식이 적합하며, 임계값은 자체 정답 데이터로 설정하고 별도 데이터로 검증해야 함 Jev의 출력 방식과 평가 조건 TypeSafe는 9월 15일 Jev의 얼리 액세스를 시작함 출시 당시 비교 대상은 텍스트를 생성하는 프런티어 모델이었지만, 실제 파이프라인의 반복 분류는 대체로 소형 고속 모델이 담당함 이번 평가는 그에 맞춰 gpt-5.4-mini와 gpt-5.6-luna를 비교 대상으로 삼고, 이틀 동안 약 1만 6,000회 호출함 Jev는 텍스트를 생성하지 않으며, 입력 텍스트와 고정된 답변 후보를 받아 각 답변의 확률을 반환함 choice는 최대 255개 선택지를 지원하고, 선택 결과와 선택지별 확률, confidence를 반환함 TypeSafe가 예/아니요 질문에 붙인 이름인 noul은 예일 확률 하나를 반환하므로, 0.05는 확신 있는 아니요, 0.95는 확신 있는 예에 해당함 한 번의 호출에 여러 질문을 담을 수 있음 영화 리뷰 감성 분류 예제에서 jev-latest의 실제 응답 모델은 jev-1.13.0 이었음 입력은 336토큰이며, 노트북에서 측정한 응답시간은 850ms, 비용은 0.000014달러였음 입력 가격은 100만 토큰당 0.042달러이며, 출력 토큰이 없어 출력 비용도 없음 confidence의 계산 방식은 비공개이며, 가장 높은 선택지 확률과도 다름 예제에서는 선택지 확률이 0.97인데 confidence는 0.93이었음 공개 데이터셋에서 최고 확률로 필터링해도 결과 차이는 1%포인트 이내였음 평가상 ‘확신 ...
공개 및 비공개 데이터로 Jev 테스트하기: 분류기인가, 필터인가?
2 weeks ago
17
Related
Show GN: 해외 직구한 내 소포, 어디쯤 있을까요?
34 minutes ago
0
x32에서 실행한 Janet: 32비트 포인터, 64비트 속도, RAM 25% 절감
58 minutes ago
2
노트북 도둑과 함께 일했던 때 (2025)
1 hour ago
2
D2Coding 폰트 1.4.0 릴리즈 소식을 전합니다.
2 hours ago
3
FE News 26년 10월 소식을 전해드립니다.
2 hours ago
3
자율주행 데이터에서 시간은 어떻게 맞춰지는가
2 hours ago
3
2026년 개발자 현황
2 hours ago
4
Strands Decider 2B - 소형 오픈소스 의사결정 모델
3 hours ago
3
Tips
click
Popular
프로들도 줄지어 샷 점검… KLPGA 스타 사랑방 된 더헤븐CC 연습장
2 weeks ago
73
iOS 27, iPadOS 27, macOS 27
3 weeks ago
69
손흥민 선제골 발판·골대 불운…LAFC, 7경기 만에 승리
3 weeks ago
65
영림원소프트랩, 나람 통합 ERP 구축…사료 제조·물류·회계 데이터 하나로
2 weeks ago
62
'이 악문' 김영범, 자유형 50m '대회 신기록' 금메달
2 weeks ago
56
Accelerate your SAP modernization with Kiro
1 week ago
55
© Clint IT 2026. All rights are reserved









English (US) ·