GLM-5.3-Flash를 Jev와 유사한 의사결정 모델로 전환하기

1 week ago 13

GLM-5.3-Flash를 미세조정하지 않고, 한 번의 순전파로 사전 정의된 선택지 중 하나를 고르고 각 선택지의 확률까지 얻는 방식을 구현함 프롬프트에 선택지 번호를 넣고 응답을 choice_index:까지 미리 채운 뒤, 다음 위치의 토큰 확률을 선택지별로 정규화함으로써 JSON 전체를 생성하는 과정을 생략함 공개 텍스트 데이터셋 28개에서 Jev와 정확도가 비슷했으며, 데이터셋별 정확도 차이의 중앙값은 Jev가 0.7%p 앞섰지만 통계적으로 유의하지 않았음 지연 시간은 접속 지역에 따라 우열이 바뀌었고, 결정 100만 건의 정가 기준 비용은 GLM-5.3-Flash 약 62유로, Jev 약 16유로로 Jev가 더 낮았음 텍스트 전용인 Jev와 Laya와 달리 이미지 입력도 처리하며 스캔 문서 분류 정확도는 70.2%였음. 다만 선택지가 많으면 요청을 나눠야 하고, 단일 토큰으로 표현할 수 있는 선택지 수도 제한됨 정형 의사결정이 필요한 이유 티켓을 어느 팀에 배정할지, 계약 조항이 책임 관련 항목에 속하는지 같은 질문은 사전 정의된 선택지와 JSON 같은 정해진 출력 형식을 요구함 일반 LLM도 적절한 지시를 받으면 이런 응답을 대체로 안정적으로 생성하지만, 결정마다 JSON 전체를 작성하고 추론 모델은 그 전에 수백 토큰을 사용할 수 있어 속도와 비용이 문제가 됨 별도로 요청하지 않으면 모델의 확신도도 알 수 없음 이런 제약은 대량 처리와 높은 처리량이 필요한 의사결정에 LLM을 적용하는 데 걸림돌이 됨 TypeSafe의 Jev와 Laya 같은 System One 모델은 상태와 이름이 붙은 선택지를 받아, 선택 결과와 각 선택지의 확률을 반환하도록 설계됨 한 번의 순전파로 선택지 확률 얻기 LLM은 텍스트를 직접 쓰는 대신 전체 어휘에 대한 다음 토큰 확률 분포를 출력함. 일반적인 생성은 토큰을 고르고 프롬프트에 추가하는 과정을 반복하지만, 출력 JSON의 형태를 이미 안다면 필요한 것은 입력에 대한 선택뿐임 이 구현은 목적에 맞게 학습한 Jev나 Laya와 달리 미세조정 없이 출하된 모델 그대로 사용함 상태, 질문, 선택지를 JSON으로 넣고 각 선택지에 번호를 붙인 뒤, choice_index: 다음에 번호로 답하도록 지시함 프롬프트를 미리 작성한 assistant 응답 choice_index:로 끝내 다음 토큰이 선택지 번호가 되도록 함 생성된 토큰 하나만 읽는 대신 해당 위치에서 모든 선택지 번호...

Read Entire Article