LLM Wiki의 불량 페이지를 Jev로 선별하는 것이 가능할까?

1 week ago 13

■ 요즘 핫한 TypeSafe의 판정 모델 Jev를 LLM Wiki에 접목 Jev는 자연어로 던진 질문에 보정된 확률을 돌려줍니다. "이 페이지에 결함이 있나?" 하고 물으면 0~1 사이 값이 나옵니다. TypeSafe는 Jev를 "지식 업무용 린터"라고 소개했는데, LLM Wiki를 운영 중 마침 그런 게 필요했습니다. AI가 쓴 위키가 커지면 매번 모든 페이지를 다 읽어서 불량 페이지를 선별할 수 없으니, 점수 낮은 의심스러운 것부터 골라 읽으면 전수 검토 없이 불량 페이지를 잡을 수 있지 않을까 싶었습니다. 그래서 저희 두가지 LLM Wiki(비공개·공개)에 Jev를 붙여서 직접 측정해 봤습니다. 결과부터 말씀드리면 Jev가 기대한 역할을 하지 못했습니다. 그런데 왜 역할을 못했는지가 오히려 쓸 만한 교훈이었습니다. ■ [핵심] 점수로 걸러내는 도구는 결함이 '어디에나' 있지도 '아무 데도' 없지도 않은, 중간정도로 결함이 섞여 있을 때 값어치가 있습니다 비공개 위키는 결함 있는 페이지가 약 44%였습니다. 이렇게 흔하면 어차피 다 읽어야 하니 걸러줄 게 없습니다. 공개 위키는 심각한 결함이 6.5%뿐이었습니다. 그런데 자잘한 흠은 거의 모든 페이지에 있고 큰 흠만 드물었습니다. 다들 고만고만하게 지저분하니 점수로 갈라낼 신호가 없습니다. 돌이 섞인 쌀에서 돌을 골라내는 조리질에 빗대면, 쌀에 돌이 절반 이상 섞여 있거나 거의 섞여 있지 않으면 조리가 소용없는 것과 같습니다. 값싼 검사가 아픈 것과 멀쩡한 것을 실제로 갈라줘야 쓸모가 있습니다. ■ 스스로 속지 않으려고 이렇게 쟀습니다 공개 위키에선 무엇을 볼지 미리 못 박아 두고(사전 등록), 라벨러가 점수를 모른 채 결함을 달게 했습니다(블라인드 라벨링). 걸러내는 성능은 AUC로 확인했습니다. 처음엔 신호가 있어 보였습니다. 뜯어보니 코호트 효과였습니다. 점수가 낮은 페이지는 파이프라인이 좋아지기 전의 옛것들이었지, 지금 뽑는 결과물이 아니었습니다. 라벨러들끼리 갈린 지점도 "결함이 있느냐"가 아니라 "얼마나 심각하냐"였습니다. ■ 그래서 Jev를 선별용으로 붙이지 않기로 했습니다. 공개 위키는 소스 페이지를 사람이 전수로 읽습니다. 일반화하면, 선별 도구를 붙이기 전에 결함이 얼마나 흔한지(기저율)부터 재야 합니다. 안 재고 붙이면 도움이 되는지조차 알 수 없습니다. Jev 자체가 나쁘다는 얘기가 아닙니다. 제가 운영하는 두 LLM Wiki가 하필 ...

Read Entire Article