■ 요즘 핫한 TypeSafe의 판정 모델 Jev를 LLM Wiki에 접목 Jev는 자연어로 던진 질문에 보정된 확률을 돌려줍니다. "이 페이지에 결함이 있나?" 하고 물으면 0~1 사이 값이 나옵니다. TypeSafe는 Jev를 "지식 업무용 린터"라고 소개했는데, LLM Wiki를 운영 중 마침 그런 게 필요했습니다. AI가 쓴 위키가 커지면 매번 모든 페이지를 다 읽어서 불량 페이지를 선별할 수 없으니, 점수 낮은 의심스러운 것부터 골라 읽으면 전수 검토 없이 불량 페이지를 잡을 수 있지 않을까 싶었습니다. 그래서 저희 두가지 LLM Wiki(비공개·공개)에 Jev를 붙여서 직접 측정해 봤습니다. 결과부터 말씀드리면 Jev가 기대한 역할을 하지 못했습니다. 그런데 왜 역할을 못했는지가 오히려 쓸 만한 교훈이었습니다. ■ [핵심] 점수로 걸러내는 도구는 결함이 '어디에나' 있지도 '아무 데도' 없지도 않은, 중간정도로 결함이 섞여 있을 때 값어치가 있습니다 비공개 위키는 결함 있는 페이지가 약 44%였습니다. 이렇게 흔하면 어차피 다 읽어야 하니 걸러줄 게 없습니다. 공개 위키는 심각한 결함이 6.5%뿐이었습니다. 그런데 자잘한 흠은 거의 모든 페이지에 있고 큰 흠만 드물었습니다. 다들 고만고만하게 지저분하니 점수로 갈라낼 신호가 없습니다. 돌이 섞인 쌀에서 돌을 골라내는 조리질에 빗대면, 쌀에 돌이 절반 이상 섞여 있거나 거의 섞여 있지 않으면 조리가 소용없는 것과 같습니다. 값싼 검사가 아픈 것과 멀쩡한 것을 실제로 갈라줘야 쓸모가 있습니다. ■ 스스로 속지 않으려고 이렇게 쟀습니다 공개 위키에선 무엇을 볼지 미리 못 박아 두고(사전 등록), 라벨러가 점수를 모른 채 결함을 달게 했습니다(블라인드 라벨링). 걸러내는 성능은 AUC로 확인했습니다. 처음엔 신호가 있어 보였습니다. 뜯어보니 코호트 효과였습니다. 점수가 낮은 페이지는 파이프라인이 좋아지기 전의 옛것들이었지, 지금 뽑는 결과물이 아니었습니다. 라벨러들끼리 갈린 지점도 "결함이 있느냐"가 아니라 "얼마나 심각하냐"였습니다. ■ 그래서 Jev를 선별용으로 붙이지 않기로 했습니다. 공개 위키는 소스 페이지를 사람이 전수로 읽습니다. 일반화하면, 선별 도구를 붙이기 전에 결함이 얼마나 흔한지(기저율)부터 재야 합니다. 안 재고 붙이면 도움이 되는지조차 알 수 없습니다. Jev 자체가 나쁘다는 얘기가 아닙니다. 제가 운영하는 두 LLM Wiki가 하필 ...
LLM Wiki의 불량 페이지를 Jev로 선별하는 것이 가능할까?
1 week ago
13
Related
Show GN: 추천링크·UTM으로 오프라인 소개의 성과를 추적하는 구조
1 hour ago
3
소프트웨어 팩토리 패턴 시도하기
2 hours ago
3
Show GN: 웹 변경 모니터링하는 크롬 확장프로그램
2 hours ago
3
OpenAI, 확률·선택지·점수를 반환하는 Decisions API 공개 베타 시작
3 hours ago
3
제프리 카첸버그 - 세상이 바뀌고 있다: 창의성을 위한 AI
3 hours ago
3
이 모든 것이 지나간 뒤를 위한 지속 가능한 웹 커리어
3 hours ago
3
여러 팀의 시스템을 이해하기 위한 AI 집단 지성 구축하기
3 hours ago
3
Tips
click
Popular
프로들도 줄지어 샷 점검… KLPGA 스타 사랑방 된 더헤븐CC 연습장
2 weeks ago
73
iOS 27, iPadOS 27, macOS 27
3 weeks ago
69
손흥민 선제골 발판·골대 불운…LAFC, 7경기 만에 승리
3 weeks ago
65
영림원소프트랩, 나람 통합 ERP 구축…사료 제조·물류·회계 데이터 하나로
2 weeks ago
62
'이 악문' 김영범, 자유형 50m '대회 신기록' 금메달
2 weeks ago
55
© Clint IT 2026. All rights are reserved









English (US) ·