로컬 LLM이 실제 성능보다 더 멍청하게 느껴지는 이유

2 hours ago 1

같은 모델 가중치라도 GPU 명령어·추론 소프트웨어·정밀도 설정이 다르면 다음 토큰 확률이 달라지고, 긴 문맥에서는 도구 호출 실패로 이어질 수 있음 Qwen3.6-27B와 약 10만 토큰의 실제 에이전트 작업 문맥을 실험한 결과, vLLM의 어텐션 백엔드 차이는 후반부부터 내용에 따라 군집 형태의 불일치를 일으킴 가중치를 BF16으로 유지하고 KV 캐시만 양자화해도 편차가 발생했으며, 도구 호출 오류에서 INT8 KV 캐시는 복구했지만 INT4는 복구하지 못함 가중치 양자화 비교에서는 INT8 W8A16이 공식 FP8과 NVIDIA NVFP4보다 기준 모델에 가까웠고, NVFP4는 88k 문맥에서 약 50%의 최상위 토큰 변경을 기록함 로컬 환경은 몇 개의 제로샷 프롬프트나 출처 불명의 KLD 수치가 아니라, 실제 작업을 반영한 긴 문맥·도구 호출·도메인 평가와 전체 실행 환경으로 검증해야 함 같은 가중치도 같은 결과를 보장하지 않음 LLM을 실행하는 하드웨어와 소프트웨어 조합은 인스턴스마다 다르며, 홈 랩에서는 서로 다른 세대의 GPU를 함께 사용할 수도 있음 GPU별 명령어 집합이 달라 동일한 가중치라도 다음 토큰을 계산하는 수학 연산과 결과가 달라질 수 있음 Terminal Bench, HLE, SWE 계열, HellaSwag, MMLU 등 여러 벤치마크 가운데 실제 작업을 대표하는 평가로 품질을 측정해야 함 temperature를 0으로 두고 프롬프트 3개만 시험해서는 충분하지 않음 제로샷 테스트는 대부분의 에이전트 작업을 제대로 반영하지 못함 같은 가중치와 벤치마크를 사용하더라도 긴 문맥 도구 호출과 도메인 지식 평가가 필요함 Logit·샘플러·KLD Logit은 가능한 각 다음 토큰에 모델이 부여하는 점수로, 확률로 정규화된 뒤 샘플러를 거쳐 디토크나이저가 텍스트로 변환함 Hugging Face 모델 카드에는 일반적으로 권장 샘플러 설정과 채팅 템플릿이 지정돼 있음 temperature 1.0, top-p 0.95 같은 값은 모델마다 다름 Qwen에서 temperature를 지나치게 낮추면 THINK 출력이 반복돼 빠져나오지 못할 수 있음 작은 확률 변화가 누적되면 예상과 다른 토큰이 선택되면서 생성 경로가 달라질 수 있음 KL Divergence(KLD) 는 출력 logit을 확률분포로 변환하고, 선택한 기준 분포에서 얼마나 이동했는지 측정함 낮은 KLD는 기준에 더 가깝다는 뜻일 뿐, 자동으로 ...

Read Entire Article