모델은 의도적으로 더 무지해지고 있다

5 days ago 9

최신 모델은 가중치에 저장하는 세계 지식을 줄이는 대신 수학·코드 추론 성능을 높여, 더 적은 활성 매개변수로 높은 벤치마크 점수를 내도록 설계되고 있음 사실 기억에서는 반대 결과가 나타나 SimpleQA 정확도는 최고 모델도 53%에 그치며, Qwen3.5 4B·9B의 지식 벤치마크 환각률은 80~82%에 달함 사실은 매개변수 공간을 많이 차지하고 빠르게 낡지만, 문제 분해·상태 추적·검산·백트래킹 같은 추론 절차는 소형 모델로 전이하기 쉽고 시간이 지나도 잘 변하지 않음 세부 지식은 검색·문서·도구 호출을 담당하는 에이전트 하네스로 옮기고, 모델은 질문을 이해해 필요한 자료를 찾고 판단하는 기초 지식과 추론 능력에 집중함 외부 지식은 출처 확인과 즉각적인 수정·회귀 테스트가 가능해 환각을 추적 가능한 데이터 버그로 바꾸며, 장기적으로 소비자용 GPU에서 고성능 추론 모델을 로컬 실행할 가능성을 열어줌 추론 성능과 사실 기억의 엇갈림 추론 점수는 오르는 반면 토큰당 계산량은 감소하고 있음 GLM-5.2는 토큰당 약 400억 개의 활성 매개변수로 AIME 2026에서 99.2%를 기록함 Qwen3.5는 활성 매개변수 170억 개로 91.3%를 기록함 DeepSeek V4-Flash는 약 130억 개의 활성 매개변수로 실행됨 GPT-4는 2023년 약 2,800억 개의 활성 매개변수를 사용했다는 소문이 있었지만 AIME 문제를 거의 풀지 못했음 Qwen3.5 9B는 양자화하면 VRAM 6GB에 들어가며, Artificial Analysis 지능 지수에서 10B 미만 차선 모델의 약 두 배 점수를 기록함 도구 없이 사실 기억을 측정하는 SimpleQA는 최고 모델인 Gemini 2.5 Pro도 정확도가 53% 에 그침 소형 모델의 사실 기억 성능은 더욱 낮음 Artificial Analysis 지식 벤치마크에서 Qwen3.5 4B와 9B는 80~82%의 환각률을 기록함 Qwen3.5 9B에 잘 알려지지 않은 19세기 수학자의 출생 연도를 물으면 그럴듯하지만 틀린 답을 자신 있게 생성할 수 있음 연구소들은 매개변수 효율을 공짜로 얻는 대신 세계 지식과 추론 능력을 의도적으로 맞바꾸고 있음 매개변수가 저장하던 지식 사실은 많은 공간을 차지하며, ‘Physics of Language Models’ 연구의 지식 용량 측정치는 매개변수당 약 2비트의 사실 지식을 제시함 잘 알려지지 않은 Wikipedia 인물의 출생 연도,...

Read Entire Article