최신 모델은 가중치에 저장하는 세계 지식을 줄이는 대신 수학·코드 추론 성능을 높여, 더 적은 활성 매개변수로 높은 벤치마크 점수를 내도록 설계되고 있음 사실 기억에서는 반대 결과가 나타나 SimpleQA 정확도는 최고 모델도 53%에 그치며, Qwen3.5 4B·9B의 지식 벤치마크 환각률은 80~82%에 달함 사실은 매개변수 공간을 많이 차지하고 빠르게 낡지만, 문제 분해·상태 추적·검산·백트래킹 같은 추론 절차는 소형 모델로 전이하기 쉽고 시간이 지나도 잘 변하지 않음 세부 지식은 검색·문서·도구 호출을 담당하는 에이전트 하네스로 옮기고, 모델은 질문을 이해해 필요한 자료를 찾고 판단하는 기초 지식과 추론 능력에 집중함 외부 지식은 출처 확인과 즉각적인 수정·회귀 테스트가 가능해 환각을 추적 가능한 데이터 버그로 바꾸며, 장기적으로 소비자용 GPU에서 고성능 추론 모델을 로컬 실행할 가능성을 열어줌 추론 성능과 사실 기억의 엇갈림 추론 점수는 오르는 반면 토큰당 계산량은 감소하고 있음 GLM-5.2는 토큰당 약 400억 개의 활성 매개변수로 AIME 2026에서 99.2%를 기록함 Qwen3.5는 활성 매개변수 170억 개로 91.3%를 기록함 DeepSeek V4-Flash는 약 130억 개의 활성 매개변수로 실행됨 GPT-4는 2023년 약 2,800억 개의 활성 매개변수를 사용했다는 소문이 있었지만 AIME 문제를 거의 풀지 못했음 Qwen3.5 9B는 양자화하면 VRAM 6GB에 들어가며, Artificial Analysis 지능 지수에서 10B 미만 차선 모델의 약 두 배 점수를 기록함 도구 없이 사실 기억을 측정하는 SimpleQA는 최고 모델인 Gemini 2.5 Pro도 정확도가 53% 에 그침 소형 모델의 사실 기억 성능은 더욱 낮음 Artificial Analysis 지식 벤치마크에서 Qwen3.5 4B와 9B는 80~82%의 환각률을 기록함 Qwen3.5 9B에 잘 알려지지 않은 19세기 수학자의 출생 연도를 물으면 그럴듯하지만 틀린 답을 자신 있게 생성할 수 있음 연구소들은 매개변수 효율을 공짜로 얻는 대신 세계 지식과 추론 능력을 의도적으로 맞바꾸고 있음 매개변수가 저장하던 지식 사실은 많은 공간을 차지하며, ‘Physics of Language Models’ 연구의 지식 용량 측정치는 매개변수당 약 2비트의 사실 지식을 제시함 잘 알려지지 않은 Wikipedia 인물의 출생 연도,...
Related
Claude Code의 메시지 제안 기능: 진짜 고객은 모델이라는 생각
33 minutes ago
0
Show GN: 추천링크·UTM으로 오프라인 소개의 성과를 추적하는 구조
2 hours ago
3
소프트웨어 팩토리 패턴 시도하기
2 hours ago
3
Show GN: 웹 변경 모니터링하는 크롬 확장프로그램
3 hours ago
3
OpenAI, 확률·선택지·점수를 반환하는 Decisions API 공개 베타 시작
3 hours ago
3
제프리 카첸버그 - 세상이 바뀌고 있다: 창의성을 위한 AI
4 hours ago
3
이 모든 것이 지나간 뒤를 위한 지속 가능한 웹 커리어
4 hours ago
3
Tips
click
Popular
프로들도 줄지어 샷 점검… KLPGA 스타 사랑방 된 더헤븐CC 연습장
2 weeks ago
73
iOS 27, iPadOS 27, macOS 27
3 weeks ago
69
손흥민 선제골 발판·골대 불운…LAFC, 7경기 만에 승리
3 weeks ago
65
영림원소프트랩, 나람 통합 ERP 구축…사료 제조·물류·회계 데이터 하나로
2 weeks ago
62
'이 악문' 김영범, 자유형 50m '대회 신기록' 금메달
2 weeks ago
55
© Clint IT 2026. All rights are reserved

1 month ago
20








English (US) ·