LittleLearner는 미국 초등학교 K–5 교육과정으로 제한한 880억 토큰 말뭉치만으로 처음부터 훈련해, 사전학습 지식의 경계가 모델 능력에 미치는 영향을 검증함 FineWeb-Edu를 Common Core 기준의 5단계 파이프라인으로 필터링하고, 5학년 이후의 개념·사실·어휘를 명시적으로 제외한 LittleCurriculum을 구축함 0.6B·1.3B·5B 모델을 아키텍처·토큰·훈련 방식이 같은 비필터링 대조군과 비교한 결과, 모델 확장은 교육과정 내부와 같은 학습 궤적의 문제에는 효과가 있었지만 범위 밖의 고급 문제에는 거의 도움이 되지 않았음 범위 밖 데이터로 진행한 GRPO 후속 훈련도 K–5 능력만 크게 높였고, 시험한 프롬프트를 이용한 문맥 내 학습 역시 5B 모델에 새로운 K–5 이후 추론 능력을 부여하지 못함 사전학습 데이터의 경계가 능력의 상한을 정하며, 규모 확장·후속 훈련·문맥 내 학습은 이미 배운 능력을 끌어낼 수는 있어도 범위 밖 지식을 의미 있게 획득시키지는 못함 교육과정으로 통제한 데이터와 모델 LittleCurriculum은 FineWeb-Edu에서 추출한 880억 토큰 말뭉치로, Common Core K–5 표준에 맞춘 5단계 필터링을 거침 5학년보다 높은 학년에서 가르치는 개념·사실·어휘를 명시적으로 배제함 훈련 분포 자체를 제한해 새로운 능력을 실제로 학습한 것인지, 이미 가진 능력을 끌어낸 것인지 구분하도록 설계함 LittleLearner는 0.6B·1.3B·5B 세 규모로 처음부터 훈련됨 각 모델에는 아키텍처·훈련 토큰·훈련 방식을 공유하는 비필터링 Unfiltered 대조군이 있음 Base는 사전학습 모델이며, GRPO는 MathCAMPS로 후속 훈련한 수학 특화 모델이라 수학 중심 출력을 보일 수 있음 Chatty는 일반적인 대화 행동에 맞춰 조정한 변형임 브라우저 데모에서 호스팅된 5B 모델과 대화할 수 있음 모델 체크포인트는 Hugging Face에서 제공됨 0.6B Base · 0.6B GRPO · 0.6B Chatty 1.3B Base · 1.3B GRPO · 1.3B Chatty 5B Base · 5B GRPO · 5B Chatty 사전학습이 정한 능력의 경계 규모 확장은 통제된 지식 범위 안의 성능을 높이고 같은 학습 궤적에 있는 문제까지 제한적으로 확장했지만, 노출 범위 밖의 고급 능력이 필요한 문제에는 거의 효과가 없었음 GRPO 후속 훈련은 K–5...
LLM이 5학년 이후의 학습 자료를 전혀 보지 못하면 어떻게 될까?
1 month ago
22
Related
Claude Code의 메시지 제안 기능: 진짜 고객은 모델이라는 생각
34 minutes ago
0
Show GN: 추천링크·UTM으로 오프라인 소개의 성과를 추적하는 구조
2 hours ago
3
소프트웨어 팩토리 패턴 시도하기
2 hours ago
3
Show GN: 웹 변경 모니터링하는 크롬 확장프로그램
3 hours ago
3
OpenAI, 확률·선택지·점수를 반환하는 Decisions API 공개 베타 시작
3 hours ago
3
제프리 카첸버그 - 세상이 바뀌고 있다: 창의성을 위한 AI
4 hours ago
3
이 모든 것이 지나간 뒤를 위한 지속 가능한 웹 커리어
4 hours ago
3
Tips
click
Popular
프로들도 줄지어 샷 점검… KLPGA 스타 사랑방 된 더헤븐CC 연습장
2 weeks ago
73
iOS 27, iPadOS 27, macOS 27
3 weeks ago
69
손흥민 선제골 발판·골대 불운…LAFC, 7경기 만에 승리
3 weeks ago
65
영림원소프트랩, 나람 통합 ERP 구축…사료 제조·물류·회계 데이터 하나로
2 weeks ago
62
'이 악문' 김영범, 자유형 50m '대회 신기록' 금메달
2 weeks ago
55
© Clint IT 2026. All rights are reserved









English (US) ·