GPT-5.5 Pro 추론의 첫 1% 를 추론 채널에 미리 넣자, Qwen3.8 A95B의 답변과 GPT-5.5 Pro 답변 간 중복 점수가 16.79%에서 34.97%로 상승함 STEM·비STEM·합성 퍼즐 각 15개, 총 45개 문제에서 일반 응답과 추론 프리필 응답을 비교하고, 대상 모델 답변의 첫 100토큰에 교사 모델 답변이 얼마나 포함되는지 측정함 Qwen은 모든 범주에서 중복 점수가 높아졌으며, 증가 폭은 STEM +26.99%p, 비STEM +12.80%p, 퍼즐 +14.75%p임 다른 모델의 변화는 DeepSeek V4 Flash −1.17%p, Inkling +0.46%p, Kimi K3 +4.54%p로 더 작았지만, Kimi K3는 프리필 전후 모두 GPT-5.5 Pro와의 중복 점수가 가장 높았음 이전 Opus 4.8 실험에서는 거의 변하지 않았던 Qwen이 이번에는 크게 반응해 GPT 계열 모델에서 학습했을 가능성을 시사하지만, 학습 출처를 확정할 수는 없음 실험 방식과 측정 지표 v1.1 실험은 Reasoning prefills on a few open models와 Stolen Thoughts의 후속 실험으로, 교사 모델을 GPT-5.5 Pro로 바꿔 실행함 각 문제에서 대상 모델별로 두 가지 조건의 응답을 생성함 일반 조건에서는 추론을 미리 넣지 않음 프리필 조건에서는 GPT-5.5 Pro 추론의 첫 1% 를 대상 모델의 추론 채널에 넣음 사용자에게 보이는 최종 답변은 두 조건 모두 대상 모델이 자유롭게 생성함 중복 점수는 대상 모델 답변의 첫 100토큰에 교사 모델의 최종 답변이 얼마나 나타나는지를 측정함 유니그램·바이그램·트라이그램의 원문 재현율(source recall) 평균을 사용함 변화량은 상대 증가율이 아닌 절대 퍼센트포인트(%p) 차이임 평가 대상은 45개 문제로, STEM 15개·비STEM 15개·합성 퍼즐 15개로 구성됨 전체 모델 비교 Qwen3.8 A95B는 프리필 전 16.79%에서 프리필 후 34.97%로 +18.18%p 상승해 가장 큰 변화 폭을 보임 Kimi K3의 중복 점수는 31.11%에서 35.65%로 +4.54%p 높아짐 프리필 전후 모두 비교 모델 중 GPT-5.5 Pro와의 중복 점수가 가장 높았음 Inkling의 증가 폭은 +0.46%p로, 19.99%에서 20.45%로 소폭 상승함 DeepSeek V4 Flash는 27.30%에서 26.13%...
Qwen 3.8, GPT-5.5 Pro의 추론 프리필을 따름
3 weeks ago
22
Related
Strands Decider 2B - 소형 오픈소스 의사결정 모델
51 minutes ago
0
Tell HN: GitHub이 한 달이 지나도 제 소프트웨어의 크랙 복제본 삭제를 거부합니다
54 minutes ago
0
Penguin Mail - AI를 탑재한 Linux용 오픈소스 Rust 이메일 클라이언트
1 hour ago
3
Show GN: 이메일 피싱 모의훈련을 전화로 옮겼습니다. 예고 없는 전화
2 hours ago
3
토론토 기반 VPN 업체, 적법 접근 법안으로 캐나다 떠날 계획
2 hours ago
3
Claude Code의 메시지 제안 기능: 진짜 고객은 모델이라는 생각
3 hours ago
3
Show GN: 추천링크·UTM으로 오프라인 소개의 성과를 추적하는 구조
5 hours ago
3
Tips
click
Popular
프로들도 줄지어 샷 점검… KLPGA 스타 사랑방 된 더헤븐CC 연습장
2 weeks ago
73
iOS 27, iPadOS 27, macOS 27
3 weeks ago
69
손흥민 선제골 발판·골대 불운…LAFC, 7경기 만에 승리
3 weeks ago
65
영림원소프트랩, 나람 통합 ERP 구축…사료 제조·물류·회계 데이터 하나로
2 weeks ago
62
'이 악문' 김영범, 자유형 50m '대회 신기록' 금메달
2 weeks ago
55
© Clint IT 2026. All rights are reserved









English (US) ·