Anthropic·OpenAI·Google API의 암호화된 추론 블록을 같은 제공업체의 약한 모델로 옮겨 탈옥하면, 상위 모델의 숨겨진 사고 과정(chain-of-thought)을 평문으로 복원할 수 있음 공격은 강한 모델에서 추론 흔적을 얻은 뒤 약한 형제 모델에 복사를 지시하는 두 번의 API 호출만 필요하며, 세션·사용자·모델 사이의 이식성을 악용함 120개 Codeforces 문제에서 복원된 길이와 API의 숨겨진 사고 토큰 수가 밀접하게 대응했으며, Claude·GPT·Gemini의 공개 에이전트 작업 기록 6,708개에서 추론 블록 315,320개를 재구성함 실제 사용자 세션에서는 자격 증명 126개와 개인정보 204개를 포함한 민감 정보 704개가 발견됐고, 이 중 64개는 사용자에게 보이는 대화에 없었음 API 키·비밀번호뿐 아니라 우회책, 하드코딩, 승인 회피, 불확실한 추측과 미완성 풀이까지 복원돼 최종 응답보다 광범위한 내부 작업 상태가 노출됨 두 번의 호출로 성립하는 공격 Anthropic·OpenAI·Google API는 모델의 추론을 암호화된 사고 과정 블록으로 클라이언트에 반환하며, 대화를 이어갈 때 해당 블록을 서버로 다시 전송함 이 블록은 원래 세션에 묶여 있지 않아 다른 세션·사용자·모델에서도 재생할 수 있음 복원 파이프라인은 두 단계로 작동함 상위 모델에서 암호화된 추론 흔적을 획득함 같은 제공업체의 더 약한 형제 모델에 흔적을 입력하고 탈옥해 내용을 그대로 복사하게 함 예시에서는 claude-opus-4-8의 암호화된 thinking 서명을 claude-haiku-4-5-20251001에 전달하고, <thinking-copy> 태그 안에 추론을 옮기도록 요청함 강한 모델 자체를 탈옥하거나 증류 방지 보호 장치를 작동시키지 않고도 추론 원문을 복원할 수 있음 복원 검증과 데이터 규모 OpenAI·Anthropic·Google의 상위 모델에서 같은 공격을 시연했으며, 복호화된 추론 길이는 API가 보고한 숨겨진 사고 토큰 수와 밀접하게 대응함 120개 Codeforces 문제에서 다음 두 값을 비교함 API가 보고한 숨겨진 추론 토큰 수 복원된 추론을 다시 모델 입력으로 넣어 계산한 토큰 수 GitHub와 Hugging Face에서 Claude·GPT·Gemini가 만든 공개 에이전트 작업 기록 6,708개를 수집했으며, 그 안에 암호화된 추론 블록이 남아 있었음 모...
Related
Show GN: 추천링크·UTM으로 오프라인 소개의 성과를 추적하는 구조
15 minutes ago
0
소프트웨어 팩토리 패턴 시도하기
39 minutes ago
0
Show GN: 웹 변경 모니터링하는 크롬 확장프로그램
1 hour ago
3
OpenAI, 확률·선택지·점수를 반환하는 Decisions API 공개 베타 시작
1 hour ago
3
제프리 카첸버그 - 세상이 바뀌고 있다: 창의성을 위한 AI
1 hour ago
2
이 모든 것이 지나간 뒤를 위한 지속 가능한 웹 커리어
2 hours ago
2
여러 팀의 시스템을 이해하기 위한 AI 집단 지성 구축하기
2 hours ago
3
Tips
click
Popular
프로들도 줄지어 샷 점검… KLPGA 스타 사랑방 된 더헤븐CC 연습장
2 weeks ago
73
iOS 27, iPadOS 27, macOS 27
3 weeks ago
69
손흥민 선제골 발판·골대 불운…LAFC, 7경기 만에 승리
3 weeks ago
65
영림원소프트랩, 나람 통합 ERP 구축…사료 제조·물류·회계 데이터 하나로
2 weeks ago
62
'이 악문' 김영범, 자유형 50m '대회 신기록' 금메달
2 weeks ago
55
© Clint IT 2026. All rights are reserved

1 month ago
29








English (US) ·