Claude Opus 5.5, 추론 설정별 성능과 비용 비교

1 hour ago 1

AAII에서 최대 추론 설정의 Opus 5.5 max는 지능 지수 58점을 기록했으며, 이전 Opus 5의 최고점 51점과 Fable 5.1의 53점을 넘어섬 추론 강도에 따라 medium 51점, high 54점, xhigh 56점, max 58점으로 성능이 올라가지만, 평가 과제당 비용도 함께 증가함 high는 과제당 1.82달러, max는 5.98달러로, 지능 지수 4점을 더 높이는 데 약 3.3배의 비용이 들었음. medium은 1.34달러로 이전 Opus 5의 최고점과 같은 점수를 기록 API 토큰 단가는 입력 100만 토큰당 4달러, 출력 20달러로 같지만, 추론 과정에서 사용하는 토큰이 달라 실제 작업 비용에는 큰 차이가 생김 평가는 코딩, 전문 업무, 지식과 긴 문맥 추론 등을 결합한 결과이며, 기본 대체 모델 전환이 적용된 설정을 사용함. 개별 작업에 맞춰 추론 강도별 성능과 비용을 함께 비교할 수 있음 추론 강도에 따른 성능과 비용 Claude Opus 5.5의 추론 설정별 평가에서 max는 가장 높은 지능 점수, medium과 high는 더 낮은 작업 비용을 기록함 아래 수치는 적응형 추론과 기본 대체 모델 전환(Default Fallback) 을 적용한 설정이며, 비용은 Artificial Analysis Intelligence Index 평가 과제당 가중평균임 high에서 max로 높이면 지능 지수는 4점 상승하지만 비용은 약 3.3배로 늘어남 medium의 51점은 이전 Opus 5의 최고점과 같으며, high의 54점은 Fable 5.1의 최고점 53점을 넘어섬 같은 모델이라도 추론 강도에 따라 사용하는 토큰과 처리 시간이 달라지므로, 최고점뿐 아니라 작업당 비용을 함께 비교할 수 있음 토큰 단가와 실제 작업 비용 Anthropic API 기준 100만 토큰당 입력 4달러, 출력 20달러이며, 추론 설정별 토큰 단가는 같음 캐시된 입력을 읽는 가격은 100만 토큰당 0.20달러로, 일반 입력보다 95% 저렴함 캐시 적중/일반 입력/출력을 7:2:1로 가정한 AA의 혼합 단가는 100만 토큰당 2.94달러임 실제 비용은 입력과 출력의 비율, 캐시 재사용량, 추론에 사용하는 토큰 수에 따라 달라짐 max 설정은 Intelligence Index 전체 평가에서 출력 토큰 약 2억 6,000만 개를 사용했으며, 전체 평가 비용은 8,708.20달러임 출력 토큰에는 추론 과정에 쓰인 토큰도 포...

Read Entire Article