Claude Opus 5, Artificial Analysis 지능 리더보드 1위

6 hours ago 3

평가된 170개 모델 중 Claude Opus 5 Adaptive Reasoning·Max Effort가 Intelligence Index 61점으로 1위를 차지했으며, Xhigh Effort와 Claude Fable 5가 각각 60점으로 뒤를 이음 Intelligence Index v4.1은 에이전트 작업·코딩·과학 추론·지식 신뢰성·장문맥 추론을 다루는 9개 평가를 결합하고, 추론 모델의 확장 사고 시간도 성능 측정에 반영함 출력 속도는 Mercury 2가 901.6 tokens/s로 가장 빠르고, 첫 토큰 지연은 Gemini 2.5 Flash-Lite가 0.34초로 가장 짧으며, Llama 4 Scout는 10M 토큰의 최대 문맥 창을 제공함 가격은 토큰 단가뿐 아니라 입력·캐시 적중·캐시 쓰기·추론·답변 토큰을 가중한 작업당 비용으로 비교하며, 캐시 쓰기와 저장 비용은 제공업체마다 다름 공개 가중치 모델 중 GLM-5.2 (max) 가 51점으로 가장 높지만 전체 1위보다 10점 낮아, 모델 선택에는 지능과 함께 비용·속도·지연·문맥 창을 고려해야 함 Claude Opus 5의 지능 순위 Claude Opus 5 (Adaptive Reasoning, Max Effort) 는 Intelligence Index 61점으로 평가된 170개 모델 가운데 1위임 상위 5개 모델은 다음과 같음 Claude Opus 5 (Adaptive Reasoning, Max Effort): 61점 Claude Opus 5 (Adaptive Reasoning, Xhigh Effort): 60점 Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback): 60점 GPT-5.6 Sol (max): 59점 Claude Opus 5 (Adaptive Reasoning, High Effort): 59점 Max Effort 구성은 126개 추론 모델 중에서도 1위이며, 추론 모델은 답변 전에 복잡한 문제를 처리하기 위한 확장 사고를 수행함 Intelligence Index v4.1의 평가 구성 Intelligence Index v4.1은 다음 9개 평가를 결합함 GDPval-AA v2: 에이전트 기반 실제 업무 𝜏³-Banking: 에이전트 도구 사용 Terminal-Bench v2.1: 에이전트 코딩 및 터미널 사용 SciCode: 코딩 Humanity's Last Exam: ...

Read Entire Article