Grok 4.6, Artificial Analysis 지능 지수 61점 기록

1 week ago 10

SpaceXAI의 Grok 4.6은 이전 버전보다 5점 오른 61점을 기록해 OpenAI와 함께 지능 최전선에 복귀했으며, Anthropic 모델들만 앞서 있음 에이전트 작업에서 GDPval-AA v2 Elo 1753, 𝜏³-Banking 50.7%, Terminal-Bench v2.1 88.4%를 기록해 지식 작업·고객 서비스·터미널 작업 전반에서 선두권에 오름 입력·출력 100만 토큰당 가격을 $2/$6로 유지해 Claude Opus 5와 GPT-5.6 Sol보다 60% 이상 저렴하며, 작업당 비용은 $0.84로 비용 대비 지능 파레토 최전선에 포함됨 장기 에이전트 지식 작업 벤치마크 AA-Briefcase에서는 Elo 1577을 기록하고, 평균 약 53턴과 입력 토큰 약 5억 개로 작업을 마쳐 Claude Opus 5(max)의 약 103턴·20억 개보다 효율적임 정적 추론보다 에이전트 작업에서 강점이 두드러지며, 비슷한 지능 지수 점수의 최전선 모델보다 낮은 토큰 가격과 적은 작업량을 결합함 지능 최전선으로 복귀 Artificial Analysis Intelligence Index에서 Grok 4.6은 61점을 기록함 GPT-5.6 Sol(max)과 같은 점수임 Claude Opus 5(max, 63점)와 Claude Fable 5(max with fallback, 62점)보다는 낮음 Kimi K3보다는 근소하게 높음 Grok 4.5 출시 후 한 달여 만에 5점 올랐고, Grok 4.3과 비교하면 23점 상승함 이 결과로 SpaceXAI는 OpenAI와 함께 지능 최전선에 자리하며 Anthropic의 뒤를 이음 에이전트 작업에서의 경쟁력 Grok 4.6의 가장 강한 결과는 정적 추론보다 에이전트 작업에서 나타남 실제 에이전트 지식 작업을 측정하는 GDPval-AA v2에서 Elo 1753을 기록함 Claude Opus 5만 이보다 앞섬 신뢰구간이 겹치는 Claude Fable 5 및 Qwen3.8 Max와는 통계적으로 구별되지 않음 작업 유형이 달라져도 선두권 성능을 유지함 도구를 사용하는 다중 턴 고객 서비스를 평가하는 𝜏³-Banking에서 50.7% 를 기록해 Qwen3.8 Max의 51.3%와 함께 상위 2개 점수에 포함됨 터미널 기반 소프트웨어 작업을 평가하는 Terminal-Bench v2.1에서는 88.4% 로 선두 모델들과 같은 수준에 오름 지식 작업·고객 서비스·터미널 사용에서 동시에 경...

Read Entire Article