독파모 글로벌 AI 벤치마크 평가 '이변'...후발 주자 모티프 선두(종합)

1 week ago 10

서효빈 기자 입력 2026.08.13 14:09 후발주자 모티프 47점 '선두'…업스테이지 37점·SKT35점·LG 31점 AAII 배점 100점 중 25점…전문가·사용자 평가가 최종 변수 [아이뉴스24 서효빈 기자] 국내 'AI 국가대표'를 선발하는 독자 AI 파운데이션 모델(독파모) 프로젝트 2차 평가에서 모티프테크놀로지스가 글로벌 인공지능(AI) 성능 평가에서 가장 높은 점수를 기록했다. 다만 벤치마크 성능은 전체 평가의 일부인 만큼 이 점수만으로 각 모델의 실제 경쟁력이나 최종 순위를 판단하기는 어렵다는 의견도 있다.후발주자 모티프 47점 '선두'…1차 1위 LG는 31점글로벌 AI 모델 평가기관 아티피셜 애널리시스가 공개한 ‘아티피셜 애널리시스 인텔리전스 지수(AAII) [사진=아티피셜 애널리시스]13일 글로벌 AI 모델 평가기관 아티피셜 애널리시스(Artificial Analysis)에 따르면 최신 '아티피셜 애널리시스 인텔리전스 인덱스(AAII) v4.1.1'에서 모티프테크놀로지스의 '모티프3'는 47점을 기록했다. 이어 업스테이지의 '솔라 오픈2'가 37점, SK텔레콤의 'A.X-K2'가 35점, LG AI연구원의 'K-엑사원 2.0'이 31점을 받았다.이 결과는 독파모 1차 평가와 다른 판도를 보였다는 점에서 주목된다. 앞선 1차 평가에서 LG AI연구원은 벤치마크 평가 40점 만점에 33.6점으로 가장 높은 점수를 기록했지만 이번 AAII에서는 4개 모델 가운데 가장 낮은 점수를 받았다.반면 가장 늦게 독파모 경쟁에 합류한 모티프테크놀로지스는 AAII에서 가장 높은 점수를 기록했다. 업스테이지 역시 두 번째로 높은 점수를 기록하면서 글로벌 벤치마크에서는 두 스타트업이 대기업을 앞섰다.AAII는 지식과 추론, 코딩 등 여러 영역의 개별 벤치마크를 하나의 점수로 종합하는 방식이다. 최신 AAII v4.1.1은 'GDPval-AA v2'(실제 직업·업무 수행 능력), 'τ³-Banking'(은행 업무에서의 도구 활용 능력), 'Terminal-Bench v2.1'(코딩·터미널 활용 능력), 'SciCode'(과학 분야 코딩 능력), 'Humanity's Last Exam'(고난도 추론·지식), 'GPQA Diamond'(고난도 과학 추론), 'CritPt'(물리학 추론), 'AA-Omniscience'(지식 정확도·환각 여부), 'AA-LCR'(장문맥 이해·추론) 등 9개 평가를 반영한다.앞서 과학...

Read Entire Article