독파모 3차 평가 어떻게…전문가들 "벤치마크 다변화·사용성 구체화" 제언

1 hour ago 1

최병호 고려대 교수, 김장현 성균관대 교수, 안광섭 세종대 겸임교수, 이승현 가천대 겸임교수 등 "특정 벤치마크 의존 낮추고…외부·실전 평가 다변화해야" "탈락이 퇴장돼선 안 돼"…AI 생태계 다양성도 과제 [아이뉴스24 서효빈 기자] 정부의 '독자 AI 파운데이션 모델'(독파모) 3차 평가 방식에 대해 전문가들은 특정 벤치마크 의존을 낮추고 사용성 평가 기준을 구체화해야 한다고 제언했다. 탈락팀의 기술과 연구 성과가 생태계 안에서 이어질 수 있도록 후속 지원 체계도 마련해야 한다는 지적이다.류제명 과학기술정보통신부 2차관이 18일 서울 종로구 정부서울청사에서 독자 AI파운데이션모델 프로젝트 2차 단계평가 결과 브리핑을 하고 있다. [사진=연합뉴스]앞서 독파모 2차 평가는 벤치마크 40점, 전문가 평가 35점, 사용자 평가 25점으로 진행됐다. 하지만 평가 기준에 대한 문제 제기가 안팎에서 이어지면서 3차 평가 방식에 대한 정부의 고민도 깊어가고 있다.1일 아이뉴스24가 AI 학계·업계 전문가들의 제언을 종합한 결과 3차 평가에서는 특정 벤치마크에 대한 의존도를 낮추고 사용성 평가 기준을 보다 명확하게 설계해야 한다는 의견이 나왔다.특정 벤치마크 의존 낮추고…외부·실전 평가 다변화최병호 고려대 인공지능연구소 교수는 글로벌 벤치마크 성능만으로는 한국형 소버린 AI에 필요한 역량을 충분히 평가하기 어렵다고 지적했다. 최 교수는 "소버린 AI가 되려면 한국형에 맞아야 한다"며 "한국의 제조 환경과 언어, 문화, 보안성에 맞아야 하고 일정 수준의 지능도 있어야 한다"고 말했다. 특정 벤치마크에 의존할 경우 왜곡된 결과가 나올 것이라는 지적이다.안광섭 세종대 겸임교수(OBF 대표)도 특정 시험에 최적화한 점수보다 다양한 외부 평가에서 안정적인 성능을 보이는지를 살펴야 한다고 조언했다. 그는 "좋은 모델은 어떤 평가에 갖다 놔도 좋은 점수를 받는다"면서 추론과 코딩, 에이전트 수행 능력 등 서로 다른 역량을 측정하는 여러 벤치마크를 함께 활용해야 한다고 주문했다.안 교수는 "오래된 벤치마크를 반복적으로 사용할 경우 특정 시험에 맞춰 성능을 끌어올리는 '벤치맥싱'이 발생할 수 있다"면서 벤치마크 다변화를 통해 특정 벤치마크에서 점수가 높게 나오는 벤치맥싱을 해소해야 한다고 주장했다.이승현 가천대 스타트업칼리지 겸임교수도 특정 글로벌 지표가 평가를 좌우해서는 안 된다고 봤다. 그는 자신의 SNS를 통해 "AAII 같은 외부 ...

Read Entire Article