패밀리 사이트
아주일보
베트남
회원서비스
로그인
회원가입
지면보기
AAII 1위 모티프는 왜 탈락했나…독파모 평가 공개 놓고 논란
기사 읽기 도구
공유하기
기사 프린트
글씨 크게
글씨 작게
2026.08.27 목요일
흐림 서울 27˚C
흐림 부산 30˚C
흐림 대구 30˚C
흐림 인천 27˚C
흐림 광주 31˚C
흐림 대전 29˚C
흐림 울산 31˚C
흐림 강릉 29˚C
맑음 제주 34˚C
IT

AAII 1위 모티프는 왜 탈락했나…독파모 평가 공개 놓고 논란

기자정보, 기사등록일
선재관 기자
2026-08-27 09:38:30

글로벌 성능 47점으로 경쟁 모델 앞섰지만 최종 탈락

정부 "사용성·활용성에서 낮은 평가"

모티프 "세부 점수·평가기준 공개해야"

벤치마크 중심 AI 평가의 한계도 쟁점

류제명 과학기술정보통신부 2차관이 18일 서울 종로구 정부서울청사에서 독자 AI파운데이션모델 프로젝트 2차 단계평가 결과 브리핑을 하고 있다사진연합뉴스
류제명 과학기술정보통신부 2차관이 18일 서울 종로구 정부서울청사에서 독자 AI파운데이션모델 프로젝트 2차 단계평가 결과 브리핑을 하고 있다.[사진=연합뉴스]

[경제일보] 정부의 ‘독자 AI 파운데이션 모델 프로젝트’(독파모) 2차 평가에서 글로벌 성능지표 1위를 기록한 모티프테크놀로지스가 탈락하면서 평가 방식의 투명성을 둘러싼 논쟁이 커지고 있다. 모티프의 ‘Motif 3’는 글로벌 AI 평가기관 아티피셜 애널리시스의 AAII에서 47점을 받아 업스테이지(37점), SK텔레콤(35점), LG AI연구원(31점)을 모두 앞섰다. 하지만 최종 종합평가에서는 4개 팀 중 최하위를 기록했다.

모티프테크놀로지스는 27일 과학기술정보통신부에 공식 이의를 제기하고 전체 평가 항목별·업체별 점수와 판단 근거, 벤치마크 배점 산정 방식, 전문가 평가 기준, 사용자 평가 방법론 및 블라인드 평가 여부 등을 공개해 달라고 요구했다. 이의 제기 결과와 관계없이 독파모 3차에는 참여하지 않겠다는 입장도 밝혔다.

◆ ‘AAII 47점’이 탈락으로 이어진 이유

핵심은 AAII가 독파모 전체 평가의 일부에 불과했다는 점이다. 2차 평가는 벤치마크 40점, 전문가 평가 35점, 사용자 평가 25점 등 총 100점으로 구성됐다. 벤치마크 가운데 AAII가 25점, 한국지능정보사회진흥원(NIA) 평가가 15점이다. 전문가 평가는 AI 전문가 10명이 개발 전략·기술, 개발 성과·계획, 파급효과·기여계획 등을 평가했고 사용자 평가는 AI 스타트업 대표 등 전문 사용자 49명과 일반 국민 185명이 참여했다.

따라서 AAII에서 47점을 받은 것이 곧 독파모 2차 평가에서 가장 높은 점수를 받았다는 의미는 아니다. 실제 정부 발표에서도 4개 팀의 벤치마크 점수 평균은 22.5점이었고 1위와 4위의 격차는 4점에 그쳤다. 전문가 평가의 1·4위 격차는 2.4점, 사용자 평가에서는 5점이었다. 즉 글로벌 벤치마크만 놓고 보면 차이가 있었지만 100점짜리 종합평가에서는 다른 항목이 순위를 충분히 뒤집을 수 있는 구조였다.

과기정통부가 공개한 탈락 사유도 여기에 있다. 류제명 과기정통부 2차관은 모티프가 기술력 측면에서는 뛰어난 성과를 냈지만 “사용성·활용성 측면에서는 다른 모델보다 다소 낮은 평가”를 받았다고 설명했다. 반면 업스테이지는 포털 다음 서비스 실증과 국산 NPU 협업, SK텔레콤은 대규모 상용 서비스 및 산업 특화 에이전트 실증, LG AI연구원은 국제기구 협업과 에이전틱 AI 차별성 및 위험관리 등에서 높은 평가를 받았다.

◆ ‘성능 좋은 모델’과 ‘쓸 수 있는 모델’은 다르다

정부가 사용성과 활용성을 별도로 본 이유도 있다. 이번 독파모 사업의 다음 단계는 단순히 높은 벤치마크 점수를 기록하는 모델을 만드는 데 그치지 않고 실제 국민 서비스와 산업 현장에 적용할 수 있는 AI를 만드는 데 초점이 맞춰져 있기 때문이다. 이에 따라 모델의 답변 성능뿐 아니라 서비스 적용 계획, 산업 생태계 기여, 실제 사용 효용 등을 평가하도록 구조가 바뀌었다.

실제 AAII 역시 모델의 추론·지식·코딩 등 다양한 능력을 종합적으로 보는 글로벌 지표지만 특정 모델의 실제 서비스 안정성이나 한국 산업 환경에서의 활용성을 모두 보여주는 것은 아니다. 모티프 역시 이 점을 인정하면서도 파운데이션 모델의 핵심 가치는 챗봇 사용성보다 여러 분야로 확장 가능한 기반 성능에 있다고 주장하고 있다.

논란은 결국 ‘국가대표 AI를 무엇으로 뽑을 것인가’라는 문제로 이어진다. 글로벌 성능을 우선하면 모티프의 탈락은 납득하기 어렵지만, 실제 국민 서비스와 산업 적용까지 고려한다면 모델 성능 외 평가가 필요하다는 정부 논리에도 일리가 있다. 문제는 어느 쪽이 맞느냐보다 그 판단을 검증할 수 있도록 세부 점수와 평가 기준을 얼마나 공개할 수 있느냐다.

모티프가 제기한 가장 큰 문제도 바로 이 부분이다. 모티프는 AAII 47점과 다른 평가 결과가 크게 엇갈린 이유를 알 수 있도록 세부 점수와 전문가·사용자 평가 근거를 공개해야 한다고 요구하고 있다. 특히 사용자 평가에서 브랜드 인지도나 선입견이 결과에 영향을 줬는지, 블라인드 평가가 적용됐는지도 확인해야 한다는 주장이다.

정부도 평가방식 자체의 한계를 인식하고 있다. 과기정통부는 3차 평가를 앞두고 소수 승자만 뽑는 기존 방식을 넘어 프런티어급 모델 경쟁이 가능하도록 지원체계를 전면 재편하는 방안을 검토하고 있다. 3차 진출팀에는 엔비디아 B200 GPU 지원도 상반기 768장에서 하반기 약 1000장 수준으로 확대할 계획이다.

한편 이번 논란에서 중요한 것은 모티프를 다시 선정하느냐가 아니다. 국민 세금이 투입되는 국가대표 AI 선발전이라면 왜 탈락했는지를 외부에서도 검증할 수 있어야 한다는 것이다. 글로벌 벤치마크와 실제 활용성 가운데 어느 쪽에 더 높은 가치를 둘지는 정책적 선택일 수 있다. 다만 그 선택이 설득력을 가지려면 점수와 기준이 투명하게 공개돼야 한다. 이번 이의 제기가 독파모의 기술 경쟁뿐 아니라 국가 AI 선발 시스템 자체의 신뢰도를 점검하는 계기가 될 전망이다.


0개의 댓글
0 / 300
댓글 더보기
롯데
빙그레
미래에셋
현대
국민카드
메리츠증권
하이닉스
농협
한화
동국제약
kb금융그룹
청정원
하나금융그룹
위메이드
넷마블
LG화학
농협
신한투자
포스코
키움증권
SK증권
올리브영
한국토지주택공사
사회안전망
KB국민은행
보령
우리금융
미래에셋자산운용
한국자산운용
신한라이프
기업은행
태광
효성
삼성물산
컴투스
부영그룹
다음
이전
댓글을 삭제 하시겠습니까?
닫기
로그인 후 댓글작성이 가능합니다.
로그인 하시겠습니까?
닫기
기사 이미지 확대 보기
닫기