검색결과 총 6건
-
AAII 1위 모티프는 왜 탈락했나…독파모 평가 공개 놓고 논란
[경제일보] 정부의 ‘독자 AI 파운데이션 모델 프로젝트’(독파모) 2차 평가에서 글로벌 성능지표 1위를 기록한 모티프테크놀로지스가 탈락하면서 평가 방식의 투명성을 둘러싼 논쟁이 커지고 있다. 모티프의 ‘Motif 3’는 글로벌 AI 평가기관 아티피셜 애널리시스의 AAII에서 47점을 받아 업스테이지(37점), SK텔레콤(35점), LG AI연구원(31점)을 모두 앞섰다. 하지만 최종 종합평가에서는 4개 팀 중 최하위를 기록했다. 모티프테크놀로지스는 27일 과학기술정보통신부에 공식 이의를 제기하고 전체 평가 항목별·업체별 점수와 판단 근거, 벤치마크 배점 산정 방식, 전문가 평가 기준, 사용자 평가 방법론 및 블라인드 평가 여부 등을 공개해 달라고 요구했다. 이의 제기 결과와 관계없이 독파모 3차에는 참여하지 않겠다는 입장도 밝혔다. ◆ ‘AAII 47점’이 탈락으로 이어진 이유 핵심은 AAII가 독파모 전체 평가의 일부에 불과했다는 점이다. 2차 평가는 벤치마크 40점, 전문가 평가 35점, 사용자 평가 25점 등 총 100점으로 구성됐다. 벤치마크 가운데 AAII가 25점, 한국지능정보사회진흥원(NIA) 평가가 15점이다. 전문가 평가는 AI 전문가 10명이 개발 전략·기술, 개발 성과·계획, 파급효과·기여계획 등을 평가했고 사용자 평가는 AI 스타트업 대표 등 전문 사용자 49명과 일반 국민 185명이 참여했다. 따라서 AAII에서 47점을 받은 것이 곧 독파모 2차 평가에서 가장 높은 점수를 받았다는 의미는 아니다. 실제 정부 발표에서도 4개 팀의 벤치마크 점수 평균은 22.5점이었고 1위와 4위의 격차는 4점에 그쳤다. 전문가 평가의 1·4위 격차는 2.4점, 사용자 평가에서는 5점이었다. 즉 글로벌 벤치마크만 놓고 보면 차이가 있었지만 100점짜리 종합평가에서는 다른 항목이 순위를 충분히 뒤집을 수 있는 구조였다. 과기정통부가 공개한 탈락 사유도 여기에 있다. 류제명 과기정통부 2차관은 모티프가 기술력 측면에서는 뛰어난 성과를 냈지만 “사용성·활용성 측면에서는 다른 모델보다 다소 낮은 평가”를 받았다고 설명했다. 반면 업스테이지는 포털 다음 서비스 실증과 국산 NPU 협업, SK텔레콤은 대규모 상용 서비스 및 산업 특화 에이전트 실증, LG AI연구원은 국제기구 협업과 에이전틱 AI 차별성 및 위험관리 등에서 높은 평가를 받았다. ◆ ‘성능 좋은 모델’과 ‘쓸 수 있는 모델’은 다르다 정부가 사용성과 활용성을 별도로 본 이유도 있다. 이번 독파모 사업의 다음 단계는 단순히 높은 벤치마크 점수를 기록하는 모델을 만드는 데 그치지 않고 실제 국민 서비스와 산업 현장에 적용할 수 있는 AI를 만드는 데 초점이 맞춰져 있기 때문이다. 이에 따라 모델의 답변 성능뿐 아니라 서비스 적용 계획, 산업 생태계 기여, 실제 사용 효용 등을 평가하도록 구조가 바뀌었다. 실제 AAII 역시 모델의 추론·지식·코딩 등 다양한 능력을 종합적으로 보는 글로벌 지표지만 특정 모델의 실제 서비스 안정성이나 한국 산업 환경에서의 활용성을 모두 보여주는 것은 아니다. 모티프 역시 이 점을 인정하면서도 파운데이션 모델의 핵심 가치는 챗봇 사용성보다 여러 분야로 확장 가능한 기반 성능에 있다고 주장하고 있다. 논란은 결국 ‘국가대표 AI를 무엇으로 뽑을 것인가’라는 문제로 이어진다. 글로벌 성능을 우선하면 모티프의 탈락은 납득하기 어렵지만, 실제 국민 서비스와 산업 적용까지 고려한다면 모델 성능 외 평가가 필요하다는 정부 논리에도 일리가 있다. 문제는 어느 쪽이 맞느냐보다 그 판단을 검증할 수 있도록 세부 점수와 평가 기준을 얼마나 공개할 수 있느냐다. 모티프가 제기한 가장 큰 문제도 바로 이 부분이다. 모티프는 AAII 47점과 다른 평가 결과가 크게 엇갈린 이유를 알 수 있도록 세부 점수와 전문가·사용자 평가 근거를 공개해야 한다고 요구하고 있다. 특히 사용자 평가에서 브랜드 인지도나 선입견이 결과에 영향을 줬는지, 블라인드 평가가 적용됐는지도 확인해야 한다는 주장이다. 정부도 평가방식 자체의 한계를 인식하고 있다. 과기정통부는 3차 평가를 앞두고 소수 승자만 뽑는 기존 방식을 넘어 프런티어급 모델 경쟁이 가능하도록 지원체계를 전면 재편하는 방안을 검토하고 있다. 3차 진출팀에는 엔비디아 B200 GPU 지원도 상반기 768장에서 하반기 약 1000장 수준으로 확대할 계획이다. 한편 이번 논란에서 중요한 것은 모티프를 다시 선정하느냐가 아니다. 국민 세금이 투입되는 국가대표 AI 선발전이라면 왜 탈락했는지를 외부에서도 검증할 수 있어야 한다는 것이다. 글로벌 벤치마크와 실제 활용성 가운데 어느 쪽에 더 높은 가치를 둘지는 정책적 선택일 수 있다. 다만 그 선택이 설득력을 가지려면 점수와 기준이 투명하게 공개돼야 한다. 이번 이의 제기가 독파모의 기술 경쟁뿐 아니라 국가 AI 선발 시스템 자체의 신뢰도를 점검하는 계기가 될 전망이다.
2026-08-27 09:38:30
-
독파모 2차 평가 공개…모티프·SKT·LG AI연구원 항목별 강점 엇갈려
[경제일보] 정부가 '국가대표 AI' 육성을 위해 추진 중인 독자 AI 파운데이션 모델 프로젝트의 2차 단계 평가 세부 기준과 결과를 공개했다. 이번 평가는 글로벌 AI 벤치마크뿐 아니라 국내 환경에 맞춘 성능 평가, 전문가 평가, 실제 사용자 평가까지 반영한 것이 특징이다. 당초 항목별 1위 기업과 점수를 공개하지 않는다는 방침이었지만 평가 투명성을 둘러싼 논란이 제기되자 1차 평가와 동일한 수준으로 공개 범위를 확대했다. 20일 과학기술정보통신부는 최근 발표한 독자 AI 파운데이션 모델 프로젝트 2차 단계 평가의 기준과 결과를 공개했다고 밝혔다. 이번 평가에는 SK텔레콤, LG AI연구원, 모티프테크놀로지스 등 4개 정예팀이 참여했다. 이번 2차 평가는 총 100점 만점으로 벤치마크 평가 40점, 전문가 평가 35점, 사용자 평가 25점으로 구성됐다. 단순히 AI 모델의 벤치마크 성능만 비교하는 방식에서 벗어나 기술적 독자성, 개발 전략, 생태계 파급 효과, 실제 사용성 등을 종합적으로 평가한 것으로 알려졌다. 가장 큰 비중을 차지한 벤치마크 평가는 글로벌 평가와 국내 평가로 나뉜다. 글로벌 평가에는 'AAII'에서 활용하는 벤치마크를 적용해 에이전트, 코딩, 일반 지식, 과학적 추론 등 분야의 성능을 평가했다. 국내 평가는 한국지능정보사회진흥원(NIA) 벤치마크를 활용해 수학, 지식, 장문 이해, 안전성, 신뢰성, 한국어, 지시 이행 등 7개 분야를 평가했다. 글로벌 AAII 평가에서는 모티프테크놀로지스 정예팀이 11.9점으로 가장 높은 점수를 받았다. NIA 벤치마크에서는 SK텔레콤 정예팀이 13.4점으로 최고점을 기록했다. 4개 팀의 AAII 평균 점수는 9.48점, NIA 벤치마크 평균은 13.05점이었다. 전문가 평가는 외부 전문가 10명으로 구성된 평가위원회가 진행했다. 산업계 3명, 학계 5명, 연구계 2명이 참여했으며 정예팀이 제출한 자료를 바탕으로 약 5일간 서면 평가와 질의응답을 진행했다. 전문가 평가는 개발 전략 및 기술 10점, 개발 성과 및 계획 10점, 생태계·글로벌 파급효과 및 기여 계획 15점으로 구성됐다. 특히 이번 2차 평가에서는 1차 평가 이후 제기된 AI 모델의 독자성과 활용성에 대한 요구를 반영했다. 향후 AI 기술 변화에 대응하는 '무빙타깃' 전략과 차세대 기술 도입 계획 등도 평가 대상에 포함됐다. 전문가 평가에서는 LG AI연구원 정예팀이 29.5점으로 최고점을 기록했다. 4개 팀 평균은 28.75점이었다. 실제 이용자가 AI 모델을 어떻게 평가하는지도 점수에 반영됐다. 사용자 평가는 AI 전문 사용자와 일반 국민으로 나눠 진행됐으며 AI 스타트업 대표 등 전문 사용자 49명과 일반 국민 185명이 실제 평가에 참여했다. 전문 사용자 평가는 15점 만점으로 환산됐으며 SK텔레콤 정예팀이 11.6점으로 가장 높은 점수를 받았다. 일반 국민 평가에서는 LG AI연구원 정예팀이 7.6점으로 최고점을 기록했다. 일반 국민 평가단은 성별과 연령별 쿼터를 적용해 무작위로 선정됐다. 글로벌 벤치마크에서는 모티프테크놀로지스, 국내 벤치마크와 전문 사용자 평가에서는 SK텔레콤, 전문가 평가와 일반 국민 평가에서는 LG AI연구원이 각각 최고점을 기록했다. 과기정통부 관계자는 "독파모 프로젝트는 단순한 순위 경쟁이나 탈락 팀 선정을 목적으로 하는 것이 아니라, 우리 AI 기업들이 경쟁을 넘어 성장하고, 국내 AI 생태계의 질적 성장과 확장을 견인하는 데 그 취지가 있다"며 "평가 결과 공개에 따른 일부 기업의 예기치 않은 직·간접적 피해를 최소화하는 한편, 평가 과정 결과에 대한 공정성과 투명성이라는 가치 역시 균형 있게 고려하여, 1차 단계평가 결과 공개와 같은 수준으로 2차 단계평가 결과를 공개했다"고 말했다.
2026-08-20 17:54:50
-
-
'국가대표 AI' 2차 관문, 모티프 탈락…업스테이지·SKT·LG AI연구원 3단계 진출 확정
[경제일보] 정부의 국가대표 인공지능(AI) 모델 선발 프로젝트 '독자 AI 파운데이션 모델(독파모)' 2차 단계 평가에서 모티프테크놀로지스가 18일 탈락했다. 업스테이지와 SK텔레콤, LG AI연구원 3개 팀이 3단계로 넘어간다. 류제명 과학기술정보통신부 2차관이 이날 오전 서울 종로구 정부서울청사에서 열린 브리핑에서 결과를 발표했다. 이번 평가는 LG AI연구원 'K-엑사원 2.0', SK텔레콤 '에이닷엑스 케이투(A.X K2)', 업스테이지 '솔라 오픈 2', 모티프테크놀로지스 '모티프 3' 네 모델을 대상으로 △벤치마크 40점 △전문가 평가 35점 △사용자 평가 25점, 총 100점 만점으로 진행됐다. 가장 눈길을 끈 것은 벤치마크 결과와 최종 순위의 엇갈림이다. 지난 13일 공개된 글로벌 AI 성능 평가기관 아티피셜 애널리시스의 'AAII(Artificial Analysis Intelligence Index)'에서 모티프 3는 47점으로 4개 팀 중 가장 높은 점수를 받았다. 글로벌 거대언어모델(LLM) 가운데 10위, 오픈웨이트 모델 중 4위에 오르며 금융 업무 AI 에이전트와 코딩 부문에서 강점을 보였다. 이어 업스테이지 '솔라 오픈2 250B'가 37점, SK텔레콤 '에이닷엑스-K2'가 35점, LG AI연구원 'K-엑사원 2.0'이 31점 순이었다. 30명 미만 인력이 5개월간 개발한 모델이 대기업 두 곳을 제친 결과였지만, AAII가 벤치마크 40점 중 25점만 차지하는 구조여서 이 점수가 곧바로 최종 순위로 이어지지는 않았다. 전문가 평가에서는 개발 전략·기술(10점), 개발 성과·계획(10점), 파급효과·기여계획(15점)을 심층 평가했다. 특히 독자성과 이를 기반으로 한 성능 향상 수준을 반영했다. 사용자 평가는 AI 스타트업 대표 등 전문 사용자 49명과 일반 국민 평가단 185명이 나눠 참여했다. 벤치마크 평가에서 4개 팀 평균은 22.5점으로 1·4위 격차가 4점, 전문가 평가는 평균 28.8점에 격차 2.4점, 사용자 평가는 평균 17.6점에 격차 5점이었다. 세 항목 모두 격차가 크지 않아 근소한 차이로 순위가 갈렸을 가능성이 크다. 지난 1월 15일 1차 단계 평가에서는 LG AI연구원이 90.2점으로 종합 1위를 차지했고, SK텔레콤과 업스테이지도 관문을 넘었다. 네이버클라우드와 NC AI는 이때 탈락했다. NC AI는 종합 점수에서, 네이버클라우드는 독자성 기준에서 밀렸다. 과기정통부는 이후 추가 공모를 거쳐 모티프테크놀로지스를 합류시켜 현재의 4팀 체제를 만들었다. 2차 평가는 1차와 성격이 달랐다. 1차가 기본 언어 이해·생성 능력과 모델 완성도에 초점을 맞췄다면, 2차는 외부 도구를 호출해 실제 업무를 자율 수행하는 에이전틱 AI 역량과 오케스트레이션 능력 검증 비중이 커졌다. LG AI연구원은 엑사원의 에이전트 작업 수행 능력 강화에 주력했고, 24개 벤치마크 지표 평균 점수를 1차 63.3점에서 70.1점으로 끌어올렸다고 밝힌 바 있다. 과기정통부는 다음 단계에 진출한 3개 팀에 고성능 GPU(B200) 지원을 확대하겠다고 밝혔다. 최종 3개 모델에는 GPU 1000장 지원 등 컴퓨팅 자원과 연구개발(R&D) 지원이 이어질 것으로 예상된다. 업계에서는 정부가 추가 탈락 없이 3개 팀을 그대로 프론티어급 AI 개발 프로젝트로 넘길 가능성도 거론되고 있다. 과기정통부 관계자는 "최근 AI 모델을 둘러싼 글로벌 경쟁이 더 치열해지고, AI 모델의 범분야 성능이 눈에 띄게 도약하는 가운데, 주요 선도국에서 AI 모델의 국가 안보 전략 자산화 움직임이 현실화되고 있다"며 "과기정통부도 AI 모델 개발 필요성을 깊이 인식하고 기존의 방식을 뛰어넘는 새로운 지원 체계를 관계 부처와 논의 중에 있으며, 곧 구체적인 내용을 준비해 발표할 것"이라고 말했다.
2026-08-18 11:23:40
-
NHN클라우드, AI 풀스택 '팩토리X' 공개…"국가대표 AI 인프라 기업 도약"
[경제일보] "NHN클라우드는 '팩토리X'라는 새로운 이름으로 다시 도전을 시작하려고 한다" 26일 김동훈 NHN클라우드 대표는 NHN클라우드가 서울 중구 더플라자호텔 서울에서 진행하는 기자간담회에서 신규 AI 풀스택 브랜드 '팩토리X'와 중장기 AI 사업 전략을 발표하며 이렇게 말했다. 이날 기자간담회에는 김동훈 NHN클라우드 대표와 강민수 CIO, 김태형 CTO, 안성민 NHN엔터프라이즈 대표 등이 참석해 AI 인프라와 플랫폼, 서비스 전략을 직접 소개했다. NHN클라우드는 이날 대규모 GPU 인프라 운영 경험을 기반으로 차세대 AI 풀스택 전략을 통해 AI 인프라 사업을 확대한다는 목표를 공개했다. 단순 클라우드 사업자를 넘어 AI 인프라 구축부터 운영, 서비스 실행까지 전 과정을 제공하는 '국가대표 AI 인프라 기업'으로 도약하겠다는 것이다. NHN클라우드는 이번 신규 브랜드 공개를 시작으로 AI 사업을 핵심 성장축으로 육성한다는 계획이다. 최근 3년간 연평균 24% 성장세를 이어온 AI 사업을 기반으로 향후 전체 매출에서 AI 사업 비중을 50% 이상까지 확대하겠다는 목표도 제시했다. 김동훈 대표는 이날 발표에서 AI 산업 경쟁 구도가 변화하고 있다고 강조했다. 그는 "AI 경쟁 핵심은 거대 모델 자체보다 이를 실제 비즈니스 환경에서 안정적으로 운영하고 비용을 최적화할 수 있는 실행 환경으로 이동하고 있다"며 "'팩토리X'는 NHN클라우드가 지난 수년간 GPU 인프라 시장에서 축적한 운영 경험과 엔지니어링 역량을 집약한 결과물"이라고 강조했다. '팩토리X'는 GPU 인프라와 AI 플랫폼, AI 서비스까지 통합 제공하는 구조로 설계됐다. NHN클라우드는 개념검증(PoC) 단계에 머무르는 기업들의 AI 프로젝트를 실제 서비스와 업무 환경으로 연결하는 데 초점을 맞췄다고 설명했다. 이날 NHN클라우드는 대규모 GPU 인프라 운영 현황도 공개했다. NHN클라우드에 따르면 광주 국가 AI 데이터센터에서 엔비디아 H100 GPU와 국산 NPU를 함께 운영 중이며 AI 전용 데이터센터 '팩토리X 서울'에서는 정부 GPU 사업을 기반으로 총 27.4EF(엑사플롭스) 규모 AI 클러스터를 구축했다. 특히 NHN클라우드는 최신 GPU인 B200 7656장을 기반으로 국내 최대 수준인 4080장 단일 GPU 클러스터를 상용 운영하고 있다고 설명했다. 현장에서는 랙당 75kW급 고밀도 GPU 환경을 제어하기 위한 100% 수랭식 냉각 시스템 운영 사례도 함께 소개됐다. NHN클라우드는 이를 통해 기존 공랭식 대비 GPU 장애율을 크게 낮추고 운영 안정성을 확보했다고 강조했다. 강민수 CIO는 "AI 서비스 경쟁이 본격화되면서 GPU 확보뿐 아니라 냉각과 전력, 네트워크 설계까지 인프라 운영 역량 중요성이 커지고 있다"며 "AI 서버의 수냉을 적용한 비율은 지난해 23%에 그쳤지만 올해에는 57%로 1년 만에 약 2.5배 급등할 것으로 예상"이라고 설명했다. NHN클라우드는 GPU 자원 운영 효율화를 위한 자체 플랫폼 전략도 공개했다. 자체 개발한 GPU 통합 관리 플랫폼 'GPU Live'는 AI 학습과 추론 워크로드를 자동 분리하고 GPU 자원을 동적으로 배분하는 기능을 제공한다. 이를 통해 GPU 활용률을 높이고 유휴 자원을 최소화한다는 것이다. AI 개발 플랫폼 'AI 이지메이커'도 소개됐다. NHN클라우드는 컨테이너 기반 개발 환경을 통해 모델 학습부터 배포와 운영까지 전 과정을 지원하며 기업들의 AI 개발 생산성을 높일 수 있을 것으로 전망했다. 김태형 NHN클라우드 CTO는 "GPU를 보유한 것과 GPU를 잘 쓰는 것은 완전히 다른 문제"라며 "NHN클라우드의 인프라와 플랫폼 위에서 고객은 AI 시대가 요구하는 빠르고 폭발적인 시도를 반복할 수 있다"고 설명했다. 안성민 NHN엔터프라이즈 대표는 이날 기업 업무 환경에 적용 가능한 AI 에이전트 서비스 '프로젝트 X'도 공개했다. 해당 서비스는 올해 하반기 출시 예정으로 비개발자도 자연어 기반으로 맞춤형 AI 에이전트를 설계할 수 있도록 구성된 것이 특징이다. 안 대표는 "에이전틱 AI 서비스는 폭발적으로 성장하고 있지만, 역설적이게도 이러한 에이전틱 AI 서비스의 폭발은 기업 간 격차를 폭발적으로 벌리고 있는 양상"이라며 "프로젝트 X가 준비한 표준 환경 위에서 최신 상용 모델과 때로는 오픈 모델을 함께 활용할 수 있어 안전성과 유연성 그리고 기동성까지 동시에 만족시킨다"고 말했다. NHN클라우드는 최근 공공과 민간 AI 인프라 사업을 동시에 확대하고 있다. 지난해 정부 'AI 컴퓨팅자원 활용기반 강화 사업'에서 최대 구축 사업자로 선정된 데 이어 올해 초에는 크래프톤 GPU 클러스터 구축 사업도 수주했다. NHN클라우드는 현재 엔씨 AI, 티맥스티베로 등과 협력해 AI·클라우드 생태계 구축에도 나서고 있고, 특히 데이터 주권 기반 AI 인프라 구축과 국산 기술 중심 생태계 확대를 한다는 계획이다. 김 대표는 "100개 기업 중에 7개 기업만이 GPU를 제대로 활용하고 있다"며 "인프라를 얼마나 단단하고 효율적으로 운영하냐가 AI 성적을 좌우한다"고 강조했다.
2026-05-26 11:17:24
-