검색결과 총 43건
-
세일즈포스·앤트로픽, '클로드포스' 공개…기업 데이터 읽고 업무까지 실행
[경제일보] 세일즈포스와 앤트로픽이 기업용 인공지능(AI)의 역할을 단순 정보 검색과 문서 작성에서 실제 업무 실행 단계로 확대한다. 앤트로픽의 AI 모델 '클로드'가 세일즈포스의 고객 데이터와 영업 파이프라인, 업무 규칙 등에 접근해 분석하고 작업을 수행할 수 있도록 양사의 플랫폼을 결합한다는 구상이다. 28일 세일즈포스는 앤트로픽의 클로드에 세일즈포스의 기업용 AI 인프라인 '엔터프라이즈 하네스'를 결합한 '클로드포스'를 선보인다고 밝혔다. 양사는 이번 협력을 통해 기업의 데이터와 워크플로, 비즈니스 로직, 실행 환경, 거버넌스 등에 클로드가 접근할 수 있도록 하고 업무 전반에서 AI 에이전트 활용을 확대한다는 계획이다. 양사의 첫 결과물은 '세일즈포스 인 클로드'다. 영업 담당자가 별도의 세일즈포스 화면으로 이동하지 않고 클로드 안에서 세일즈포스 기능을 활용할 수 있도록 설계된 플러그인으로, 미팅 준비와 딜 상태 검토, 파이프라인 분석 등 37개의 사전 구축된 영업 스킬을 구현했다. 클로드는 세일즈포스와 슬랙에 저장된 기업 정보를 바탕으로 영업 상황을 분석하고 필요한 업무를 수행할 수 있다. 실시간 매출 맥락을 기반으로 파이프라인을 검토하거나 업데이트하는 방식이다. 일반적인 생성형 AI가 사용자의 질문에 답하거나 문서를 작성하는 데 그쳤다면, 기업 내부 시스템과 연결해 실제 업무 과정에 개입하는 형태로 확장된 것으로 평가된다. 다리오 아모데이 앤트로픽 공동창업자 겸 CEO는 "우리는 프론티어 지능이 안전하고 신뢰할 수 있으며 높은 역량을 갖춰야 한다고 믿는다"며 이번 파트너십을 통해 기업들은 수십 년간 세일즈포스에 구축해 온 고객 정보와 비즈니스 맥락에 클로드를 연결하고, 이를 사용해 실제 비즈니스를 운영하고 성장시킬 수 있다"고 말했다. 특히 이번 통합 모델은 AI가 기업 데이터를 가져와 사용하는 과정에서 기존의 권한과 업무 규칙을 그대로 적용하는 것이 특징이다. 관리자가 한 차례 연결하면 인증과 권한이 중앙에서 관리되며 별도의 사용자별 추가 설정 없이 사용할 수 있도록 설계됐다. 최근 기업들은 AI의 활용 범위가 넓어질수록 내부 데이터에 대한 접근 통제를 중요 과제로 꼽고 있다. 고객 정보나 영업 자료 등 민감한 기업 데이터를 AI가 직접 처리할 경우 누가 어떤 데이터에 접근하고 어떤 업무를 실행할 수 있는지를 통제하지 못하면 생산성 향상만큼 보안 위험도 커질 수 있기 때문이다. 세일즈포스는 기존 기업의 데이터와 업무 규칙을 AI의 실행 과정에 포함하는 방식으로 해당 문제를 해결한다는 전략이다. 클로드가 임의로 데이터를 수정하거나 업무를 수행하는 것이 아니라 세일즈포스에 구축된 권한 체계와 비즈니스 규칙을 기반으로 작업하도록 해 기업이 기존 통제 체계를 유지할 수 있도록 했다. 규제 산업을 겨냥한 보안 체계도 강조했다. 세일즈포스는 아마존웹서비스(AWS)의 아마존 베드록을 통해 클로드를 세일즈포스의 '신뢰 경계' 내에서 제공할 수 있도록 설정했다. 세일즈포스는 이를 통해 금융 등 규제 수준이 높은 산업에서도 기업의 데이터와 AI 작업을 보호하면서 도메인 특화 AI를 활용할 수 있다고 설명했다. 반대로 클로드가 세일즈포스 플랫폼 안으로 들어가는 통합도 진행된다. 클로드는 세일즈포스의 '에이전트포스'에서 사용할 수 있으며 아틀라스 추론 엔진의 추론 모델로 활용된다. 에이전트포스 바이브와 에이전트포스 코워커를 구동하고 에이전트 빌더에서도 사용할 수 있도록 지원한다. 슬랙 역시 양사 통합의 주요 축이다. 세일즈포스는 업무용 협업 플랫폼 슬랙에 클로드를 내장해 사람과 AI 에이전트가 같은 업무 공간에서 협업하도록 한다는 구상이다. 클로드는 슬랙봇의 기본 AI 모델로 활용되며 팀의 의사결정 지원과 코딩 등 업무 영역으로 활용 범위를 넓힌다. 이처럼 양사가 서로의 플랫폼에 AI와 업무 시스템을 깊게 연결하는 것은 기업용 AI 시장의 경쟁 구도가 달라지고 있기 때문으로 풀이된다. 과거에는 어떤 AI 모델이 더 높은 벤치마크 점수와 추론 성능을 갖췄는지가 중요했다면, 최근에는 해당 모델이 기업의 실제 데이터와 업무 시스템에 접근해 얼마나 많은 업무를 처리할 수 있는지가 중요한 경쟁 요소로 부상하고 있다. '세일즈포스 인 클로드'는 현재 일부 고객을 대상으로 파일럿 형태로 제공되고 있으며 내달 오픈 베타 출시가 예정됐다. 추가 사전 구축 스킬도 올해 하반기부터 순차적으로 확대할 계획이다. 마크 베니오프 세일즈포스 회장 겸 CEO는 "이번 파트너십은 글로벌 선도 AI와 선도 CRM의 강점을 하나로 결합한다"며 "클로드의 뛰어난 추론 능력과 신뢰할 수 있는 데이터, 업무 흐름, 관리 체계를 결합해 사고하고 추론하며 실행하는 동적인 업무 환경을 제공한다"고 말했다.
2026-08-28 14:08:16
-
AAII 1위 모티프는 왜 탈락했나…독파모 평가 공개 놓고 논란
[경제일보] 정부의 ‘독자 AI 파운데이션 모델 프로젝트’(독파모) 2차 평가에서 글로벌 성능지표 1위를 기록한 모티프테크놀로지스가 탈락하면서 평가 방식의 투명성을 둘러싼 논쟁이 커지고 있다. 모티프의 ‘Motif 3’는 글로벌 AI 평가기관 아티피셜 애널리시스의 AAII에서 47점을 받아 업스테이지(37점), SK텔레콤(35점), LG AI연구원(31점)을 모두 앞섰다. 하지만 최종 종합평가에서는 4개 팀 중 최하위를 기록했다. 모티프테크놀로지스는 27일 과학기술정보통신부에 공식 이의를 제기하고 전체 평가 항목별·업체별 점수와 판단 근거, 벤치마크 배점 산정 방식, 전문가 평가 기준, 사용자 평가 방법론 및 블라인드 평가 여부 등을 공개해 달라고 요구했다. 이의 제기 결과와 관계없이 독파모 3차에는 참여하지 않겠다는 입장도 밝혔다. ◆ ‘AAII 47점’이 탈락으로 이어진 이유 핵심은 AAII가 독파모 전체 평가의 일부에 불과했다는 점이다. 2차 평가는 벤치마크 40점, 전문가 평가 35점, 사용자 평가 25점 등 총 100점으로 구성됐다. 벤치마크 가운데 AAII가 25점, 한국지능정보사회진흥원(NIA) 평가가 15점이다. 전문가 평가는 AI 전문가 10명이 개발 전략·기술, 개발 성과·계획, 파급효과·기여계획 등을 평가했고 사용자 평가는 AI 스타트업 대표 등 전문 사용자 49명과 일반 국민 185명이 참여했다. 따라서 AAII에서 47점을 받은 것이 곧 독파모 2차 평가에서 가장 높은 점수를 받았다는 의미는 아니다. 실제 정부 발표에서도 4개 팀의 벤치마크 점수 평균은 22.5점이었고 1위와 4위의 격차는 4점에 그쳤다. 전문가 평가의 1·4위 격차는 2.4점, 사용자 평가에서는 5점이었다. 즉 글로벌 벤치마크만 놓고 보면 차이가 있었지만 100점짜리 종합평가에서는 다른 항목이 순위를 충분히 뒤집을 수 있는 구조였다. 과기정통부가 공개한 탈락 사유도 여기에 있다. 류제명 과기정통부 2차관은 모티프가 기술력 측면에서는 뛰어난 성과를 냈지만 “사용성·활용성 측면에서는 다른 모델보다 다소 낮은 평가”를 받았다고 설명했다. 반면 업스테이지는 포털 다음 서비스 실증과 국산 NPU 협업, SK텔레콤은 대규모 상용 서비스 및 산업 특화 에이전트 실증, LG AI연구원은 국제기구 협업과 에이전틱 AI 차별성 및 위험관리 등에서 높은 평가를 받았다. ◆ ‘성능 좋은 모델’과 ‘쓸 수 있는 모델’은 다르다 정부가 사용성과 활용성을 별도로 본 이유도 있다. 이번 독파모 사업의 다음 단계는 단순히 높은 벤치마크 점수를 기록하는 모델을 만드는 데 그치지 않고 실제 국민 서비스와 산업 현장에 적용할 수 있는 AI를 만드는 데 초점이 맞춰져 있기 때문이다. 이에 따라 모델의 답변 성능뿐 아니라 서비스 적용 계획, 산업 생태계 기여, 실제 사용 효용 등을 평가하도록 구조가 바뀌었다. 실제 AAII 역시 모델의 추론·지식·코딩 등 다양한 능력을 종합적으로 보는 글로벌 지표지만 특정 모델의 실제 서비스 안정성이나 한국 산업 환경에서의 활용성을 모두 보여주는 것은 아니다. 모티프 역시 이 점을 인정하면서도 파운데이션 모델의 핵심 가치는 챗봇 사용성보다 여러 분야로 확장 가능한 기반 성능에 있다고 주장하고 있다. 논란은 결국 ‘국가대표 AI를 무엇으로 뽑을 것인가’라는 문제로 이어진다. 글로벌 성능을 우선하면 모티프의 탈락은 납득하기 어렵지만, 실제 국민 서비스와 산업 적용까지 고려한다면 모델 성능 외 평가가 필요하다는 정부 논리에도 일리가 있다. 문제는 어느 쪽이 맞느냐보다 그 판단을 검증할 수 있도록 세부 점수와 평가 기준을 얼마나 공개할 수 있느냐다. 모티프가 제기한 가장 큰 문제도 바로 이 부분이다. 모티프는 AAII 47점과 다른 평가 결과가 크게 엇갈린 이유를 알 수 있도록 세부 점수와 전문가·사용자 평가 근거를 공개해야 한다고 요구하고 있다. 특히 사용자 평가에서 브랜드 인지도나 선입견이 결과에 영향을 줬는지, 블라인드 평가가 적용됐는지도 확인해야 한다는 주장이다. 정부도 평가방식 자체의 한계를 인식하고 있다. 과기정통부는 3차 평가를 앞두고 소수 승자만 뽑는 기존 방식을 넘어 프런티어급 모델 경쟁이 가능하도록 지원체계를 전면 재편하는 방안을 검토하고 있다. 3차 진출팀에는 엔비디아 B200 GPU 지원도 상반기 768장에서 하반기 약 1000장 수준으로 확대할 계획이다. 한편 이번 논란에서 중요한 것은 모티프를 다시 선정하느냐가 아니다. 국민 세금이 투입되는 국가대표 AI 선발전이라면 왜 탈락했는지를 외부에서도 검증할 수 있어야 한다는 것이다. 글로벌 벤치마크와 실제 활용성 가운데 어느 쪽에 더 높은 가치를 둘지는 정책적 선택일 수 있다. 다만 그 선택이 설득력을 가지려면 점수와 기준이 투명하게 공개돼야 한다. 이번 이의 제기가 독파모의 기술 경쟁뿐 아니라 국가 AI 선발 시스템 자체의 신뢰도를 점검하는 계기가 될 전망이다.
2026-08-27 09:38:30
-
-
SKT, '모두의 AI' 승부수…좋은 모델보다 빠른 '개선 루프'에 방점
[경제일보] SK텔레콤이 정부의 ‘모두의 AI’ 사업을 계기로 인공지능(AI) 경쟁의 기준을 모델 성능에서 서비스를 통해 지능을 얼마나 빠르게 개선하느냐로 확장하고 있다. 6880억개 파라미터의 독자 AI 모델 ‘A.X K2’를 확보한 데 이어 대규모 이용자가 실제로 사용하는 서비스와 AI 인프라를 연결하고, 여기서 축적되는 데이터를 다시 모델과 시스템 개선에 투입하는 순환 구조를 구축하겠다는 전략이다. 유경상 SK텔레콤 AI CIC장은 24일 회사 뉴스룸에 게재한 칼럼에서 “미래의 AI 경쟁은 가장 좋은 모델을 한 번 만들어내는 경쟁이 아니라, 가장 빠른 ‘지능의 개선 루프’를 구축하는 경쟁이 될 것”이라고 밝혔다. 모델을 개발하는 것만으로는 부족하며 추론 비용, 서비스 완성도, 재학습 속도, 신뢰성까지 하나의 시스템으로 연결해야 실제 경쟁력이 된다는 설명이다. ◆ A.X K2에서 ‘모두의 AI’까지…모델을 서비스로 검증 SKT는 지난 7월 29일 6880억개 파라미터 규모의 A.X K2를 공개했다. 기존 A.X K1보다 수학·과학 추론과 한국어 지식, 장문 이해 및 에이전트 역량을 강화했으며, 14개 벤치마크 평균 성능이 32.2%포인트 향상됐다고 밝혔다. 최근에는 국제수학올림피아드(IMO) 2026 문제 평가에서 금메달 기준에 해당하는 점수를 기록했다고 발표하며 모델 자체의 성능도 강조하고 있다. 그러나 SKT가 이번에 강조한 것은 모델의 ‘크기’보다 이를 실제 서비스에서 얼마나 효율적으로 운영하느냐다. 수백만명이 동시에 AI를 이용할 경우 모든 질문을 최고 성능 모델로 처리하면 비용 부담이 커질 수밖에 없다. SKT는 이를 해결하기 위해 일부 매개변수만 활성화하는 MoE 구조, 질문 난이도에 따른 추론 방식 조절, 경량 모델과 대형 모델의 선택적 배치, 메모리와 연산 자원의 최적화 등을 제시했다. 특히 에이닷은 이 전략을 검증할 수 있는 핵심 서비스다. SKT에 따르면 에이닷은 지난해 9월 MAU 1000만명을 넘어섰고, 지난해 8월에는 에이전틱 워크플로우를 적용해 사용자의 요구를 해석하고 작업을 계획·실행하는 기능을 강화했다. 대규모 이용자가 실제 서비스를 사용하는 과정에서 발생하는 데이터를 AI 개선으로 연결할 수 있는 기반을 확보한 셈이다. ◆ ‘대화 수’ 아닌 ‘완료한 일’이 AI 성패 가른다 SKT가 정부 사업에서 강조하는 것도 이 같은 서비스 경험이다. 과학기술정보통신부와 정보통신산업진흥원이 추진하는 ‘모두의 AI’는 국산 AI 모델을 활용해 연내 전 국민 대상 무료 범용 AI 챗봇과 공공 AI 에이전트를 제공하는 사업이다. 지난 18일 공모를 마감한 결과 SKT·KT·카카오·이스트소프트·엠케이디·제논 등 6개 컨소시엄이 제안서를 제출했다. 아직 최종 사업자는 선정되지 않았다. SKT는 금융·모빌리티·미디어·교육·의료·공공·세무·돌봄 등 다양한 분야 기업과 컨소시엄을 구성했다. AI 모델 하나로 모든 문제를 해결하는 것이 아니라 각 산업의 전문기업과 AI 모델·서비스를 연결하는 ‘오케스트레이터’ 역할을 맡겠다는 구상이다. 유 CIC장은 특히 AI 성과를 “대화의 횟수가 아니라 완료된 일의 숫자로 측정해야 한다”고 강조했다. AI가 질문에 얼마나 정확하게 답했는지를 넘어 검색과 도구 호출, 실행을 거쳐 실제 사용자의 목적을 달성했는지 봐야 한다는 것이다. 이는 향후 AI 경쟁이 챗봇의 답변 품질에서 에이전트의 실행 성공률과 비용 효율성으로 이동할 가능성을 보여준다. ◆ 정부 사업은 SKT AI 전략의 실증 무대 ‘모두의 AI’는 SKT 입장에서도 사업성을 검증할 기회다. 정부는 국산 AI 모델 활용과 전국민 무료 서비스 출시를 조건으로 GPU 등을 지원하고 있으며, 2027년 이후에는 AI 에이전트 고도화도 추진할 계획이다. 결국 관건은 이용자다. 얼마나 많은 국민이 서비스를 실제로 사용하고, 그 과정에서 발생한 경험이 모델 개선과 서비스 고도화로 얼마나 빠르게 돌아가느냐가 중요하다. SKT가 통신망과 에이닷, 독자 모델, AI 데이터센터까지 갖춘 풀스택 역량을 강조하는 이유도 여기에 있다. AI 경쟁이 ‘누가 가장 좋은 모델을 보유했는가’에서 ‘누가 실제 생활에서 더 많은 일을 처리하게 만들고 더 빠르게 개선하는가’로 이동한다면, SKT의 승부처 역시 모델 자체보다 서비스→데이터→개선→재서비스로 이어지는 선순환 구조가 될 전망이다.
2026-08-24 15:47:18
-
독파모 2차 평가 공개…모티프·SKT·LG AI연구원 항목별 강점 엇갈려
[경제일보] 정부가 '국가대표 AI' 육성을 위해 추진 중인 독자 AI 파운데이션 모델 프로젝트의 2차 단계 평가 세부 기준과 결과를 공개했다. 이번 평가는 글로벌 AI 벤치마크뿐 아니라 국내 환경에 맞춘 성능 평가, 전문가 평가, 실제 사용자 평가까지 반영한 것이 특징이다. 당초 항목별 1위 기업과 점수를 공개하지 않는다는 방침이었지만 평가 투명성을 둘러싼 논란이 제기되자 1차 평가와 동일한 수준으로 공개 범위를 확대했다. 20일 과학기술정보통신부는 최근 발표한 독자 AI 파운데이션 모델 프로젝트 2차 단계 평가의 기준과 결과를 공개했다고 밝혔다. 이번 평가에는 SK텔레콤, LG AI연구원, 모티프테크놀로지스 등 4개 정예팀이 참여했다. 이번 2차 평가는 총 100점 만점으로 벤치마크 평가 40점, 전문가 평가 35점, 사용자 평가 25점으로 구성됐다. 단순히 AI 모델의 벤치마크 성능만 비교하는 방식에서 벗어나 기술적 독자성, 개발 전략, 생태계 파급 효과, 실제 사용성 등을 종합적으로 평가한 것으로 알려졌다. 가장 큰 비중을 차지한 벤치마크 평가는 글로벌 평가와 국내 평가로 나뉜다. 글로벌 평가에는 'AAII'에서 활용하는 벤치마크를 적용해 에이전트, 코딩, 일반 지식, 과학적 추론 등 분야의 성능을 평가했다. 국내 평가는 한국지능정보사회진흥원(NIA) 벤치마크를 활용해 수학, 지식, 장문 이해, 안전성, 신뢰성, 한국어, 지시 이행 등 7개 분야를 평가했다. 글로벌 AAII 평가에서는 모티프테크놀로지스 정예팀이 11.9점으로 가장 높은 점수를 받았다. NIA 벤치마크에서는 SK텔레콤 정예팀이 13.4점으로 최고점을 기록했다. 4개 팀의 AAII 평균 점수는 9.48점, NIA 벤치마크 평균은 13.05점이었다. 전문가 평가는 외부 전문가 10명으로 구성된 평가위원회가 진행했다. 산업계 3명, 학계 5명, 연구계 2명이 참여했으며 정예팀이 제출한 자료를 바탕으로 약 5일간 서면 평가와 질의응답을 진행했다. 전문가 평가는 개발 전략 및 기술 10점, 개발 성과 및 계획 10점, 생태계·글로벌 파급효과 및 기여 계획 15점으로 구성됐다. 특히 이번 2차 평가에서는 1차 평가 이후 제기된 AI 모델의 독자성과 활용성에 대한 요구를 반영했다. 향후 AI 기술 변화에 대응하는 '무빙타깃' 전략과 차세대 기술 도입 계획 등도 평가 대상에 포함됐다. 전문가 평가에서는 LG AI연구원 정예팀이 29.5점으로 최고점을 기록했다. 4개 팀 평균은 28.75점이었다. 실제 이용자가 AI 모델을 어떻게 평가하는지도 점수에 반영됐다. 사용자 평가는 AI 전문 사용자와 일반 국민으로 나눠 진행됐으며 AI 스타트업 대표 등 전문 사용자 49명과 일반 국민 185명이 실제 평가에 참여했다. 전문 사용자 평가는 15점 만점으로 환산됐으며 SK텔레콤 정예팀이 11.6점으로 가장 높은 점수를 받았다. 일반 국민 평가에서는 LG AI연구원 정예팀이 7.6점으로 최고점을 기록했다. 일반 국민 평가단은 성별과 연령별 쿼터를 적용해 무작위로 선정됐다. 글로벌 벤치마크에서는 모티프테크놀로지스, 국내 벤치마크와 전문 사용자 평가에서는 SK텔레콤, 전문가 평가와 일반 국민 평가에서는 LG AI연구원이 각각 최고점을 기록했다. 과기정통부 관계자는 "독파모 프로젝트는 단순한 순위 경쟁이나 탈락 팀 선정을 목적으로 하는 것이 아니라, 우리 AI 기업들이 경쟁을 넘어 성장하고, 국내 AI 생태계의 질적 성장과 확장을 견인하는 데 그 취지가 있다"며 "평가 결과 공개에 따른 일부 기업의 예기치 않은 직·간접적 피해를 최소화하는 한편, 평가 과정 결과에 대한 공정성과 투명성이라는 가치 역시 균형 있게 고려하여, 1차 단계평가 결과 공개와 같은 수준으로 2차 단계평가 결과를 공개했다"고 말했다.
2026-08-20 17:54:50
-
-
SKT 'A.X K2' 3단계행…셀렉트스타, AI 데이터 품질 검증 고도화 나선다
[경제일보] 정부의 '독자 AI 파운데이션 모델' 프로젝트 2차 평가에서 SK텔레콤 컨소시엄이 3단계에 진출한 가운데 컨소시엄의 데이터 부문을 맡은 셀렉트스타의 역할도 확대되고 있다. 인공지능(AI) 모델의 성능 경쟁이 고도화하면서 학습 데이터의 품질과 안전성을 관리하는 역량이 독자 AI 모델 경쟁력의 주요 요소로 부상하고 있는 것으로 분석된다. 18일 셀렉트스타가 참여한 SK텔레콤 컨소시엄은 과학기술정보통신부가 추진하는 '독자 AI 파운데이션 모델' 프로젝트 2차 평가를 통과해 3개 정예팀 가운데 하나로 선정됐다. 이번 평가에서는 SK텔레콤의 'A.X K2'를 비롯해 업스테이지 '솔라 오픈 2', LG AI연구원 'K-엑사원 2.0'이 3단계 개발을 이어가게 됐다. 이번 프로젝트는 글로벌 AI 모델과 경쟁할 수 있는 국내 독자 AI 파운데이션 모델을 확보하기 위해 정부가 추진하는 국가 사업이다. 2차 평가는 벤치마크와 전문가 평가, 사용자 평가 등을 종합해 후속 개발팀을 가리는 방식으로 진행됐다. SK텔레콤 컨소시엄은 SK텔레콤을 중심으로 셀렉트스타, 크래프톤, 포티투닷, 리벨리온, 라이너, SK AX, 테크노매트릭스 등 기업과 서울대, KAIST 등 학계가 참여하고 있다. SK텔레콤 컨소시엄에서 셀렉트스타는 모델 개발에 필요한 학습 데이터의 품질 관리와 검수를 담당했다. 단순히 데이터를 구축해 공급하는 역할에서 나아가 여러 참여 기관에서 생성·구축한 데이터를 동일한 기준으로 검증하고 관리하는 역할을 맡았다. 셀렉트스타는 1차 단계에서 대규모 학습 데이터를 구축하고 품질을 검증해 SK텔레콤의 'A.X K1' 성능과 신뢰성 향상을 지원한 것에 이어 2차 단계에서는 컨소시엄 내 여러 기관이 생산한 데이터를 통합 관리하는 데 초점을 맞춰 품질을 검수했다. 최근 AI 모델의 성능이 학습 데이터의 양뿐 아니라 데이터의 정확성과 일관성에 영향을 받는 만큼 데이터 품질 관리의 중요성도 커지고 있다. 특히 여러 기관이 하나의 컨소시엄을 구성해 모델을 개발할 경우 기관마다 데이터 생성 방식이나 검수 기준이 달라질 수 있어 이를 통합하는 관리 체계가 필요한 것으로 꼽힌다. 셀렉트스타는 2차 단계에서 모델 개발 과정에 필요한 데이터 품질 기준을 별도로 수립하고 세부 항목을 검증했다. 질문과 답변이 적절하게 구성됐는지를 확인하는 '질의·응답 적정성', 이미지와 질문·답변의 내용이 일치하는지를 살펴보는 'VQA(시각 질의응답) 적정성', 문장의 형식과 구조 등을 확인하는 '구문 정확성' 등이 검수 대상에 포함됐다. 특히 2차 단계에서는 1차보다 강화된 데이터 품질 기준이 적용되면서 여러 참여 기관이 구축한 데이터를 일관된 기준으로 검증하는 작업의 중요성이 커졌다. 이에 셀렉트스타는 데이터 품질 관리 프로세스를 고도화해 기관별 데이터의 품질 편차를 줄이고 사후 학습에 활용되는 데이터의 완성도를 높이는 데 주력했다. AI 안전성 확보를 위한 데이터 검수도 진행했다. 모델이 실제 서비스에 활용되는 과정에서 유해하거나 편향된 결과를 내놓는 것을 줄이기 위해 레드티밍 학습용 데이터셋의 품질을 점검했다. 레드티밍은 AI 모델에 의도적으로 취약점을 공격하거나 문제가 발생할 수 있는 질문을 제시해 모델의 위험 요소를 확인하는 방식이다. 셀렉트스타는 자체 AI 신뢰성 평가 플랫폼인 '다투모 플랫폼'과 산업·공공 분야에서 축적한 레드티밍 경험 등을 활용해 데이터 품질과 안전성 검증을 진행했다고 설명했다. AI 모델의 파라미터 규모나 벤치마크 성능뿐 아니라 어떤 데이터를 어떤 기준으로 학습시킨 것인지를 검증해 실제 서비스 경쟁력을 향상시킨 것으로 평가된다. 특히 3단계에 진입한 모델들이 향후 산업과 실생활에서 활용될 수 있는 수준으로 고도화될 경우 데이터 품질 관리와 안전성 검증에 대한 요구도 더욱 커질 전망이다. 연구·개발 단계에서 확보한 모델 성능을 실제 서비스로 연결하기 위해서는 데이터의 정확성과 안정성, 개인정보 및 편향 문제 등을 지속적으로 관리해야 하기 때문이다. 김세엽 셀렉트스타 대표는 "이번 2차 평가 통과는 SKT 컨소시엄 참여기관들이 각자의 영역에서 역량을 모아온 결과"라며 "셀렉트스타도 데이터 총괄 파트너로서 축적해 온 데이터 구축·품질 관리 역량을 바탕으로 모델 고도화를 안정적으로 지원해 나가겠다"고 말했다. 이어 "이번 프로젝트의 기술과 데이터 성과가 특정 기업에 머무르지 않고 국내 AI 생태계가 폭넓게 활용할 수 있는 결과물로 이어질 수 있도록 데이터와 신뢰성 평가 기술을 지속적으로 고도화하겠다"고 강조했다.
2026-08-18 14:08:11
-
'국가대표 AI' 2차 관문, 모티프 탈락…업스테이지·SKT·LG AI연구원 3단계 진출 확정
[경제일보] 정부의 국가대표 인공지능(AI) 모델 선발 프로젝트 '독자 AI 파운데이션 모델(독파모)' 2차 단계 평가에서 모티프테크놀로지스가 18일 탈락했다. 업스테이지와 SK텔레콤, LG AI연구원 3개 팀이 3단계로 넘어간다. 류제명 과학기술정보통신부 2차관이 이날 오전 서울 종로구 정부서울청사에서 열린 브리핑에서 결과를 발표했다. 이번 평가는 LG AI연구원 'K-엑사원 2.0', SK텔레콤 '에이닷엑스 케이투(A.X K2)', 업스테이지 '솔라 오픈 2', 모티프테크놀로지스 '모티프 3' 네 모델을 대상으로 △벤치마크 40점 △전문가 평가 35점 △사용자 평가 25점, 총 100점 만점으로 진행됐다. 가장 눈길을 끈 것은 벤치마크 결과와 최종 순위의 엇갈림이다. 지난 13일 공개된 글로벌 AI 성능 평가기관 아티피셜 애널리시스의 'AAII(Artificial Analysis Intelligence Index)'에서 모티프 3는 47점으로 4개 팀 중 가장 높은 점수를 받았다. 글로벌 거대언어모델(LLM) 가운데 10위, 오픈웨이트 모델 중 4위에 오르며 금융 업무 AI 에이전트와 코딩 부문에서 강점을 보였다. 이어 업스테이지 '솔라 오픈2 250B'가 37점, SK텔레콤 '에이닷엑스-K2'가 35점, LG AI연구원 'K-엑사원 2.0'이 31점 순이었다. 30명 미만 인력이 5개월간 개발한 모델이 대기업 두 곳을 제친 결과였지만, AAII가 벤치마크 40점 중 25점만 차지하는 구조여서 이 점수가 곧바로 최종 순위로 이어지지는 않았다. 전문가 평가에서는 개발 전략·기술(10점), 개발 성과·계획(10점), 파급효과·기여계획(15점)을 심층 평가했다. 특히 독자성과 이를 기반으로 한 성능 향상 수준을 반영했다. 사용자 평가는 AI 스타트업 대표 등 전문 사용자 49명과 일반 국민 평가단 185명이 나눠 참여했다. 벤치마크 평가에서 4개 팀 평균은 22.5점으로 1·4위 격차가 4점, 전문가 평가는 평균 28.8점에 격차 2.4점, 사용자 평가는 평균 17.6점에 격차 5점이었다. 세 항목 모두 격차가 크지 않아 근소한 차이로 순위가 갈렸을 가능성이 크다. 지난 1월 15일 1차 단계 평가에서는 LG AI연구원이 90.2점으로 종합 1위를 차지했고, SK텔레콤과 업스테이지도 관문을 넘었다. 네이버클라우드와 NC AI는 이때 탈락했다. NC AI는 종합 점수에서, 네이버클라우드는 독자성 기준에서 밀렸다. 과기정통부는 이후 추가 공모를 거쳐 모티프테크놀로지스를 합류시켜 현재의 4팀 체제를 만들었다. 2차 평가는 1차와 성격이 달랐다. 1차가 기본 언어 이해·생성 능력과 모델 완성도에 초점을 맞췄다면, 2차는 외부 도구를 호출해 실제 업무를 자율 수행하는 에이전틱 AI 역량과 오케스트레이션 능력 검증 비중이 커졌다. LG AI연구원은 엑사원의 에이전트 작업 수행 능력 강화에 주력했고, 24개 벤치마크 지표 평균 점수를 1차 63.3점에서 70.1점으로 끌어올렸다고 밝힌 바 있다. 과기정통부는 다음 단계에 진출한 3개 팀에 고성능 GPU(B200) 지원을 확대하겠다고 밝혔다. 최종 3개 모델에는 GPU 1000장 지원 등 컴퓨팅 자원과 연구개발(R&D) 지원이 이어질 것으로 예상된다. 업계에서는 정부가 추가 탈락 없이 3개 팀을 그대로 프론티어급 AI 개발 프로젝트로 넘길 가능성도 거론되고 있다. 과기정통부 관계자는 "최근 AI 모델을 둘러싼 글로벌 경쟁이 더 치열해지고, AI 모델의 범분야 성능이 눈에 띄게 도약하는 가운데, 주요 선도국에서 AI 모델의 국가 안보 전략 자산화 움직임이 현실화되고 있다"며 "과기정통부도 AI 모델 개발 필요성을 깊이 인식하고 기존의 방식을 뛰어넘는 새로운 지원 체계를 관계 부처와 논의 중에 있으며, 곧 구체적인 내용을 준비해 발표할 것"이라고 말했다.
2026-08-18 11:23:40
-
카카오 '카나나2', 허깅페이스 공개 두 모델, 안전성 평가 종합 1위
[경제일보] 카카오가 오픈소스로 공개한 경량언어모델(SLM) '카나나-2' 시리즈의 안전성 평가 결과를 18일 내놨다. 유사 규모 글로벌 모델과 비교해 종합 1위를 기록했다고 밝혔다. 평가 대상은 지난달 28일 허깅페이스에 공개한 4종 가운데 'Kanana-2-1.3B-Instruct'와 'Kanana-2-3B-Instruct'다. 카카오는 당시 4종을 상업적 활용까지 허용하는 '카나나 오픈 라이선스'로 배포했고, 자체 개발한 한국어 특화 토크나이저를 적용해 한국어 처리 효율을 30% 이상 높였다고 밝힌 바 있다. 현재 '카나나 인 카카오톡'과 카카오톡 대화·통화 요약, AI 국민비서 등에 카카오의 경량 모델이 쓰이고 있다. 이번 평가는 카카오가 자체 구축한 'AI 안전성 평가 플랫폼'으로 진행됐다. 지난해 11월 한국정보통신기술협회(TTA), KAIST, 카카오 등이 과학기술정보통신부 사업으로 공동 구축한 한국어 특화 벤치마크 'AssurAI'를 활용했다. AssurAI는 한국의 사회·문화적 맥락을 반영해 AI 위험 요소를 측정하며, 텍스트뿐 아니라 이미지·오디오 등 멀티모달 환경과 악의적 프롬프트 입력 상황까지 평가할 수 있다. 총 35개 위험 범주에 9560개 평가 항목으로 구성됐고, 카카오는 이를 △사회적 리스크 △성적 콘텐츠·아동보호 △범죄·불법 행위 △폭력 △권리 침해 등 5개 대분류로 재편해 집계했다. AI 모델이 사전 정의된 채점 기준에 따라 다른 모델의 응답을 평가하는 방식을 적용해, 대규모 평가에서도 주관적 편차를 줄이고 동일한 기준으로 비교할 수 있게 했다는 설명이다. 비교 대상은 유사 파라미터 규모의 구글 '젬마'와 알리바바 '큐웬'이었다. 결과는 카나나2 1.3B 모델이 종합점수 0.70으로 젬마(0.68), 큐웬(0.58)을 앞섰고, 3B 모델도 0.70으로 젬마(0.66), 큐웬(0.62)보다 높았다. 대분류별로는 1.3B 모델이 범죄·불법 행위 영역에서, 3B 모델이 성적 콘텐츠·아동보호와 권리 침해 영역에서 비교 모델을 크게 앞섰다. 카카오는 앞으로 자체 개발 모델에 상시적인 사전 안전성 평가를 확대 적용할 계획이다. 텍스트 언어모델을 넘어 멀티모달 모델과 스스로 작업을 수행하는 에이전틱 AI 리스크 평가로도 범위를 단계적으로 넓힌다는 방침이다. 카카오는 이에 앞서 AI 안전성 검증 도구 '카나나 세이프가드'도 오픈소스로 공개한 바 있다. 김경훈 카카오 AI 세이프티 리더는 "이번 평가는 자체 검증 체계를 통해 오픈소스 모델의 안전성을 사전에 점검하고, 그 결과를 공개하고자 한 사례"라며 "앞으로도 책임 있는 AI 개발 원칙 아래 안전성 검증을 모델 출시 프로세스의 핵심 단계로 정착시켜 나갈 것"이라고 말했다.
2026-08-18 11:09:21
-
독파모 2차 관문 앞…3팀 압축 임박…LG '몸집 키우기' VS '효율형 AI 효율·에이전트'
[경제일보] 정부의 독자 인공지능(AI) 파운데이션 모델 프로젝트(독파모) 2차 평가 결과 발표가 임박했다. LG AI연구원과 SK텔레콤, 업스테이지, 모티프테크놀로지스 4개 팀 가운데 3개 팀만 다음 단계에 진출한다. 독파모는 새 정부의 'AI 3대 강국 도약' 전략 핵심 과제로 지난해 8월 시작됐다. 해외 AI 모델 의존도를 낮추고 기술·경제·안보 리스크를 줄이겠다는 목적으로, 총사업비 1576억원을 들여 팀당 데이터 구축비 30억~50억원과 연간 20억원가량의 연구비, 컴퓨팅 자원을 지원한다. 6개월 단위 평가로 매번 팀을 떨어뜨려 2027년 상반기까지 최종 1~2개 팀만 남기는 구조다. 첫 단추부터 순탄치 않았다. 애초 선정된 5개 팀(네이버클라우드·NC AI·LG AI연구원·SK텔레콤·업스테이지) 가운데 지난 1월 15일 발표된 1차 평가에서 네이버클라우드와 NC AI가 동반 탈락했다. 네이버클라우드는 오픈소스 모델을 차용했다는 의혹이 불거지며 독자성 기준에 부합하지 못한다는 판정을 받았고, NC AI는 종합 점수 경쟁에서 밀렸다. 당초 계획보다 1개 팀이 더 빠지자 정부는 패자부활전을 열었지만 네이버클라우드와 NC AI, 그리고 최초 선정에서 탈락했던 카카오까지 국내 IT 양강이 모두 재도전을 거부했다. 결국 2월 20일 모티프테크놀로지스 컨소시엄이 새 정예팀으로 뽑히며 4개 팀 체제가 만들어졌다. 과학기술정보통신부는 독파모 2차 단계평가를 마무리하고 조만간 결과를 발표할 예정이다. 대상은 △LG AI연구원 'K-엑사원 2.0' △SK텔레콤 '에이닷엑스 케이투(A.X K2)' △업스테이지 '솔라 오픈 2' △모티프테크놀로지스 '모티프3'다. 평가는 벤치마크 40점(글로벌 평가기관 아티피셜 애널리시스 25점, NIA 자체 벤치마크 15점), 전문가 평가 35점, 국민 평가단 200명이 참여하는 사용자 평가 25점으로 구성된다. 외부에 공개된 벤치마크 지표만으로 결과를 예단하기 어려운 것도 이 때문이다. 네 팀의 전략은 두 갈래로 갈린다. 규모로 밀어붙인 쪽은 LG와 SKT다. LG AI연구원의 K-엑사원 2.0은 파라미터 7500억 개(750B)로 1차 모델(236B)보다 3배 이상 커졌고, 코딩·에이전틱 코딩 지표를 이전 대비 약 30% 개선했다고 밝혔다. 장문 이해 평가 OpenAI-MRCR 94.4점, 한국어 장문 이해 Ko-LongBench 89.6점을 기록했고 지원 언어도 10개로 늘렸다. SKT의 에이닷엑스 케이투(688B)는 수학·한국어 추론에 집중해 2026년 국제수학올림피아드(IMO) 평가에서 42점 만점에 29점으로 금메달 기준선을 넘겼고, 고난도 수학 추론 평가 MathArena AIME 2026에서는 97.1% 정확도로 싱킹 머신스랩의 오픈웨이트 모델 '잉클링'과 공동 최고점을 기록했다. 업스테이지와 모티프테크놀로지스는 작은 몸집으로 효율을 택했다. 업스테이지의 솔라 오픈 2(250B)는 실제 연산에는 150억 개만 쓰는 전문가 혼합(MoE) 구조로, 양자화 시 엔비디아 H200 GPU 2장으로 구동할 수 있다. 모티프3(314B)는 은행 업무 처리와 IT 장애 진단 등 실무형 평가에서 강점을 보였다. 공개된 AAII(Artificial Analysis Intelligence Index) 지표에서는 이 구도가 뒤집힌다. 모티프3가 47점으로 1위, 업스테이지 솔라 오픈 2가 37점으로 뒤를 이었고 SKT 35점, LG 31점 순이었다. 모델 규모는 LG와 SKT가 앞서지만 공개 지표에서는 상대적으로 작은 모티프와 업스테이지가 높은 점수를 받은 셈이다. 다만 AAII는 전체 평가의 25%에 불과해 이 순위가 곧 정부 최종 순위로 이어지지는 않는다. 2차 평가를 통과한 3개 팀은 추가 단계평가를 거쳐 최종 2개 팀으로 압축된다. 정부는 이 과정에서 확보한 고성능 GPU 배분과 국가기록원·대법원 판결문 등 공공데이터 제공을 병행해 2027년까지 글로벌 톱10 수준의 모델을 만들겠다는 목표를 세웠다.
2026-08-18 09:40:27
-
"출시 3일만 1000억 토큰 썼다"…업스테이지 '솔라 프로 4', 글로벌 실사용 시험대
[경제일보] 업스테이지가 '솔라 프로 4'를 앞세워 글로벌 AI 모델 시장에서 실사용 경쟁에 본격적으로 뛰어든다. 글로벌 개발자 플랫폼에 이름을 올린 데 이어 출시 직후 실제 사용량도 빠르게 늘면서, 단순 벤치마크 성능 경쟁을 넘어 AI 에이전트와 기업 업무 영역을 중심으로 상용화 확대에 나서고 있다. 14일 업스테이지는 자체 개발한 거대언어모델(LLM) '솔라 프로 4'를 공개했다고 밝혔다. 솔라 프로 4는 전작 '솔라 프로 3'보다 추론 능력과 에이전트 역량을 강화한 차세대 상용 AI 모델로, 단순 질의에 답하는 것을 넘어 문서 이해와 정보 추출, 긴 맥락 추론, 여러 단계의 의사결정 등 실제 업무 수행에 초점을 맞춰 설계됐다. 특히 솔라 프로 4는 공개 직후 미국 누스 리서치가 개발한 AI 에이전트 '헤르메스 에이전트'와 API 라우팅 플랫폼 '오픈라우터'에 등재됐다. 업스테이지는 한국 모델 최초로 등재된 것으로 오픈AI, 앤스로픽, 구글, 엔비디아 등 글로벌 빅테크와 딥시크, 문샷, 미니맥스 등 중국 AI 기업들이 이름을 올린 플랫폼에 국내 기업 모델이 정식 프로바이더로 참여하면서 글로벌 개발자 시장에서 실사용 기회를 확보했다고 설명했다. 실제 사용량도 빠르게 늘고 있다. 업스테이지에 따르면 솔라 프로 4는 오픈라우터 등재 3일 만에 누적 토큰 소비량 800억 토큰을 넘어섰고, 이날 오전 8시 오픈라우터 기준 누적 토큰 소비량 1000억 토큰을 넘겼다. 단순히 모델을 공개하는 데 그치지 않고 글로벌 개발자들이 API를 통해 실제 모델을 사용하는 단계로 진입한 것으로 평가된다. 에이전트 성능에서도 전작 대비 개선 폭을 키웠다. 여러 단계의 작업을 터미널 환경에서 끝까지 수행하는 능력을 평가하는 '터미널벤치(Terminal-Bench v2.1)'에서 57점을 기록해 전작보다 4.8배 높아졌다. 대화를 이어가면서 도구를 사용하는 능력을 평가하는 '타우3-뱅킹(τ³-Banking)'에서는 23점을 기록해 전작 대비 2.6배 개선됐다. 긴 문서를 이해하고 필요한 정보를 추출하는 능력도 강화했다. 대량의 장문 문서에서 정보를 찾아내고 이를 근거로 답변하는 능력을 평가하는 장문 이해 벤치마크(AA-LCR)에서는 71점을 기록해 전작보다 2.3배 이상 높은 성능을 보였다. 업스테이지는 문서 중간의 맥락을 놓치는 실패를 줄이면서 정확도를 높이는 동시에 토큰 소모량도 줄여 운영 비용 측면에서도 경쟁력을 확보했다고 설명했다. 글로벌 평가에서도 성능 개선을 내세웠다. 글로벌 AI 평가기관 아티피셜 애널리시스 기준 솔라 프로 4의 종합 성능은 42점으로 전작 대비 3배 이상 개선됐다. 업스테이지는 엔비디아 '네모트론 3 울트라'(38점), 구글 '제미나이 3.5 플래시-라이트'(37점) 등 일부 글로벌 모델보다 높은 점수를 기록했다고 밝혔다. 국내 기업과 공공기관을 겨냥한 문서 처리 기능도 강화했다. 솔라 프로 4는 업스테이지의 에이전트 문서 처리 통합 솔루션 '업스테이지 스튜디오'에 탑재돼 한글 문서를 비롯한 다양한 형식의 문서에서 정보를 추출하고 요약, 분석, 번역 등의 작업을 수행할 수 있다. 이를 통해 업스테이지는 LLM 자체의 성능 경쟁뿐 아니라 기업이 실제 업무에 AI를 적용하는 영역까지 사업 범위를 확대한다는 전략이다. 특히 국내 기업과 공공기관에서 활용도가 높은 한글 문서 처리와 업무 자동화를 앞세워 글로벌 범용 모델과 차별화된 시장을 확보하려는 움직임으로 풀이된다. 글로벌 시장에서는 AI 모델 자체를 공급하는 방식과 함께 에이전트 생태계 확대가 새로운 경쟁 영역으로 떠오르고 있다. 개발자가 특정 모델을 직접 선택해 사용하는 것을 넘어 AI가 문서를 읽고 필요한 정보를 찾아내며 외부 도구를 호출해 여러 단계의 업무를 수행하는 형태로 활용 범위가 넓어지고 있기 때문이다. 업스테이지 역시 솔라 프로 4를 통해 이러한 시장 변화에 대응한다는 구상이다. 글로벌 개발자 플랫폼에 모델을 공급하면서 해외 개발자와의 접점을 확대하는 동시에 국내에서는 문서 처리 솔루션과 결합해 기업 고객 확보에 나서는 방식이다. 김성훈 업스테이지 대표는 "실무에서 AI에게 필요한 것은 시험을 잘 보는 능력이 아니라 맡은 일을 끝까지 해내는 신뢰성"이라며 "솔라 프로 4가 글로벌 개발자 플랫폼에 한국 모델 최초로 이름을 올린 것은 우리 AI 기술이 세계 현장에서 통한다는 증거로, 앞으로도 현장에서 검증된 기술력을 바탕으로 한층 더 활용성 높은 AI를 만들어 나가겠다"고 말했다.
2026-08-14 08:55:12
-
-
-
SKT, 독자 AI 'A.X K2' 앞세워 제조·국방 현장 공략
[경제일보] SK텔레콤이 독자 AI 파운데이션 모델 'A.X K2'를 앞세워 제조와 국방, 바이오 등 산업 현장 공략에 나선다. 지난달 29일 모델을 공개한 데 이어 4일 회사 뉴스룸 인터뷰를 통해 세부 전략을 밝혔다. 단순 질의응답을 넘어 스스로 계획을 세우고 도구를 활용해 업무를 수행하는 '에이전틱 AI'를 구현해 한국형 소버린 AI 생태계를 만들겠다는 구상이다. 김태윤 SK텔레콤 파운데이션모델담당은 "A.X K2의 가장 큰 변화는 '답하는 AI'에서 '스스로 계획하고 실행하는 AI'로 진화한 것"이라며 "에이전틱 시대에 맞춰 추론 능력을 크게 강화했고 특히 수학과 한국어 영역에서 의미 있는 성과를 냈다"고 말했다. ◆ 매개변수 6880억개, 추론엔 330억개만 활성화 A.X K2는 매개변수 6880억개 규모의 초거대언어모델(LLM)이다. 직전 모델인 519B 규모 A.X K1보다 커졌지만 추론 과정에서는 330억개(33B)만 활성화하는 MoE 구조를 적용해 추론 비용은 기존 수준으로 유지했다. 국내외 14개 벤치마크 평균 성능은 A.X K1 대비 32.2%포인트, 장문 이해와 AI 에이전트 평가에서는 83.9%포인트 개선됐다. 초고난도 수학 벤치마크 'Apex' 점수는 1.0에서 45.8로 뛰었고 AIME26에서는 97.1점을 기록했다. 한국어 지식 평가(KMMLU-Pro) 80.5점, 한국 문화 이해(CLIcK) 91.6점을 냈고 통신 분야 에이전트 도구 활용을 재는 τ²-Bench Telecom에서는 오픈웨이트 모델 가운데 최고 성능을 기록했다고 회사는 설명했다. 핵심 기술은 SK텔레콤이 자체 개발한 SGA(Sparse Gated Attention)다. 여러 차례 대화와 도구 호출, 긴 문서 참조를 반복하는 AI 에이전트 특성상 긴 문맥 처리 효율이 중요한데 SGA는 입력이 길어질수록 처리 속도와 안정성이 오르도록 설계됐다. 120K 토큰 입력 기준 토큰 처리량은 A.X K1 대비 67.7% 개선됐다. 텍스트 모델 외에 제조 도면과 문서를 이해하는 비전언어모델 'A.X K2 VL', 상담·회의 음성을 분석하는 'A.X K2 ALM', 크래프톤과 공동 개발한 음성 모델 'A.X K2 라온스피치'도 함께 공개해 멀티모달 구성을 갖췄다. 산업 현장 적용도 본격화하고 있다. KG스틸, 자동차 부품업체 코넥과는 생산 라인의 과거 불량 사례를 학습해 원인을 분석하고 조치를 제안하는 제조 특화 AI 에이전트를 실증 중이다. SK하이닉스에는 사내 AI 서비스 'LLM Chat'에 경량 모델을 적용해 반도체 지식 검색과 정보 정리를 지원한다. 국방부에는 A.X K1을 FP8·FP4·INT4로 양자화해 공급했고 A.X K2도 온프레미스 기반 폐쇄망 환경에 제공할 계획이다. 민감한 데이터는 외부 학습에 쓰지 않고 기관 내부에서만 학습하도록 했다. 김 담당은 "국내 업무 환경에서는 언어뿐 아니라 제도와 문화적 맥락을 이해하는 것이 중요하다"며 "국내 기업과 공공기관이 안심하고 활용할 수 있는 소버린 AI를 구현하는 것이 목표"라고 설명했다. ◆ 허깅페이스 공개하며 조단위 후속모델 준비 SK텔레콤은 A.X K2를 허깅페이스에 Apache 2.0 라이선스로 공개하고 API도 제공할 예정이다. 스타트업 액셀러레이팅 프로그램 '스케치 with AI', '모두의 챌린지 AX-LLM'을 통해 개발자와 스타트업의 상업적 활용 생태계도 넓힌다. 앞서 A.X K1은 정부 지원 없이 상시 1000개 이상의 자체 GPU로 개발됐다. 이번에 예고한 조(兆) 단위 매개변수 후속 모델은 정부 GPU 인프라와 자체 투자를 함께 활용해 규모를 키우고 에이전틱 강화학습과 사이버보안 역량도 고도화한다는 계획이다. 서울대, KAIST, 크래프톤과 차세대 아키텍처 연구도 병행하고 독자 AI 파운데이션 모델(독파모) 컨소시엄 참여사인 리벨리온과는 국산 NPU 기반 모델 서빙 최적화와 상용 서비스 실증을 강화한다. 리벨리온은 앞서 자체 NPU '리벨카드' 단일 서버로 A.X K1 구동에 성공한 바 있다. 한편 회사가 제시한 벤치마크 수치는 자체 측정 결과이며 독립 기관의 검증을 거친 값은 아니다. 오픈소스로 공개돼 외부 개발자들이 성능을 검증할 여지는 있지만 남은 과제는 이 수치가 실제 제조·국방·바이오 현장에서 상업적 계약과 매출로 이어지느냐다. 김 담당은 "A.X K2는 한국이 설계부터 학습까지 자체 기술로 개발한 AI 모델이 글로벌 최고 수준에 도달할 수 있다는 가능성을 보여준 사례"라며 "개방과 협력을 통해 국내 AI 생태계의 기반을 만들고 산업 현장과 국민이 체감할 수 있는 AI 서비스를 확대해 나가겠다"고 말했다.
2026-08-04 10:10:29
-