경제일보
패밀리 사이트
아주일보
베트남
회원서비스
로그인
회원가입
지면보기
네이버블로그
금융
산업
생활경제
IT
건설
정치
피플
국제
사회
문화
딥인사이트
Fun
검색
2026.10.08 목요일
맑음
서울 24˚C
맑음
부산 24˚C
맑음
대구 27˚C
맑음
인천 24˚C
맑음
광주 24˚C
맑음
대전 24˚C
맑음
울산 25˚C
맑음
강릉 22˚C
맑음
제주 23˚C
검색
검색 버튼
검색
'AI효율화'
검색결과
기간검색
1주일
1개월
6개월
직접입력
시작 날짜
~
마지막 날짜
검색영역
제목
내용
제목+내용
키워드
기자명
전체
검색어
검색
검색
검색결과 총
1
건
10조 토큰 학습에 비용 최적화…카카오, '효율형 AI' 기술 공개
[경제일보] 대규모 언어모델(LLM) 학습에 필요한 GPU와 전력 비용이 커지면서 학습 과정의 시행착오를 줄이고 모델 자체의 크기를 줄이는 기술이 인공지능(AI) 개발 경쟁력으로 떠오르고 있다. 카카오는 대규모 모델의 학습 비용을 줄이는 동시에 모델 경량화를 통해 운영 효율까지 높이는 연구 성과를 공개하며 자체 AI 경쟁력 강화에 나섰다. 8일 카카오는 언어모델링 국제 학회 'COLM(컨퍼런스 온 랭귀지 모델링) 2026'에서 대규모 전문가 혼합(MoE) 모델의 학습 효율을 높이는 기술과 모델 크기를 줄이면서 성능을 개선하는 경량화 기술을 각각 공개했다. 두 연구 모두 AI 모델의 성능을 유지·향상하면서 학습과 운영에 필요한 컴퓨팅 자원을 줄이는 데 초점을 맞췄다. 카카오가 메인 컨퍼런스에서 발표한 논문 'Let's Scale Step by Step: Compute-Efficient Hyperparameter Transfer for Large-Scale Mixture-of-Experts'는 대규모 MoE 모델을 학습할 때 최적의 학습 설정을 찾는 데 필요한 비용을 줄이는 방법론을 담았다. LLM 학습에서는 학습률과 같은 하이퍼파라미터를 어떻게 설정하느냐가 모델 성능과 학습 안정성에 영향을 미치는 것으로 꼽힌다. 학습률이 지나치게 높으면 학습이 불안정해지고 반대로 너무 낮으면 학습 속도가 떨어질 수 있다. 문제는 모델 규모가 커질수록 최적의 설정값을 찾기 위한 실험 자체에도 상당한 컴퓨팅 자원이 필요하다는 것이다. 카카오는 이를 해결하기 위해 소규모 모델에서 찾은 최적의 학습 설정을 대규모 모델로 확장하는 '뮤-매개변수화' 기법을 MoE 구조에 맞게 적용했다고 설명했다. 모델 크기와 학습 토큰량을 단계적으로 늘리면서 최적의 학습률을 탐색하고, 짧은 학습 구간에서 찾은 설정이 대규모 학습에서도 유효한지 검증하는 방식이다. 카카오에 따르면 해당 방법을 활용하면 대규모 MoE 모델의 사전학습에 필요한 최적 학습률을 전체 학습 비용의 약 1% 수준에서 예측할 수 있다. 대규모 모델을 본격적으로 학습하기 전에 상대적으로 적은 비용으로 설정값을 찾아 시행착오를 줄이는 구조다. 특히 이번 연구는 카카오의 자체 AI 모델 개발에도 실제 적용됐다. 카카오는 해당 방법론을 'Kanana-2.6-155b-a17b'의 사전학습에 적용했으며, 최대 10조(10T) 토큰 규모까지 안정적으로 학습하는 데 활용했다고 설명했다. 단순히 학술적 실험에 그치지 않고 자체 파운데이션 모델을 개발하는 과정에서 학습 효율화 기술을 적용했다는 점이 특징이다. AI 모델의 비용 문제는 학습 과정에만 국한되지 않는다. 모델이 커질수록 서비스 단계에서 필요한 메모리와 연산량도 늘어나기 때문에 실제 서비스에 투입할 때도 비용 부담이 커진다. 카카오는 이번 COLM에서 모델 자체의 크기를 줄이는 연구도 함께 공개했다. 토크나이제이션 워크숍 '톡샵'에서 발표한 'BBT: BPE-Guided Byte Transformer'는 기존 BPE(바이트 페어 인코딩) 기반 모델의 구조에 바이트 단위 처리 방식을 결합한 모델이다. 기존 방식이 단어와 단어 조각에 해당하는 정보를 토큰으로 만들어 처리하는 것과 달리 BBT는 더 작은 기본 단위인 바이트를 활용하면서 여러 문자를 효율적으로 압축 처리하는 장점을 유지하도록 설계됐다. 비교 실험에서는 모델의 파라미터 수를 20.2~40.4% 줄이면서도 테스트 성능은 2.7~6.6% 개선됐다. 모델을 단순히 축소하는 데 그치지 않고 크기를 줄이면서 성능까지 높였다는 것으로 나타났다. BBT는 오탈자나 문자 교란에 대한 강건성과 학습하지 않은 언어로의 전이 성능도 높였다. 이는 여러 언어가 섞이거나 입력 오류가 발생하기 쉬운 실제 대화 환경에서 활용 가능성을 높이는 요소다. 특히 모델의 메모리 부담을 줄일 수 있다는 점에서 스마트폰이나 PC 등 기기에서 AI를 직접 구동하는 온디바이스 AI에도 활용 가능성이 거론된다. 이 같은 효율화 기술의 중요성은 AI 모델이 대형화될수록 커질 전망이다. 고성능 LLM을 개발하기 위해서는 대규모 GPU 인프라와 전력, 데이터센터 등 막대한 자원이 필요하다. 모델 개발사가 확보한 컴퓨팅 자원을 얼마나 효율적으로 활용하느냐가 모델 개발 속도와 비용에 직접적인 영향을 미칠 수밖에 없다. 특히 국내 AI 기업 입장에서는 글로벌 빅테크와 비교해 무한정 컴퓨팅 자원을 투입하기 어려운 만큼 모델 구조와 학습 방식 자체를 최적화하는 기술이 경쟁력의 한 축이 될 전망이다. 카카오가 자체 모델인 카나나 개발 과정에서 학습 최적화 기술을 실제 적용한 것도 이러한 비용 효율화 전략과 연결된다. 카카오는 앞으로 다양한 모델 구조로 연구 적용 범위를 확대하고 멀티모달과 다국어 환경으로 연구를 확장할 계획이다. 이를 통해 대규모 LLM의 학습 비용을 줄이는 동시에 실제 서비스 환경에서 효율적으로 구동할 수 있는 AI 모델 개발 역량을 강화한다는 방침이다. 카카오 관계자는 "이번 연구들은 AI 모델의 성능을 유지하거나 향상시키면서도 학습 및 운영 비용을 낮출 수 있는 실용적인 해법을 제시했다는 데 의의가 있다"며 "앞으로 다양한 모델 구조와 멀티모달 및 다국어 환경으로 연구를 확장해 실제 서비스 활용 가능성을 높이며 글로벌 경쟁력 강화를 이어가겠다"고 말했다.
2026-10-08 12:18:39
처음
이전
1
다음
끝
많이 본 뉴스
1
계약취소·미계약 물량 한날에…강변역 1가구·충정로 35가구 무순위 나온다
2
[김아령의 오토세이프] 기아·현대차·벤츠 리콜…시동 꺼짐부터 조향 불가까지
3
코스피, '7천피' 복귀…연휴 앞 관망 속 0.46%↑
4
고객정보 2만5000명 유출·173억 대출사기…흔들리는 신한은행 정상혁號
5
신한 이어 하나은행도 뚫렸다…AI 해킹으로 고객 89명 개인정보 유출
6
국민·하나·부산은행도 당했다…고객정보 줄줄 새는 금융권, 보안은 어디에
7
[현장] 100일 만에 1000만개…삼양 '짜르르', 정체된 시장서 프리미엄 안착
8
[단독] 포스코, 美정부 상대 국제무역법원 제소…상계관세 판정 법정공방
영상
Youtube 바로가기
오피니언
[사설] 감정적 대립 부추기는 외교를 경계한다