닫기

글로벌이코노믹

카카오, 국제 언어모델링 학회서 AI 연구 성과 발표

글로벌이코노믹

카카오, 국제 언어모델링 학회서 AI 연구 성과 발표

대규모 AI 모델 학습 최적화 방법, 모델 경량화 연구 기법 발표
향후 관련 연구 확장해 글로벌 경쟁력 강화할 것
카카오가 글로벌 학회에서 AI 개발을 효율화하는 연구 결과를 발표했다. 사진=카카오이미지 확대보기
카카오가 글로벌 학회에서 AI 개발을 효율화하는 연구 결과를 발표했다. 사진=카카오
카카오가 글로벌 언어모델링 학회에서 고성능 언어모델 개발에 필요한 자원을 효율적으로 활용하기 위한 학습 최적화 및 모델 경량화 연구 성과를 공개했다.

11일 업계에 따르면 카카오는 '언어모델링 국제 학회(이하 COLM) 2026'에서 대규모 전문가 혼합(MoE) 모델의 학습 효율을 높이는 기술과 모델 크기를 줄이면서도 성능을 개선하는 경량화 기술을 발표했다.

메인 컨퍼런스에서 발표한 논문 '단계별 스케일링: 대규모 전문가 혼합 모델을 위한 계산 효율적인 하이퍼파라미터 전이'는 대규모 MoE 모델의 사전 학습에 필요한 최적의 학습률을 전체 학습 비용의 약 1% 수준으로 예측하는 방법론을 담았다. 학습률은 인공지능(AI)이 학습할 때 내부 설정값인 ‘매개변수’를 얼마나 크게 조정할지 정하는 값으로 너무 크면 불안정해지고 너무 작으면 속도가 더뎌져 적절한 값을 찾는 것이 중요하다.

MoE 모델은 최근 고성능 LLM의 핵심 구조로 주목받고 있지만 기존 밀집형 모델에 비해 학습 설정과 방법에 관한 공개 연구가 충분하지 않다. 이에 대규모 학습 시 비용에 대한 부담과 시행착오가 발생할 수 있다.
카카오는 소규모 모델에서 찾은 최적의 학습 설정을 대규모 모델로 확장하는 '뮤-매개변수화기법'을 MoE 모델 구조의 특성에 맞게 적용했다. 모델의 크기와 학습 토큰량을 단계적으로 확장하며 최적의 학습률을 탐색하고 짧은 학습 구간에서 찾은 설정이 대규모 학습에서도 유효하게 적용됨을 검증했다. 이 방법론은 카카오의 ‘카나나-2.6-155b-a17b’ 모델의 사전학습에 실제로 적용돼 10조(10T) 토큰까지 안정적으로 학습하는 데 활용됐다.

또 카카오는 모델 크기를 줄이면서도 성능을 높인 ‘BBT: 문자 조합 토큰 생성 방식(BPE) 기반 바이트 트랜스퍼러’를 공개했다. 기존 모델은 글을 읽고 답변을 생성하기 위해 수많은 단어와 단어 조각에 해당하는 정보를 저장해야 한다. BBT는 이를 더 작은 기본 단위인 ‘바이트’를 활용하는 구조로 바꿔 모델의 크기를 줄이면서 여러 문자를 묶어 효율적으로 압축 처리하는 기존 방식의 장점은 유지했다.

BBT는 비교 실험에서 파라미터 수를 20.2~40.4% 줄이면서 테스트 성능을 2.7~6.6% 개선했다. 아울러 오탈자나 문자 교란에 대한 강건성을 확보하고 학습하지 않은 언어로의 전이 성능도 높였다.

카카오 관계자는 “이번 발표로 AI 모델의 성능을 유지하거나 향상시키면서도 학습·운영 비용을 낮출 수 있는 실용적인 해법을 제시했다”며 “향후 다양한 모델 구조와 멀티모달 및 다국어 환경으로 연구를 확장해 실제 서비스 활용 가능성을 높이고 글로벌 경쟁력 강화하겠다”고 말했다


이재현 글로벌이코노믹 기자 kiscezyr@g-enews.com