대규모 AI 모델 최적 학습률, 전체 학습 비용 1%로 예측
자체 AI '카나나'에 적용…10조 토큰까지 안정적 학습
모델 크기 최대 40.4% 줄이고 테스트 성능 최대 6.6% 개선
카카오는 언어모델링 국제학회 'COLM 2026'에서 AI 모델 학습 효율을 높이는 기술과 모델 경량화 연구 성과를 발표했다고 8일 밝혔다.
COLM은 대규모 언어모델(LLM)과 언어모델링 연구를 다루는 국제학회로, 2024년 신설됐다. 카카오는 이번 학회의 메인 컨퍼런스와 토큰화 기술을 다루는 워크숍 '톡숍'에서 각각 연구 결과를 공개했다.
첫 번째 연구는 대규모 AI 모델의 최적 학습률을 적은 비용으로 찾아내는 기술이다. 학습률은 AI가 데이터를 학습할 때 내부 매개변수를 얼마나 크게 조정할지 결정하는 값이다. 지나치게 높으면 학습이 불안정해지고 낮으면 학습 속도가 느려져 적절한 설정이 중요하다.
카카오는 여러 전문 모델 가운데 필요한 일부만 선택해 사용하는 전문가 혼합(MoE) 구조에 맞춰 학습률을 예측하는 방법을 개발했다. 작은 모델에서 찾은 학습 설정을 큰 모델에 적용하는 방식으로, 전체 학습 비용의 약 1%만 사용해 최적의 학습률을 예측할 수 있도록 했다.
이 기술은 카카오의 자체 AI 모델 '카나나-2.6-155b-a17b' 사전학습에 실제로 적용됐다. 카카오는 해당 방법을 활용해 10조 토큰 규모까지 안정적으로 학습을 진행했다고 설명했다.
두 번째 연구는 AI 모델의 크기를 줄이면서 성능을 개선하는 기술이다. 카카오는 'BBT'라는 새로운 모델 구조를 통해 기존 방식보다 적은 매개변수로 텍스트를 처리할 수 있도록 했다.
기존 AI 모델은 글을 이해하고 생성하기 위해 단어나 단어 조각에 해당하는 정보를 저장한다. BBT는 이를 더 작은 데이터 단위인 바이트를 활용하는 방식으로 바꾸면서도 여러 문자를 묶어 효율적으로 처리하는 기존 기술의 장점을 유지했다.
비교 실험 결과 BBT는 모델의 매개변수 수를 20.2~40.4% 줄이면서 테스트 성능을 2.7~6.6% 개선했다. 오탈자나 문자 변형이 포함된 입력을 처리하는 능력과 학습하지 않은 언어에 대응하는 성능도 향상됐다.
카카오는 이러한 기술이 스마트폰 등 기기 자체에서 AI를 구동할 때 메모리 부담을 줄이고, 여러 언어가 혼용되거나 오탈자가 많은 환경에서도 안정적으로 서비스를 제공하는 데 도움이 될 것으로 기대하고 있다고 밝혔다.
카카오 관계자는 "다양한 모델 구조와 멀티모달 및 다국어 환경으로 연구를 확장해 실제 서비스 활용 가능성을 높이겠다"고 말했다.
◎공감언론 뉴시스 zoo@newsis.com