옵트에이아이와 토큰 최적화 공동연구…GPU·전력 사용량 절감 목표
온디바이스 AI 이어 서버 GPU로 협력 확대…모델 연산 과정 효율화
자체 AI 서비스·대규모 인프라에 단계 적용…응답속도·품질 개선 추진
LG유플러스는 AI 모델 최적화 전문기업 옵트에이아이와 AI 운영 효율을 높이기 위한 '토큰 최적화' 기술을 공동 연구한다고 2일 밝혔다.
최근 AI 업계에서는 제한된 자원으로 높은 성능을 구현하는 기술의 중요성이 커지고 있다. AI 서비스 이용이 늘수록 GPU와 전력 등 운영에 필요한 비용도 함께 증가하는 만큼 동일한 수준의 서비스를 더 적은 자원으로 제공할 수 있는 기술이 경쟁력의 주요 요소로 떠오르고 있다.
토큰은 AI가 이용자의 질문을 이해하고 답변을 만들어낼 때 처리하는 데이터의 기본 단위다. 토큰 최적화는 AI 모델의 크기를 줄이거나 연산 구조를 효율화해 동일한 자원으로 더 많은 이용자 요청을 처리할 수 있도록 하는 기술이다.
양사는 각자의 전문성을 결합해 토큰 처리 효율을 높일 계획이다. LG유플러스는 실제 AI 서비스 운영 경험을 토대로 기술 검증과 적용을 담당하고, 옵트에이아이는 AI 모델을 가볍고 빠르게 작동시키는 최적화 기술 연구·개발을 맡는다.
이를 통해 AI 서비스를 운영할 때 필요한 GPU와 전력 사용량은 줄이면서 응답 속도와 서비스 품질을 높이는 것이 목표다.
LG유플러스와 옵트에이아이는 앞서 스마트폰 등 기기 자체에서 AI를 실행하는 온디바이스 AI 분야에서도 협력해왔다.
LG유플러스는 '엑사원(EXAONE)' 기반 소형언어모델(sLM)에 연산량과 모델 크기를 줄이는 경량화 기술을 적용해 스마트폰의 AI 전용 반도체인 신경망처리장치(NPU)에서 구동할 수 있도록 했다.
이 과정에서 기존 중앙처리장치(CPU) 방식과 같은 수준의 성능을 유지하면서 전력 소모를 78%, 모델 크기를 82% 줄였다. 양사는 이를 통해 온디바이스 환경에서 AI 운영 효율화 기술을 검증했다.
양사는 이번 기술 교류를 계기로 기존 온디바이스 AI에서 서버 GPU 환경으로 공동연구 범위를 확대한다.
대규모 AI 서비스를 운영할 때 동일한 GPU 자원으로 더 많은 이용자 요청을 처리할 수 있도록 모델의 연산 과정을 효율화하는 기술을 중점적으로 연구할 계획이다.
현재 진행 중인 GPU 기반 AI 모델 최적화 연구에서는 초기 성과도 확보했다. 실제 서비스 환경에 맞춰 AI가 답변을 생성하는 연산 과정을 개선한 결과, 같은 GPU에서 처리할 수 있는 토큰량을 기존 대비 최대 4배까지 높였다.
LG유플러스는 앞으로 확보한 기술을 자체 AI 서비스와 대규모 AI 인프라 운영 환경에 순차적으로 적용해 운영 효율을 높여나갈 방침이다.
이상엽 LG유플러스 CTO는 "AI 경쟁력은 단순히 성능을 높이는 것을 넘어 같은 자원으로 얼마나 많은 토큰을 효율적으로 처리할 수 있느냐에 달려 있다"며 "옵트에이아이를 비롯한 다양한 파트너들과 협력해 토큰 최적화 기술 연구를 확대하고 실제 서비스에 적용할 수 있는 성과를 만들어 나가겠다"고 말했다.
이재호 옵트에이아이 대표는 "생성형 AI 시대에는 높은 성능만큼이나 운영 효율을 확보하는 것이 중요해지고 있다"며 "LG유플러스와 함께 실제 서비스 환경에서 검증 가능한 AI 최적화 기술을 고도화하고 AI 산업의 효율성 향상에 기여하겠다"고 전했다.
◎공감언론 뉴시스 hsyhs@newsis.com