← Back to Blog
AI · AX Article · 2026.09.22

MoE의 활성 파라미터만 보면 배포 비용을 놓친다

Mixture-of-Experts 모델이 일부 전문가만 계산하는 원리와 전체 가중치 메모리, 전문가 간 통신, 부하 쏠림을 분리해 실제 업무 도입 기준을 살펴본다.

ai-axmodel-inferencemixture-of-expertsexpert-routingworkload-evaluation

원형으로 배치된 많은 전문가 모듈 가운데 일부만 토큰 경로를 따라 빛나는 추상 개념 이미지

이 글의 개념을 표현하기 위해 GPT Image 2로 생성한 이미지이며, 실제 모델 구조도나 성능 측정 화면이 아니다.

로컬에서 쓸 모델을 고르다가 "전체 671B, 토큰당 활성 37B" 같은 표기를 만났다고 하자. 37B만 계산한다면 37B dense 모델을 구동할 장비면 충분해 보인다. 그러나 이 판단은 연산량과 저장량을 같은 숫자로 취급한다. Mixture-of-Experts(MoE)의 희소 활성은 한 토큰이 모든 전문가를 거치지 않게 만들지만, 선택될 수 있는 전문가의 가중치는 여전히 어딘가에 있어야 한다.

그렇다고 MoE가 비효율적이라는 뜻은 아니다. 토큰마다 일부 경로만 계산하므로 모델 용량을 늘리면서 매번 드는 연산은 제한할 수 있다. 문제는 "활성 파라미터"가 무엇을 줄이고 무엇을 줄이지 않는지 구별하지 않을 때 생긴다. 실제 배포에서는 가중치 메모리, 토큰 이동, KV 캐시, 동시 요청, 전문가별 부하가 제각기 병목을 만든다.

이 글은 MoE를 모델 순위표의 한 속성이 아니라 조건부 계산 시스템으로 읽는다. DeepSeek-V3는 동시대 사례로, Switch Transformer는 계보를 설명하는 오래된 기반 연구로 사용한다. 뒤의 AKM 적용은 공개된 구현 성과가 아니라 DEXA의 설계 제안이다.

라우터는 토큰마다 다른 계산 경로를 고른다

일반적인 dense Transformer의 feed-forward 층은 들어온 모든 토큰에 같은 가중치를 적용한다. MoE 층은 여러 feed-forward network를 전문가로 두고, 라우터가 각 토큰에 점수를 매겨 상위 몇 개만 선택한다. 같은 문장 안에서도 토큰마다 선택되는 전문가가 다를 수 있다. 선택된 전문가의 출력은 라우팅 가중치에 따라 합쳐져 다음 층으로 넘어간다.

2022년 JMLR에 실린 Switch Transformer는 2021년 연구 계보에 속한다. 이 논문은 토큰을 하나의 전문가로 보내는 top-1 routing으로 구조를 단순화했고, 희소 활성 모델이 입력마다 다른 파라미터를 선택하면서도 계산 비용의 증가를 제한하는 방식을 설명했다. 동시에 통신 비용, 학습 불안정성, 전문가 용량과 버려지는 토큰을 핵심 문제로 제시했다. 오래된 연구지만 "많은 파라미터를 보유하는 것"과 "한 토큰에서 일부만 계산하는 것"을 나누는 출발점으로 남아 있다.

DeepSeek-V3 기술 보고서 v2는 2025년 2월 18일 판이다. 보고서는 모델 전체가 671B 파라미터이고 토큰마다 37B가 활성화된다고 밝힌다. 각 MoE 층에는 공유 전문가와 라우팅 전문가가 있으며, 라우팅 전문가는 라우터가 고른 일부만 계산한다. 이 수치는 37B 가중치만 저장하면 된다는 뜻이 아니다. 활성 수는 토큰의 계산 경로를, 전체 수는 모델이 보유한 선택 가능한 용량을 설명한다.

연산량, 메모리, 통신은 따로 계산해야 한다

MoE의 장점은 토큰마다 수행하는 행렬 연산을 줄이는 데 있다. 하지만 일반적인 GPU serving에서는 선택될 수 있는 전체 전문가 가중치를 GPU 메모리에 올리거나 여러 장치에 나눠 둬야 한다. quantization은 가중치가 차지하는 바이트를 줄일 수 있고 expert offloading은 일부 가중치를 CPU나 다른 저장 장치에서 가져올 수 있다. 다만 offloading은 전송 비용과 지연을 새로 만들고, quantization은 역양자화와 실행 커널에 따른 추가 오버헤드를 만들 수 있다. 활성 파라미터가 같아도 가중치 정밀도와 배치 위치가 다르면 필요한 메모리와 응답 시간은 달라진다.

전문가를 여러 GPU에 나누면 expert parallelism이 된다. 토큰은 라우터가 지정한 전문가가 있는 장치로 이동하고, 계산 결과는 원래 흐름으로 돌아온다. 이때 생기는 all-to-all communication은 dense 모델의 GPU 연산량 표에는 보이지 않는다. interconnect가 느리거나 선택이 몇 장치에 몰리면 계산을 줄인 이익을 통신과 대기가 깎아 먹는다.

2026년 9월 22일 확인한 vLLM의 최신 개발 문서는 MoE 전문가를 여러 GPU에 분산하는 Expert Parallel Deployment를 설명한다. 문서는 전문가 층과 attention 층의 병렬화를 구분하고, 실제 요청에서는 토큰 분포가 특정 전문가에 크게 쏠릴 수 있다고 경고한다. Expert Parallel Load Balancer는 forward pass의 부하 통계를 모으고 전문가 배치를 주기적으로 조정한다. "학습 때 균형을 고려했다"는 사실만으로 운영 부하가 저절로 균등해지지는 않는다.

인기 있는 전문가 하나가 전체 지연을 결정할 수 있다

한 batch의 토큰이 전문가들에게 고르게 나뉜다는 보장은 없다. 특정 주제나 언어, 코드 패턴이 반복되는 업무에서는 일부 전문가가 더 자주 선택될 수 있다. 그 전문가가 놓인 GPU의 대기열이 길어지면 다른 GPU가 먼저 끝나도 층 전체가 기다린다. 평균 활성 파라미터 수는 같아도 tail latency와 처리량이 달라지는 이유다.

DeepSeek-V3 보고서는 학습 중 전문가 부하를 맞추기 위한 auxiliary-loss-free 전략과 sequence-wise balance loss를 설명한다. 이것은 해당 아키텍처와 학습 방법에 관한 보고다. 다른 MoE 모델이나 실제 production traffic이 같은 균형을 보인다고 일반화할 수 없다. serving runtime이 부하를 따로 관찰하고 전문가 배치를 조정하는 이유도 여기에 있다.

그래서 model card의 전체·활성 파라미터만으로 하드웨어를 결정하면 안 된다. 가중치 정밀도와 실제 저장 바이트, 전문가 배치, GPU 사이 대역폭, 입력·출력 길이, 동시 요청 수, KV 캐시, 전문가 부하의 쏠림을 함께 봐야 한다. benchmark도 단일 token/s 대신 time to first token, 토큰 간 지연, 처리량, 메모리 여유, 통신 시간, 상위 전문가의 부하를 나눠 기록해야 한다.

AKM 업무에서는 모델보다 작업 분포부터 잰다

AKM 문서를 분류하고 요약하는 local MoE 도입을 가정해 보자. "37B active"라는 이유만으로 장비를 고르기보다 먼저 실제 문서 묶음을 고정한다. 긴 회의록, 짧은 메모, 한국어와 영어가 섞인 자료, 표가 많은 문서를 평소 비율대로 담는다. 이것은 특정 AKM 시스템의 측정 결과가 아니라 재현 가능한 검토를 위한 설계 제안이다.

모델 기록에는 전체·활성 파라미터, 가중치 형식, 양자화, context limit, runtime version이 필요하다. 배포 기록에는 GPU 수와 메모리, expert parallel size, 장치 간 연결, offloading 여부를 남긴다. 업무 기록에는 입력과 출력 토큰 길이, 동시 요청 수, 반복되는 문서 유형을 적는다. 결과는 TTFT, generation latency, throughput, peak memory, preemption, expert load distribution으로 나눠야 병목의 위치가 보인다.

품질 평가는 별도로 기록해야 한다. 희소 라우팅이 추론 비용을 줄여도 출처를 제대로 고르거나 사실을 지지한다는 보장은 없다. 같은 문서 집합에서 요약 누락, 날짜와 이름 오류, 근거 locator 보존 여부를 검토해야 한다. 성능이 좋은 구성과 증거 품질이 좋은 구성이 같지 않을 수도 있다.

MoE를 고를 때 "몇 B가 활성화되는가"만 물으면 숫자의 절반만 읽게 된다. 어느 전문가가 선택되고, 그 가중치는 어디에 있으며, 토큰이 장치 사이를 얼마나 움직이고, 우리 업무가 특정 전문가를 얼마나 뜨겁게 만드는지까지 봐야 한다. 희소성은 계산 경로의 성질이고, 배포 비용은 그 경로를 떠받치는 전체 시스템에서 결정된다.

참고 자료