AI 모델 이름의 MoE, Instruct, Abliterated, Distill, 멀티모달, Coder, TTS 뜻

허깅페이스(Hugging Face)에서 모델을 둘러보거나 새 AI 모델 소식을 접하다 보면 이름과 설명에 MoE, Instruct, Abliterated, Distill, 멀티모달(multimodal), Coder, TTS 같은 낯선 단어들이 붙어 있는 것을 보게 됩니다. 이 키워드들은 그 모델이 어떤 구조로 만들어졌고, 어떤 방식으로 다듬어졌으며, 무엇을 잘하는지를 압축해서 보여주는 일종의 ‘성분표’입니다. 하나하나 뜯어보면 모델을 고르는 안목이 확 넓어집니다.

크게 나누면 이 단어들은 세 갈래로 정리됩니다. 모델의 구조(아키텍처)를 말하는 것(MoE), 사전학습 이후 어떻게 다듬어졌는지(후처리·파인튜닝)를 말하는 것(Instruct·Abliterated·Distill), 그리고 무엇을 다루는지(입출력·전문 분야)를 말하는 것(멀티모달·Coder·TTS)입니다. 이 틀만 잡아두면 Qwen2.5-Coder-32B-Instruct처럼 여러 키워드가 겹쳐 붙은 긴 이름도 술술 읽힙니다.

MoE — 여러 전문가가 나눠 일하는 구조

MoE는 ‘Mixture of Experts(전문가 혼합)’의 약자로, 모델의 구조(아키텍처)를 가리키는 말입니다. 하나의 거대한 신경망이 모든 입력을 처리하는 대신, 여러 개의 전문화된 ‘전문가(expert)’ 하위 모델과 이들 중 누구를 쓸지 결정하는 ‘라우터(gating, 게이팅)’로 구성됩니다.

핵심은 효율입니다. 전체 파라미터 수는 매우 크지만, 토큰 하나를 처리할 때는 관련 있는 소수의 전문가만 활성화됩니다. 그래서 총 파라미터가 수백억~수천억이어도 실제 추론에 쓰이는 연산량은 그 일부에 그칩니다. 덩치는 크지만 실제로 쓰는 힘은 아껴 쓰는 셈이라, 거대 모델을 더 빠르고 저렴하게 돌릴 수 있게 해줍니다.

Instruct — 지시를 잘 따르도록 길들인 모델

Instruct는 ‘지시(instruction)를 따르도록 파인튜닝된’ 모델이라는 뜻입니다. 이 단어를 이해하려면 먼저 ‘Base(베이스) 모델’과 짝지어 봐야 합니다.

Base 모델은 방대한 텍스트로 사전학습만 마친 ‘날것(raw)’ 상태입니다. 언어와 지식은 폭넓게 익혔지만, 사용자의 지시를 그대로 따르도록 훈련받지는 않았습니다. 그래서 질문을 던지면 엉뚱하게 문장을 이어 쓰거나 원하는 형식으로 답하지 않는 경우가 많습니다.

Instruct 모델은 이 Base 모델 위에 ‘지시–프롬프트–모범답안’ 형태의 데이터로 추가 학습(지시 튜닝)을 얹은 것입니다. 덕분에 복잡한 요청을 해석하고, 단계별 지시를 따르며, 대화형으로 협조적으로 응답합니다. 우리가 챗봇처럼 쓰는 모델은 대부분 이 Instruct(또는 Chat) 계열입니다. 반대로 Base 모델은 추가 파인튜닝의 재료나 아이디어 실험용으로 주로 쓰입니다.

Abliterated — 거부 반응을 제거한 모델

Abliterated는 모델의 ‘거부 행동(refusal)’을 외과적으로 제거한 상태를 뜻합니다. ‘ablation(제거)’에서 온 조어로, 모델이 특정 요청에 “죄송하지만 도와드릴 수 없습니다”라고 거절하는 반응을 담당하는 내부 방향(refusal direction)을 찾아내 약화시키는 후처리 기법입니다.

중요한 구분이 있습니다. 이것은 프롬프트로 안전장치를 우회하는 ‘탈옥(jailbreak)’과 다릅니다. Abliteration은 모델의 가중치 자체를 수정해 거부 성향을 영구적으로 눌러버리는 방식입니다. 그 결과 검열이 줄어든(uncensored) 모델이 되며, Abliterated 모델은 무검열 모델의 한 종류로 분류됩니다. 다만 안전장치가 약해진 만큼, 실제 서비스에 쓸 때는 별도의 정책·필터를 앱 단에서 반드시 얹어야 합니다.

Distill — 큰 모델을 압축해 물려받은 모델

Distill은 ‘지식 증류(Knowledge Distillation)’로 만들어진 모델이라는 표시입니다. 크고 똑똑한 ‘교사(teacher) 모델’의 지식과 판단을 더 작고 가벼운 ‘학생(student) 모델’에게 옮겨 담는 기법입니다.

교사 모델이 내놓는 정답뿐 아니라 ‘확률 분포’ 형태의 미묘한 판단(soft label)까지 학생이 흉내 내며 배우기 때문에, 크기를 크게 줄이면서도 원본 성능의 상당 부분을 지킬 수 있습니다. 대표적으로 DistilBERT는 BERT 정확도의 약 97%를 유지하면서 크기는 40% 작고 속도는 60% 빠릅니다. 최근에는 대형 모델을 증류해 노트북이나 모바일에서도 돌아가는 경량 버전을 내놓는 사례가 흔해졌습니다. 이름에 Distill이 붙어 있으면 ‘가볍게 압축된 버전’이라고 이해하면 됩니다.

멀티모달(multimodal) — 텍스트 말고도 보고 듣는 모델

멀티모달은 텍스트 하나만이 아니라 여러 종류의 데이터(모달리티)를 함께 다루는 모델을 뜻합니다. 이미지, 음성, 영상 같은 서로 다른 형태의 입력을 이해하고 연결해서 판단합니다.

예를 들어 사진을 올리고 “이 안에 뭐가 있어?”라고 묻거나, 그래프 이미지를 해석하게 하거나, 문서 스캔본을 읽히는 작업이 멀티모달 모델의 영역입니다. 텍스트만 처리하던 기존 언어 모델보다 사람의 인지 방식에 한 걸음 더 가까워진 형태라고 볼 수 있습니다.

Coder — 코딩에 특화된 모델

Coder는 소스 코드에 특화되도록 훈련된 모델임을 나타냅니다. 방대한 코드, 기술 문서, 프로그래밍 자료를 집중적으로 학습해 코드 작성·자동완성·디버깅·오류 탐지·다른 언어로의 코드 변환 같은 작업을 잘합니다.

일반 대화 모델도 코드를 어느 정도 다루지만, 이름에 Coder가 붙은 모델은 개발 작업에 초점이 맞춰져 있어 프로그래밍 상황에서 더 정확하고 안정적인 결과를 내는 경향이 있습니다. 개발용 보조 도구를 찾는다면 Coder 계열을 눈여겨보면 됩니다.

TTS — 글자를 음성으로 바꾸는 모델

TTS는 ‘Text-to-Speech’, 즉 글로 쓰인 텍스트를 자연스러운 음성으로 변환하는 모델입니다. 허깅페이스에서는 SpeechT5, Bark 같은 TTS 모델을 볼 수 있고, 여러 언어와 화자 목소리로 음성을 생성할 수 있습니다.

가상 비서, 오디오북, 화면을 읽어주는 접근성 도구처럼 ‘소리 출력’이 필요한 곳에 쓰입니다. 반대로 음성을 텍스트로 바꾸는 작업은 STT(Speech-to-Text)나 ASR로 따로 표기됩니다.

한눈에 보는 키워드 정리표

키워드분류핵심 뜻
MoE구조여러 전문가 중 필요한 일부만 활성화해 효율을 높인 아키텍처
Instruct후처리지시를 잘 따르도록 파인튜닝된 모델 (Base 모델의 대응 개념)
Abliterated후처리가중치를 수정해 거부 반응을 제거한 무검열 모델
Distill후처리큰 교사 모델의 지식을 압축해 작게 만든 경량 모델
멀티모달입출력텍스트 외 이미지·음성·영상까지 함께 다루는 모델
Coder전문분야코드 작성·디버깅 등 프로그래밍에 특화된 모델
TTS전문분야텍스트를 음성으로 변환하는 모델

키워드는 겹쳐 붙기도 합니다

실제 모델 이름에는 이 키워드들이 여러 개 겹쳐 붙는 경우가 많습니다. 예를 들어 Qwen2.5-Coder-32B-Instruct는 ‘코딩에 특화(Coder)된 320억(32B) 파라미터 규모의, 지시를 따르도록 튜닝(Instruct)된 모델’로 읽을 수 있습니다. 여기에 파라미터 수(7B·70B 등), 버전, 양자화 표기(GGUF·AWQ 등)까지 붙으면 이름이 길어지지만, 각 조각이 무엇을 뜻하는지 알면 모델의 성격을 이름만 보고도 상당히 파악할 수 있습니다.

마무리

모델 이름에 붙는 키워드는 결국 ‘어떤 구조로(MoE), 어떻게 다듬어져(Instruct·Abliterated·Distill), 무엇을 다루는가(멀티모달·Coder·TTS)’라는 세 질문에 대한 답입니다. 이 틀만 기억해두면 새로운 모델을 만나도 이름과 설명만으로 용도와 성격을 빠르게 가늠할 수 있습니다. 더 다양한 모델과 표기 방식이 궁금하다면 허깅페이스 모델 허브에서 실제 사례를 직접 살펴보는 것을 추천합니다.

이 갈래에서 이어 읽기