확산 언어 모델을 만드는 방법
요약
확산 언어 모델(Diffusion Language Model)은 기존 자기회귀 방식의 한계를 극복하고 텍스트 생성에 확산 원리를 적용한 기술입니다. 이 모델은 문장의 일부를 가리고 복원하는 방식으로 학습하며, 점진적인 완성 과정을 통해 속도와 품질을 조절할 수 있습니다. Mercury 같은 실제 구현체는 높은 생성 속도를 보여주며, 단백질 및 DNA 설계 등 다양한 분야로 활용 가능성이 제시되었습니다.
핵심 포인트
- 확산 모델은 여러 위치를 동시에 채우고 점진적으로 완성하여 병렬 생성이 용이합니다.
- 자기회귀 모델의 누적 오류와 느린 생성 속도 문제를 해결할 수 있습니다.
- 마스킹 확산(MDLM)은 토큰을 가리는 방식으로 잡음을 정의하여 이산 데이터에 적용했습니다.
- 생성 단계 수를 조절해 품질과 속도를 제어하며, 단백질/DNA 설계에도 활용됩니다.
- 기존 언어 모델이 토큰을 하나씩 이어 쓰는 반면,
확산 언어 모델(Diffusion Language Model)은 여러 위치를 동시에 채우며 반복 단계 수에 따라 생성 속도와 품질을 조절함 - 기본적인 학습은
문장의 일부를 무작위로 가리고 복원하는 방식이며, 생성할 때는 빈칸으로 가득한 문장에서 시작해 점차 내용을 완성함 - 실제 모델은
블록 단위 생성, 이미 채운 토큰의 재수정, 생성 단계 수를 줄이는 증류를 결합해 길이 제한과 오류, 속도 문제를 해결함 - Mercury는 일반 GPU에서
초당 1,000토큰 이상을 생성하며, 확산 방식은 텍스트뿐 아니라 원하는 성질을 가진 단백질과 DNA 설계에도 활용됨 - 병렬 학습이 트랜스포머의 대규모 학습을 가능하게 했듯,
병렬 생성은 후속 학습과 추론의 연산 규모를 키우는 길이 될 수 있으며 지능 향상으로 이어질지가 다음 과제임
자기회귀 생성과 확산의 차이
- 이미지와 영상 같은 연속 데이터에서는
확산 모델, 텍스트와 코드 같은 이산 데이터에서는 자기회귀 모델이 널리 쓰임 - 자기회귀 언어 모델은 이전 토큰을 조건으로 다음 토큰을 하나씩 생성하므로 세 가지 제약이 있음
- 이미 출력한 토큰을 수정할 수 없어 초기 오류가 누적됨
- 시퀀스 길이만큼 생성 단계가 필요하고 자연스러운 병렬 생성이 어려움
- 인과적 어텐션 때문에 미래 문맥을 보지 못함
확산 생성은 전체 시퀀스의 초기 추정에서 출발해 여러 단계로 다듬으며, 단계 수로 속도와 품질을 조절하고 양방향 문맥을 활용함
-
다만 오류 수정은 모든 확산 모델의 기본 기능이 아니며, 표준 MDLM에는 별도 확장이 필요함
-
언어에 확산을 적용하는 문제는 오랫동안 난제였으나,
2024년을 기점으로 자기회귀 모델과 품질 경쟁이 가능해짐 -
2026년에는 Inception Labs의 Mercury 2, Google의 Gemma Diffusion, NVIDIA의 Nemotron Diffusion 같은 제품과 모델이 등장함
가우시안 확산에서 마스킹 확산으로
가우시안 확산은 데이터를 손상시키는 순방향 과정과 이를 되돌리는 역방향 과정으로 구성됨
-
순방향 과정은 깨끗한 이미지에 가우시안 잡음을 점차 더해 순수 잡음으로 바꾸며, 학습 없이 역방향 과정의 훈련 데이터를 생성함
-
역방향 모델은 잡음이 섞인 입력에서 추가된 잡음 또는 원본 이미지를 예측함
-
생성 시에는 무작위 잡음에서 시작해 조금씩 잡음을 제거하며 새 이미지를 만듦
-
이산 토큰에는 연속적인 가우시안 잡음을 더하는 연산이 명확하지 않으므로,
마스킹 확산은 토큰을 가리는 방식으로 잡음을 정의함 -
MDLM은
마스킹 비율을 무작위로 정하는 생성형 BERT로 이해할 수 있음 -
깨끗한 시퀀스의 일부를 가리고, 양방향 트랜스포머가 원래 토큰을 복원하도록 학습함
-
생성은 완전히 가려진 시퀀스에서 시작해 모든 빈칸을 예측하고, 새 예측 일부를 다시 가리는 과정을 반복함
-
매 단계에서 확정된 토큰 수를 늘려 임의의 순서로 시퀀스를 완성함
-
『백년의 고독』 도입부 예시에서는 드문드문 채워진 토큰이 점차 완전한 문장으로 수렴함
-
확률적으로 순방향 과정은
마르코프 연쇄이며, 토큰이 가려지지 않고 남을 확률을 정하는 스케줄이 가우시안 확산의 신호 대 잡음비 역할을 함 -
아직 가려지지 않은 토큰을 단계적으로 마스킹해 깨끗한 데이터에서 완전히 가려진 상태로 이동함
-
원본을 알고 있다면 베이즈 법칙으로 최적 역방향 과정을 구할 수 있고, 각 마스킹 위치를 정해진 확률로 원래 토큰으로 복원함
-
실제 생성에서는 원본 대신 모델의 예측을 사용해 이 역방향 과정을 근사함
-
중간의 부분 마스킹 시퀀스는
잠재변수이며, 역방향 생성은 이 모델의 조상 샘플링(ancestral sampling)에 해당함 -
직접 계산하기 어려운 우도는
증거 하한(ELBO) 으로 근사함 -
학습 손실의 내부 항은 예측 토큰과 원본 토큰 사이의 교차 엔트로피로, BERT 손실과 같음
-
고정 마스킹 비율 대신 가능한 모든 비율에 걸쳐 평균을 내고, 마스킹된 토큰의 기대 비율로 정규화함
-
따라서 BERT와 달리 원리적으로 정당화된 생성 절차와 로그 우도의 변분 하한을 함께 갖춤
-
ELBO는
로그 우도와 퍼플렉서티를 이용한 자기회귀 모델과의 비교를 가능하게 함 -
LM1B 평가에서 MDLM은 Diffusion-LM, D3PM, DiffusionBERT, SEDD보다 개선된 결과로 자기회귀 모델과의 격차를 상당 부분 줄임
가변 길이 생성과 효율적인 아키텍처
-
표준 MDLM은
고정 길이 생성, 기본적인 오류 수정 기능의 부재, 추가 후속 학습 없이는 충분히 빠르지 않은 생성 속도 때문에 그대로 프로덕션에 쓰기 어려움
블록 확산은 이전에 생성한 토큰을 조건으로 블록별 확산을 수행해 가변 길이 생성을 지원함 -
블록 크기는 십여 개부터 수천 개 토큰까지 가능하며 응용 분야에 맞춰 선택함
-
생물학에서는 포착하려는 상호작용의 길이를, 언어 모델에서는 배치 크기와 함께 결정되는 연산 집약도와 GPU 특성을 고려할 수 있음
-
Gemma Diffusion 예시에서는 256토큰 블록을 이어 붙여 1,024토큰 시퀀스를 생성함
-
완료된 블록의 키와 값을 재사용하는
KV 캐싱도 자연스럽게 지원함 -
가변 길이 생성을 위한 다른 접근도 있음
Set Diffusion은 왼쪽부터 이어지는 블록 대신 임의 위치의 집합에 확산을 적용함
Edit Flows와 FlexMDM은 삽입, 삭제, 치환 연산으로 생성 과정을 구성해 수정 중 시퀀스 길이를 늘리거나 줄임 -
표준 MDLM의
인코더 전용 구조는 매 잡음 제거 단계마다 전체 네트워크를 실행해야 하므로 계산 비용이 큼
인코더-디코더 구조는 이미 생성된 깨끗한 문맥의 표현 계산과 손상된 토큰의 잡음 제거를 분리함 -
무거운 인코더가 깨끗한 문맥을 한 번 처리하고, 가벼운 디코더가 그 표현을 조건으로 반복적인 잡음 제거를 수행함
-
Gemma Diffusion과 최근 Nemotron Diffusion이 이 구조를 사용함
-
학습에서도 시퀀스를 블록으로 나누어 작은 디코더에 전달하므로 블록 확산의 학습 FLOPs를 줄일 수 있음
오류 수정과 증류를 통한 고속 샘플링
- 표준 MDLM은 한 번 마스킹을 해제해 확정한 토큰을 바꾸지 않으므로
초기 오류를 수정하지 못함
재마스킹 확산은 새로 복원한 토큰 일부를 유지하는 동시에, 이전에 확정한 토큰 일부를 다시 가려 재생성함 - 추가 문맥을 얻은 뒤 문법적으로 잘못 선택한
sell
을 sells
로 수정하는 식임
- 사전 학습된 MDLM에도 예측자-교정자 마르코프 연쇄에 해당하는 플러그인 샘플러로 적용할 수 있음
- 단계 수를 늘려 품질을 높이는
추론 시점 연산 확장을 지원하며, 연산 예산이 작을 때도 일반 MDLM 샘플링보다 품질을 잘 유지함 - ReMDM 결과에서 MAUVE는 샘플링 연산을 늘리며 0.40에서 0.66으로 상승함
- 비교값은 자기회귀 생성 0.76과 일반 MDLM 0.04임
균일 상태 확산(UDLM) 은 마스크 대신 어휘 집합에서 무작위로 뽑은 토큰을 잡음으로 사용함
-
무작위 토큰 시퀀스에서 시작해 각 위치를 교체할지 판단하므로 어느 단계에서든 모든 토큰을 수정할 수 있음
-
마스킹 확산이 일반적으로 더 빠르게 학습되고 더 좋은 퍼플렉서티를 달성하는 반면, UDLM은 빠른 샘플링과 제어 가능한 생성에 유리함
-
Gemma Diffusion은 UDLM을 사용하며, 매 단계에서 깨끗한 시퀀스를 예측한 뒤 일부 토큰에 다시 무작위 잡음을 넣음
-
UDLM도 학습을 개선하는
단순화된 ELBO 목적함수를 지원함 -
앞선 D3PM은 균일 잡음과 다른 구조화된 잡음을 연구함
GIDD는 마스킹과 균일 잡음을 하나의 과정으로 결합하며, 각각을 특수한 경우로 포함함 -
확산은 한 단계에서 여러 토큰을 생성하거나 수정해 자기회귀 생성보다
5~10배 빠를 수 있지만, 동시 예측은 토큰 사이의 문법적 불일치 등을 만들 수 있음 -
이를 고치지 못하면 오류가 누적되므로, 현재의 빠른 확산 모델 대부분은 재마스킹이나 UDLM 같은 오류 수정 과정을 사용함
점진적 증류는 교사의 두 단계를 학생의 한 단계로 재현하도록 학습하고, 이를 반복해 샘플링 단계 수를 절반씩 줄임
- 언어 모델에서는 시간에 따른 자기 증류와 이산 일관성 증류 같은 기법으로 확장됨
- 일반 학습은 순방향 과정의 샘플을 사용하는 오프폴리시 학습이지만, 증류는 모델 자신의 생성 샘플로 학습하는 온폴리시 방식으로 해석할 수 있음
- 자체 샘플을 이용한 학습은 주 학습 과정에서 수행하기에는 비싸므로 후처리 단계에서 적용함
목표 속성에 맞춘 생성과 강화학습 후속 학습
제어 가능한 생성은 실제 데이터처럼 자연스러우면서도 목표 속성을 만족하는 샘플을 만드는 문제임
- 이미지와 프롬프트의 일치, 분자의 특정 부위 결합 친화도 등이 목표가 될 수 있음
- 자연스러운 분자가 원하는 결합력을 갖지 못할 수 있고, 결합력만 최적화하면 자연스럽지 않거나 합성 불가능한 분자가 나올 수 있음
- 확산은 전체 시퀀스를 반복 수정해
자연스러움과 속성 충족 사이의 파레토 전선을 자기회귀 방식보다 개선함
분류기 기반 유도(CBG) 는 잡음이 섞인 샘플에서 목표 속성을 예측하는 모델을 각 생성 단계에 적용함
- 베이즈 법칙에 따라 무조건부 역방향 모델과 속성 분류기를 결합해 조건부 모델을 구성함
- 유도 강도로 목표 속성과 모델 자체 선호의 균형을 조절함
- 단일 토큰의 분포는 어휘 전체를 합산해 정규화할 수 있지만, 전체 시퀀스에는 추가 정규화 기법이 필요함
분류기 없는 유도(CFG) 는 별도 분류기 대신 조건부 모델과 무조건부 모델의 역방향 분포를 결합함
-
실제로는 학습 중 조건 신호를 무작위로 제거해 하나의 네트워크가 두 모드를 모두 익히도록 함
-
토큰별 가능한 값을 합산하는 방식으로 정규화할 수 있음
-
CBG와 CFG는 MDLM과 UDLM 모두에 적용 가능하며, 토큰을 반복 수정할 수 있는 UDLM이나 재마스킹 MDLM과 특히 잘 맞음
-
확산 언어 모델도
강화학습 후속 학습으로 추론 능력을 높일 수 있지만, 정책 경사에 필요한 샘플 궤적의 우도 계산이 어려움 -
자기회귀 모델은 다음 토큰 확률의 곱으로 쉽게 계산하지만, MDLM의 학습 목적함수는 모든 마스킹 순서에 걸친 평균을 포함함
d1과 d2는 이 우도 계산 문제를 서로 다른 방식으로 해결함
-
d1의 diffu-GRPO는 가치 평가기 없는 정책 경사 알고리듬으로, 평균장 근사로 궤적 로그 확률을 추정하고 마스킹 기반 지도 미세 조정으로 기존 데이터의 추론 행동을 증류함
-
d2는 임의 순서 디코딩을 지원하는 모델에 정확한 단일 패스 추정량을 사용하고, 그렇지 않은 경우 연산량과 정확도를 조절할 수 있는 근사 추정량을 사용함
-
d2는 지도 미세 조정 없이 논리 및 수학 추론 벤치마크에서 새로운 최고 성능을 달성함
-
생물학 응용에서는 정답 검증 대신 결합 친화도나 유전자 발현 같은
실험 측정 속성을 보상으로 사용할 수 있음
DRAKES는 보상을 이산 확산 샘플링 궤적을 통해 역전파해 DNA와 단백질 설계에 직접 미세 조정함
단백질과 DNA에서의 대규모 적용
- 생물학적 시퀀스는 자기회귀 모델의
왼쪽에서 오른쪽으로 향하는 편향이 덜 적합하고, 과학 응용은 목표 속성에 맞춘 생성의 이점이 커 확산 언어 모델의 초기 성공 분야가 됨
ESM3는 대규모 아미노산 데이터로 학습한 최대 1,000억 파라미터 MDLM임 - 서열, 구조, 기능의 세 트랙에 걸쳐 토큰을 마스킹하고 교차 엔트로피 손실로 복원해 여러 모달리티를 조건으로 사용하거나 생성함
- 자기회귀 기준 모델을 능가하며 단백질 생성에서 새로운 최고 성능을 기록함
- ESM 계열은 변이 효과 예측, 단백질 접힘, 단백질 생성 등 단백질체학 전반에서 널리 사용됨
Nucleotide Transformer v3(NT-v3) 는 단백질 모델이 다루지 않는 비암호화 조절 서열까지 포함해 DNA를 모델링함
-
Kuleshov Group, InstaDeep, BioNTech의 협업으로 수십억 파라미터와 1조 토큰 이상의 DNA 규모까지 MDLM을 확장함
-
원시 서열과 유전자 발현 수준을 포함한 다중 트랙 데이터를 입력으로 사용함
-
추론에서는 이산 CFG와 재마스킹으로 목표 속성을 가진 DNA를 생성함
-
예시에서는 4kb 서열에서 프로모터를 고정한 채 가려진 인핸서를 생성함
-
NT-v3로 특정 유전자 발현을 높이거나 억제하는
조절 DNA를 만들고 실제 실험실에서 검증함 -
CFG 유도 강도를 바꿔 여러 서열을 생성했으며, 이전 기준 모델보다 발현을 더 잘 조절함
-
높은 발현을 목표로 한
High
, Highest
구간에서 생성 인핸서의 측정 활성도가 자연 인핸서보다 높았음
현재의 확산 대규모 언어 모델
LLaDA는 LLaMA의 학습 방식을 본떠 MDLM을 80억 파라미터로 확장한 오픈 웨이트 모델임
- 샘플링 시 블록 확산을 사용하며 재마스킹과 후속 학습을 지원함
- 일반, 수학, 코드 벤치마크에서 LLaMA2-7B 및 LLaMA3-8B와 경쟁력 있는 성능을 보임
- GSM8K와 MMLU에서 학습 FLOPs 증가에 따른 정확도 향상이 자기회귀 모델과 유사하며, 여러 학술 연구의 기반으로 쓰임
Mercury는 2025년 발표된 최초의 상용 확산 LLM으로, 표준 GPU에서 동급 품질을 유지하며 사용자당 초당 1,000토큰을 넘는 생성 속도를 달성함
- Mercury 2는 Claude Haiku, Gemini Flash-Lite/Flash 같은 속도 최적화 모델과 경쟁하면서
5~10배 빠른 속도를 보임 - Artificial Analysis 에이전트 지수와 출력 속도를 비교한 도표에서는 약 1,200토큰/초를 기록하며 GPT-5 mini, Claude 4.5 Haiku 등 유사 품질 모델보다 빠름
- Mercury Mini 비교에서는 일반 GPU로 SambaNova, Groq 등의 전용 추론 환경에 필적하는 속도를 내면서 더 높은 지능 평가값을 기록함
- 전용 칩으로 자기회귀 추론을 가속하는 대신, 알고리듬을 기존 하드웨어의 병렬성에 맞추는 접근임
Gemma Diffusion은 Google의 오픈 웨이트 모델로, Unsloth와 Hugging Face 등에서 지원함
- UDLM, 가변 길이를 위한 블록 확산, 인코더-디코더 구조, 가속 샘플링을 결합함
- 매 순전파에서 전체 토큰 블록을 병렬로 처리해 생성 병목을 메모리 대역폭에서 연산으로 옮김
Nemotron Diffusion은 자기회귀와 확산 목적함수를 함께 사용해 학습하는 NVIDIA의 오픈 웨이트 모델 계열임
- MDLM과 블록 확산을 구현하며, 최근 모델은 인코더-디코더 구조를 도입하고 350억 파라미터까지 확장함
- 비교 대상 자기회귀 모델의 품질을 최대 99% 유지하면서 약
2~8배 처리량을 기록함 - 같은 체크포인트에서 일반 자기회귀 디코딩으로 전환할 수도 있음
병렬 추론이 지능 확장으로 이어질 수 있는가
-
확산의 잠재적 이점은
최대 10배 수준의 병렬 생성 속도, 목표 속성 제어, 이미지와 텍스트를 아우르는 공통 알고리듬, 추론 시점 연산 확장에 있음 -
아직 자기회귀 모델과 같은 파라미터, 연산량, 데이터 규모로 확장되지는 않았지만 최대 1,000억 파라미터 실험은 가능성을 보여줌
-
2019~2024년 모델 지능 발전의 중요한 원동력은
사전 학습 규모 확대였음 -
순차적인 RNN은 병렬 GPU를 충분히 활용하지 못했지만, 트랜스포머는 병렬 학습으로 대규모 GPU 활용을 가능하게 함
-
2024년 이후에는 사전 학습의 개선 폭이 둔화되고,
후속 학습과 추론 시점 연산 확대가 지능 향상의 중심이 됨 -
두 과정 모두 빠른 생성에 의존하지만 현재의 자기회귀 생성은 순차 처리에 묶여 있음
-
확산이 추론을 완전히 병렬화할 수 있다면, 트랜스포머가 사전 학습에 가져온 것과 유사한
확장 기회를 후속 학습과 추론에 열 수 있음 -
초당 더 많은 FLOPs를 활용해 하드웨어 이용률과 확장 가능성을 높일 수 있을 것으로 기대됨
-
이것이 근본적인 지능 향상으로 얼마나 빠르게 이어질지는 아직 판단하기 어려움
댓글과 토론
AI 자동 생성 콘텐츠
본 콘텐츠는 GeekNews의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기