
inclusionAI/LLaDA2.2-flash · Hugging Face
요약
LLaDA2.2-flash는 Levenshtein Editing 기술을 도입한 에이전트 지향적 확산 언어 모델입니다. 128K의 긴 컨텍스트 창과 MoE 기반 블록 라우팅을 통해 효율적인 도구 사용 및 오류 수정 능력을 갖추었습니다.
핵심 포인트
- Levenshtein Editing을 통한 시퀀스 구조 편집 및 오류 수정 가능
- 128K 컨텍스트 확장을 위한 효율적인 블록 라우팅 도입
- 에이전트 강화를 위한 L-EBPO 정책 최적화 기법 제안
- 100B 파라미터 규모의 MoE 기반 확산 언어 모델
LLaDA2.2-flash는 LLaDA2 시리즈의 에이전트 지향적 확산 언어 모델 (diffusion language model)입니다. 확산 언어 모델링 (diffusion language modeling)에 Levenshtein Editing (DELETE 및 INSERT 제어 토큰 포함)을 도입함으로써, 긴 문맥의 도구 사용 (tool use), 다회차 상호작용 (multi-turn interaction), 강력한 오류 수정 (error correction)을 포함한 에이전트 애플리케이션 (agentic applications)을 향한 LLaDA2 시리즈의 첫 번째 단계를 나타냅니다. 더 자세한 정보는 기술 보고서 (technical report)를 참조하십시오. 🚀 주요 특징
효율적인 128K 확산 인프라 (Diffusion Infrastructure): LLaDA2.2-flash는 컨텍스트 창 (context window)을 128K로 확장하고, 효율적인 긴 문맥의 에이전트 워크로드 (agentic workloads)를 가능하게 하기 위해 확산 블록 (diffusion-block) 수준에서 MoE 전문가 활성화를 제한하는 블록 라우팅 (Block Routing)을 도입합니다.
Levenshtein Editing: DELETE 및 INSERT 제어 토큰을 도입하여, 확산 디코딩 (diffusion decoding)이 시퀀스 구조를 편집하고, 중복된 내용을 제거하며, 병렬 생성 (parallel generation) 중에 삽입 슬롯 (insertion slots)을 생성할 수 있도록 합니다.
에이전트 강화학습 (Agentic Reinforcement Learning): 우리는 다회차 도구 사용 (multi-turn tool-use) 시나리오에서 Levenshtein Editing 및 오류 수정을 훈련하기 위해 에이전트 환경 보상 (agentic environmental rewards)을 활용하는 Levenshtein Editing ELBO 기반 블록 수준 정책 최적화 (L-EBPO, Levenshtein Editing ELBO-based Block-level Policy Optimization)를 제안합니다.
🔍 모델 개요
LLaDA2.2-flash의 사양은 다음과 같습니다:
유형: Levenshtein Editing을 적용한 전문가 혼합 (Mixture-of-Experts, MoE) 확산 언어 모델 (Diffusion Language Model)
컨텍스트 길이: 128K 토큰
Levenshtein Editing 제어 토큰: DELETE, INSERT
총 파라미터 수 (임베딩 제외): 100B
레이어 수: 32
어텐션 헤드 (Attention Heads): 32
위치 인코딩 (Positional Encoding): 회전 위치 임베딩 (Rotary Position Embedding, RoPE)
어휘 사전 크기 (Vocabulary Size): 157,184
AI 자동 생성 콘텐츠
본 콘텐츠는 r/LocalLLaMA의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기