Microsoft의 AesCode 8B 및 32B 모델
요약
Microsoft가 AesCode 8B 및 32B 모델을 공개했습니다. 이 모델은 슬라이드, 포스터 등 시각적 아티팩트를 HTML/CSS로 생성하며, 이미지의 미학적 참조와 프롬프트의 논리적 요구사항을 결합합니다. 특히 그래프 구조화 감독과 분리된 크로스모달 보상을 통해 기존 Vision-Language 모델의 한계를 극복했습니다.
핵심 포인트
- AesCode는 시각적 아티팩트를 HTML/CSS 코드로 생성하는 모델입니다.
- 이미지 참조와 텍스트 프롬프트의 장점을 결합하여 정확도를 높였습니다.
- 그래프 구조화 감독과 분리된 크로스모달 보상을 핵심 기술로 사용했습니다.
- AesCode-32B는 Qwen3-VL-32B-Instruct 기반으로 GDPO를 통해 훈련되었습니다.
AesCode는 슬라이드, 포스터, 대시보드와 같은 정보가 풍부한 시각적 아티팩트를 HTML/CSS로 생성합니다. 출력물은 구조화되고 편집 가능하며 검증할 수 있지만, 이 작업은 명확한 어려움을 안고 있습니다: 코드 모델은 레이아웃, 계층 구조, 색상이 캔버스 위에서 어떻게 결합되는지 볼 수 없습니다. 이미지 생성기는 정반대의 강점을 가집니다. 이들은 시각적으로 매력적인 페이지를 구성하지만, 종종 텍스트, 숫자 및 논리적 관계를 잘못 렌더링합니다. AesCode는 프롬프트와 동일한 이미지에서 생성된 이미지를 미학적 참조로 사용하면서 필요한 콘텐츠에 대해서는 프롬프트를 따릅니다. 참조 입력만으로는 문제를 해결할 수 없습니다. 기성 Vision-Language 모델은 환각된 콘텐츠를 복사하거나 참조 레이아웃을 무시할 수 있습니다. AesCode는 그래프 구조화 감독(graph-structured supervision)과 분리된 크로스모달 보상(decoupled cross-modal rewards)을 통해 의미적 요구사항을 시각적 단서로부터 분리합니다. AesCode-32B는 Qwen3-VL-32B-Instruct를 기반으로 하며, 콜드 스타트 SFT(cold-start SFT)로 훈련된 후 7개의 보상 채널에 걸쳐 GDPO로 훈련되었습니다. 이는 더 큰 버전의 출시 체크포인트이며 종합적인 벤치마크 결과를 이끌어냅니다. https://huggingface.co/microsoft/AesCode-32B https://huggingface.co/bartowski/AesCode-32B-GGUF https://huggingface.co/microsoft/AesCode-8B https://huggingface.co/bartowski/AesCode-8B-GGUF submitted by /u/jacek2023 [link] [comments]
AI 자동 생성 콘텐츠
본 콘텐츠는 r/LocalLLaMA의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기