Shieldstral
요약
3B 파라미터 규모의 멀티모달 안전 분류기인 Shieldstral을 소개합니다. 이 모델은 텍스트 안전 벤치마크에서 대형 모델을 능가하며, 콘텐츠 중재를 이진 질의응답 방식으로 통합하여 높은 효율성을 보여줍니다.
핵심 포인트
- 3B 규모로 대형 모델 대비 뛰어난 멀티모달 안전 분류 성능 달성
- 콘텐츠 중재를 이진 질의응답(yes/no) 태스크로 단순화하여 통합
- 5,410만 개의 샘플을 활용한 데이터 구축 레시피 제시
- 작은 적응형 모델의 높은 정책 적응성 및 SOTA 성능 입증
우리는 3B-파라미터(3B-parameter) 규모의 정책 적응형 멀티모달 안전 분류기(multimodal safety classifier)인 Shieldstral을 소개합니다. 이 모델은 텍스트 안전 벤치마크(text safety benchmarks)에서 크기가 거의 7배 더 큰 모델들과 대등하거나 이를 능가하는 성능을 보여주며, 멀티모달 안전 분류(multimodal safety classification) 분야에서 새로운 SOTA(state of the art)를 기록했습니다. Shieldstral은 콘텐츠 중재(content moderation)를 이진 질의응답(binary question-answering) 태스크로 공식화합니다. 이러한 단순한 공식화는 다양한 중재 태스크를 단일한 yes/no 문제로 통합하여, 서로 다른 분류 체계(taxonomies)를 가진 이질적인 안전 데이터셋들을 하나의 학습 프레임워크(training framework) 아래로 통합할 수 있게 합니다. 우리는 약 5,410만(54.1M) 개의 샘플 큐레이션 및 생성과 정책 적응성(policy adaptability)을 평가하기 위한 세밀한 평가 세트(fine-grained evaluation set)를 포함하는 데이터 구축 레시피를 제시합니다. 이를 통해 작은 적응형 모델이 훨씬 더 큰 모델들과 대등하거나 이를 능가할 수 있음을 입증합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.CL (NLP)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기