고정된 장면 속 텍스트-3D 평가의 구성 취약성 분석
요약
본 연구는 고정된 장면 환경에서 텍스트-3D 생성 모델의 리더보드 평가가 구성 변수에 취약한지 분석했습니다. 카메라 설정, 캡션 문구 등 다양한 요인을 변경하며 총 300개의 고정 장면을 테스트했습니다. 그 결과, 순위 변화는 점수보다 안정적이지만 특정 조건에서 승자가 바뀌는 경향이 관찰되었으며, 이는 기술적인 묘사일 뿐 생성기 우월성의 확정적 증거가 아님을 밝혔습니다.
핵심 포인트
- 평가 프로토콜의 구성 변수가 리더보드에 영향을 미칠 수 있음.
- 순위 변화는 점수보다 안정적이나 여전히 특정 조건에서 승자가 바뀜.
- 관찰된 승자 변화는 생성기 우월성의 확정적인 증거가 아님.
- 점수 안정성, 결정 불확실성, 목표화된 민감도를 분리하여 평가할 것을 권장함.
모든 생성된 장면이 고정되어 있을 때, 텍스트-3D 리더보드가 변할 수 있을까요? 우리는 카메라 설정과 캡션 문구가 측정 프로토콜의 일부가 되는 렌더링 이미지 평가를 위해 이 질문을 감사했습니다. 여섯 개의 생성기에서 나온 300개의 고정된 장면을 대상으로, 우리는 19개의 정렬(alignment) 평가자 및 하나의 지각 품질 제어 요소를 위해 여덟 가지 렌더 및 캡션 요인을 변경하고, 네 가지 목표화된 장면 저하를 테스트했습니다. 피크 구성 변동성은 17/19개 정렬 평가자에서 생성기 간 변동성보다 높았으며, 프롬프트 부트스트랩 하한은 11/19개에서 1을 초과했습니다. 순위는 점수보다 더 안정적이지만, 여전히 18/19개 평가자는 특정 구성 하에서 지점 추정치(point-estimate)의 승자를 변경했습니다. 쌍별 프로토콜 마진 엔벨로프는 테스트된 설정 전반에 걸쳐 방향을 유지하는 비교를 보여줍니다. 선택된 쌍들은 서로 반대되는 점별 구간을 가지지만, 전체 검색에 대한 동시 추론에서는 어떤 역전도 생존하지 못합니다. 따라서 관찰된 승자 변화는 생성기 우월성의 확정적인 변화가 아니라 기술적인 묘사입니다. 민감도는 별개로 유지됩니다: 프롬프트 없는 제어(prompt-free control)를 포함하여 어떤 평가자도 레이아웃 스크램블링에서 67%의 동점 조정 방향 판별력을 초과하지 못했는데, 이는 인간이 검증한 진실(ground truth)이라기보다는 진단적입니다. 이 감사는 점수 안정성, 결정 불확실성, 그리고 목표화된 민감도를 분리하며, 프로토콜 의존적인 비교와 선택 인지 불확실성을 포함하여 (생성기, 점수, 카드 ID)를 보고할 것을 권장합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.GR (Graphics)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기