HiTMS: 고처리량 멀티 스트림 언어 스테가노그래피 (Linguistic Steganography) 프레임워크
요약
HiTMS는 LLM의 샘플링 무작위성을 활용해 비밀 정보를 숨기는 멀티 스트림 언어 스테가노그래피 프레임워크입니다. 단일 스트림의 한계를 넘어 배치 추론을 통해 처리량을 최대 4.3배 향상시키고 보안성을 강화했습니다.
핵심 포인트
- 멀티 스트림 방식을 통해 모델 호출 비용 분산 및 처리량 향상
- 자기 기술적 프레임을 사용하여 데이터 복구 가능성 보장
- 미끼(Decoys) 슬롯을 활용해 활성 스트림 수 은닉
- 기존 단일 스트림 방식 대비 스테가날라이저 탐지 성능 저하
- LLM 및 스테가노그래피 코더에 대해 모델 불가지론적 설계
생성형 언어 스테가노그래피 (Generative linguistic steganography)는 대규모 언어 모델 (Large Language Models, LLMs)의 샘플링 무작위성 내에 비밀 비트를 숨깁니다. 기존 방식은 단일 스트림 (Single-stream) 방식으로, 단일 프롬프트에 대한 단일 응답을 통해 전체 비밀을 전달합니다. 이러한 관행은 두 가지 한계를 초래합니다: 배치형 멀티 스트림 추론 (Batched multi-stream inference)을 위한 프로토콜 수준의 지원이 없으며, 단순한 공동 배치 (Co-batching)는 슬롯 점유 (Slot occupancy)나 페이로드 완료 (Payload completion)를 숨기지 못합니다. 우리는 연속적인 상호작용 라운드에 걸쳐 공동으로 생성되는 여러 응답에 비밀을 분산시키는 HiTMS를 제안합니다. 각 라운드는 단일 배치 호출 (Batched call) 내에서 여러 스트림을 임베딩 (Embedding) 및 추출 (Extraction)하여, 모델 호출 비용을 분할 상환하고 처리량 (Throughput)을 실질적으로 향상시킵니다. 복구 가능성을 보장하기 위해, HiTMS는 각 응답을 자기 기술적 프레임 (Self-describing frame)으로 감싸고, 스트림을 슬롯에 바인딩하며 사용되지 않는 슬롯을 미끼 (Decoys)로 채우는 키 유도 스케줄 (Key-derived schedule)을 채택하여, 활성 스트림의 수를 숨기면서도 정확한 복구를 보장합니다. 이 프레임워크는 언어 모델과 스테가노그래피 코더 (Steganographic coder) 모두에 대해 불가지론적 (Agnostic)입니다. 8개의 데이터셋-모델-코더 설정에 걸쳐, 8개 스트림을 사용하는 HiTMS는 단일 스트림 베이스라인보다 최대 4.3배 높은 임베딩 및 추출 속도를 달성하는 동시에, 스테가날라이저 (Steganalyzer)의 AUROC를 평균 0.681에서 0.601로 낮추었습니다. 4개에서 64개 스트림을 사용한 추가 실험은 동시성 (Concurrency)이 증가함에 따라 지속적인 처리량 이득을 입증합니다. 이 작업에 대한 GitHub 저장소는 https://github.com/ryehr/HiTMS_steganography 입니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.CL (NLP)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기