불규칙한 임상 시계열 데이터에 대한 질의응답을 위한 비용 효율적인 멀티모달 LLM 추론 프레임워크
요약
불규칙한 임상 시계열 데이터(ICTS)를 효과적으로 처리하기 위한 멀티모달 LLM 추론 프레임워크 ClinPRISM을 제안합니다. 다중 척도 인코더와 증류 기술을 통해 데이터의 희소성과 비동기성 문제를 해결하며, 높은 효율성과 성능을 동시에 달성했습니다.
핵심 포인트
- 불규칙한 임상 시계열을 위한 ClinPRISM 프레임워크 제안
- 불규칙성 인식 다중 척도 인코더 및 시간적 증거 증류기 설계
- 텍스트 임베딩 공간과 궤적을 정렬하는 점진적 정렬 전략 도입
- 질문당 평균 0.15초의 매우 낮은 추론 지연 시간 달성
- 4B 규모 LLM 백본 사용 및 SOTA 성능 기록
불규칙한 임상 시계열 (Irregular Clinical Time Series, ICTS)에 대한 질의응답 (Question Answering, QA)은 광범위한 의료 애플리케이션에서 중추적인 역할을 합니다. 최근의 멀티모달 시계열 거대 언어 모델 (Large Language Models, LLMs)이 범용 시계열 QA에서 상당한 가능성을 보여주었음에도 불구하고, 임상 관찰 데이터의 희소성 (Sparsity), 비동기성 (Asynchrony), 그리고 불규칙한 샘플링 패턴 (Irregular Sampling Patterns)을 모델링하는 데에는 여전히 역부족입니다. 이러한 격차를 메우기 위해, 우리는 ICTS 데이터에 대한 질의응답을 위한 비용 효율적인 멀티모달 LLM 추론 프레임워크인 ClinPRISM을 제안합니다. 첫째, 우리는 다양한 시간적 척도 (Temporal Scales)에서 희소한 임상 증거를 포착하기 위해 불규칙성 인식 다중 척도 인코더 (Irregularity-aware Multi-scale Encoder)를 설계합니다. 그다음, 이러한 척도 전반의 표현 (Representations)을 통합하고 이를 소수의 LLM 호환 토큰 (LLM-compatible Tokens)으로 압축하는 시간적 증거 증류기 (Temporal Evidence Distiller)를 제안합니다. 또한, 불규칙한 궤적 (Trajectories)을 LLM의 텍스트 임베딩 공간 (Textual Embedding Space)과 순차적으로 정렬하는 점진적 정렬 전략 (Progressive Alignment Strategy)을 도입합니다. 학습을 용이하게 하기 위해, 우리는 다중 척도 설명이 쌍을 이룬 30,000개의 임상 시계열과 11개 태스크에 걸친 41,000개의 인스트럭션 튜닝 (Instruction-tuning) 인스턴스를 구축합니다. 40억 파라미터 (4-billion-parameter) 규모의 LLM 백본 (Backbone)을 사용하여, ClinPRISM은 단 16개의 시계열 토큰만을 사용하고 질문당 평균 0.15초의 추론 지연 시간 (Inference Latency)을 달성하면서도, 홀드아웃 평가 벤치마크 (Held-out Evaluation Benchmark)에서 최첨단 (State-of-the-art) 성능을 기록했습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.CL (NLP)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기