텍스트 요구사항에서 마이크로서비스 아키텍처로 - LLM 기반 설계 합성의 종합적 평가
요약
본 연구는 LLM을 활용하여 텍스트 요구사항으로부터 마이크로서비스 아키텍처를 자동으로 합성하는 능력을 평가합니다. OpenAI o3 모델을 사용하여 Zero-shot 및 Few-shot 프롬프팅 성능을 비교 분석하였으며, Few-shot 방식이 서비스 식별과 통신 복구 측면에서 더 높은 정확도와 품질을 보임을 입증했습니다.
핵심 포인트
- LLM을 통한 요구사항 기반 마이크로서비스 아키텍처 합성 가능성 확인
- OpenAI o3 모델 사용 시 Few-shot 프롬프팅이 Zero-shot보다 높은 성능 기록
- Few-shot 방식이 서비스 식별 F1-score 0.97, 통신 복구 F1-score 0.82 달성
- 전문가 평가 결과, Few-shot 결과물이 더 모듈화되고 타당한 것으로 나타남
마이크로서비스 아키텍처 (Microservice architectures)는 모놀리식 시스템 (monolithic systems)을 현대화하는 데 지배적인 방식이 되었으나, 적절한 서비스를 식별하는 일은 여전히 어려우며 주로 수동으로 이루어집니다. 기존의 분해 접근 방식은 주로 코드 중심적 (code-centric)이며, 이는 텍스트 요구사항 (textual requirements)만 존재하는 초기 설계 단계에서의 적용성을 제한합니다. 거대 언어 모델 (Large Language Models, LLMs)의 발전에도 불구하고, 서비스 정의와 서비스 간 상호작용 (inter-service interactions)을 포함하여 자연어 요구사항으로부터 완전한 마이크로서비스 아키텍처를 합성하는 능력에 대한 실증적 증거는 제한적입니다. 본 연구는 LLM이 요구사항 공학 (requirements engineering)과 아키텍처 설계 (architectural design) 사이의 가교 역할을 할 수 있는지 조사하며, 오직 텍스트 요구사항으로부터만 아키텍처를 생성하고 결과의 구조적 일치성 및 인지된 품질을 평가합니다. 우리는 두 가지 시스템 (Bookstore, PetClinic)에 대해 zero-shot (ZS) 및 few-shot (FS) 프롬프팅을 사용하여 OpenAI o3를 활용한 혼합 방법론 연구를 수행하였으며, 각 시스템/조건당 1회의 실행을 진행했습니다. 아키텍처는 (i) 서비스 식별 및 통신 복구 (communication recovery)에 대한 정밀도 (precision), 재현율 (recall), F1-score를 사용하여 참조 아키텍처와 비교하고, (ii) 정확성, 완전성, 모듈성 (modularity), 타당성 (plausibility)에 대한 맹검 전문가 평가 및 개방형 피드백 합성을 통해 평가됩니다. OpenAI o3는 FS 프롬프팅 하에서 더 높은 일치도로 서비스를 식별했습니다 (ZS의 F1 = 0.79 대비 FS의 F1 = 0.97). 통신 복구는 더 어려운 과제입니다: ZS는 높은 재현율을 가지지만 정밀도가 낮은 (F1 = 0.61) 밀집된 아키텍처를 생성하는 반면, FS는 일치성을 개선하여 F1 = 0.82에 도달하고 지원되지 않는 의존성을 줄입니다. 전문가 평가는 이러한 결과를 뒷받침하며, FS 아키텍처는 ZS 출력보다 더 모듈화되고, 일관되며, 타당한 것으로 인식되었습니다. OpenAI o3는 예시 프롬프팅 (exemplar prompting)에 의해 유도될 때 요구사항 기반 합성 (requirements-driven synthesis)의 잠재력을 보여줍니다. 결과는 두 개의 작은 시스템을 대상으로 한 모델 및 컨텍스트 특정적 결과이며, 모델 독립적인 증거는 아닙니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv Codex (cs.SE)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기