DASyR-LLM: 운동학적 모델 발견을 위한 LLM 기반 도메인 인지 심볼릭 회귀 (Symbolic Regression)
요약
본 연구는 화학 공학의 핵심 과제인 운동학적 모델 발견에 LLM 기반 도메인 인지 심볼릭 회귀(SR) 프레임워크를 제안합니다. 이 프레임워크는 LLM이 물리화학적 지식을 활용하여 SR 후보를 비평하고 새로운 속도식을 제안함으로써, 기존 방식 대비 정답 모델 탐색 횟수를 크게 줄였습니다. 이는 과학적 모델 발견 과정에 LLM을 통합하는 효과적인 방법을 제시합니다.
핵심 포인트
- LLM을 이용해 운동학적 모델 발견의 효율성을 높임.
- LLM은 물리화학 지식을 활용하여 SR 후보를 비평하고 제안함.
- 기존 방식 대비 정답 모델 탐색 횟수를 크게 감소시킴.
- 도메인 인지형 자동화된 모델링 파이프라인을 구축하는 데 기여함.
운동학적 모델 발견 (Kinetic model discovery)은 화학 공학의 핵심 과제입니다. 정확한 속도식 (rate expressions)은 화학 및 생물학적 공정을 이해하고 제어하는 데 필수적이기 때문입니다. 심볼릭 회귀 (Symbolic regression, SR)는 해석 가능한 운동학적 모델을 식별하기 위한 강력한 데이터 기반 접근 방식으로 부상했지만, 대개 도메인 지식 없이 작동하여 물리화학적으로 타당하지 않은 모델을 탐색하는 경우가 많습니다. 대규모 언어 모델 (Large language models, LLMs)은 이러한 탐색 과정에 도메인 전문 지식을 주입할 수 있는 유망한 방안을 제공합니다. 본 연구에서는 자동화된 운동학적 모델 발견을 위해 반복적인 SR 알고리즘 내에 LLM 모듈을 내장한 LLM 가이드형 SR 프레임워크를 소개합니다. LLM은 각 반복 단계에서 두 가지 역할을 수행합니다: (1) 최적의 SR 후보들에 대한 정성적인 물리화학적 비평, (2) SR이 생성한 모델과 내장된 화학 지식에 기반하여 새로운 후보 속도식을 제안하는 역할입니다. 우리의 프레임워크는 불균일 촉매 (heterogeneous catalysis) 및 바이오 프로세스 (bioprocess) 시스템을 아우르는, 복잡도가 점진적으로 증가하는 네 가지 인실리코 (in silico) 사례 연구를 통해 평가되었습니다. 결과에 따르면, LLM 가이드형 프레임워크는 최신 SR 프레임워크와 비교했을 때 정답 모델 (ground-truth model)을 식별하기 위한 반복 횟수를 $41.7-79.3%$ 감소시켰으며, 가이드된 실행의 절반 이상에서 LLM이 올바른 모델 구조를 직접 제안했습니다. 각 반복마다 일반적으로 새로운 습식 실험 (wet-lab experiment)이 필요한 실제 환경에서, 이는 실험적 노력의 상당한 감소로 이어집니다. 독립적인 검증 세트에 대한 예측 성능은 두 접근 방식 모두에서 동등하게 나타났으며, 모든 사례 연구에서 $R^2>0.98$을 기록했습니다. 절제 연구 (Ablation studies) 결과, SR 구성 요소와 LLM 규모 모두가 이러한 성능에 기여하며, 크기가 축소된 LLM도 발견 효율성을 상당 부분 유지함을 확인했습니다. 이러한 발견은 LLM이 과학적 모델 발견 과정에 도메인 지식을 효과적으로 주입할 수 있음을 입증하며, 완전히 자동화된 도메인 인지형 운동학적 모델링 파이프라인을 향한 길을 열어줍니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.LG의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기