클라우드 없는 에이전트 기반 코딩: 종단적 데이터 준비 작업에 대한 오픈 웨이트 거대 언어 모델(Open-weight LLMs) 평가
요약
민감한 데이터를 다루는 연구 환경을 위해 로컬에서 실행 가능한 오픈 웨이트 LLM 기반 AI 에이전트의 데이터 준비 효능을 평가한 연구입니다. 영국 코호트 연구 데이터를 활용해 데이터 클리닝 및 병합 작업에서의 성능을 벤치마킹했습니다.
핵심 포인트
- 데이터 보안을 위해 클라우드 없이 로컬에서 구동되는 오픈 웨이트 모델의 중요성 강조
- 데이터 준비(Data preparation) 작업을 위한 오픈 소스 평가 프레임워크 RRBench 소개
- 31-35B 파라미터 규모의 모델이 데이터 준비 작업에서 높은 성능(최대 87.9%)을 보임
- 소비자급 하드웨어에서도 거버넌스가 제한된 연구 환경 내 AI 에이전트 활용 가능성 입증
거대 언어 모델 (LLMs)과 에이전트 (Agents)는 이제 코드 개발에서 널리 사용되는 도구이며, 일반적으로 데이터는 제3자 클라우드 기반 모델로 전송됩니다. 개인 데이터를 사용하는 연구에서의 도입은 일반적으로 외부 서비스로의 데이터 전송을 금지하는 거버넌스(Governance) 요구 사항에 의해 제약을 받습니다. 로컬에 배포 가능한 오픈 웨이트 (Open-weight) 모델은 민감한 데이터가 로컬 환경을 절대 떠나지 않기 때문에 대안을 제공합니다. 우리는 종단적 인구 연구 (Longitudinal population studies) 연구에서 가장 지속적인 병목 현상 중 하나인 데이터 준비 (Data preparation) 작업에 대해, 오픈 웨이트 LLMs로 구동되는 AI 에이전트의 효능을 평가하기 위한 오픈 소스 프레임워크를 소개합니다. 이 프레임워크는 다음으로 구성됩니다: 큐레이션된 그라운드 트루스 (Ground-truth) 데이터셋 (영국 코호트 연구의 6개 스윕 데이터를 준비하는 클리닝 스크립트), 카테고리 조화 (Category harmonization) 및 다중 파동 병합 (Multi-wave merging)과 같은 작업을 포함하는 작업 정의, 그리고 LLM이 생성한 R 코드 및 출력된 데이터를 평가하기 위한 자동화된 루틴입니다. 우리는 20개의 데이터 준비 작업 (102개 변수 생성)에 대한 효능을 평가하기 위해 (소비자급) 배포 스펙트럼 전반에 걸쳐 LLMs를 벤치마킹합니다. 현재의 최첨단 (State-of-the-art) 기술인 31-35B 파라미터 모델은 우리의 벤치마크를 거의 포화 상태로 만들었습니다 ("평균 작업 완료율" 최대 87.9%). 소비자급 하드웨어에서 실행되는 오픈 웨이트 LLMs의 성능은 거버넌스가 제한된 연구 환경에서 AI 지원 데이터 준비를 향한 실행 가능한 경로로서의 가능성을 보여줍니다. 우리의 프레임워크는 다음에서 공개적으로 사용할 수 있습니다: https://github.com/UCL-ARC/RRBench.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.AI의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기