CogAdapt: 코드 LLM의 인지 기반 희소 적응 (Sparse Adaptation)
요약
본 논문은 대규모 언어 모델(LLMs)의 코드 생성 성능 향상을 위해 비용이 많이 드는 전체 미세 조정을 대체하는 인지 기반 희소 적응 프레임워크 CogAdapt를 제안합니다. CogAdapt는 인간의 EEG 및 어텐션 데이터에서 얻은 사전 지식을 활용하여, 코딩 작업에 필요한 특정 트랜스포머 블록만 선택적으로 업데이트함으로써 효율성을 극대화했습니다.
핵심 포인트
- CogAdapt는 인지 신호를 이용해 코드 모델의 희소 적응을 수행합니다.
- 선택적 적응으로 전체 미세 조정 대비 높은 성능 향상을 보였습니다.
- LiveCodeBench에서 10.86%, BigCodeBench에서 6.29%p 개선을 달성했습니다.
- 적응 매개변수를 크게 줄여 효율성을 높였습니다.
대규모 언어 모델(LLMs)은 코드를 생성하는 능력이 점점 커지고 있습니다. 하지만 더 강력한 코드 생성 성능을 달성하기 위해서는 여전히 비용이 많이 드는 모델 적응, 즉 사전 학습된 모델 매개변수 미세 조정(fine-tuning)에 의존하는 경우가 많습니다. 이전 연구들은 인간의 코드 처리와 신경 모델의 어텐션 또는 내부 계산 사이에 상관관계가 있음을 보여주었습니다. 인간에게 맞춘 학습 접근 방식은 인지 신호(cognitive signals)를 사용하여 훈련을 안내하지만, 일반적으로 모델의 큰 부분을 적응시키기 때문에 훈련 비용이 크게 변하지 않습니다. 인간의 인지 신호는 모델이 무엇을 배워야 하는지뿐만 아니라 어디에 적응하는 것이 가장 유용한지를 나타낼 수도 있습니다. 우리는 코드 읽기 중 인간의 반응이 코드-모델 행동과 일치하며, 성능 저하 없이 선택적 적응을 안내할 수 있는지 조사합니다. 우리는 코드 모델의 작업 의존적 희소 적응을 위한 인지 기반 프레임워크인 CogAdapt를 제시합니다. CogAdapt는 먼저 인간의 뇌전도(EEG) 및 어텐션 데이터로부터 전이 가능한 프로그램 수준 및 토큰 수준 사전 지식(priors)을 학습한 다음, 이러한 사전 지식을 고정된 모델(frozen model)의 각 코딩 작업에 대한 응답과 결합하여 얼마나 많은 적응을 할당해야 하고 어떤 트랜스포머 블록이 업데이트를 받아야 하는지를 결정합니다. 미세 조정 과정 동안에는 선택된 블록만 업데이트되며, 추론 시 새로운 인간 기록은 필요하지 않습니다. Qwen과 GLM 모두에서 우리는 인간의 읽기 행동과 Mixture-of-Experts (MoE) 계산 사이에 일관된 상관관계가 있음을 발견했습니다. CogAdapt는 LiveCodeBench와 BigCodeBench 모두에서 최고의 pass@1을 달성했으며, LiveCodeBench에서는 일반적인 미세 조정 대비 10.86%, BigCodeBench에서는 6.29% 포인트의 향상을 보였으며, 그 과정에서 그래디언트 적격 적응 매개변수(gradient-eligible adaptation parameters)를 86.21~87.21% 감소시켰습니다. 이러한 결과는 인간의 이해 신호가 코드-모델 적응을 더 선택적이고 더 효과적으로 만드는 데 유용한 지침을 제공할 수 있음을 시사합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv Codex (cs.SE)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기