더 새롭고 더 크지만, 더 안전할까? LLM 생성 코드의 기능성-보안 격차에 대한 종단적 연구
요약
본 연구는 LLM이 생성하는 코드의 기능성 및 보안 취약점 격차에 대한 종단적 분석을 수행했습니다. 그 결과, 모델이 발전함에도 불구하고 특정 계열은 보안성이 개선되지 않았으며, 특히 소형 모델은 플래그십 모델보다 보안성이 낮은 경향을 보였습니다. 개발자들은 모델 업데이트나 독점성 여부만으로 보안 개선을 가정해서는 안 되며, 항상 보안 검사를 재실행해야 합니다.
핵심 포인트
- LLM의 코드 생성 기능성은 향상되지만, 보안 취약점 격차는 좁혀지지 않았습니다.
- 오픈 웨이트 계열은 모델 간 성능 차이를 보이지 않으며, Gemini 3.1 Pro와 Llama 사이에도 큰 격차가 유지되었습니다.
- 소형 모델이 플래그십 모델보다 전반적으로 낮은 보안성을 가질 수 있습니다.
- 개발자는 모델 업데이트 후 반드시 보안 검사를 재실행하고 안전한 API를 사용해야 합니다.
대규모 언어 모델(LLMs)은 코드를 생성하는 데 널리 사용됩니다. 이들의 기능적 타당성은 계속 향상되고 있지만, 생성된 코드는 종종 보안 취약점을 포함합니다. 기능성-보안 격차는 기능 테스트를 통과하지만 보안 테스트에는 실패하는 코드를 포착합니다. 세 가지 모델 계열에 대한 최근의 종단적 연구는 LLMs가 더 똑똑해지지만 더 안전하지는 않으며, 고려된 유일한 오픈 웨이트(open-weight) 계열은 정체되어 있음을 결론지었습니다. 이것이 다른 (오픈 웨이트) 계열과 특히 소형 모델에 대해서도 성립하는지는 미지수입니다. 우리는 7개 모델 계열의 32개 LLM을 대상으로, 플래그십 및 소형 변형에서 각 계열별로 세 번의 연속적인 출시를 다루는 격차에 대한 종단적 연구를 제시합니다. 5개 프로그래밍 언어와 31개의 CWE(Common Weakness Enumeration)를 포함하는 119개 태스크로 CWEval을 사용하여, 우리는 계열, 모델 크기 및 언어 전반에 걸친 궤적을 비교합니다. 새로운 모델들은 절대적인 측면에서 더 안전해지기는 하지만, 어떤 계열도 격차를 좁히지는 못했습니다. 이전 연구와 달리, 우리는 개방성이 계열들을 분리하지 않는다는 것을 발견했습니다. 고려된 모든 오픈 웨이트 계열은 격차를 상당히 좁혔으며, Gemini 3.1 Pro는 Llama에 대해 보고된 것과 마찬가지로 넓은 격차를 유지했습니다. 소형 모델들은 일반적으로 플래그십 모델보다 보안성이 낮은 코드를 생성하며, 주목할 만한 예외(예: Gemini 3.7 Flash)가 있습니다. CWE 수준에서, 우리는 로그 주입(CWE-117) 및 HTTP 응답 분할(CWE-113)과 같은 지속적인 약점과 메모리 및 정수 취약점에 대한 최신 독점 모델의 회귀를 확인하고, 동일한 CWE가 언어에 따라 매우 다른 위험을 가짐을 보여줍니다. 이러한 결과로부터 우리는 LLM 공급업체, 연구원 및 개발자를 위한 시사점을 도출합니다. 특히 개발자들은 업그레이드가 보안을 개선한다는 것도, 독점 모델이 더 안전하다는 것도 가정해서는 안 되며, 각 모델 변경 후에 보안 검사를 다시 실행하고 모델의 컨텍스트 내에서 안전한 API를 제공해야 합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv Codex (cs.SE)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기