Show HN: Autofix Bot – 정적 분석과 AI 코드 리뷰 에이전트의 하이브리드 모델
요약
DeepSource에서 정적 분석과 AI 에이전트를 결합한 하이브리드 코드 리뷰 도구인 Autofix Bot을 출시했습니다. 이 모델은 정적 분석의 결정론적 특성과 LLM의 유연성을 결합하여, 기존 AI 코딩 도구 대비 높은 정확도와 보안 취약점 탐지 성능을 제공합니다.
핵심 포인트
- 정적 분석(Static Analysis)을 통해 LLM의 비결정성, 낮은 재현율, 높은 비용 문제를 해결하는 하이브리드 아키텍처 채택
- AST, 데이터 흐름 그래프 등 정밀한 도구를 활용하여 단순 텍스트 기반 리뷰를 넘어선 심층 분석 수행
- OpenSSF CVE Benchmark에서 81.2%의 정확도를 기록하며 Cursor Bugbot 및 Claude Code보다 우수한 성능 입증
- TUI를 통한 대화형 사용은 물론, Claude Code 플러그인 및 MCP를 통해 다양한 AI 클라이언트와 호환 가능
안녕하세요, HN 여러분! 저희는 DeepSource (YC W20)의 Jai와 Sanket입니다. 오늘 저희는 AI 코딩 에이전트와 함께 루프 내(in-the-loop)에서 사용하도록 특화 설계된 하이브리드 정적 분석(static analysis) + AI 에이전트인 Autofix Bot을 출시합니다.
AI 코딩 에이전트 덕분에 코드 생성 비용이 거의 무료에 가까워졌으며, 이로 인해 병목 현상은 코드 리뷰(code review)로 옮겨갔습니다. 고정된 체크 도구 세트만을 사용하는 정적 전용 분석만으로는 충분하지 않습니다. 반면 LLM(Large Language Model) 전용 리뷰는 실행 시마다 결과가 달라지는 비결정성(non-deterministic), 보안 문제에 대한 낮은 재현율(low recall), 대규모 운영 시의 높은 비용, 그리고 '주의가 산만해지는' 경향 등 여러 한계가 있습니다.
저희는 지난 6년 동안 결정론적인 정적 분석 전용 코드 리뷰 제품을 만들어 왔습니다. 올해 초, 저희는 이 문제를 근본부터 다시 고민하기 시작했고, 정적 분석이 LLM 전용 리뷰의 주요 사각지대를 해결할 수 있다는 점을 깨달았습니다. 지난 6개월 동안 저희는 정적 분석과 최첨단(frontier) AI 에이전트를 함께 사용하여, 코드 품질 및 보안 문제를 찾아내고 수정하는 데 있어 정적 전용 도구와 LLM 전용 도구 모두를 능가하는 새로운 '하이브리드' 에이전트 루프를 구축했습니다. 오늘 이를 대중에게 공개합니다.
하이브리드 아키텍처의 작동 방식은 다음과 같습니다:
-
정적 패스(Static pass): 5,000개 이상의 결정론적인 체크 도구(코드 품질, 보안, 성능)가 고정밀 베이스라인을 설정합니다. 서브 에이전트(sub-agent)가 문맥에 따른 오탐(false positives)을 억제합니다.
-
AI 리뷰(AI review): 에이전트는 정적 분석 결과를 앵커(anchor)로 삼아 코드를 리뷰합니다. 단순한 grep이나 일반적인 쉘 명령어가 아닌, AST(Abstract Syntax Tree), 데이터 흐름 그래프(data-flow graphs), 제어 흐름(control-flow), 임포트 그래프(import graphs)를 도구로서 활용합니다.
-
수정(Remediation): 서브 에이전트가 수정 사항을 생성합니다. 정적 하네스(static harness)가 깨끗한 git 패치(git patch)를 내보내기 전에 모든 편집 내용을 검증합니다.
정적 분석은 LLM의 주요 문제들을 해결합니다: 실행 간의 비결정성, 보안 문제에 대한 낮은 재현율(LLM은 스타일에 의해 주의가 산만해짐), 그리고 비용(정적 분석을 통한 범위 축소는 프롬프트 크기와 도구 호출을 줄여줍니다).
OpenSSF CVE Benchmark [1] (200개 이상의 실제 JS/TS 취약점)에서 우리는 81.2%의 정확도(accuracy)와 80.0%의 F1 점수를 기록했습니다. 이는 Cursor Bugbot (정확도 74.5%, F1 77.42%), Claude Code (정확도 71.5%, F1 62.99%), CodeRabbit (정확도 59.4%, F1 36.19%), 그리고 Semgrep CE (정확도 56.9%, F1 38.26%)와 비교되는 수치입니다.
비밀 정보 탐지(secrets detection)에서는 92.8%의 F1 점수를 기록했습니다. 이는 Gitleaks (75.6%), detect-secrets (64.1%), 그리고 TruffleHog (41.2%)와 비교됩니다. 우리는 이를 위해 자체 오픈 소스 분류 모델을 사용합니다. [2]
전체 방법론 및 각 도구의 평가 방식은 다음에서 확인할 수 있습니다: https://autofix.bot/benchmarks
Autofix Bot은 우리의 TUI를 사용하여 모든 저장소에서 대화형으로 사용하거나, Claude Code의 플러그인으로 사용하거나, 호환 가능한 모든 AI 클라이언트(예: OpenAI Codex)에서 우리의 MCP를 통해 사용할 수 있습니다. [3] 우리는 특히 AI 코딩 에이전트 우선(AI coding agent-first) 워크플로우를 위해 구축하고 있으므로, 에이전트가 모든 체크포인트에서 자율적으로 Autofix Bot을 실행하도록 요청할 수 있습니다.
지금 바로 체험해 보세요: https://autofix.bot. 여러분의 피드백을 기다립니다!
[1] https://github.com/ossf-cve-benchmark/ossf-cve-benchmark
AI 자동 생성 콘텐츠
본 콘텐츠는 HN AI Engineering의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기