저는 12살입니다. $150짜리 휴대폰으로 Claude Code를 능가하는 AI 에코시스템을 구축했습니다 (벤치마크 보고서 포함)
요약
12세의 개발자가 $150 휴대폰과 제한된 자원 환경에서 Claude Code를 능가하는 AI 에코시스템 'KODA'를 구축했습니다. KODA는 92kb 웹 앱, 22kb 코드 확장 프로그램, 그리고 작업 유형에 따라 세 가지 다른 AI 모델을 라우팅하는 Cloudflare Edge Worker 하네스를 결합한 것이 특징입니다. 이 구조적 폴백 체인은 일반 코딩, 지연 시간 민감 작업, 복잡 추론 등 다양한 시나리오에서 최적의 성능을 제공합니다.
핵심 포인트
- 제약 조건(저사양 기기, 저비용)에 맞춰 설계된 에코시스템 구축이 핵심입니다.
- 단일 모델 대신 3가지 AI 모델을 라우팅하는 폴백 체인 구조가 필수적입니다.
- KODA는 가벼운 웹 앱과 확장 프로그램으로 낮은 오버헤드를 유지합니다.
- 각 모델은 일반 코딩, 속도 최적화, 복잡 추론 등 특정 목적에 특화되어 있습니다.
저는 12살입니다.
MacBook Pro도 없고, 월 $100의 클라우드 예산도 없습니다. 저는 $150짜리 Poco C55 휴대폰으로 코딩합니다.
RAM 4GB 장치에서 코딩을 하다 보면 무거움(bloat)이 적이라는 것을 매우 빨리 배웁니다. 무거운 프레임워크를 쓸 여유가 없습니다. 토큰을 낭비할 여유도 없고, 저렴한 모바일 데이터 요금제로는 느린 로드 시간을 감당할 수 없습니다.
그래서 KODA를 만들 때, 저는 단순히 API를 포장하는 것에 그치지 않았습니다. 제약 조건에 맞춰 설계된 전체 에코시스템을 구축했습니다.
92kb의 단일 파일 웹 앱. 22kb 코드 에디터 확장 프로그램. 그리고 작업 유형에 따라 세 가지 다른 AI 모델 사이를 라우팅하는 Cloudflare Edge Worker 하네스입니다.
저는 단순히 마케팅 과장만 하고 싶지 않았습니다. 저는 순수한 데이터가 필요했습니다. 그래서 전체 스택을 벤치마크 했습니다.
여기에 공식 KODA 에코시스템 벤치마크 보고서가 있습니다.
1. 모델 스택 — 원시 코딩 성능
openai/gpt-oss-120b (주요 범용 목적)
| 벤치마크 | 점수 | 컨텍스트 |
|---|---|---|
| swe-bench verified | 62.4% | groq 공식 모델 카드 |
| ... | ||
| 분석: 오픈 모델 중 상위-중급 티어입니다. 62.4%와 26%의 격차는 KODA 자체 에이전트 셸이 실제 성능에 큰 기여를 함을 증명합니다. |
openai/gpt-oss-20b (속도 및 효율성)
| 벤치마크 | 점수 | 컨텍스트 |
|---|---|---|
| swe-bench verified (높음) | 60.4% | 독립적 재현 |
| ... | ||
| 분석: 60.4%의 swe-bench는 파라미터가 6배 적음에도 불구하고 120b 변형과 2점 이내입니다. 이는 속도 폴백(speed fallback)으로 사용하기에 적합하며, 품질 손실은 거의 없고 지연 시간 절약 효과가 큽니다. |
deepseek r1 distill qwen 3.8 (추론 전문)
| 벤치마크 | 점수 | 컨텍스트 |
|---|---|---|
| aime 2024 (pass@1) | 86.0% | qwen3-235b-a22b 능가 |
| ... | ||
| 분석: 일반적인 코더가 아닌 진정한 추론 모델입니다. 수학 및 알고리즘 문제에 강합니다. 낮은 swe-bench 점수는 설계 의도를 반영한 것인데, 이는 일상적인 편집이 아니라 디버깅과 논리를 위한 |
| metric | 120b | 20b | r1 distill |
|---|---|---|---|
| swe-bench verified | 62.4% | 60.4% | 49.2% |
| ... | |||
| *with tools |
이 스택은 세 가지의 명확한 실패 모드를 다룹니다:
- 일반 코딩 (general coding) → gpt-oss-120b
- 지연 시간 민감 (latency-sensitive) → gpt-oss-20b
- 복잡 추론 (complex reasoning) → deepseek r1 distill
어떤 단일 모델도 이 세 가지를 모두 처리하지 못합니다. 폴백 체인(fallback chain)은 선택 사항이 아니라 구조적 필수 요소입니다.
3. koda 확장 기능 및 웹 앱 벤치마크
| metric | value | significance |
|---|---|---|
| total footprint | ~22 kb | < one react component |
| ... | ||
| 분석: 아키텍처 제약 조건 자체가 특징이 됩니다. 즉시 로드되며, 측정 가능한 에디터 부담을 전혀 추가하지 않습니다. 안전 및 보안 계층은 인지할 수 없는 지연 시간 없이 견고함을 더합니다. |
4. 하네스 품질 — koda 대 경쟁사
동일 모델(deepseek v4 flash)로 다섯 가지 다른 에이전트 쉘을 사용했습니다:
| harness | code index (max) | code index (medium) |
|---|---|---|
| koda | 52.2% ← 최고 | 46.3% |
| ... | ||
| 분석: koda의 하네스는 최대 노력(max effort)에서 승리합니다. claude code는 중간 정도의 노력(medium effort)에서 우위를 점합니다. koda의 에이전트 아키텍처는 균형 잡힌 일상적인 사용보다는 높은 컴퓨팅, 고품질 워크플로우에 최적화되어 있습니다. |
5. 발견 사항 요약
| benchmark area | key metric | result |
|---|---|---|
| primary model | swe-bench verified | 62.4% |
| ... | ||
| koda의 강점은 어떤 단일 모델이 아닙니다. 그것은 조합(composition)입니다: 상호 보완적인 강점을 가진 세 가지 모델, 경쟁하는 쉘보다 각 모델에서 더 많은 가치를 추출해내는 하네스, 그리고 거의 제로 오버헤드로 이를 제공하는 확장 계층입니다. |
하네스(52.2%)와 풋프린트(22 kb)가 koda를 차별화하는 지점입니다.
제가 숫자에 관심을 갖는 이유
사람들은 저에게 왜 12세짜리가 200ms 안전 예산, 4개 계층의 정규식 주입 필터, 그리고 22kb의 풋프린트에 관심을 가지는지 묻습니다.
왜냐하면 AI가 환각(hallucinate)을 일으켜 제 장치를 고장 내면, 저는 백업 노트북이 없기 때문입니다. 만약 앱이 무겁다면, 휴대폰의 3G 네트워크에서는 로드되지 않을 것입니다. 보안과 속도는 저에게 '있으면 좋은' 기능이 아닙니다. 그것은 생존 문제입니다.
모델은 그저 엔진일 뿐입니다. 이 시스템(harness)이야말로 운전대인 거죠.
12살짜리가 개발팀 없이 코딩 인덱스에서 52.2%를 기록하는 시스템을 어떻게 구축했는지 보고 싶다면, 생태계가 작동 중입니다.
부숴보세요. 🐯
여기서 시도해 보세요: koda-aicodementor.netlify.app
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기