2025년 말 Juejin 선정 요약본이 네 가지 아티팩트 카테고리를 하나의 S/A/B 열로 혼합하고 있는 현상
요약
Juejin의 2025년 말 선정 요약본이 IDE, 터미널 에이전트, 모바일 앱 생성기, 프론트엔드 컴포넌트 도구들을 하나의 기준으로 혼합하여 평가하는 구조적 결함을 비판합니다. 각 도구가 생성하는 결과물(artifact)의 특성과 검증 비용이 다름에도 불구하고 동일한 순위 열에 배치하는 것은 부적절하다고 지적합니다.
핵심 포인트
- IDE, 에이전트, 앱 생성기 등 서로 다른 카테고리의 도구들이 혼합된 평가 방식의 문제점 지적
- Cursor, Claude Code, v0, Lovable 등 각 도구의 결과물(artifact) 특성 차이 강조
- 도구별 핸드오프 객체의 수명과 검증 비용이 다르므로 별도의 평가 기준이 필요함
오늘 아침 2025년 말 Juejin 선정 요약본(picking roundups)을 나란히 읽다가 깊이 빠져들게 되었는데, 모바일 앱 계층(mobile-app tier)이 적절하지 않다고 생각되는 열에 슬그머니 끼어들어 있었습니다. 编程工具评测(프로그래밍 도구 리뷰) 섹션에서는 Cursor를 S档(S등급)으로, Claude Code와 Codex를 A档(A등급)으로 분류한 뒤, Rork, VibeCode App, Anything이라는 세 가지 모바일 앱 생성기를 동일한 목록에 밀어 넣었습니다. 또한 Lovable과 v0를 GitHub Copilot 및 Codeium과 점수표를 공유하는 프론트엔드 컴포넌트(frontend-component) 행에 배치했습니다. AI开发工具最新排行(AI 개발 도구 최신 순위) 섹션에서는 Cursor를 20元/月(월 20위안) 가격에 综合能力第一(종합 능력 1위)로 추대하고, Codeium을 免费(무료)로, V0.dev를 Vercel 통합 UI 전문가로 꼽은 뒤, Lovable, BlackBox AI, Replit, CodeWhisperer를 별도의 지표 명시 없이 단일 순위 목록으로 통합해 버렸습니다. 모바일 계층을 에디터 루프(editor-loop) 계층 옆에, 이를 다시 컴포넌트 계층(component-tier) 옆에, 그리고 터미널 에이전트(terminal-agent) 계층 옆에 나란히 배치한 것을 보고 내 솔직한 견해를 말씀드리자면, 현재의 선정 요약본은 네 가지 아티팩트(artifact) 카테고리를 하나의 열에 혼합하고 있으며, 그 결과 순위를 공유해서는 안 될 카테고리들 사이에서 판정이 붕괴되고 있습니다.
이 상황을 명확하게 보여주는 글은 Cursor를 S档闭眼选(S등급 고민 없이 선택)으로 시작합니다. Codex에는 빠른 GPT 업데이트를 이유로 A档를 부여하고, Claude Code에는 A档를 부여하면서 代理能力(에이전트 능력)이 더 이상 Cursor보다 앞서지 않는다고 언급합니다. 그러고 나서 一句话生成(한 문장 생성)이 Cursor의 Cmd+K와 동일한 타겟층을 커버한다는 이유로 Lovable과 v0를 동일한 계층에 밀어 넣고, Rork, VibeCode App, Anything은 Expo를 통해 iOS와 Android를 생성한다는 이유로 B档에 떨어뜨립니다. 공정하게 말하자면, 업체들이 그 이후로 번들(bundles)을 재구성했기 때문에 정확한 계층 경계는 걸러서 들어야 하겠지만, 구조적인 결함이 아침 내내 내 머릿속을 떠나지 않았습니다. Cursor, Codex, Claude Code, v0, Lovable, Rork, VibeCode App, Anything은 모두 동일한 정렬 목록에 포함되어 있으며, 이 목록은 정렬 기준 열(sort column)을 전혀 명시하지 않고 있습니다.
제가 기록해두고 싶은 메타 패턴(meta-pattern)은, 2025년 말의 선정 요약본들이 에디터-IDE 제품, 터미널-에이전트(terminal-agent) 제품, 모바일 앱 생성기, 그리고 컴포넌트 계층(component-tier) 프론트엔드 도구들을 각각이 제공하는 아티팩트(artifact)가 결정적 요소라는 점을 인지하지 못한 채 하나의 판정 열(verdict column)로 혼합하고 있다는 것입니다. Cursor와 Claude Code는 테스트와 터미널 증거가 포함된 검토 가능한 git diff를 남깁니다. Codex는 패치(patch)나 ChatGPT 플랜 업그레이드를 남깁니다. v0는 Vercel을 향한 React 컴포넌트를 남깁니다. Lovable은 호스팅된 웹 프로토타입(prototype)을 남깁니다. Rork와 VibeCode App은 Expo로 빌드된 iOS 및 Android 쌍을 남깁니다. Replit은 실행 중인 호스팅된 프로토타입을 남깁니다. 이러한 핸드오프 객체(handoff objects)들은 수명(lifetimes), 검증 비용(verification costs), 그리고 리뷰 루프(review loops)가 완전히 다릅니다. 이들을 하나의 열에 순위를 매기는 것은 PostgreSQL, GitHub Actions, 그리고 시니어 백엔드 엔지니어를 '셋 다 백엔드 배포를 도울 수 있다'는 이유로 한데 묶어 순위를 매기는 것과 같습니다. Cursor를 최상단에 두는 S 등급과 Rork를 그 아래에 두는 B 등급은 품질에 대한 판정처럼 보이지만, 실제로는 요약본이 전혀 분리하지 않은 네 가지 서로 다른 작업에 대한 판정입니다.
솔직히 말해서, 저는 이 네 가지 아티팩트 카테릭터리 전체에 대해 단일한 S/A/B 티어 등급이나 단일 소수점 점수를 출력하는 그 어떤 2026년 선정 요약본도 다소 회의적입니다. 왜냐하면 그 등급은 작성자가 누구냐에 따라 실제로 네 가지 서로 다른 의미를 전달하고 있기 때문입니다. Cursor의 '综合能力第一(종합 능력 1위)' 순위는 에디터 루프 유창성(editor-loop fluency)을 기준으로 정렬하고 있고, Codeium의 '性价比之王(가성비의 왕)' 순위는 '무료(免费)' 대 '월 20위안(20元/月)' 가격 책정을 기준으로 정렬하고 있으며, UI 전문가로서의 V0.dev 순위는 Vercel 배포를 기준으로 정렬하고 있고, Lovable 순위는 프로토타입 속도를 기준으로 정렬하고 있습니다. 이 축(axes)들은 그 어느 것도 동일하지 않습니다. 제 직감으로는, 이 형식이 자신이 점수를 매기고 있는 행(row)이 더 이상 단일한 형태에 매핑되지 않는다는 사실을 아직 알아차리지 못한 것 같습니다.
실질적인 시사점은, 이러한 선정 요약본(picking roundups)이 카테고리 내부의 앵커(anchor)를 파악하는 데는 여전히 유용하지만, 이번 분기에 대부분의 엔지니어들이 조용히 시도하고 있는 카테고리 간 재순위화(cross-category re-rank)에는 유용하지 않다는 것입니다. 이 요약본들은 Cursor, Claude Code, Codex, GitHub Copilot, Codeium이 평가할 가치가 있는 5가지 에디터 루프(editor-loop) 도구라는 점, v0와 Lovable이 평가할 가치가 있는 2가지 컴포넌트 계층(component-tier) 도구라는 점, 그리고 Rork, VibeCode App, Anything이 평가할 가치가 있는 3가지 모바일 앱 생성기라는 점을 알려주는 데는 능숙합니다. 하지만 작업 내용이 검토 가능한 디프(diff)를 요구하는지, 배포된 모바일 프로토타입을 요구하는지, 아니면 호스팅된 웹 앱을 요구하는지에 따라 어떤 것을 선택해야 하는지는 제대로 알려주지 못하는데, 이는 이 세 가지 작업이 하나의 판정(verdict) 열을 공유하지 않기 때문입니다. S 등급 문자와 5축 소수점 점수 모두 네 가지 아티팩트(artifact) 카테고리를 하나의 셀에 압축해 버리며, 이로 인해 해당 셀은 독자에게 필요한 정보를 더 이상 담지 못하게 됩니다.
저는 3개월 후에 다시 평가할 것입니다. 현재 저는 저장소(repository) 작업에는 주로 Cursor와 Claude Code를, 개방형 탐색에는 ChatGPT를, GitHub과 VS Code의 통합이 마찰을 제거해 줄 때는 GitHub Copilot을, 그리고 결과물이 기능(feature)보다는 컴포넌트(component)일 때는 v0를 사용하고 있습니다. 또한 작업이 진정으로 호스팅된 프로토타입이나 모바일 페어(mobile pair)를 요구하기 전까지는 Lovable, Rork, VibeCode App, Anything을 제 스택에서 명시적으로 제외하고 있습니다. 6개월 정도 지나면, 선정 요약본이 명시적인 아티팩트 카테고리 열(에디터 IDE, 터미널 에이전트, 호스팅된 프로토타입, 컴포넌트 계층, 모바일 페어)을 추가하거나, 혹은 계층 문자와 소수점 점수판이 독자가 직접 분해해야 하는 영구적인 카테고리 간 판정(cross-category verdict)으로 굳어질 것이라고 예상합니다. 이 중 어느 쪽이 먼저 움직이느냐에 따라, 이 형식이 자신이 순위를 매기고 있는 행(row)이 더 이상 단일한 형태가 아니라는 사실을 마침내 인지했는지를 알 수 있을 것입니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기