S/A 티어 표기가 Picking Roundup에서 네 개의 스코어카드 컬럼을 숨기고 있는 방식
요약
최근 AI 코딩 도구 리뷰들이 S/A/B와 같은 티어 문자를 사용하여 복잡한 평가 지표를 지나치게 단순화하고 있다고 비판합니다. 티어 표기가 코드 생성, 에이전트 자율성 등 여러 평가 축을 하나로 압축함으로써 도구 간의 실제 성능 차이와 특성을 왜곡할 수 있음을 지적합니다.
핵심 포인트
- 티어 문자는 여러 평가 지표를 하나로 압축한 '판결 요약'으로 변질됨
- 단일 티어 표기는 제품의 다각적인 강점(IDE 완성도 vs 에이전트 자율성)을 가림
- Cursor와 Claude Code의 순위 차이는 평가 기준(축)에 따라 역전될 수 있음
- 단순 순위 매기기에서 다차원적 성능 분석으로의 전환 필요성 강조
오늘 아침 2025년 말 Juejin의 picking roundup(선정 요약)들을 나란히 읽으며 깊은 탐구에 빠졌습니다. S/A/B/D 티어 문자를 중심으로 리뷰를 구성한 '2025 的热门 AI 编程工具评测(2025 인기 AI 프로그래밍 도구 리뷰)' 기사, 5개 축에 대해 9.6부터 7.2까지 소수점 스코어카드를 출력한 '2025年12月权威(2025년 12월 권위 있는)' 기사, Cursor를 20위안/월 가격에 '综合能力第一(종합 능력 1위)'로 둔 11월 프론트엔드 가이드, 그리고 Gemini Pro를 월 19.99달러로 설명한 '2025年AI工具定价指南(2025년 AI 도구 가격 가이드)' 기사를 비교해 보았습니다. 그리고 마침내 제 머릿속에서 명확해진 사실은, 티어 문자(tier letter)가 1년 전과는 더 이상 같은 컬럼이 아니라는 점입니다. 왜냐하면 현재의 picking roundup들은 코드 생성(code generation), 에이전트 자율성(agent autonomy), IDE 완성도(IDE polish), 생태계 적합성(ecosystem fit)이라는 최소 네 가지의 판결을 하나의 S/A/B 셀 안에 압축하고 있기 때문입니다. Cursor를 최상위로 올린 S와 Claude Code를 그 바로 아래 단계로 둔 A는, 실제로는 두 게시물 모두 공개하지 않은 두 개의 축을 기준으로 세부 사항에 대해 동의하고 있음에도 불구하고 서로 의견이 일치하지 않는 것처럼 보입니다. 다음 분기 roundup이 이 문자를 더욱 고착화하기 전에 이 내용을 정리해 두고 싶습니다.
저를 한계까지 몰아붙인 것은 Cursor를 'S档闭眼选(S등급 고민 없이 선택)'에, v0를 S/A 경계에, Claude Code와 Codex를 A등급에, Replit을 B등급에 단일 순위 목록으로 배치하면서, 동시에 Claude Code가 최근 '性能下降(성능 저하)'를 겪었으며 '代理能力(에이전트 능력)'이 더 이상 Cursor를 앞서지 못한다고 측면 주석을 달았던 티어 문자 리뷰였습니다. 그 후 저는 Tencent CodeBuddy에 9.6, Sourcegraph Cody에 8.2, Replit Ghostwriter에 8.0, Codeium에 7.8을 부여한 5개 축 그리드 방식의 소수점 스코어카드 기사를 읽었습니다. 11월 프론트엔드 기사는 별도로 Cursor를 '综合能力第一(종합 능력 1위)'로, Codeium을 '性价比之王(가성비의 왕)'으로 '免费(무료)' 상태에서 순위를 매겼습니다. 공정하게 말하자면, 테스트 코퍼스(test corpus)가 결코 공개되지 않고 벤더들이 그 이후로 티어를 변경했기 때문에 정확한 소수점 점수와 달러 금액을 그대로 믿지는 않지만, 구조적인 특징이 아침 내내 제 머릿속을 맴돌았습니다. S라는 문자가 네 개의 스코어카드 컬럼을 하나로 흡수해 버린 것입니다.
제가 지적하고 싶은 메타 패턴(meta-pattern)은, 2025년 말의 피킹 라운드업(picking roundups)들이 티어(tier) 문자를 일종의 판결 요약(verdict-shorthand)으로 사용하고 있다는 점입니다. 이는 제품 순위(product rankings)에서 작업 순위(job rankings)로의 전환을 숨기고 있으며, 동일한 제품이 한 축에서는 S이고 다른 축에서는 A가 될 수 있음에도 게시물은 이를 전혀 인지하지 못합니다. 티어 문자로 된 리뷰는 Cursor를 S로, Claude Code를 A로 분류하지만, 만약 정렬 기준이 된 축이 IDE의 완성도(IDE polish)와 에디터 루프 유창성(editor-loop fluency)이라면 Cursor가 승리할 것이고, 만약 그 축이 검토 가능한 디프(reviewable diffs)를 갖춘 터미널 우선 에이전트 자율성(terminal-first agent autonomy)이라면 Claude Code가 승리하며 그 격차는 역전됩니다. 소수점 스코어카드(decimal scorecard) 방식은 공식적으로 컬럼을 다섯 개의 축으로 나누었지만, 여전히 CodeBuddy를 9.6으로, Blackbox를 7.2로 순위를 매겼는데, 이는 마치 합계 점수가 세부 내역을 대체한 것과 같습니다. 솔직히 저는 축(axis) 컬럼 없이 단 하나의 S 문자만을 출력하는 2026년의 어떤 라운드업에 대해서도 다소 회의적입니다. 왜냐하면 그 S는 작성자가 누구인지, 그리고 그들이 머릿속으로 어떤 컬럼을 기준으로 정렬하고 있는지에 따라 실제로 네 가지 서로 다른 의미 중 하나를 전달하고 있기 때문입니다.
제가 남겨두고 싶은 실질적인 시사점(practical takeaway)은, 2025년 말에서 2026년 초 사이의 피킹 라운드업들이 두 가지 좁은 용도로는 여전히 유용하지만, 이번 분기에 대부분의 엔지니어들이 조용히 시도하고 있는 티어 간 재순위화(cross-tier re-rank)에는 유용하지 않다는 것입니다. 이들은 카테고리별 기준점(per-category anchor)을 잡는 데는 유용합니다. 티어 문자 리뷰가 Cursor, Claude Code, Codex, v0, Replit을 구매할 가치가 있는 5가지로 명시했고, 소수점 방식이 CodeBuddy, Cody, Ghostwriter, Codeium을 평가할 가치가 있는 8가지로 명시했기 때문입니다. 또한 작성자가 정렬한 축에 대한 티어 내 순위(within-tier rank)를 파악하는 데도 유용합니다. S 등급의 Cursor와 B 등급의 Replit 사이의 격차는 팀 리더가 두 개의 컴플리터(completers) 사이에서 내려야 하는 바로 그 종류의 결정이기 때문입니다. 하지만 이들은 티어 간 재순위화(cross-tier re-rank)에는 적합하지 않습니다. Cursor와 Claude Code 사이에서 결정하려는 엔지니어는 티어 문자와 代理能力(대리 능력)에 관한 측면 코멘트를 읽고 나서야, 그것들이 서로 다른 두 개의 컬럼을 설명하고 있다는 사실을 발견해야 하기 때문입니다. 단일 셀로 구성된 티어 문자는 그 아래에 숨겨진 컬럼들을 가림으로써 동점을 해결해 버린 행(row)입니다.
저는 3개월 후에 다시 평가할 것입니다. 지난번에 제가 그렇게 말했을 당시에는 코딩에는 주로 Cursor와 Claude Code를 사용하고, 그 외의 모든 것에는 ChatGPT를 사용하고 있었는데, 현재도 대략 비슷한 상태입니다. 다만 이제는 이들을 두 개의 경쟁자로 보기보다는 Cursor-IDE 인터페이스와 Claude-Code-터미널 인터페이스로 생각합니다. 변화된 점은, 이제 제가 Picking Roundup(픽킹 라운드업)을 읽을 때 포스트에서 공개하지 않은 컬럼에 대한 티어 문자(tier-letter) 판결로 받아들인다는 것입니다. 그래서 저는 그 문자를 신뢰하기 전에 옆에 달린 코멘트와 소수점 단위의 세부 분석(decimal breakdown)을 먼저 확인하며, 만약 문자와 코멘트가 서로 일치하지 않는다면 그 문자를 마케팅으로 간주합니다. 6개월 정도 지나면, Picking Roundup이 티어 문자 아래에 명시적인 축(axis) 컬럼을 추가하거나, 아니면 티어 문자가 독자가 분해해야만 하는 영구적인 단일 셀 판결로 굳어질 것이라고 예상합니다. 어느 쪽이 먼저 움직이든, 그 움직임은 이 형식이 출력하는 'S'가 더 이상 하나의 숫자가 아니라는 사실을 마침내 인지했는지를 저에게 알려줄 것입니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기