7개의 랭킹 프레임워크, 하나의 검색 페이지, 번역 테이블은 전무함
요약
AI 도구 평가 방식이 카테고리별로 파편화되어 있어, 서로 다른 평가 프레임워크 간의 비교와 통합이 어렵다는 문제를 지적합니다. 각 도구의 성능을 측정하는 기준(축)이 상이하여 엔지니어가 기술 스택을 구성할 때 통합적인 판단을 내리기 어렵다는 메타 패턴을 분석합니다.
핵심 포인트
- AI 도구 평가 프레임워크가 카테고리별로 고착화되어 상호 호환되지 않음
- 코딩, 소설 쓰기, 범용 어시스턴트 등 분야마다 평가 지표(축)가 다름
- 통합적인 비교를 위한 '번역 테이블'의 부재로 인한 기술 스택 구성의 어려움
- 평가 데이터의 파편화가 엔지니어의 의사결정 비용을 높이는 메타 패턴 형성
오늘 아침 2025년 말 Juejin AI 요약본들을 나란히 읽으며 깊이 파고들었는데, 이번 달 내내 제가 글을 써왔던 형식들이 실제로 최소 7개의 서로 다른 랭킹 프레임워크 (ranking frameworks)로 갈라졌다는 사실이 마침내 명확해졌습니다. 각 프레임워크는 하나의 제품 카테고리에 전념하고 있으며, 그 축(axes)들은 카테고리 간에 서로 호환되지 않습니다. 코딩 선정 요약본은 5개 축의 십진수 스코어카드(CodeBuddy 9.6, Cody 8.2, Ghostwriter 8.0, Codeium 7.8)를 출력하거나 S/A/B/D 등급의 알파벳(Cursor는 S등급, Claude Code와 Codex는 A등급, Rork는 B등급)을 출력합니다. 오늘 아침 읽은 소설 쓰기 관련 글은 4개 축 프레임워크(上手体验, 网文场景适配度, 数据安全感, 生产效率)를 사용하여 蛙蛙写作, ChatGPT, DeepSeek, Kimi, 作家助手의 순위를 매깁니다. 광범위한 시장의 主流AI软件盘点(주류 AI 소프트웨어 점검) 글은 通用助手(범용 어시스턴트) 항목 아래에 ChatGPT, Claude, DeepSeek, 通义千问를 나열할 뿐 순위는 매기지 않습니다. 가격 가이드는 월별 달러($)를 출력합니다. 10월 트렌드 요약은 월별 GitHub star 수를 출력합니다. 전망 칼럼은 2029년까지 44달러의 ChatGPT Plus 예측치를 출력합니다. 각 형식은 내부적으로는 일관성이 있지만 다음 형식과는 완전히 호환되지 않으며, 카테고리 전반에 걸쳐 스택을 구성하려는 엔지니어에게는 번역 테이블 (translation table)이 없습니다.
저를 한계로 몰아넣은 것은 소설 쓰기 리뷰였는데, 그 이유는 해당 프레임워크 하에서 한 번도 비교된 적 없는 5개의 도구에 4개 축 스코어카드가 적용되었기 때문이며, 그 축들은 코딩 요약본에서 사용하는 그 어떤 것과도 매핑되지 않기 때문입니다. 蛙蛙写作은 网文场景适配度(웹소설 시나리오 적합도)에서 높은 순위를 차지하지만, 해당 글은 IDE 통합에 대해서는 전혀 묻지 않습니다. Kimi는 중국어 긴 문서 처리 능력에서 높은 순위를 차지하는데, 이는 코딩 선정 요약본들이 구축한 적 없는 열(column)입니다. 作家助手는 码字场景效率(글쓰기 시나리오 효율)에서 높은 순위를 차지하지만, 码字场景(글쓰기 시나리오)은 제가 읽은 그 어떤 코딩 스코어카드에도 행(row)으로 존재하지 않습니다. 공정하게 말하자면, 테스트 코퍼스 (test corpus)가 전혀 공개되지 않았기 때문에 정확한 십진수 점수들은 어느 정도 걸러서 받아들여야 하지만, 구조적인 특징이 오늘 아침 내내 머릿속을 맴돌았습니다. 7개의 프레임워크 모두 누군가 변환 테이블 (conversion table)을 발행하지 않은 채 동일한 검색 결과 페이지로 수렴해 있습니다.
제가 지적하고 싶은 메타 패턴 (meta-pattern)은, 2025년 말의 종합 정리 (roundups) 자료들이 단순히 여러 형식으로 갈라진 것이 아니라, 각 형식이 하나의 카테고리에 고착된 '형식-카테고리 쌍 (format-category pairs)'으로 분화되었다는 점입니다. 이로 인해 엔지니어가 수행하고 있는 카테고리 간 스택 (cross-category stack) 작업은, 아무도 맡으려 하지 않는 '7개 프레임워크 번역 작업'이 되어버렸습니다. 범용 어시스턴트 (general-assistant) 작업을 위해 ChatGPT, Claude, Gemini를 비교할 때, 광범위한 시장 (broad-market) 섹션은 저에게 벤더 리스트 (vendor list)만 제공할 뿐 순위는 제공하지 않습니다. 제가 기존의 Kimi 사용 습관과 더불어 蛙蛙写作을 소설 집필 파이프라인 (novel-writing pipeline)에 추가할지 결정하려 할 때, 4축 소설 프레임워크 (four-axis novel framework)는 그 질문에 답을 주지만, 코딩 스코어카드 (coding scorecard)나 광범위한 시장 벤더 리스트, 혹은 월간 비용 (dollar-per-month pricing) 열 어디에도 해당 항목에 대한 행 (row)은 없습니다. 솔직히 말해서, 검색 결과 페이지에서 단 하나의 조각을 가져와 여러 카테고리에 걸쳐 신뢰하는 그 어떤 2026년형 종합 정리 워크플로우 (roundup workflow)에 대해서도 저는 약간의 회의감을 느낍니다. 왜냐하면 각 프레임워크는 하나의 작업만을 위해 작성되었으며, 작업 간의 통합 (cross-job integration)은 보이지 않기 때문입니다.
제가 남기고 싶은 실질적인 시사점 (practical takeaway)은, 2025년 말에서 2026년 초의 종합 정리 자료들이 프레임워크 내부의 기준점 (within-framework anchor)으로는 여전히 유용하지만, 이번 분기에 많은 엔지니어들이 조용히 시도하고 있는 프레임워크 간 재순위화 (cross-framework re-rank)에는 유용하지 않다는 것입니다. 이 자료들은 카테고리별 쇼트리스트 (per-category shortlist)를 작성하는 데는 능숙합니다. 코딩 스코어카드가 CodeBuddy, Cody, Ghostwriter, Codeium을 명시했고, 소설 집필 섹션이 蛙蛙写作, ChatGPT, DeepSeek, Kimi, 作家助手 등을 명시했으며, 광범위한 시장 섹션이 ChatGPT, Claude, DeepSeek, 通义千问 등을 명시했기 때문입니다. 하지만 이들은 프레임워크 간 재순위화 (cross-framework re-rank)에는 서툽니다. 왜냐하면 网文场景适配度 (웹소설 시나리오 적합도) 점수를 근거로 코딩 스택에 소설 집필 도구를 추가할지 결정하려는 엔지니어는, 网文场景适配度가 에이전트 자율성 (agent autonomy), IDE 통합 (IDE integration), 또는 비용 (cost)으로 변환된 공개된 수치가 없으며, 그러한 변환 정보가 그 어떤 종합 정리 자료에도 존재하지 않는다는 사실을 깨달아야 하기 때문입니다. 7개의 프레임워크는 동일한 문제에 대한 7개의 방언 (dialects)이며, 이들 사이를 이어주는 사전 (dictionary)은 아직 존재하지 않습니다.
저는 3개월 후에 다시 평가하겠습니다. 지난번에 제가 그렇게 말했을 당시에는 코딩에는 주로 Cursor와 Claude Code를, 일반적인 어시스턴트 업무에는 ChatGPT를 사용하고 있었으며, 현재도 대략 그러한 상태에 머물러 있습니다. 다만 이제는 모든 Juejin 요약(roundup)을 카테고리별 방언 (dialect)으로 읽고, 개별 포스트를 7개의 조각으로 이루어진 워크플로우 (workflow) 중 하나의 조각으로 취급한다는 점이 다릅니다. 달라진 점은 이제 요약본의 결론을 신뢰하기 전에 해당 요약이 어떤 프레임워크 (framework)로 작성되었는지 확인한다는 것입니다. 만약 그 프레임워크가 제가 실제로 수행하려는 작업과 일치하지 않는다면, 저는 그 순위를 카테고리별 잡학 지식으로 취급하고 다른 포스트를 찾습니다. 6개월 정도 지나면, 요약본들이 검색 결과 페이지 상단에 명시적인 축 변환 테이블 (axis-translation table)을 게시하거나, 혹은 7개의 프레임워크가 독자가 직접 연결해야 하는 영구적인 7개 방언 워크플로우로 굳어질 것이라고 예상합니다. 어느 쪽이 먼저 움직이느냐에 따라, 이 형식이 '카테고리를 넘나드는 스택 작업 (cross-category stack work)이 엔지니어링 결정 사항이며, 카테고리 내부의 순위는 이를 뒷받침하는 증거일 뿐'이라는 사실을 마침내 인지했는지 알 수 있을 것입니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기