Claude Code로 완전히 구축한 aipolcom.net: 50개의 AI 모델이 정치 성향 테스트(Political Compass
요약
Claude Code를 활용하여 50개 AI 모델의 정치 성향을 테스트하는 사이트 aipolcom.net을 구축한 사례를 소개합니다. 개발자는 직접 코드를 작성하지 않고 오직 프롬프트와 Claude Code의 에이전트 기능을 통해 데이터 파이프라인부터 시각화까지 전 과정을 완료했습니다.
핵심 포인트
- Claude Code를 사용하여 코드 작성 없이 전체 프로젝트 구축
- 데이터 파이프라인, SQLite 스키마, Puppeteer 실행기 구현
- 실시간 피드백을 반영하는 리뷰 노트(review-note) 시스템 구축
- 약 11.7억 개의 토큰과 12,220회의 도구 호출 사용 기록 공개
무엇인가
aipolcom.net - 13개 기업의 50개 AI 모델이 정치 성향 테스트(Political Compass test)의 62개 명제를 답변하며, 이 답변들은 headless Chromium을 통해 실제 테스트에 제출된 후 대화형 컴퍼스(interactive compass) 위에 시각화됩니다. 하지만 정말 흥미로운 부분은 메인 플롯/컴퍼스가 아니라 방법론(methodology) 섹션을 만드는 과정이었습니다. 어떤 점(dot)이든 클릭하면 해당 모델의 답변과 모든 명제에 대한 간략한 추론을 확인할 수 있습니다.
첫 번째 버전이 Reddit(r/dataisbeautiful)에서 방법론적 비판을 받은 후(감사합니다, r/dataisbeautiful), 저는 다음 사항들을 테스트하기 위해 850회의 추가 실행을 포함한 전체 검증(validation) 섹션을 추가했습니다:
실행 간 분산 (run-to-run variance)
프롬프트 간 분산 (prompt-to-prompt variance)
프롬프트 민감도에 대한 양성 대조군 테스트로서의 페르소나 (personas) - 모델을 의도적으로 유도함
접속 방식 (예: API vs. 웹 인터페이스)
어떻게 구축되었나
전적으로 Claude Code를 사용하여 구축되었습니다. 저는 기술적인 지식이 있어 많은 결정을 내렸지만, 코드 한 줄도 직접 쓰지 않았습니다. Claude가 데이터 파이프라인(data pipeline), SQLite 스키마(schema), Puppeteer 퀴즈 실행기(quiz runner), 시각화(visualization), API를 작성했으며, 모든 git 작업을 처리했습니다.
저의 총 투입량: 370개의 프롬프트, 약 37,800단어 입력, 10일 동안 46시간 이상의 활성 작업.
계획 및 모델: Max 20x를 사용했으며, 연구를 위한 일부 Sonnet 및 Opus 하위 에이전트(subagents)를 제외하고는 거의 전적으로 Fable을 사용했습니다. 저는 보통 Max 5x를 사용하지만, 이 프로젝트에는 약간의 추가적인 자원이 필요했습니다.
프로젝트 중간에 고안한 리뷰 노트(review-note) 시스템
프로젝트 중간에 저는 Claude에게 사이트 자체에 피드백 도구를 구축하도록 요청했습니다. 이를 통해 라이브 페이지에서 어떤 텍스트든 선택하여 강조 표시하고 지침을 첨부할 수 있습니다 ("이것을 다시 작성해줘", "이 수치는 틀렸어", "여기에 여백을 조금 더 추가해줘" 등).
그런 다음 저는 연관된 /reviewnotes 스킬을 사용하며, Claude는 열려 있는 노트를 가져와 각 노트를 구현하고, 완료로 표시하여 다음 검토 시 강조 표시가 사라지게 한 뒤, 커밋(commit)합니다. 모든 서식과 차트가 포함된 브라우저에서 사이트를 검토하는 것은 여기저기를 다듬는 데 엄청난 도움이 되었습니다. Claude는 나중에 이 시스템을 제가 다른 프로젝트에도 바로 적용할 수 있도록 패키징해 주었습니다.
모든 토큰의 기록
이 사이트의 콜로폰 (colophon)은 자체 빌드 통계를 공개적으로 추적합니다: 캐시를 포함하여 약 11.7억 개의 토큰, 541회의 서브 에이전트 (subagent) 실행, 12,220회의 도구 호출 (tool invocations), 그리고 API 정가 기준 예상 비용(약 $2,170 - 저는 구독형 서비스를 이용 중이므로 가설적인 수치입니다)이 포함됩니다. 이와 같은 프로젝트가 실제로 얼마나 소비하는지 궁금하시다면 페이지 하단의 숫자를 확인해 보세요. 저는 모든 것을 추적하기 위해 제 프로젝트인 ccstats를 사용했습니다.
질문 및 비판
워크플로우에 관한 어떤 질문이든 기꺼이 답변하겠습니다. 또한 방법론 (methodology) 섹션은 정확히 스트레스 테스트를 받기 위해 존재하는 것이므로, 비판을 환영합니다.
제출자: /u/Zapador
[link] [comments]
AI 자동 생성 콘텐츠
본 콘텐츠는 r/ClaudeAI의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기