Cursor가 Composer 2.5를 출시했습니다: AI 코딩 전쟁이 본격화된 이유
요약
Cursor가 복잡하고 다단계적인 코딩 작업을 수행할 수 있는 Composer 2.5를 출시했습니다. 이번 업데이트는 강화학습(RL)과 타겟팅된 텍스트 피드백을 통해 모델의 컨텍스트 유지 능력을 대폭 향상시켜, 장기적인 에이전트 워크플로우를 지원합니다.
핵심 포인트
- 이전 모델 대비 25배 더 많은 합성 강화학습(RL) 태스크를 통해 학습됨
- 실시간 국소적 힌트(localized hint)를 제공하는 피드백 메커니즘으로 모델의 오류 수정 능력 강화
- 단순 코드 생성을 넘어 .cursorrules를 활용한 자율적인 리팩터링 및 에이전트 워크플로우 지원
- 수십만 토큰에 달하는 긴 컨텍스트에서도 일관된 성능을 유지하는 장기적 코딩(long-horizon coding) 능력 확보
AI 코딩 어시스턴트(AI coding assistants)가 이미 빠르게 발전하고 있다고 생각했다면, 마음 단단히 먹으십시오. Cursor가 그들의 가장 똑똑하고 유능한 코딩 모델인 Composer 2.5를 방금 출시했습니다. 이전 버전들이 보일러플레이트(boilerplate) 코드를 찍어내는 데 뛰어났다면, Composer 2.5는 장기적 관점의 코딩 작업(long-horizon coding work)을 처리하는 데 있어 거대한 도약을 의미합니다. 우리는 정확한 결과를 얻기 위해 수백 번의 도구 호출(tool calls)이 필요한 복잡하고 다단계적인 문제들을 다루고 있습니다. 이번 업데이트와 그 뒤에 숨겨진 기술, 그리고 이것이 개발자들에게 왜 중요한지에 대해 알아야 할 모든 것을 소개합니다. 👇
🧠 어려운 작업에 더 똑똑해진 성능
AI 코딩 도구의 가장 큰 병목 현상은 항상 지속적인 컨텍스트(sustained context)였습니다. 처음에는 강력하게 시작하지만, 파일 몇 개를 지나면 맥락을 놓치곤 합니다. Cursor는 훈련 규모를 대폭 확장함으로써 이 문제에 정면으로 맞섰습니다. Composer 2.5는 이전 모델보다 25배 더 많은 합성 RL (강화학습, Reinforcement Learning) 태스크를 통해 학습되었습니다. 하지만 단순히 데이터를 확장하는 것만으로는 충분하지 않습니다. 모델의 롤아웃(rollout)이 수십만 토큰에 달할 때, 공로를 할당하는 것(assign credit)은 매우 어려워집니다. 즉, AI가 어떤 특정 결정이 결과에 도움이 되었는지 혹은 해가 되었는지 파악하는 데 어려움을 겪는다는 의미입니다. 이를 해결하기 위해 Cursor는 RL 과정에서 타겟팅된 텍스트 피드백(targeted textual feedback)을 도입했습니다. 롤아웃이 끝날 때까지 기다려 모델에 벌점을 주는 대신, 모델이 실수한 정확한 시점에 직접 피드백을 제공합니다. 예를 들어, 모델이 잘못된 도구 호출을 하거나 혼란스러운 설명을 제공하면, 원하는 개선 사항을 설명하는 국소적인 힌트(localized hint)를 받게 됩니다. 이는 커뮤니케이션 스타일 및 노력 보정(effort calibration)과 같은 중요한 행동을 형성하여, AI와 협업하는 것을 진정으로 더 즐겁게 만들어 줍니다.
💻 코드: 장기적 에이전트(Long-Horizon Agents)를 활용하는 방법
Composer 2.5는 지속적인 작업을 위해 구축되었기 때문에, 훨씬 더 복잡한 아키텍처 작업을 맡길 수 있습니다. 단일 함수를 요청하는 대신, .cursorrules 파일을 설정하여 장기적으로 실행되는 에이전트 워크플로우(agentic workflow)를 정의할 수 있습니다.
다음은 Composer 2.5와 같은 장기적 모델(long-horizon model)에게 레거시 코드베이스(legacy codebase)를 자율적으로 리팩터링(refactor)하도록 지시하는 방법의 예시입니다:
.cursorrules
당신은 전문 시스템 아키텍트(systems architect)입니다. 당신의 작업은 레거시 auth 모듈을 현대적이고 확장 가능한 서비스로 리팩터링하는 것입니다.
워크플로우 실행 단계:
- 분석 (Analyze):
/src/legacy_auth디렉토리의 모든 파일을 읽습니다. - 계획 (Plan): 마이그레이션 계획을 초안으로 작성하고, 코드를 작성하기 전에 나의 승인을 기다리십시오.
- 실행 (Execute): 모든 미들웨어(middleware)에 걸쳐 새로운 JWT 기반 인증 흐름을 구현합니다.
- 테스트 (Test): 새로운 구현에 대한 단위 테스트(unit tests)를 생성합니다.
- 검증 (Verify): 터미널 도구를 사용하여 테스트를 실행합니다. 만약 실패하는 테스트가 있다면, 모든 테스트가 통과할 때까지 자율적으로 오류를 수정하십시오.
참고: 누락된 의존성(dependency)을 발견하면, 터미널을 사용하여 이를 설치하십시오.
Composer 2.5의 향상된 도구 사용(tool use) 능력과 행동 형성(behavioral shaping) 덕분에, 중간에 환각(hallucination)을 일으키지 않고 실제로 이와 같은 다단계 루프(multi-step loop)를 실행할 수 있습니다.
🏗️ 핵심 쟁점: Kimi 베이스
Composer 2가 Moonshot AI의 오픈 소스 Kimi K2.5 체크포인트(checkpoint)를 기반으로 구축되었다는 커뮤니티의 논란이 많았습니다. Cursor는 이를 인정했으며, Composer 2.5 또한 동일한 Kimi K2.5 오픈 소스 체크포인트를 기반으로 구축되었음을 확인했습니다. 하지만 Cursor의 비결은 사후 학습(post-training)에 있습니다. 지속적인 사전 학습(continued pretraining)과 대규모 강화학습(RL) 파이프라인이 Composer에 특유의 개발자 중심적인
Colossus 2 슈퍼컴퓨터에서 10배 더 많은 총 연산량(total compute)을 사용하여, 이 차기 모델은 성능 면에서 거대한 도약을 이뤄낼 것으로 기대됩니다. 여러분은 벌써 Composer 2.5를 사용하고 계신가요? 아래 댓글로 여러분의 생각을 남겨주세요! 👇
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기