Microsoft가 MAI Code 1.1 Flash 로컬 추론 기능을 GitHub Copilot에 도입합니다
요약
Microsoft가 GitHub Copilot에 로컬 추론 기능을 도입하여, 코딩 모델을 장치 자체에서 실행할 수 있게 합니다. 이는 클라우드 의존성을 줄이고 개발자에게 유연한 워크플로우를 제공합니다. 사용자는 자동 오케스트레이션 또는 명시적 로컬 선택 방식을 통해 요청 처리 환경을 제어할 수 있습니다.
핵심 포인트
- Copilot이 장치 자체에서 코딩 모델 실행 가능 (로컬 추론 도입)
- 자동 오케스트레이션으로 최적의 환경(로컬/클라우드) 자동 라우팅
- 명시적 선택 모드로 로컬 모델을 직접 제어할 수 있음
- 격리된 도구 사용(MXC) 기능 결합으로 에이전트 워크플로우 강화
Microsoft는 MAI Code 1.1 Flash를 GitHub Copilot의 로컬 코딩 워크플로우로 가져와, 지원되는 Copilot 경험이 클라우드 추론에만 의존하는 대신 장치 자체에서 코딩 모델을 실행할 수 있도록 할 계획입니다. 이 배포는 2026년 10월 말까지 제한된 사용자 그룹을 대상으로 시작될 예정이며, Copilot CLI, Copilot 앱, Visual Studio Code와 같은 IDE 통합 기능을 포함합니다.
이러한 개발은 개발자들에게 AI 기반 코딩에 또 다른 경로를 제공한다는 점에서 중요합니다. 즉, 적합한 작업의 경우 로컬 모델 실행과 더불어, 클라우드 호스팅 모델을 활용하는 방법입니다. Copilot을 일상적인 개발에 사용하는 팀에게 실질적인 가치는 호환 가능한 하드웨어, 로컬 및 클라우드 모델 간 라우팅의 품질, 그리고 최종 상업적 약관에 따라 달라질 것입니다. Microsoft는 공식 발표에서 로컬 추론에 대한 가격 정보를 공개하지 않았습니다.
GitHub Copilot의 로컬 모델 및 샌드박스 도구에 대한 Microsoft의 공식 개요에 따르면, MAI Code 1.1 Flash는 256,000 토큰의 참조 컨텍스트 창을 가진 로컬 코딩 모델로 설계되었습니다. 이 모델은 총 1370억 개의 파라미터를 가지고 있으며, 그중 68억 개의 활성 파라미터가 사용되며, 장치에서의 크기(footprint)를 줄이기 위해 양자화(quantization)와 추측 디코딩(speculative decoding)을 사용합니다.
Copilot에서 로컬 MAI Code 1.1 Flash 작동 방식
Microsoft는 로컬 추론을 사용하는 두 가지 방법을 설명합니다. **자동 오케스트레이션(Auto orchestration)**에서는 Copilot이 요청을 로컬에서 처리할지 클라우드에서 처리할지를 결정합니다. 이 라우팅은 Microsoft의 HydraFusion 오케스트레이션 접근 방식을 기반으로 하며, 이는 엣지 및 클라우드 환경 전반에 걸쳐 모델을 조정하는 것을 목표로 합니다.
두 번째 옵션은 **명시적인 로컬 모델 선택(explicit local-model selection)**입니다. 사용자는 Windows ML 프로바이더를 통해 MAI Code 1.1 Flash를 선택하거나 Copilot을 로컬 엔드포인트에 연결할 수 있습니다. 이러한 구분은 코딩 요청이 자동 라우팅에 맡겨지는 대신, 어느 곳에서 처리될지 직접 제어하고 싶은 개발자에게 중요합니다.
| 사용 모드 | 작동 방식 | 개발자에게 제공하는 것 |
|---|---|---|
| 자동 오케스트레이션 (Auto orchestration) | Copilot이 로컬 및 클라우드 추론 간에 요청을 라우팅합니다. | 요청에 가장 적합한 환경을 사용할 수 있는 단일 워크플로우입니다. |
| 명시적 로컬 선택 (Explicit local selection) | 사용자가 Windows ML 또는 로컬 엔드포인트를 통해 MAI Code 1.1 Flash를 선택합니다. | 로컬 코딩 모델을 직접 제어하여 사용하는 것입니다. |
Microsoft는 또한 로컬 모델 실행에 격리된 도구 사용(sandboxed tool use) 기능을 결합하고 있습니다. Microsoft Execution Containers, 또는 MXC가 바로 도구 실행을 격리하도록 설계되었습니다. 이는 에이전트적 코딩 워크플로우에서 중요합니다. 이러한 워크플로우에서는 모델이 단순히 편집기 내에서 텍스트를 생성하는 것 이상으로, 개발 작업을 완료하기 위해 도구를 사용해야 할 수 있기 때문입니다.
GitHub의 변경 로그(Changelog) 항목에 따르면, 이 회사는 이미 2026년 6월에 MAI-Code-1-Flash를 더 많은 Copilot 영역으로 확장한 바 있습니다. MAI Code 1.1 Flash는 이러한 광범위한 Copilot 존재감에 구체적으로 발표된 로컬 코딩 경로를 추가합니다.
하드웨어 요구 사항 및 성능 참고 자료
로컬 추론은 모든 노트북에서 가벼운 자동 완성 도구를 실행하는 것과 동일하지 않습니다. Microsoft가 공개한 참고 측정값은 NVIDIA RTX Spark가 장착된 Surface Laptop Ultra를 사용합니다. 이 설정에서 MAI Code 1.1 Flash는 256,000 토큰의 컨텍스트에서 약 75.5GB의 최대 메모리 사용량을 달성합니다.
Microsoft는 해당 참고 구성에서 다음과 같은 디코드 처리량(decode throughput)을 보고합니다:
- 컨텍스트 64,000 토큰 기준 초당 923.5 토큰.
- 컨텍스트 128,000 토큰 기준 초당 769.8 토큰.
- 최대 메모리 사용량 약 75.5GB를 갖는 256,000 토큰 참고 컨텍스트 창.
이 수치들은 왜 하드웨어가 도입의 핵심이 될지 보여줍니다. 공식 발표에서는 일반적인 최소 사양이나 완전한 지원 장치 목록을 제공하지 않습니다. 따라서 기업들은 모든 기존 개발자 머신이 보고된 컨텍스트 크기나 성능 수준에서 모델을 로컬로 실행할 수 있을 것이라고 가정하는 것을 피해야 합니다.
배포가 개발자 워크플로우에 의미하는 바
Copilot CLI, Copilot 앱 또는 지원되는 IDE 통합 환경에서 이미 작업하고 있는 개발자의 경우, 로컬 추론은 별도의 코딩 어시스턴트를 설치하고 학습할 필요 없이 기존의 Copilot 워크플로우의 일부가 될 수 있습니다. 명시적인 선택 옵션은 개발자가 로컬 엔드포인트로 작업하기를 원할 때 유용할 수 있으며, 자동 오케스트레이션(automatic orchestration)은 모든 작업을 위해 수동으로 결정해야 할 필요성을 줄이도록 설계되었습니다.
기업의 경우, 당장의 질문은 클라우드 AI를 완전히 대체하는 것보다는 업무에 적합한 환경을 매칭시키는 것에 가깝습니다. 로컬 처리는 팀이 호환 가능한 머신을 가지고 있고 기존 개발 도구 내에서 로컬 옵션을 원할 때 관련성이 있을 수 있습니다. 클라우드 추론(Cloud inference)은 여전히 Microsoft가 명시한 라우팅 모델의 일부로 남아 있으므로, 이 발표는 완전히 로컬 전용 Copilot 경험보다는 하이브리드 워크플로우를 가리킵니다.
비용은 아직 미정인 세부 사항입니다. 비록 출처 소셜 게시물에서 로컬 호출에 추론 비용이 없다고 설명했지만, Microsoft의 공식 발표는 로컬 추론 가격 책정, 구독 처리 방식, 사용 제한 또는 모든 로컬 워크플로우가 추가 요금을 부과하지 않을지 여부를 공개하지 않았습니다. 팀들은 해당 주장에 기반하여 예산 가정을 하기 전에 배포 및 제품 문서를 기다려야 합니다.
기업들이 AI 코딩 지원이 소프트웨어 개발 프로세스의 어느 부분에 적합한지 평가할 때, 모델 성능만큼 구현 세부 사항도 중요합니다. Scalevise는 실제 개발 작업을 매핑하고, AI 도구를 안정적인 워크플로우에 연결하며, AI 워크플로우 자동화 서비스를 통해 반복적인 운영 작업을 줄이는 데 도움을 줄 수 있습니다. 집중적인 평가를 통해 개발자들이 이미 작업하는 방식에 방해 없이 로컬 및 클라우드 AI 기능이 현재 도구에 어떻게 적합할지 파악할 수 있습니다. AI 자동화 프로젝트 논의를 위해 상담을 요청하세요.
자주 묻는 질문 (FAQ)
GitHub Copilot에서 MAI Code 1.1 Flash란 무엇인가요?
MAI Code 1.1 Flash는 GitHub Copilot용으로 도입된 Microsoft의 코딩 모델이며, 로컬 추론(local inference)을 지원합니다. Microsoft에 따르면 이 모델은 Copilot CLI, Copilot 앱 및 IDE 통합 전반에서 작동할 것입니다.
로컬 MAI Code 1.1 Flash는 언제 사용할 수 있나요?
Microsoft는 2026년 10월 말까지 제한적인 출시를 시작할 계획입니다. 공식 발표에서는 더 광범위한 사용 가능 날짜를 제공하지 않았습니다.
사용자가 클라우드 추론 대신 로컬 추론을 선택할 수 있나요?
예. Microsoft는 Windows ML 프로바이더 또는 로컬 엔드포인트에 연결하여 명시적인 로컬 모델 선택을 설명합니다. Copilot은 또한 요청을 로컬 및 클라우드 추론 간에 자동으로 라우팅할 수도 있습니다.
Microsoft가 로컬 Copilot 추론 가격을 공개했나요?
아니요. Microsoft의 공식 발표에서는 로컬 추론에 대한 가격 책정, 사용 제한 또는 구독 처리를 공개하지 않았습니다. 로컬 호출에는 추론 비용이 없다는 주장은 공식 발표에서 확인되지 않았습니다.
결론
MAI Code 1.1 Flash는 하이브리드 라우팅(hybrid routing), 명시적 로컬 선택(explicit local selection), 그리고 격리된 도구 실행(sandboxed tool execution)을 기반으로 GitHub Copilot에 계획된 로컬 추론 옵션을 제공합니다. 발표된 성능 수치는 상당하지만, 참조 메모리 요구 사항 또한 마찬가지입니다. 이의 실제 가치는 Microsoft가 아직 공개하지 않은 출시 계획, 지원되는 하드웨어, 그리고 상업적 세부 사항에 달려 있을 것입니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기