IBM이 온프레미스 환경의 IBM Bob에 NVIDIA Nemotron을 채택한 이유
요약
IBM은 기업의 민감한 코드와 IP를 외부 클라우드에 전송할 수 없는 환경을 위해, 온프레미스 배포가 가능한 AI 모델을 도입했습니다. 이 과정에서 NVIDIA Nemotron과 Poolside Laguna를 IBM Bob 핵심 지원 모델로 선정했으며, 단순히 성능 점수뿐 아니라 하드웨어 효율성, 실제 코딩 정확도, 낮은 지연 시간 등 엔터프라이즈 환경의 복합적인 요구사항을 기준으로 평가했습니다.
핵심 포인트
- 온프레미스 AI는 보안, 규정 준수(compliance)가 최우선 고려 사항입니다.
- IBM은 모델 선택 시 성능 외에 하드웨어 효율성과 배포 가능성을 중시했습니다.
- 코딩 정확도는 단순 벤치마크보다 실제 개발 워크플로우 완료 능력을 측정했습니다.
- 개발자 생산성 유지를 위해 낮은 지연 시간(latency)이 핵심 평가 요소였습니다.
기업들이 소프트웨어 개발에 AI를 도입함에 따라, 하나의 과제가 계속해서 제기되고 있습니다.
코드, 지적 재산(IP), 그리고 개발 컨텍스트를 기업이 통제하는 환경 내부에 유지하면서 최첨단 수준의 코딩 성능을 어떻게 제공할 것인가?
이 질문은 IBM이 IBM Bob을 온프레미스 배포로 확장함에 따라 특히 중요해졌습니다. 클라우드 기반 AI 서비스가 강력한 기능을 제공할 수 있지만, 많은 조직들은 민감한 코드를 외부 환경으로 전송하는 것이 비실용적인 엄격한 보안, 규정 준수(compliance), 주권(sovereignty), 그리고 운영 요구 사항 하에 운영됩니다.
이를 해결하기 위해 IBM은 고객이 관리하는 인프라에서 효율적으로 실행되면서 엔터프라이즈급 에이전트 개발을 제공할 수 있는 모델이 필요했습니다.
광범위한 평가 끝에, IBM은 NVIDIA Nemotron과 Poolside Laguna를 IBM Bob 온프레미스 배포의 핵심 지원 모델로 선정했습니다.
과제: 최첨단 AI를 온프레미스로 가져오기
온프레미스(Self-hosted) AI는 공개 SaaS 배포와 매우 다른 일련의 요구 사항을 만듭니다.
규제 산업에서 운영하는 조직들은 종종 다음이 필요합니다:
- 소스 코드가 승인된 환경 내부에 남아 있어야 함
- 개발 아티팩트가 기업 경계 내에 머물러야 함
- 에어 갭(Air-gapped) 배포 옵션
- 유연한 인프라 제어
- 예측 가능한 성능 및 지연 시간(latency)
- 모델 사용에 대한 거버넌스
동시에, 개발자들은 여전히 현대적인 AI 기능을 기대합니다.
해결책은 단순히 안전하기만 해서는 안 됩니다.
효과적이어야 합니다.
이 균형이 모델 평가 과정의 원동력이 되었습니다.
IBM이 후보 모델을 평가한 방법
IBM Bob 팀은 단지 벤치마크 점수에 근거하여 모델을 선택하기보다는, 실제 엔터프라이즈 환경에서 중요한 여러 차원에 걸쳐 오픈 웨이트(open-weight) 및 클로즈드 웨이트(closed-weight) 모델 모두를 평가했습니다.
1. 하드웨어 사용량 (Hardware Footprint)
많은 최첨단 모델은 엄청난 컴퓨팅 자원을 필요로 합니다.
비록 그러한 모델들이 훌륭한 결과를 산출할 수 있지만, 이를 온프레미스(on-premises) 환경에 배포하는 것은 엄청나게 비쌀 수 있습니다.
IBM은 지능과 인프라 요구사항 사이에서 최적의 균형을 제공하는 모델이 무엇인지 파악하기 위해 다양한 크기 프로필의 모델들을 평가했습니다.
목표는 단순히 최대 규모의 모델을 사용하는 것이 아니라, 실제적인 배포 가능성이었습니다.
2. 코딩 정확도 (Coding Accuracy)
코딩 모델은 궁극적으로 소프트웨어 엔지니어링 문제를 해결하는 데 도움을 주어야 합니다.
IBM은 다음을 포함한 실제 개발 워크플로우 전반에 걸쳐 후보 모델들을 벤치마킹했습니다:
- 단순 개발 작업 (Simple development tasks)
- 중간 복잡도의 엔지니어링 작업 (Medium-complexity engineering work)
- 다단계 소프트웨어 현대화 시나리오 (Multi-step software modernization scenarios)
- 에이전트 지원 워크플로우 (Agent-assisted workflows)
강조된 부분은 고립된 벤치마크 점수보다는 실제 작업 완료였습니다.
3. 지연 시간 (Latency)
개발자 생산성은 피드백 루프(feedback loops)에 크게 의존합니다.
에이전트가 분석, 도구 호출(tool calls), 파일 작업, 실행 워크플로우를 수행할 때 느린 응답은 마찰을 일으킵니다.
따라서 IBM은 다음 항목들을 측정했습니다:
- 첫 토큰까지 걸리는 시간 (Time-to-first-token)
- 전반적인 응답 지연 시간 (Overall response latency)
- 생성 처리량 (Generation throughput)
- 다단계 워크플로우 응답성 (Multi-step workflow responsiveness)
4. 개방성 (Openness)
셀프 호스팅(self-hosted) 배포는 단순히 원시적인 능력 이상의 것을 요구합니다.
조직들은 자신들의 환경 내에서 통제하고, 배포하며, 운영할 수 있는 모델을 필요로 합니다.
이러한 점은 고도로 통제되거나 에어 갭(air-gapped)된 환경을 포함하여 고객 관리형 배포에 개방 가중치(open-weight) 모델을 특히 매력적으로 만듭니다.
원시 모델 벤치마크를 넘어서 보기 (Looking Beyond Raw Model Benchmarks)
평가 과정에서 특히 흥미로운 측면 중 하나는 IBM이 모델들을 고립된 상태로 평가하지 않았다는 점입니다.
Bob 팀은 주변의 **에이전트 하네스(agent harness)**와 함께 모델들을 평가했습니다.
이는 에이전틱 개발(agentic development)이 단순히 모델 추론을 넘어선 영역이기 때문에 중요합니다.
실제 워크플로우에는 다음 요소들이 포함됩니다:
- 도구 호출 (Tool calling)
- 터미널 상호작용 (Terminal interactions)
- 계획 시스템 (Planning systems)
- 스킬 (Skills)
- 모드 (Modes)
- 에이전트 오케스트레이션 (Agent orchestration)
벤치마크에서 좋은 성능을 보이는 모델이라도 완전한 소프트웨어 엔지니어링 워크플로우 내부에서는 반드시 좋은 성능을 보장하지는 않습니다.
따라서 평가는 엔드투엔드(end-to-end) 성능에 초점을 맞췄습니다.
NVIDIA와의 공동 엔지니어링 (Co-Engineering with NVIDIA)
초기 테스트 기간 동안, NVIDIA Nemotron 모델은 강력한 추론 능력을 보여주었습니다.
하지만 IBM은 에이전트 기반 소프트웨어 개발 워크플로우 내에서 이 모델들의 효과성을 개선할 수 있는 기회를 발견했습니다.
IBM Bob 엔지니어링 팀은 Bob의 환경 내에서 모델의 동작을 다듬기 위해 NVIDIA와 긴밀하게 협력했습니다.
최적화 노력에는 다음이 포함되었습니다:
- 프롬프트 튜닝 (Prompt tuning)
- 샘플링 조정 (Sampling adjustments)
- 추론 구성 개선 (Reasoning configuration improvements)
- 에이전트 하네스 수정 (Agent harness modifications)
이 과정은 단순히 Bob을 모델에 적응시키는 것이 아니었습니다.
완벽한 경험 자체를 공동 엔지니어링하는 것이었습니다.
IBM 엔지니어와 내부 Bob 사용자들의 피드백은 평가 및 최적화 과정에 지속적으로 통합되었습니다.
IBM이 발견한 것 (What IBM Found)
NVIDIA Nemotron 3 Ultra
NVIDIA Nemotron 3 Ultra는 여러 영역에서 두각을 나타냈습니다.
IBM은 다음 사항들을 강조했습니다:
- 신뢰할 수 있고 예측 가능한 출력 동작
- 도구 스키마(tool schemas)에 대한 강력한 준수성
- 작업에서 벗어나는 경향 감소 (Reduced tendency to drift off-task)
- 불필요한 복잡성이 없는 깔끔한 구현
- 낮은 지연 시간 실행 특성 (Low-latency execution characteristics)
IBM의 내부 벤치마크에 따르면, Nemotron은 네트워크를 통해 접근하는 선도적인 SaaS 기반 모델 배포와 비교하여 NVIDIA Blackwell 인프라에서 훨씬 낮은 지연 시간을 제공했습니다.
기업 개발팀에게 있어 낮은 지연 시간은 더 빠른 피드백 주기와 원활한 에이전트 상호 작용으로 직접 연결될 수 있습니다.
Poolside Laguna S 2.1
Poolside Laguna는 다른 이유로 인상을 남겼습니다.
IBM은 다음 사항들을 강조했습니다:
- 모델 크기에 비해 강력한 추론 능력
- 빠른 응답 생성 속도
- 추론 과정에 대한 명확한 설명
- 우수한 성능 대비 적재 공간 비율 (Excellent performance-to-footprint ratio)
이는 인프라 리소스가 더 제한적이지만 고품질 코딩 지원이 여전히 필요한 상황에서 Laguna를 특히 매력적으로 만듭니다.
이것이 기업 고객에게 의미하는 바 (What This Means for Enterprise Customers)
조직이 자체 호스팅(self-hosted) AI 지원 소프트웨어 개발을 고려할 때, 이번 작업의 결과는 매우 중요합니다.
IBM Bob을 자체 호스팅하면, 조직은 지원되는 모델들을 자체 인프라에 직접 배포하고 Bob의 모델 게이트웨이를 통해 연결할 수 있습니다.
실질적인 이점들은 다음과 같습니다:
- 코드가 기업이 통제하는 환경 내에 유지됩니다
- 개발 컨텍스트가 로컬로 유지됩니다
- 지적 재산(IP)이 보호됩니다
- 에어 갭(Air-gapped) 배포가 가능해집니다
- 기업은 인프라 통제권을 유지합니다
- 개발팀은 에이전트 워크플로우(agentic workflows)에 접근할 수 있게 됩니다.
아마도 더 중요한 것은, 기업들이 강력한 AI 기능과 배포 유연성 사이에서 선택해야 할 필요가 없어졌다는 점입니다.
IBM Bob을 NVIDIA Nemotron이나 Poolside Laguna 같은 모델들과 결합하는 것은 최첨단(frontier-grade) 소프트웨어 엔지니어링 지원을 규제되고 보안에 민감한 환경 내부에서도 이용 가능하게 만드는 것을 목표로 합니다.
향후 전망 (Looking Ahead)
IBM은 또한 모델 유연성을 더욱 확장하기 위한 미래 계획도 제시했습니다.
특히 흥미로운 방향 중 하나는 **멀티-모델 라우팅(multi-model routing)**입니다.
기업들이 여러 목적을 위해 다양한 모델들을 채택함에 따라, 워크로드를 가장 적절한 모델로 라우팅하는 것은 다음 요소들의 균형을 맞추는 데 도움이 될 수 있습니다:
- 비용(Cost)
- 성능(Performance)
- 정확도(Accuracy)
- 인프라 활용률(Infrastructure utilization)
이는 조직들이 단일 AI 제공업체에 의존하기보다는 여러 모델을 점점 더 많이 사용하는 광범위한 산업 트렌드와 일치합니다.
최종 생각 (Final Thoughts)
이번 발표에서 가장 흥미로운 측면은 대화의 초점을 모델 순위(model rankings)에서 배포 현실(deployment reality)로 이동시킨다는 점입니다.
많은 조직들은 이미 AI가 소프트웨어 개발을 개선할 수 있다는 것을 알고 있습니다.
도전 과제는 이러한 기능을 가장 중요한 애플리케이션이 존재하는 환경으로 가져오는 것입니다.
IBM이 NVIDIA Nemotron과 Poolside Laguna을 지원하기로 한 결정은 실질적인 기업 요구사항을 반영합니다:
인프라, 코드, 데이터 및 운영 환경에 대한 통제권을 유지하면서 강력한 에이전트 개발 역량을 제공하는 것입니다.
규제가 엄격한 산업(regulated industries), 에어갭 환경(air-gapped environments), 그리고 민감한 지적 재산(intellectual property)을 관리하는 기업에게, 이러한 조합은 모델 인텔리전스 자체만큼 중요할 수 있습니다.
더 알아보기
📖 전체 발표 읽기:
👉 IBM Bob에 NVIDIA Nemotron을 선택한 이유
⤵️ IBM Bob 무료 체험하기: 👉 IBM Bob 체험 시작하기
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기