GLM 5.3 Flash로 한 달간 코딩하기
요약
본 기사는 AI 모델 사용 시 에너지 효율성과 비용 구조에 대한 논의를 다루며, 데이터센터 증설 과잉 투자 가능성을 제기합니다. 특히 개인 PC 환경에서의 코딩 경험과 클라우드 서비스의 전력 소비 패턴을 비교 분석하며, 실제 에너지 영향 보고가 기술적 제약에 초점을 맞춰야 한다고 주장합니다.
핵심 포인트
- AI 모델 사용 시 에너지 효율성이 중요한 고려 사항입니다.
- 데이터센터 증설은 과잉 투자일 수 있으며, 공급 부족이 오히려 경제를 지탱할 수 있습니다.
- 개인 PC 환경과 클라우드 서비스의 전력 소비 패턴 차이를 이해해야 합니다.
- 모델 선택 및 에이전트 구성을 최적화하여 비용을 절감하는 것이 중요합니다.
이 수치에서 가장 놀라운 건 에너지 사용량이 매우 적다는 것임. 모델 사용 비용이 68달러인데 에너지는 약 4kWh, 탄소 배출량은 365g이라고 함. 전기요금은 전체 비용의 1%에 불과함. 4kWh는 전기차로 약 24km를 달리거나 물 약 38리터를 끓이는 정도임.
AI 데이터센터의 영향을 둘러싼 논의를 보면, 이 정도 결과를 얻으려면 에너지가 10~100배는 더 들 것처럼 느껴짐. AI 데이터센터 증설은 과잉 투자이며, 막대한 미사용 광케이블을 남긴 과거의 광통신망 투자 열풍 못지않거나 그보다 심할 것으로 봄. NVIDIA와 반도체 공장이 계획된 증설량만큼 칩을 공급하지 못하는 것이 오히려 경제를 구할 유일한 요인일 수 있음.
Neuralwatt의 CTO로서 보면, 언론의 묘사와 현장 사이에는 큰 괴리가 있음. 우리는 클라우드에서 에너지 관측과 보고를 제공하므로 글쓴이가 이용하는 업체도 우리일 가능성이 높음. 언론은 AI 전반을 다룰 때처럼 현재 추세를 실현 가능성이 낮을 수도 있는 최악의 미래로 외삽하는 경향이 있음.
실제로 우리는 성능을 유지하면서 줄당 토큰 수를 극대화하는 등, 기존 데이터센터의 에너지 제약을 해결하는 데 대부분의 시간을 씀. 이미 데이터센터에 공급되거나 전력망에 있지만 활용하기 어려운 전력으로 더 많은 토큰을 생성하려는 것임. 현재는 환경 영향보다 기술적 제약에 가까운 문제인데, 보도도 이를 더 잘 반영하면 좋겠음.
총비용과 순수 전력비가 몇 자릿수나 차이 나는 이유도 있음. 전력은 범용 상품인 반면, 다른 구성 요소 대부분에는 공급 부족으로 높은 마진이 붙음. 앞으로 하드웨어 경쟁으로 마진이 낮아지는 한편 전력이 병목이 되어 전기요금이 오르면 이 격차가 줄어들 수 있음.
집에서 스마트 플러그에 연결한 5090 PC로 Qwen3.8 27B를 돌려 에이전트 코딩을 함. 바쁜 날은 약 5kWh, 보통은 약 2kWh를 소비함. 클라우드는 여러 요청의 병렬 처리, 더 적은 활성 매개변수를 가진 모델, 여러 GPU에 분산되는 주변 장치 전력 덕분에 더 효율적일 것임. 그래도 추론 업체의 에너지 수치는 어느 정도 보기 좋게 다듬어졌다고 봄. 정치적 논쟁 속에서 상황이 그리 나쁘지 않다는 걸 보여줘야 하기 때문임.
다만 올해 모델의 발전 속도를 보면 계획된 증설은 지나치게 의욕적이라고 확신함. 게임용 하드웨어를 쓰는 나조차 시킬 일이 떨어질 때가 많고, 실행 가능한 모델이 똑똑해질수록 하드웨어를 쉬지 않고 가동하기는 더 어려워질 것임. 내가 AI에 맡길 일을 창의적으로 찾지 못해서일 수도 있지만, 그것만으로 설명될 것 같지는 않음.
앞부분은 좋았지만, 환경 영향에 관한 결론부터는 동의하기 어려움. 규모가 커지면 무엇이든 환경에 영향을 줌. 피해는 한곳에 집중되고 혜택은 분산되기 때문임. 이런 분리는 데이터센터의 열과 소음, 배전망 부담이 지역 기반 시설과 환경에 미치는 영향을 가려버림.
4kWh는 일반적인 가정용 중앙식 히트펌프·에어컨을 한 시간 돌리거나 게임용 PC로 여덟 시간 게임을 하는 정도임. 데이터센터 자원 소비에 관한 선전이 실제를 크게 앞질렀다고 느낌. 배후에서 이를 밀어붙이는 이해관계자가 있는 건 아닌지 의심하게 됨.
다만 내 사용량이 늘어나는 속도는 걱정됨. 두 달 전에는 토큰 사용량이 지금의 10분의 1이었고 추론 전력도 아마 5kWh를 크게 넘지 않았는데, 이번 달은 약 30kWh임. 더 저렴해지면 또 한 번 급증할지 모르겠음.
잘못된 모델을 골라 거의 하룻밤 만에 4억 5천만 토큰·150달러·5kWh를 썼고, 모델과 에이전트 구성을 잘 선택했다면 비용을 5분의 1로 줄일 수 있었다는데 이해가 안 됨. 왜 잘못된 선택이었고 어떤 모델이 더 나았을까? 구체적으로 무엇을 배웠으며 어떻게 미리 알 수 있었을까?
표현을 고쳐야 할 것 같음. 원래 도전은 GLM 5.3 Flash만 사용하는 것이었는데, 바이브 코딩으로 만드는 내내 Flash가 아닌 버전을 쓰고 있었음. 주의를 기울이지 않아 한 세션이 월간 지출의 4분의 1이자 예산의 150%를 차지한다는 걸 알아차리지 못함. 두 모델의 가격 차이가 큼.
내 실수임. 그래프를 지능 지수와 작업당 비용 비교로 바꿨음. 다만 블로그의 그래프는 실제로 협업할 수 있는 유럽 추론 업체가 제공하는 모델만 남겨서 AA보다 더 좁게 필터링함. 바이브 코딩으로 만든 아주 거친 필터링 도구는 여기 있음. https://pareto-eco-sum.netlify.app/.
GLM 5.3 Flash가 정말 마음에 듦. Hermes의 중앙 오케스트레이터가 호출하는 자체 코딩 에이전트에 연결해 쓰고 있으며, 전용 봇 프로필까지 만들어줬음.
내게 핵심은 한 달간 에이전트 코딩에 68달러라는 것임. 모델 선택이 품질만큼이나 예산의 결정이 되어가고 있음.
2년 안에, 어쩌면 그보다 빨리 오늘날의 최첨단 모델도 이만큼 저렴해질 거라니 놀라움.
이 글은 LLM으로 생성한 걸까? 정확히 왜 실패했는지 예시와 함께 제대로 설명한 부분이 있는지, 내가 잘못 읽은 건지 모르겠음.
GLM 5.3 Flash 리뷰를 기대하고 들어갔는데, 실제로는 9월 한 달 동안 이 모델만 써보려던 도전을 돌아보는 글에 가까움.
실패한 이유는 실수로 다른 모델을 써서 바이브 코딩에 4억 5천만 토큰을 소비했고, GLM 5.3 Flash가 가끔 느려 Deepseek나 Qwen으로 전환했으며, 연구개발과 벤치마크에도 다른 모델이 필요했기 때문임. 느린 이유는 모델이 좋아서 제공 업체에 사용자가 몰렸기 때문이라고 추측함.
도전에서 얻은 교훈은 로컬 사용량을 더 잘 측정하고, 목표 범위를 제한한 에이전트 오케스트레이션을 실험하며, 연구개발용 다른 모델은 집계에서 제외하자는 것임. Jev를 써보고 저렴한 개방형 모델과 비교할 최상위 모델 실험도 포함하려고 함. GLM 5.3 Flash는 일상 업무에 쓸 만할 가능성이 높다는 정도이며, 더 자세한 평가는 다음 달로 미룸.
성능에 관한 설명은 모호하고 GPU 가용성에 대한 추정처럼 보이는데, 어느 추론 업체를 쓰는지도 명확하지 않음. ZAI라면 공개적으로 밝힌 내용을 볼 때 글의 가정이 적용되지 않을 것 같고, 다른 업체라면 가능할 수도 있음.
두 번째 이유는 사실상 그냥 그렇게 하지 않기로 선택했다는 것처럼 보임. 실용적으로 얻을 내용이 거의 없음. 이 모델의 전반적인 성능을 꽤 좋아해서 리뷰를 기대하고 들어갔기에 아쉬움.
결국 가끔 느리고 다른 모델도 써보고 싶어서 한 달 동안 GLM만 쓰지 못했다는 내용임. 그렇다면 모델보다 서비스의 속도가 조금 느리다는 것이 사실상 유일한 불만인 셈임.
최근 DGX Spark 클러스터에서 GLM5.3-Flash의 속도 개선이 무척 반가움. 대화하는 느낌이 Opus 4.5 무렵에 상당히 가까워졌음. 일관성은 아직 부족하지만 사용 경험은 아주 좋고, 제약이 적으며 거부 반응을 제거한 고품질 변형 모델도 있어 활용성이 더 높아짐.
다만 Qwen3.8-Flash-Next는 더 적은 자원으로 거의 같은 수준에 도달해서 Qwen4가 정말 기대됨.
나도 드디어 Spark 두 대에서 GLM 5.3 Flash를 쓸 만하게 돌리게 됨. 아주 빠르지는 않지만 sol 6.1보다는 빠르고 감당할 만함. 반면 Qwen 3.8은 Spark 두 대에서 정말 잘 돌아가며, 동시 세션 3~4개를 각각 초당 40토큰 이상으로 안정적으로 처리할 수 있음.
좋은 발전이지만 비용 효율이 높다고 하기는 어려움. OPUS 5.5도 상당히 훌륭함. 그래도 4.5가 처음 나왔을 때의 감동에 비할 수는 없음. 추수감사절 무렵이었는데 정말 굉장했음.
GLM5.3-flash는 “X 기능이 왜 잘못됐는지 보고 고쳐줘”처럼 모호하게 요청해도 작은 수정 작업을 아주 잘 처리해줌.
기존 Z.ai 코딩 요금제의 GLM 5.3 Flash와 DGX Spark 비슷한 로컬 장비의 Qwen 3.8 Flash를 함께 쓰니 Anthropic/OpenAI 구독은 거의 쓰지 않게 됨. 조만간 해지할 것 같음.
GLM-5.3으로 계획을 세우고 GLM-5.3-flash로 구현함. 실무용으로 아주 든든하며, GLM 사용 한도가 떨어지면 구현 모델을 DS-4.1-flash로 바꿈.
조금 엉뚱한 도전이었고 얼마나 현실적으로 가능할지도 몰랐지만, 사용량과 비용을 좌우하는 요인과 둘을 통제하는 방법을 많이 배움.
가장 많이 쓴 두 모델인 Flash와 일반 버전은 어떻게 달랐을까? 서로 다른 작업에 사용했는지도 궁금함.
AI 자동 생성 콘텐츠
본 콘텐츠는 GeekNews의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기