500달러로 미세조정한 9B 오픈 모델, 카탈로그 검수에서 프런티어 모델 능가
요약
500달러의 저렴한 비용으로 미세조정한 9B 오픈 모델이 특정 카탈로그 검수 작업에서 프런티어 모델을 능가할 수 있음을 분석합니다. 소형 오픈 가중치 모델의 발전이 거대 모델 중심의 경제성을 위협할 수 있다는 전망을 다룹니다.
핵심 포인트
- 저렴한 미세조정 모델이 특정 용도에서 초거대 모델보다 효율적일 수 있음
- 모델 학습 비용보다 데이터 생성 및 품질 유지 비용이 훨씬 높음
- 소형 오픈 가중치 모델의 표준화는 대형 연구소의 비즈니스 모델에 위협이 됨
- 정확도가 임계치에 도달하면 고비용 범용 모델 대신 저렴한 특화 모델로 이동함
대형 연구소들이 놓치는 핵심은 대부분의 용도에 박사 50명 수준의 지식과 12개 언어 능력이 필요하지 않으며, 비용 제약이 훨씬 중요하다는 점임
오픈 가중치 모델과 저렴한 미세조정이 보편화되면 초거대 모델과 부채로 조달한 대규모 인프라의 경제성이 무너짐
정치나 중국 위협론은 표면적 명분일 뿐이며, 소형 오픈 가중치 모델이 표준이 되면 대형 연구소는 살아남기 어려움
범용 용도는 광범위하게 학습된 모델의 도움을 많이 받음. 사전에 구체적인 용도를 모르면 세계 지식을 갖춰야 하며, 코딩에서도 제품 의도와 사용 방식을 이해하는 데 이 지식이 유용함
미세조정에서 진짜 비싼 부분은 좋은 데이터셋 수집이고, 깔끔한 데이터가 있어도 평가를 실행하고 품질을 측정할 역량이 필요함
엔지니어링·데이터 라벨링·지속적인 품질 검토 비용까지 합치면 처음부터 잘 작동하는 최첨단 연구소 모델을 계속 쓰는 편이 더 저렴한 용도도 많음
대부분의 회사가 여전히 필요한 소프트웨어 엔지니어 대신 갑자기 AI 연구자를 찾기 시작했다는 점에서도 같은 현상이 보임
약 10년 전 FAANG 면접 방식이 공개되자 모두가 그대로 따라 했던 모습과 비슷함
더 효율적인 초소형 모델이 등장하면 지금은 보이지 않는 변화도 많이 드러날 것임
그렇게 많은 매개변수가 필요하지 않음을 증명하려고 TinyToT를 만들고 있음
기사 표처럼 전체 작업량이 분류된 항목 1,000개, 품질 기준이 70%라면 맞춤 미세조정에 500달러와 시간을 쓰기보다 Gemini API에 19달러를 내는 편이 낫지 않나 싶음
이런 이야기를 볼 때마다 두 가지가 걸림
첫째, 기존 모델을 더 잘 활용하거나 아무것도 하지 않고 기다리는 전략이 재학습보다 나은 결과를 내는 경우를 여러 번 봤음. 비교 대상은 현재의 최첨단 모델이 아니라 미세조정 모델을 유지하는 동안 출시될 다음 모델이어야 함
둘째, 학습비 500달러는 가장 저렴한 항목이며 데이터 생성과 이후 모델 유지가 훨씬 비쌈. 점수가 매겨진 17만7천 개 에피소드를 실제로 만들 수 있는 용도가 얼마나 될지 의문임
여기서는 Amazon Berkeley Objects로 합성해야 했는데, 자연스럽게 존재했다면 만들 필요도 없었을 이 데이터셋 자체가 미세조정 적용의 어려움을 가장 잘 보여줌
기다리는 동안 발생하는 비용이 학습·유지 비용보다 크다면 이 접근은 여전히 타당함. 저렴한 오픈소스 모델의 발전 속도에 따라 일시적인 전략일 수 있지만 충분히 가치가 있음
GPU 같은 특화 하드웨어가 CPU 발전 후에도 쓰이듯, 특화 모델은 범용 모델보다 비용이나 결과 측면에서 계속 우월할 가능성이 큼
초기 학습이 500달러라면 지속 학습 자체는 비교적 저렴함. 데이터 변화에 맞춘 새 예제 생성은 더 비싸지만 다음 모델 학습에 재사용할 수 있고, 모델과 프롬프트 변경을 평가하려면 어차피 어느 정도 필요함
결국 데이터 생성·학습 비용이나 데이터 부족 때문에 항상 타당한 것은 아니며, 기사 도표처럼 빈번하고 검증 가능한 작업에서만 적합함. 수백만 건의 의사결정을 처리하는 대기업에만 현실적일 수도 있음
공개되지 않은 하이퍼파라미터 시행착오까지 포함하면 학습 실행에만 5,000달러 이상 들었을 것이 확실해 보임
최첨단 모델 추론에 가장 많은 돈을 쓰는 세계적 기업 다수는 이미 비싼 부분인 라벨링된 데이터셋을 보유하고 있음
데이터셋과 모델 유지 비용도 Braintrust나 Hugging Face 같은 스타트업을 통해 범용 서비스화되고 있음
여기서 말하는 모델 유지가 구체적으로 무엇을 뜻하는지 궁금함
최첨단 모델은 스스로 일자리를 없애는 데 매우 뛰어남
이미 GPT에서도 Luna가 Sol 용도의 90%를 처리함. 중국이 여전히 모델 증류에 공을 들이는 이유는 정확한 학습 데이터 생성이며, OpenAI와 Anthropic은 법적 문제를 피하면서 이를 모으는 데 수년을 썼음
모델이 똑똑해질수록 충분히 일을 해내는 저렴한 대안으로 이동하게 됨. 정확도가 이미 99%라면 최첨단 모델을 쓸 실익이 거의 없으며, 이것이 미국 연구소의 가장 큰 위험으로 보임
최상위 모델의 핵심 용도는 코딩임. Terra를 최고 추론 수준으로 설정해 코드를 작성하게 하면 Sol이 수많은 버그를 찾아 코드를 철저히 해부함
그 외 작업에는 더 저렴한 모델을 써도 충분함
이는 기술의 일반적인 S자 곡선과 같음. AI 추론 능력의 발전이 실제로 둔화했는지는 논외로 해도 React 프런트엔드 작성이라는 실용적 목적에서는 이미 둔화한 셈임
2018년쯤 산 LCD TV를 바꿀 생각이 없는 것처럼 다른 기술도 비슷함
기술은 새 기술을 대체하거나 빈 영역에 침투하는 경향이 있지만, 인간 상호작용 같은 비기술 영역을 대체하는 일은 드묾. 화면 앞에서 하는 여가 활동도 대체로 준사회적 관계를 향하고 있음
충분히 복잡하거나 규모가 큰 코드에는 Sol 외의 모델이 부족함
Terra와 Sol의 차이를 잘 느끼지 못하지만 항상 Sol을 사용함. 중간 추론과 최고 추론의 차이도 그다지 명확하지 않게 느껴짐
오픈 모델 미세조정에 관심이 많아 직접 추천할 만한 자료를 찾고 있으며, 이 글도 자세히 읽으려고 저장해 둠
Nemotron-3-Nano 30B를 로컬에서 실행했고 300억~1,200억 매개변수 모델을 목표로 삼고 있음. 기본 모델만으로도 실질적 가치를 낼 만큼 충분하지만, 특화 작업은 학습으로 마지막 간극을 넘을 수 있다고 봄
저자가 전체 과정을 고민한다는 점이 특히 좋으며, 같은 용도와 가치 창출 전략을 확인할 수 있었음. 장기 프로젝트라 미세조정용 하드웨어도 구매할 계획임
어떤 하드웨어를 쓰며 초당 토큰 생성 속도가 어느 정도인지 궁금함. 메모리 128GB인 고성능 MacBook에서도 로컬 모델의 생성 속도는 늘 매우 실망스러웠음
Ramp 글은 읽지 않았지만 사후 오류처럼 보임. 매출이 2배인 회사는 AI에 쓸 돈이 있고, 1.15배인 회사는 그렇지 않을 뿐일 수 있음
AI를 많이 쓰는 회사가 대규모 성숙 기업보다 민첩한 성장 단계 기업일 가능성이 훨씬 높다는 해석도 가능함
소형 LLM이나 BERT 같은 더 작은 언어 모델을 미세조정하는 방식은 LLM 등장 초기부터 권장됐음. 실행이 빠르고 전체 기술 구성을 통제할 수 있으며 맞춤 도메인에 더 잘 맞는다는 장점이 분명함
하지만 대형 언어 모델 API가 여전히 저렴하고 충분히 빠르며 계속 개선되기 때문에 실제 미세조정은 많지 않음. 시간과 돈을 들여 특화 모델을 출시하자마자 새 범용 모델이 이를 넘어설 수 있기 때문임
언젠가 LLM 발전이 둔화하거나 API 가격이 감당하기 어려워지면 미세조정과 소형 모델의 시대가 다시 올 것임
결국 S자 곡선의 그 지점에 도달할 것으로 봄. 많은 회사의 방어력은 자체 프로세스와 데이터에서 나오며, 직접 호스팅하는 미세조정 모델은 갈수록 영업비밀로 간주될 수 있음
미세조정 자체도 매우 어렵고, 좋은 결과를 내려면 많은 데이터가 필요함
모델을 언제 미세조정하고 언제 최첨단 모델을 쓸지 보여주는 2×2 격자가 마음에 듦
다만 평가기가 각 에피소드의 점수를 어떻게 정했는지는 불분명함. 최첨단 모델이 채점했다면 미세조정 모델이 그 모델보다 작업을 잘하게 된 뒤에도 평가가 유효할지 궁금함
먼저 Kimi K3 같은 더 큰 오픈 모델에서 도메인 특화 작업 흐름의 전체 확률분포를 증류한 뒤, 결과에 자체 비공개 강화학습 파이프라인을 적용하면 도움이 됨. 우리는 GLM 5.2를 이용해 영어→SQL용 비공개 27B 모델을 만들었고 Fable보다 좋은 결과를 얻었지만 설명 능력은 사라졌음
고도로 특화된 영역에서는 비용의 극히 일부로 최첨단 모델을 넘기 어렵지 않음. 자체 강화학습 파이프라인이 없어도 증류만으로 큰 비용을 절약할 수 있고, 27B 모델이 해당 작업에서는 3T 모델에 가까워질 수 있음
다만 전문가 모델에 맞지 않을 만큼 야심 찬 작업에는 통하지 않을 가능성이 큼
AI 자동 생성 콘텐츠
본 콘텐츠는 GeekNews의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기