
OpenAI가 2027년 1월에 파인튜닝 (Fine-Tuning)을 종료합니다. 대신 어디에서 학습해야 할까요?
요약
OpenAI가 2027년 1월까지 파인튜닝 지원을 단계적으로 종료할 예정입니다. 이에 따라 기존 모델들의 지원 중단 일정을 확인하고, 파인튜닝이 필요한 작업과 RAG 등으로 대체 가능한 작업을 구분하여 적절한 대안을 준비해야 합니다.
핵심 포인트
- OpenAI 파인튜닝 서비스는 2027년 1월 최종 종료 예정
- gpt-3.5-turbo, gpt-4 등 주요 모델은 2026년 10월 중단
- 지식 습득은 RAG로, 출력 형식 제어는 파인튜닝으로 구분 필요
- SFT, DPO 등 목적에 맞는 파인튜닝 방법론 고려 필요
OpenAI의 지원 종료 (deprecations) 페이지를 가서 읽어보세요. 이에 대한 블로그 포스트가 아니라, 2026년 5월 7일 자의 해당 페이지 자체를 말하는 것입니다. 만약 귀하의 조직이 파인튜닝 (fine-tuning) 작업을 한 번도 실행한 적이 없다면, 새로운 작업을 시작할 수 없습니다. 2026년 7월 2일 이후부터, 새로운 작업은 이전 60일 이내에 파인튜닝된 모델에 대한 추론 (inference)이 이루어져야 합니다. 2027년 1월 6일에는 모든 사람에게 그 문이 닫히며, 파인튜닝된 gpt-3.5-turbo, gpt-4, gpt-4.1-nano, babbage-002 및 davinci-002는 2026년 10월 23일에 작동이 중단됩니다.
저는 모든 가격 정보를 제공업체의 자체 페이지에서 가져와 DevToolLab에서 전체 비교 자료를 정리했습니다. 이것은 압축된 버전입니다. 왜냐하면 헤드라인이 널리 알려질 가치가 있기 때문입니다: 업계에서 가장 눈에 띄는 파인튜닝 (fine-tuning) API가 은퇴하는 동안, 모든 대안은 지난 12개월 동안 더 저렴해지고 더 좋아졌습니다.
사실이 아닌 동작 (Behaviour, Not Facts)
플랫폼을 쇼핑하기 전에, 정말로 플랫폼이 필요한지 확인하십시오. 파인튜닝 (fine-tuning)은 모델이 동작 (behave)하는 방식을 바꿉니다. 지식을 설치하는 것이 아닙니다. "모델이 우리의 내부 결제 API에 대해 들어본 적이 없다"는 것은 검색 (retrieval) 문제입니다. "모델이 작업은 이해하지만, JSON을 요청했을 때 계속 산문 (prose)을 반환하거나, 6개 중 잘못된 라벨을 선택한다"는 것은 파인튜닝 (fine-tuning) 문제입니다. 프롬프트 엔지니어링 (prompt engineering)으로는 이를 영원히 거의 해결하지 못한 상태로만 남겨둘 것입니다.
한 가지 필터가 이를 결정합니다: 귀하가 직접 앉아서 원하는 출력값의 예시를 200개에서 1,000개까지 작성할 수 있습니까? 만약 대답이 '아니오'라면, 여기서 멈추십시오. 이 목록에 있는 그 어떤 것도 귀하가 설명할 수 없는 데이터셋을 구원할 수는 없습니다.
네 가지 방법을 간략히 설명하겠습니다. SFT (Supervised Fine-Tuning)는 입력과 이상적인 출력 쌍으로부터 학습하며, 대부분의 실제 요구 사항을 충족합니다. DPO (Direct Preference Optimization)는 한 답변이 다른 답변보다 우수하다는 쌍으로부터 학습하며, 어조나 요약 품질과 같이 취향이 반영되는 작업에 적합합니다. RFT (Rejection Sampling Fine-Tuning), 실제로는 GRPO (Group Relative Policy Optimization)로 구현되는 방식은 시도(attempts)에 점수를 매기는 채점자(grader)를 대상으로 학습하므로, 테스트 스위트를 통과해야 하는 코드와 같이 측정은 가능하지만 직접 작성할 수는 없는 문제에 적합합니다. Distillation (증류)은 서빙 비용을 절감하기 위해 대형 모델의 출력을 소형 모델로 복제하는 방식입니다.
왜 모두가 LoRA를 찾는가
LoRA (Low-Rank Adaptation)는 기본 가중치(base weights)를 동결하고 그 옆에 작은 어댑터(adapter)를 훈련합니다. 핵심은 그 비율에 있으며, 이는 직접 확인하기 쉽습니다. peft 0.20.0 버전을 사용하여 제 노트북에서 실행한 결과는 다음과 같습니다:
from transformers import AutoModelForCausalLM
from peft import LoraConfig, get_peft_model
...
trainable params: 1,843,200 || all params: 136,358,208 || trainable%: 1.3517
가중치의 1.5% 미만이 훈련을 수행합니다. fp16 기준으로 이 어댑터는 3.5 MiB이며, 모델은 260 MiB입니다. 이것이 바로 단일 GPU가 하나의 기본 모델로부터 수십 개의 작업 특화 변형 모델(task-specific variants)을 서빙할 수 있는 이유입니다.
거대 클라우드 기업들이 모두 물러나고 있는 것은 아니다
OpenAI 자체의 모델 최적화 가이드(model optimization guide)는 이제 자사의 파인튜닝(fine-tuning) 자료가 레거시 문서(legacy documentation)로 이동하고 있다고 경고하며, 이는 지원 종료(deprecation) 표가 알려주는 것과 동일한 내용을 전달합니다. 기존 고객을 위해 여전히 작동하는 기능은 다음과 같습니다: gpt-4.1에서의 SFT 및 DPO, mini 및 nano 모델, gpt-4o-2024-08-06에서의 비전 튜닝(vision tuning), 그리고 o4-mini-2025-04-16에서의 RFT뿐입니다. 훈련 비용은 gpt-4.1의 경우 100만 토큰당 $25, mini는 $5, nano는 $1.50이며, RFT는 핵심 훈련 시간당 $100가 청구됩니다. GPT-5 모델은 한 번도 파인튜닝이 가능했던 적이 없으며, 마이그레이션 노트는 여러분을 튜닝되지 않은 gpt-5.4-mini 및 gpt-5.5로 안내합니다.
Microsoft는 동일한 모델 제품군을 가지고 반대의 길을 택했습니다. Foundry는 데이터 거주성 (Data Residency)을 대가로, 표준보다 낮은 토큰당 비용으로 13개 지역에 걸친 글로벌 트레이닝 (Global Training)을 통해 o4-mini에 대한 RFT (Rejection Fine-Tuning)를 실행합니다. GPT-4.1, mini 및 nano가 채점자 (Graders) 역할을 수행하며, Microsoft의 자체 권장 사항은 nano로 먼저 채점하는 것입니다. 만약 종료 일정이 정해지지 않은 관리형 OpenAI 제품군 튜닝이 필요하다면, 이것이 가장 짧은 이동 경로입니다.
Google은 Vertex 튜닝 비용을 데이터셋 토큰 수에 에포크 (Epochs)를 곱한 방식으로 청구하며, 그 후 튜닝된 엔드포인트 (Endpoint)를 서비스하는 데 기본 요율보다 높은 비용을 부과하는데, 이 부분이 청구 시점에 사람들을 놀라게 하는 부분입니다. Gemini 3.x 튜닝은 공개적인 셀프 서비스 (Self-serve) 방식보다는 프리뷰 (Preview) 및 허용 목록 (Allowlist)을 통해 제공되어 왔으므로, 계획을 세우기 전에 어떤 스냅샷 (Snapshot)이 실제로 튜닝 가능한지 확인하십시오.
AWS는 오픈 웨이트 (Open weights)를 메인 이벤트로 취급함으로써 가장 흥미로운 도박을 했습니다. Bedrock은 2026년 2월 17일에 Qwen3-32B 및 gpt-oss-20b에 대한 RFT를 추가했으며, 튜닝된 모델은 OpenAI 호환 응답 (Responses) 및 채팅 완료 (Chat Completions) 엔드포인트를 통해 즉시 답변합니다. SageMaker AI는 2026년 3월 25일, 버지니아 북부, 오리건, 도쿄 및 아일랜드에서 gpt-oss-120b 및 Qwen3 14B를 포함한 12개의 오픈 모델에 대해 서버리스 SFT (Supervised Fine-Tuning), DPO (Direct Preference Optimization) 및 RFT를 지원하며 그 뒤를 이었습니다. Anthropic은 공백 상태입니다. 공개 Claude API에는 파인튜닝 (Fine-tuning)이 전혀 없으며, Bedrock이 노출하는 Claude 모델에 대한 커스터마이징 (Customisation)만 가능합니다.
전문가들의 가격 경쟁
Together AI는 다른 모든 곳과 비교할 벤치마크 기준이 되는 수치를 제시합니다: 16B 이하의 LoRA (Low-Rank Adaptation)에 대해 100만 트레이닝 토큰당 $0.48, 17B에서 69B까지는 $1.50, 70B에서 100B까지는 $2.90이며, 풀 파인튜닝 (Full fine-tuning)과 DPO도 사용 가능합니다. Fireworks AI는 16B까지는 거의 동일한 $0.50로 시작하지만, 80B에서는 $3.00, 300B에서는 $6.00까지 상승합니다. 따라서 어떤 브랜드인지는 중요하지 않으며, 실제로 훈련하고자 하는 모델의 크기가 어느 쪽이 더 저렴할지를 결정합니다.

GPU를 직접 관리(babysitting)하지 않으면서도 제어권을 갖고 싶다면, 저는 Thinking Machines Lab의 Tinker를 선택할 것입니다. 이 서비스는 GPU 시간당 비용이 아닌 100만 토큰당 비용을 측정합니다. Qwen3-8B의 경우 2026년 7월 17일에 $0.40에서 $0.44로 이동했으므로, 5,000만 토큰 실행 시 약 $22가 소요되며 여기에 체크포인트(checkpoint)당 GB-월별 $0.10가 추가됩니다. 이 서비스는 rank 32의 LoRA만 수행하며, 일반적인 PEFT 어댑터를 내보내기(export)하므로 떠날 때 비용이 들지 않습니다.
Predibase는 추천이라기보다 주의 사항에 가깝습니다. GRPO는 16B 모델까지 100만 토큰당 $10, 그 이상의 32B 모델은 $20가 소요되며 관대한 무료 서버리스 추론 (serverless inference)을 제공하지만, 2025년 6월부터 Rubrik의 소유가 되었고 2026년 8월 기준으로 predibase.com은 더 이상 자체 사이트를 운영하지 않습니다. 현재 Rubrik Agent Cloud로 리다이렉트(redirect)됩니다. 이를 기반으로 로드맵을 구축하기 전에 해당 제품이 여전히 독자적으로 판매되고 있는지 확인하십시오. 원문 게시물에서 이 모든 서비스의 전체 가격표를 나란히 비교해 볼 수 있습니다.
또는 청구서 자체를 건너뛰기
GPU 한 대, 혹은 한 대를 대여한 한 시간만 있다면, 무료 툴링(tooling)이 이 카테고리에서 가장 빠른 경로입니다. Unsloth 2026.8.3은 처리량(throughput) 전문가입니다. GRPO는 대략 1.3배 더 빠르고, 전문가 혼합(Mixture-of-Experts, MoE) 학습은 3~5배 더 빠르며, 강화학습 (Reinforcement Learning, RL) 시 VRAM 사용량을 최대 80%까지 줄여줍니다. 이것이 바로 GRPO를 소비자용 그래픽 카드에서도 실행 가능하게 만드는 핵심입니다. Axolotl 0.18.0은 모든 실행 과정을 YAML 파일에 기록하므로, 학습 변경 사항이 아무도 재현할 수 없는 노트북(notebook) 대신 검토 가능한 diff 형태로 제공됩니다. LLaMA-Factory 0.9.5는 100개 이상의 모델을 지원하며 가장 넓은 모델 범위를 자랑하며 UI를 함께 제공합니다. 이 모든 도구의 밑바탕에는 TRL 1.9.2와 PEFT 0.20.0이 자리 잡고 있으며, 만약 학습 루프(loop)를 직접 제어하고 싶다면 이들은 SFT, DPO 및 GRPO 트레이너(trainer)를 직접 노출합니다.
여러분이 물려받는 것은 GPU, CUDA 버전, 그리고 평가 하네스(evaluation harness)입니다. 합리적인 분할 방식은 다음과 같습니다: 먼저 호스팅된 플랫폼을 대여하여 아이디어가 실제로 작동하는지 확인한 다음, 동일한 작업이 매주 반복될 때 인하우스(in-house)로 전환하는 것입니다.
계량기가 돌아가기 전에 데이터셋을 확인하세요
학습은 토큰(token)당 비용이 청구되므로, 손상된 JSONL 파일은 실험을 망치기 전에 돈부터 낭비하게 만듭니다. 아래 코드는 어떤 리포지토리(repo)에도 붙여넣을 수 있을 만큼 짧으며, 아래 출력 결과는 의도적으로 손상된 6행 파일에 대해 실제로 실행한 결과입니다:
import json, sys, tiktoken
enc = tiktoken.get_encoding("o200k_base")
...
line 5: unusable - no assistant turn
line 6: unusable - 'messages'
6 rows, 2 unusable, 53 dataset tokens
...
비율을 바꾸면 토큰 수가 견적(quote)이 됩니다. 현실적인 예시를 들어보겠습니다: 평균 400 토큰인 5,000개의 예시, 3 에포크(epoch)를 수행하면 총 6백만 개의 학습 토큰이 필요합니다. 이는 Together의 LoRA 티어에서 $2.88, Tinker에서 $2.64, gpt-4.1-mini에서 $30, 그리고 전체 gpt-4.1에서 $150입니다. 돈이 들어가는 곳은 작은 오픈 모델이 아닙니다. 그것들을 부주의하게 서빙(serving)하는 곳이 돈이 나가는 곳입니다.
업로드하기 전에 수행할 가치가 있는 두 가지 정리 단계가 있습니다. 학습 데이터는 몇 달 동안 보관할 수도 있는 체크포인트 (checkpoint) 내부에 포함되기 때문입니다. PII Redactor를 사용하여 개인정보를 제거(scrub)하고, Remove Duplicate Lines를 사용하여 중복을 제거하세요. 거의 동일한 행들은 비용을 부풀릴 뿐만 아니라, 모델이 두 번 붙여넣은 내용을 과도하게 가중치(over-weight)를 두도록 학습시키기 때문입니다.
팀들이 건너뛰는 단계
학습 실행 중에 절대 보지 못하도록 예시의 10~20%를 평가 세트 (evaluation set)로 따로 떼어 두십시오. 그런 다음 기본 하이퍼파라미터 (hyperparameters)로 작업을 한 번 실행하고, 그 결과를 좋은 프롬프트 (prompt)를 사용한 튜닝되지 않은 베이스 모델 (base model)과 비교하십시오. 이 단 한 번의 비교가 유일하게 중요한 증거이며, 때로는 프롬프트가 괜찮다는 결과가 나오기 때문에 사람들이 생략하는 단계이기도 합니다.
튜닝된 모델이 승리한다면, 이를 배포하고 요청당 비용 (cost per request)을 모니터링하십시오. 만약 그렇지 않다면, 해결책은 거의 항상 다른 벤더 (vendor)를 찾는 것이 아니라, 더 많거나 더 나은 예시를 사용하는 것입니다.
내가 실제로 할 일
여전히 로드맵에 튜닝이 포함되어 있는 OpenAI를 사용 중이라면, 2027년 1월 6일을 변경 불가능한 날짜로 간주하고 지금 목적지를 정하십시오. Foundry는 변화가 가장 적고, Together나 Tinker는 오픈 모델 (open model)을 사용하여 비용이 가장 적게 들며 결정 이후에도 오래 지속됩니다.
작은 규모의 작업에서 최저가를 찾는다면: Together가 $0.48이며, Fireworks를 두 번째 견적으로 고려하십시오. 16B 미만에서는 차이가 몇 센트 수준이므로, 어떤 베이스 모델이 제공되는지를 기준으로 선택하십시오.
출력값의 점수는 매길 수 있지만 직접 작성할 수는 없는 경우: 이는 RFT (Rejection Sampling Fine-Tuning)의 사례이므로, AWS의 Bedrock 또는 SageMaker를 사용하거나, 자체 구축을 원한다면 TRL 및 Unsloth의 GRPO를 사용하십시오.
파인튜닝 (fine-tuning)이 정답인지조차 확실하지 않은 경우: 아직은 아닐 가능성이 높습니다. 더 나은 프롬프트를 작성하고, 그다음 검색 (retrieval)을 적용한 뒤, 작동하는 프롬프트를 더 작은 모델로 증류 (distil)하십시오.
참고 문헌
- 2026년 최고의 AI 파인튜닝 (Fine-Tuning) 플랫폼: 호스팅 및 오픈 소스 비교 - 전체 가격표와 모든 출처가 포함된 원문
- OpenAI 지원 종료 (deprecations) 및 모델 최적화 가이드 (model optimization guide)
- Microsoft Foundry 파인튜닝 (fine-tuning)
- Amazon Bedrock 및 SageMaker AI
- Together AI, Fireworks AI, Tinker
- Unsloth, Axolotl, LLaMA-Factory, TRL, PEFT
- LLM 평가 가이드 (LLM Evals Guide) - 튜닝이 도움이 되었는지 결정하는 비교를 실행하는 방법
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기

