GPT-OSS가 오늘로 출시 1주년을 맞이했습니다!
요약
GPT-OSS 출시 1주년을 맞아 20B 및 120B 모델의 성능을 분석합니다. Qwen 3.5 및 Nemotron 3 Super와 비교하여 GPT-OSS 120B의 속도와 로컬 친화적 형식(MXFP4)의 우수성을 강조합니다.
핵심 포인트
- GPT-OSS 120B는 Qwen 3.5 122B보다 빠르고 효율적임
- MXFP4와 같은 로컬 친화적 QAT 형식을 지원함
- Nemotron 3 Super 및 Mistral 4 Small 대비 우수한 성능과 아키텍처 보유
- 도구 호출 및 토큰 스머글링 방지가 개선된 Jinja 템플릿 공유
GPT-OSS는 20B 및 120B 버전 모두 지금까지 출시된 로컬 모델 중 최고 중 하나입니다. 저는 항상 이 모델로 돌아오게 되는데, 특히 120B 버전이 그렇습니다. 제 생각에 유일한 경쟁 상대는 Qwen 3.5 122B이지만, 그 모델은 훨씬 느리고 (A10B), 로컬 친화적인 QAT 형식(예: MXFP4)으로 출시되지 않았습니다. Nemotron 3 Super는 실망스럽습니다. 성능은 비슷하며 더 나은 아키텍처를 가진 GPT-OSS 120B의 클론처럼 느껴집니다. 또한 (A12B이기 때문에) 더 느립니다. NVIDIA는 본질적으로 더 느린 GPT-OSS 120B 클론을 만든 셈입니다. Mistral 4 Small도 비슷한 문제를 가지고 있습니다. 확실히 더 똑똑하지는 않으며, 다만 (좋든 나쁘든) 생각을 덜 할 뿐입니다. OpenAI는 훌륭한 모델을 만들었으며, 언젠가 후속 모델을 출시하기를 바랍니다. 그동안, 제가 GPT-OSS Jinja 템플릿을 개선하려고 시도한 결과물이 유용할 수도 있습니다. 이는 주로 Unsloth 버전을 기반으로 하여 (도구 호출(tool calls)이 올바르게 작동함) 다른 곳에서 가져온 TypeError 수정 사항을 포함하고 있으며, 추가적인 무결성 검사(sanity checks) 및 설정 가능한 토큰 스머글링(token smuggling) 방지 기능을 통합했습니다. 누군가 저의 이 미천한 기여가 유용하다고 느끼길 바랍니다: https://huggingface.co/arbv/gpt-oss-fixed-jinja-template 대단한 것은 아니지만, 정직한 작업입니다. submitted by /u/arbv [link] [comments]
AI 자동 생성 콘텐츠
본 콘텐츠는 r/LocalLLaMA의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기