
Qwen 개발자들의 최근 Twitter/X AMA 답변 내용
요약
Qwen 개발팀의 AMA를 통해 곧 출시될 27B 모델의 성능과 비디오 이해 기술에 대한 정보를 공유합니다. 27B 모델은 완전히 새로운 역량을 갖출 예정이며, 계층적 비디오 메모리 시스템을 통해 장시간의 비디오 추론을 지원합니다.
핵심 포인트
- 곧 출시될 Qwen 27B 모델은 이전 모델과 차별화된 새로운 역량을 약속함
- 비디오 이해를 위해 에이전트 스웜 대신 계층적 비디오 메모리 시스템 활용
- Qwen 3.8 모델은 총 2.4T 파라미터 중 95B의 활성 파라미터를 가짐
- 사후 학습 과정에서 막대한 컴퓨팅 자원을 투입한 강화학습 수행
질문과 답변(굵은 글씨)은 아래와 같습니다. 가장 좋았던 질문들은 중복을 제거하고 답변을 통합하여 스레드 끝으로 옮겼습니다. 여러분, 낙관적으로 생각하세요. 27B 외에도 다른 모델들이 나올 것이라고 확신합니다. 그리고 27B는 출시될 때 엄청난 반향을 일으킬 것입니다. (그들의 답변에 기반함) 트윗 스레드: https://xcancel.com/QwenDevs/status/2084102417885585597#m
지난번에는 27B와 122B를 건너뛰셨는데, 이번에는 기대해도 될까요? 또한 카드에서 Crit Pit 점수를 찾을 수 없는 것 같습니다.
물론입니다! 실제로 곧 27B 모델을 출시할 예정입니다. 채널을 고정해 주세요. Crit Pit 점수에 대해서는 공식적인 Artificial Intelligence 점수를 기다려 주시기 바랍니다.
27B는 단순히 재학습된 3.6 27B인가요? 아니면 더 큰 형님 격인 3.8을 기반으로 하나요?
이 27B는 완전히 새로운 수준의 역량을 갖추고 있음을 약속드립니다!
100시간의 비디오 이해(Video understanding)는 비디오 섹션을 병렬로 분석하고 일종의 의미론적 표현 그래프(semantic representation graph)를 오케스트레이션하는 에이전트 스웜(agent swarm)인가요?
넓게 말하면 그렇지만, 전적으로 그렇지는 않습니다. 전통적인 에이전트 스웜보다는 계층적 비디오 메모리 시스템(hierarchical video memory system)에 더 가깝습니다. 비디오 세그먼트들은 장면, 엔티티, 이벤트 및 그들의 시간적 관계를 포함하는 구조화된 텍스트 그래프로 인코딩되어, 100시간 이상의 콘텐츠에 걸친 검색과 추론을 가능하게 합니다.
헤이! 다른 연구소(labs)의 모델들과 비교했을 때 사전 학습(pretraining) 분포에 특별한 점이 있나요?
우리의 데이터가 더 탄탄한 기반 위에 구축되기를 희망합니다!
Anthropic 수준의 아키텍처를 넘어서는 데 얼마나 걸릴 것이라고 생각하시나요?
글쎄요, 열심히 노력하고 있다고 약속드립니다😇
Qwen Code 전용 하네스(harness)를 출시할 계획이 있나요??? Codex와 같은 앱에 대한 계획이 있나요?
Qoder와 QwenWork에 대한 더 많은 업데이트가 곧 예정되어 있습니다.
Qwen 3.8의 활성 파라미터(active params)는 얼마인가요?
2.4T 파라미터 (활성 95B)
이전 모델들과 비교했을 때 사후 학습(post training)에서 강화학습 (RL)이 얼마나 수행되었나요?
정말로 비합리적일 정도의 컴퓨팅 자원이 투입되었습니다.
이전의 Qwen3.7 27B와 35B A3B를 의도적으로 건너뛴 것인가요? Qwen3.8 27B의 부활이 커뮤니티의 목소리를 반영한 것인가요?
아니면 계획된 것이었나요? 물론입니다! 이는 커뮤니티의 목소리를 진지하게 받아들인 결과입니다. 이번 릴리스는 상당히 중요한 출시인데, 전체 세부 사항이 담긴 기술 보고서 (technical report)를 받을 수 있을까요? 이번 모델에 대한 기술 보고서는 아직 없습니다. 하지만 저희는 거의 매달 이어지는 출시 주기 (release cadence)를 유지하려고 노력하고 있으며, 더 강력한 모델들이 이미 개발 중입니다. 계속 지켜봐 주세요! 왜 모델이 이렇게 생각을 많이 하나요, Mr. Qwen, 제 AI 뇌가 궁금해하네요. 토큰 효율성 (token efficiency)은 어디에 있나요? 그래도 훌륭한 모델이네요. 저희는 다양한 수준의 추론 노력 (reasoning effort)을 지원합니다. Qwen-scope를 통해 SAE 유도 미세 조정 (SAE-guided fine tuning)이 코드 스위칭 (code switching)을 수정하는 것을 보여주셨습니다. 그런 해석 가능성 기반의 개입 (interpretability driven intervention)이 이제 사후 학습 (post training) 프로세스의 일부인가요, 아니면 여전히 연구 전용 기술인가요? 현재로서는 여전히 주로 연구 지향적인 기술이지만, 일부 통찰력은 향후 학습 및 사후 학습 개선에 도움이 될 수 있습니다. 어텐션 (Attention)? 하이브리드 (Hybrid)? 모델 아키텍처 (model architecture)는 3.5와 유사하지만, 훨씬 더 큰 규모의 모델입니다! CLI 코딩 인터페이스는 언제쯤 나올까요? @qoder_ai_ide 를 확인해 보시는 것을 추천합니다. 여러분은 Qwen을 주요 내부 도구로 사용하시나요? 이 모델이 일부 OpenAI 모델들과 동일한 지능의 징후를 보이나요 ("gpt 5.5가 5.6을 만드는 데 도움을 주었다")? 물론입니다! Qwen3.8-27B는 GPT 5.4와 얼마나 가깝나요? 🤔 음, 곧 직접 확인하실 수 있을 것입니다. 어떤 하네스 (harness)가 Qwen과 가장 잘 작동하나요? Qwen은 모든 하네스에서 가능한 최상의 경험을 제공하기 위해 전념하고 있습니다. 왜 최대 가중치 (max weights)를 오픈 소스로 공개하고 싶었나요? 커뮤니티가 무엇을 요구하고 있는지 들었기 때문입니다. 제가 언제쯤 fable5를 넘어설 수 있을지 궁금하네요. 열심히 노력 중입니다. 정말 멋진 작업입니다 🥂 새로운 모델과 그 기능으로 무엇이 만들어지는 것을 보고 싶으신가요!? 저는 애플리케이션 구축을 위해 에이전트 군집 (swarm of agents) 기술을 정말 탐구해보고 싶습니다. 새로운 모델을 위한 모범 사례 (best practices)나 팁이 있을까요!? 1. 저희는 이 모델이 다양한 산업 분야의 사람들에게 실질적인 생산성 가치를 가져다줄 수 있기를 바랍니다. 2.
더 많은 병렬화된 워크플로우 (parallelized workflows)나 병렬 실행 (parallel execution) 요구 사항이 포함된 작업에 사용하는 것을 권장합니다. FE (Front-end)를 위해 어떤 루브릭 지표 (rubric metrics)를 사용하고 계신지 알고 싶습니다. 저희는 기능성과 미학 (aesthetics)에 대한 절대적 지표 (absolute metrics)와 승/무/패 (win/tie/loss) 비교에 기반한 상대적 지표 (relative metrics)를 모두 사용합니다. Qwen이 에이전트 워크로드 (agentic workloads)에서 구체적으로 어디가 가장 강하다고 생각하시나요: 긴 문맥 계획 (long-context planning), 도구 사용 신뢰성 (tool use reliability), 코딩 (coding), 아니면 대규모 비용 효율성 (cost at scale) 중 어느 것인가요? 이 모든 것의 결합입니다. 궁극적으로 사용자에게 가장 실용적이고 신뢰할 수 있는 출력을 제공하는 것이 목표입니다. Qwen이 Qwen 연구에 얼마나 도움이 되고 있나요? 이미 모델 반복 (iteration) 프로세스의 중요한 부분이 되었으며, 모델이 거의 모든 단계에 관여하고 있습니다. 대부분의 프런티어 랩 (Frontier labs)들은 코드 특화 모델 (예: Qwen3-Coder 및 GPT-5.3-Codex)을 만들었지만, 이후 후속 작업을 진행하지 않았습니다. 특화된 모델들이 문제를 겪었나요? 아니면 범용 모델 (general models)이 별도의 모델을 만들 필요가 없을 정도로 충분히 효율적이 되었나요? 저희는 올인원 (all-in-one) 모델을 구축하기를 희망합니다. Qwen 3.8은 로컬 에이전트 하네스 (local agent harnesses)가 프롬프트 특화 튜닝 (prompt-specific tuning) 없이 모델을 교체할 수 있도록 안정적이고 문서화된 도구 호출 (tool-calling) 및 구조화된 출력 (structured-output) 규약 (contract)을 제공할까요? 저희는 다양한 프로토콜에 대한 네이티브 지원 인터페이스를 제공합니다. 자세한 내용은 Qwen 블로그에서 확인하실 수 있습니다. 1: Qwen 27B를 로컬 배포를 위해 양자화 (quantizing)할 때 (예: 4-bit GGUF, NVFP4 또는 MXFP4), 어떤 트랜스포머 레이어 (transformer layers)나 비전 어텐션 블록 (vision attention blocks)이 성능 저하에 가장 민감한가요? 시각적 추론 (visual reasoning)과 높은 SWE-bench 통과율을 모두 유지하기 위해 권장하는 특정 전략이 있습니까? 2: Qwen3.6-27B는 SWE-bench 및 Terminal-Bench와 같은 에이전트 코딩 벤치마크에서 훨씬 더 큰 MoE 이전 모델들(예: Qwen3.5-397B)보다 뛰어난 성능을 보입니다. 단순한 데이터 양을 넘어, 이러한 밀도 높은 효율성 (dense efficiency)을 달성하는 데 있어 가장 영향력이 컸던 단 하나의 요인은 무엇이었나요? 그리고 놀라운 작업을 해주셔서 감사합니다. Qwen3.6-27B는 몇 달 동안 저의 주요 코딩 어시스턴트였습니다. 1.
QAT (Quantization-Aware Training)를 사용하거나, 어텐션 (Attention) 레이어의 QKV 선형 투영 (Linear Projections) 및 출력 투영 (Output Projection)은 16-bit로 유지하면서 FFN (Feed-Forward Network)만 4-bit로 양자화 (Quantize) 하세요. 2. 더 높은 품질의 데이터 엔지니어링 (Data Engineering). 여러분, 언제쯤 DeepSeek처럼 성능은 최고이면서 작고 저렴한 모델을 얻을 수 있을까요? DeepSeek v4 Flash는 정말 훌륭한 거래인 것 같습니다. 저는 이제 스케일링 (Scaling) 속도를 늦추고 기존 모델의 효율성을 개선하기 시작해야 한다고 생각합니다. 스케일링과 비용 효율성은 상호 배타적인 것이 아닙니다 — 저희는 두 가지 모두를 계속 추구할 것입니다. Qwen3.8-27B는 밀집 (Dense) 모델인가요? 그리고 3.6-27B보다 대략 얼마나 더 똑똑한가요? 엄청난 도약입니다! 좋습니다. 유용한 질문은 단순히 Qwen이 얼마나 유능한가에 그치지 않습니다. 저는 그것이 여전히 어디에서 실패하는지, 팀이 그러한 실패를 어떻게 평가하는지, 그리고 가중치 (Weights), 도구 (Tooling), 재현성 (Reproducibility) 측면에서 "오픈 (Open)"이 실제로 무엇을 의미하는지 알고 싶습니다. 오픈 모델은 사람들이 허락을 구하지 않고도 한계를 점검하고 그 결과물 위에서 작업을 구축할 수 있을 때 가장 중요합니다. 저희의 자동 평가 시스템과 인간 평가 시스템, 그리고 실제 사용자 경험 사이에는 여전히 어느 정도 격차가 존재합니다. 그것이 바로 저희가 프리뷰 버전을 먼저 출시하기로 약속한 이유이기도 합니다 — 이를 통해 반복적인 개선 (Iterate)을 거쳐 궁극적으로 사용자에게 가능한 최선의 경험을 제공할 수 있기 때문입니다. 새로운 27B 모델은 이전 모델과 비교했을 때 어떤가요? 엄청난 도약입니다! 루프 트랜스포머 (Looped Transformers)에 대해 어떻게 생각하시나요? 흥미로운 연구 아이디어입니다. 왜 Qwen인가요? 무엇이 당신들로 하여금 Qwen을, 특히 그렇게 가볍고 빠른 모델들을 만들게 했나요? 다른 이들이 단순히 무식한 힘 (Brute Power)을 추구할 때 왜 효율성에 집중했나요? 또한, 추론 엔진 (Inference Engines)이 최적화 측면에서 한계에 도달했다고 생각하시나요, 아니면 여전히 개선될 여지가 있나요? 스케일링과 비용 효율성은 상호 배타적인 것이 아닙니다 — 저희는 두 가지 모두를 계속 추구할 것입니다. 저희는 사고 모드 (Thinking Mode)에서 모델이 멈추지 않고 보통 전체 추론 예산 (Reasoning Budget)을 다 소모하여 지연 시간 (Latency)이 증가한다는 점을 인지했습니다. 이것이 알려진 문제인가요? 그리고 Qwen3.8을 위해 계획된 개선 사항이 있나요? 3.8을 사용해 보세요! 그리고 3.8은 다양한 사고 노력 (Thinking Efforts)을 지원합니다!
................................................................................................................... 70B 모델은 이제 완전히 사라진 건가요? 많은 컴퓨터에서 여전히 사용 가능하면서도 성능을 향상시킬 수 있는 40-50B 모델(약 30-32GB 정도에 들어가는 크기)을 얻는 것이 가능할까요? Qwen 3.8 27B 가중치(weight)를 제공하겠다는 약속에 감사드립니다! Qwen 3.8 35B A3B 모델이 나올 예정인지 알고 싶습니다. 많은 사람들도 이것을 원하고 있습니다. 이번에는 ~122B 모델을 기대할 수 있을까요? 120B 세그먼트는 현재 시대에 뒤처져 있고 활력이 부족한 상태이며, 유능한 모델이 출시된다면 큰 도움이 될 것입니다! 우선, Qwen 3.8 출시를 축하드립니다! 질문에 답하자면, Qwen 3.8의 35B A3B 버전도 출시할 계획인가요? 35B MoE (Mixture of Experts) 모델에 대한 계획이 있나요? (3.8) Omni 제품군에 대한 계획은 있나요? 3.5의 가중치 크기를 모두에게 알려주었지만, 정작 출시하지 않았고 그 이후로 새로운 것을 보여주지 않았습니다. 3.6/7/8 변형 모델들도 좋았을 것입니다. 가중치 크기를 작게 유지하고 관심을 기울였다면 가장 인기 있는 제품군이 되었을 수도 있습니다. 27B 외에 다른 모델을 출시할 계획은 없나요? Qwen 3 8B나 Qwen VL 8B와 같은 놀라운 모델들의 후속작에 대해 듣고 싶습니다.... 0.6B 또는 8B 가중치에 대한 업데이트 계획이 있나요? 이 모델들은 이미지 및 비디오 생성 분야의 오픈 웨이트 (open weight) 시장에서 중요한 위치를 차지하게 되었습니다. 그 부분이 진화하는 모습을 기대하고 있습니다. 이번 출시는 정말 거대하며, 27B 모델도 함께 출시된다는 점이 정말 기쁩니다! 다만, 궁금한 점은, 3.5 때와 마찬가지로 향후에 9B, 4B와 같은 새로운 소형 밀집 (small dense) Qwen 모델들을 다시 볼 수 있을까요? Qwen 3.5 제품군처럼 더 작은 모델들을 출시할 예정인가요? Qwen 3.8 27B 가중치를 제공하겠다는 약속에 감사드립니다! Qwen 3.8 35B A3B 모델이 나올 예정인지 알고 싶습니다. 많은 사람들도 이것을 원하고 있습니다. 여러분의 의견을 듣고 있습니다! 모든 요청 사항을 수집하여 향후 반복 개선 (iterations) 계획에 반영하고 있습니다. 향후 업데이트를 고려할 때 여러분의 요청을 참고 자료로 활용하겠습니다. 여러분의 의견을 경청하고 있습니다. 채널을 고정해 주세요.
저희는 모든 분의 요청 사항을 수집하여 향후 반복 개발 (iterations) 계획을 세울 때 고려하겠습니다. 확인했습니다, 요청 사항들을 수집하여 향후 반복 개발 과정에 반영할 수 있는 부분을 살펴보겠습니다. 계속해서 요청을 보내주세요. 저희는 경청하고 있으며, 향후 업데이트의 우선순위를 정하는 데 이를 활용하겠습니다. /u/pmttyji 제출 [link] [comments]
AI 자동 생성 콘텐츠
본 콘텐츠는 r/LocalLLaMA의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기