Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.

본 기사는 2026년 7월 기준 주요 오픈 가중치 AI 모델들의 출시 현황을 정리했습니다. Apache 2.0, MIT 등 라이선스별로 Inkling, DeepSeek V4 Pro, GLM-5.2, Nemotron 3 Ultra 등 다양한 최신 모델들이 공개되었습니다.

Qwen3.6-35B-A3B-uncensored-heretic-Q8_0.gguf 모델을 사용하여 '다스 베이더의 SVG 생성' 테스트 결과를 공유합니다. 이 테스트는 특정 LLM 모델의 이미지/벡터 생성 능력을 검증하는 연구 사례입니다.

본 글은 'Accurate, Large Minibatch SGD: Training ImageNet in 1 Hour' 논문을 분석하며, 다수의 GPU 환경에서 학습률과 미니배치 크기를 어떻게 확장할지에 대한 이론을 제시합니다. 핵심은 전역 배치 크기에 대한 기울기가 개별 미니배치들의 합으로 표현될 수 있다는 가정에 기반하여 학습률을 선형적으로 조정하는 것입니다.

본 글은 모델의 효율성을 '활성 파라미터 대비 점수'로 정의하고, 이 기준에 따라 파레토 프론티어(Pareto Frontier)에 속하지 않는 모든 모델을 제거하는 방법을 제시합니다. 이는 특정 벤치마크를 활용하여 최적화된 AI 모델군을 선별하려는 연구 동향을 보여줍니다.

Hy3 모델의 1bit 양자화(quant) 버전이 공개되어, 작은 크기에서도 높은 성능을 유지하는지 테스트하고 있습니다. 이 기술은 모델 크기가 커지는 추세 속에서 효율성을 검증하기 위함입니다.

Google은 Gemma 4의 채팅 템플릿을 업데이트하고, 도구 호출(tool calling) 기능에 주요 수정 사항을 적용했습니다. 특히 '게으름(laziness)' 문제를 줄이고 추론 과정(thinking process)을 보존하는 데 중점을 두었습니다. 이러한 개선 사항들은 Hopper GPU 환경에서의 성능 최적화와 관련됩니다.

Thinking Machines Lab의 Inkling 모델이 미국 오픈 웨이트 모델 중 최고 수준으로 평가받으며 큰 주목을 받고 있습니다. 이 모델은 NVIDIA Nemotron Ultra를 포함한 다른 미국 오픈 모델들을 능가하며, 전체 오픈 웨이트 모델 순위에서 약 5위에 랭크되었습니다.

본 글은 Qwen 모델을 Anthropic의 Sonnet, Opus, Fable 등 클라우드 기반 최신 모델과 비교하는 미니 벤치마크 결과를 다룹니다. 비록 클라우드 모델이 전반적으로 우수하지만, 로컬 환경에서 구동 가능한 Qwen 35B MOE와 거대 클라우드 모델 간의 성능 격차가 예상보다 크게 줄어드는 현상에 주목하고 있습니다.

Linus Torvalds는 AI를 단순히 유용한 '도구'로 규정하며, 이에 반대하는 사람들의 주장을 일축했습니다. 그는 AI가 기술적 가치를 제공하므로 커널 프로젝트의 핵심이 될 것이며, 오픈 소스 정신은 부수적인 이점일 뿐이라고 강조합니다. 또한, AI의 문제점을 지적하기보다 실제로 사용해보고 해결책을 찾는 데 집중해야 한다고 주장합니다.

본 글은 대규모 언어 모델(LLM)의 지식을 소형 모델로 '증류(distill)'하고, 복잡한 작업을 작은 모델을 통해 라우팅 및 실행하는 새로운 프레임워크 A.L.F.R.E.D.를 제안합니다. 이를 통해 큰 모델에 대한 의존도를 줄이고 속도와 결정론적 검증 능력을 향상시키는 것이 목표입니다.

Hy-Embodied-RxBrain-1.0은 체화된 인지(embodied cognition)를 위한 통합 멀티모달 파운데이션 모델입니다. 이 단일 모델은 언어 추론과 시각적 상상력을 결합하여, 질문 답변, 세계 상태 예측, 공동 하위 목표 계획 등 세 가지 핵심 기능을 제공합니다.
ExLlamaV3 v1.0.0이 프로덕션 버전으로 출시되며 대규모 성능 개선을 이루었습니다. 주요 업데이트에는 flash-attention-2 및 xformers 의존성 제거, Gemma4 포함 다수 모델의 텐서 병렬 지원 확장 등이 포함되었습니다. 또한 KV 양자화로 인한 속도 저하를 해결하고 다양한 최적화 커널이 추가되어 전반적인 성능과 안정성이 크게 향상되었습니다.
Bonsai 27B 모델에 대한 사용 후기 및 토론 내용입니다. 코딩 작업 시 사고 과정(thinking process)을 잘라내어 응답의 품질이 떨어지며, 간단한 C# 함수 작성 등에서도 성능 개선이 미미하다는 점을 지적합니다.

사용자가 직접 제작한 Qwen 3.5 122B Heretic ROCmFP4 iMatrix 관련 정보를 공유하고 있습니다. 이 모델은 특정 컴퓨팅 자원(Strix Halo)을 활용하여 구동되었으며, 성능 지표와 함께 다른 사용자들에게도 공유할 의향이 있음을 밝히고 있습니다.

DeepSeek V4 모델이 No Man's Sky와 Minecraft 하이브리드 게임을 원샷 코딩한 사례가 공유되었습니다. 이는 A/B 테스트를 통해 접근된 새로운 버전의 성능을 보여주며, 해당 기술의 활용 가능성에 대한 논의를 촉발하고 있습니다.
Gemma-4-31B를 기반으로 개발된 AntiHal 모델은 요청의 잘못되거나 조작된 전제에 대해 단순히 따르지 않고 반박하도록 유도하는 새로운 변형 모델입니다. 이 모델은 '반환각지능 벤치마크(HalBench)'와 표현 조향(representation steering) 기법을 결합하여, 거짓 가정에 대한 반박 능력을 크게 향상시켰습니다.

PrismML이 Bonsai 27B 모델을 공개했으며, 이는 BitNet/Ternary 개념을 활용하여 Qwen3.6 27B에 적용한 것입니다. 이 새로운 방법론 덕분에 메모리 약 10GB만으로도 높은 성능의 27B 모델 구동이 가능해져, 기기에서 사용하기 매우 실용적입니다.
Zhipu AI의 창립자가 GLM 5.3 출시를 예고하며, 모델 개발 방향이 단순한 성능 향상을 넘어 네이티브 멀티모달 비전 구축에 집중됨을 시사합니다. 이는 에이전트가 스크린샷이나 문서 등 시각적 자산을 해석하는 능력을 크게 개선할 것으로 기대됩니다.

PrismML 팀이 Bonsai 27B 모델을 공개했습니다. 이 모델은 1비트 양자화를 통해 크기를 대폭 줄여(54GB → 3.8GB)도 성능 저하를 최소화한 것이 특징입니다. 커스텀 WebGPU 커널을 활용하여 브라우저 환경에서 로컬 구동이 가능합니다.

DeepSeek V4와 Kimi K3 등 오픈 가중치 모델들의 출시는 컴퓨팅 지능의 계산 비용을 급격히 낮추고 있습니다. 이에 따라 엔터프라이즈 환경에서는 순수 모델 성능보다, 자율적인 AI가 핵심 시스템에 미치는 실패 모드를 제어하는 '거버넌스'와 '제어 프레임워크' 구축이 가장 중요한 과제가 되고 있습니다.