Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
Wan2.1 모델을 기반으로 동작 제어가 가능한 상호작용형 월드 모델인 Micro-World를 소개합니다. 이미지 및 텍스트를 통해 고품질 오픈 도메인 장면을 생성하며, 모델 가중치와 데이터셋을 모두 공개합니다.
Qwen3.5-9B 기반 추론 모델인 Qwythos-9B의 GGUF 양자화 버전(Q4_K_M, Q8_0) 성능을 GSM8K, IFEval, HumanEval 벤치마크로 비교 분석했습니다. 수학 및 지시 이행 능력에서는 양자화에 따른 성능 차이가 존재하나, 코딩 능력은 두 버전 모두 매우 낮음을 확인했습니다.
Surface Evolver라는 물리 시뮬레이션 도구를 활용하여 LLM의 커스텀 데이터 형식 작성 능력을 평가하는 새로운 벤치마크를 소개합니다. 모델이 문서를 참조하고 시뮬레이션을 디버깅하는 에이전틱 루프 능력을 측정합니다.
Gemma4-31B 모델에 identity-initialized layer insertion 방식을 적용해 레이어를 확장한 실험 결과, 성능이 오히려 저하됨을 확인했습니다. 삽입된 레이어들이 잔차 스트림에 유의미하게 기여하지 못하고 항등 함수에 가깝게 머무는 현상이 성능 하락의 원인으로 분석되었습니다.
232M 파라미터 규모의 실험적 모델인 Hierarchos의 연구 결과를 소개합니다. RWKV 백본과 계층적 매니저/워커 루프, 미분 가능한 슬롯 기반 장기 메모리를 결합한 하이브리드 비-Transformer 아키텍처를 통해 모델의 효율성과 일관성을 증명했습니다.
Granite 4 350M을 기반으로 지속적 사전 학습과 커스텀 SFT를 거친 Fijik 2.0 350M 모델이 출시되었습니다. lfm2.5의 커스텀 라이선스에 대응하기 위해 Apache-2.0 오픈 라이선스를 채택했습니다.
사용자가 Google의 Gemma 4 31B 모델을 기반으로 레이어 스케일링 기법을 적용하여 44B 규모의 모델로 확장하는 실험을 진행했습니다. LLaMA Pro 방식에서 영감을 얻어 60개 레이어를 88개로 늘려 모델의 용량을 확보했습니다.
RTX 3090 환경에서 Qwen3.6 27b, Gemma4 26B, Ornith1.0 35B 모델을 대상으로 로컬 벤치마크를 수행한 결과입니다. inspect-ai를 활용해 일반 지식, 추론, 코딩 성능을 비교 분석했습니다.
Gemma-4-31B 모델을 카피라이팅 및 창작 작문에 특화하여 미세 조정(Fine-tuning)한 사례를 소개합니다. 상투적인 표현을 배제하고 직접 반응형 카피라이팅 스타일을 구현하여 벤치마크 테스트에서 높은 성능을 입증했습니다.
Gemma 4 31b 모델을 기반으로 SWA 레이어 재설계 및 Attention 기반 Residual Networks를 적용하여 26b 규모의 고성능 모델로 재구축하는 프로젝트를 소개합니다. 모델 크기를 줄이면서도 전역적 일관성과 긴 문맥 처리 능력을 향상시키는 것을 목표로 합니다.
1-bit 모델인 Bonsai-8B와 IBM Granite의 CPU 도구 호출(tool calling) 성능을 비교 분석한 연구입니다. 1-bit 모델은 원시 상태에서는 성능이 낮지만, GBNF 문법을 적용할 경우 매우 높은 도구 호출 정확도를 보임을 확인했습니다.
Gemma 4 32B를 활용하여 음성 대화가 가능한 오픈 소스 파이프라인 데모를 소개합니다. Nvidia Parakeet, Cerebras 서빙, Qwen3TTS를 결합하여 OpenAI의 Realtime API를 대체할 수 있는 빠른 속도의 로컬 실행 환경을 구현했습니다.
2026년 6월 기준 최신 오픈 모델 및 파인튜닝 모델들의 동향을 정리한 리포트입니다. NVIDIA, AMD, Intel 등 주요 하드웨어 제조사별 최적화 기술과 함께 다양한 신규 모델 출시 소식을 다룹니다.
Ascend에서 학습된 92B 파라미터 규모의 MoE 모델인 openPangu-2.0-Flash를 소개합니다. MLA, DSA, SWA를 결합한 효율적인 어텐션 구조와 MTP 헤드를 통한 빠른 추론 성능을 특징으로 합니다.
Hugging Face에서 트렌딩 모델 4위를 기록 중인 Ornith-1.0-35B-uncensored-heretic 모델을 소개합니다. 이 모델은 매우 낮은 거부율(9/100)과 낮은 KLD(0.0019)를 특징으로 하는 검열되지 않은 모델입니다.
창의적인 도서 집필을 목적으로 설계된 PageStorm Research Preview 모델을 발표합니다. 이 모델은 LongPage 데이터셋을 기반으로 하며, 단일 턴으로 도서 규모의 긴 글을 작성할 수 있도록 구축되었습니다.
Qwen 3.6 27B 모델을 대상으로 다양한 llama.cpp 포크 엔진과 투기적 디코딩(Speculative Decoding) 기법의 성능을 비교 분석한 벤치마크 결과입니다. 단일 RTX 3090 환경에서 ik_llama 포크를 활용해 코드 생성 시 최대 100 TPS에 근접하는 성능을 확인했습니다.
HydraHead는 레이어 단위가 아닌 헤드 수준의 기능적 이질성을 활용하여 Full Attention과 Linear Attention을 결합한 새로운 하이브리드 어텐션 아키텍처입니다. 해석 가능성 분석을 통해 검색에 중요한 헤드를 식별하고, 스케일 정규화 융합 모듈을 통해 효율적인 긴 문맥 처리를 구현합니다.
Huawei가 512K 컨텍스트 길이를 지원하는 OpenPangu-2.0-Flash 모델을 오픈 소스로 공개했습니다. 이 모델은 총 92B 파라미터 중 6B만 활성화되는 구조이며, 가중치와 추론 및 학습 코드가 함께 제공됩니다.
Ascend에서 개발한 92B 규모의 MoE 모델인 openPangu-2.0-Flash를 소개합니다. 512k의 긴 컨텍스트 길이를 지원하며, 통합 SFT와 강화학습(RL)을 통해 사고 능력을 최적화했습니다.