Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
Claude Fable이 PyTorch 베이스라인 대비 18배 이상의 속도 향상을 제공하는 메가커널을 개발했습니다. 이는 Blackwell GPU 환경에서 Kimi-Linear W4A16 디코딩 성능을 극대화하며, Anthropic의 자동 연구 역량을 보여줍니다.
Gemma와 Huggingface가 주최하는 Fast Gemma 챌린지에 대한 소개입니다. 멀티 에이전트 협업을 통해 Google의 gemma-4-E4B-it 모델의 추론 속도(TPS)를 극대화하는 것을 목표로 합니다.
BlockPilot은 확산 기반 투기적 디코딩의 효율성을 높이기 위해 샘플별로 최적의 블록 크기를 예측하는 인스턴스 적응형 정책을 제안합니다. prefilling 단계의 표현을 활용해 최소한의 오버헤드로 추론 속도를 획기적으로 개선합니다.
LLM 추론 시 메모리 효율을 높이기 위한 KV 캐시 프루닝 기술의 한계인 '입력/도메인별 임계값 의존성'을 해결하는 ReFreeKV를 제안합니다. 임계값 제약 없이 예산 할당을 적응적으로 조정하여 다양한 입력 환경에서도 성능 저하 없이 효율적인 압축을 달성합니다.
Qwen 27B 모델을 4090+3090 시스템에서 테스트한 결과, 매우 빠른 디코딩 및 프리필 속도를 보여주었습니다. 특히 대규모 코드베이스를 안정적으로 처리하며 기존 스키마를 유지하는 뛰어난 코드 생성 능력을 입증했습니다.
Wan2.1 모델을 기반으로 동작 제어가 가능한 상호작용형 월드 모델인 Micro-World를 소개합니다. 이미지 및 텍스트를 통해 고품질 오픈 도메인 장면을 생성하며, 모델 가중치와 데이터셋을 모두 공개합니다.
Qwen3.5-9B 기반 추론 모델인 Qwythos-9B의 GGUF 양자화 버전(Q4_K_M, Q8_0) 성능을 GSM8K, IFEval, HumanEval 벤치마크로 비교 분석했습니다. 수학 및 지시 이행 능력에서는 양자화에 따른 성능 차이가 존재하나, 코딩 능력은 두 버전 모두 매우 낮음을 확인했습니다.
Surface Evolver라는 물리 시뮬레이션 도구를 활용하여 LLM의 커스텀 데이터 형식 작성 능력을 평가하는 새로운 벤치마크를 소개합니다. 모델이 문서를 참조하고 시뮬레이션을 디버깅하는 에이전틱 루프 능력을 측정합니다.
Gemma4-31B 모델에 identity-initialized layer insertion 방식을 적용해 레이어를 확장한 실험 결과, 성능이 오히려 저하됨을 확인했습니다. 삽입된 레이어들이 잔차 스트림에 유의미하게 기여하지 못하고 항등 함수에 가깝게 머무는 현상이 성능 하락의 원인으로 분석되었습니다.
232M 파라미터 규모의 실험적 모델인 Hierarchos의 연구 결과를 소개합니다. RWKV 백본과 계층적 매니저/워커 루프, 미분 가능한 슬롯 기반 장기 메모리를 결합한 하이브리드 비-Transformer 아키텍처를 통해 모델의 효율성과 일관성을 증명했습니다.
Granite 4 350M을 기반으로 지속적 사전 학습과 커스텀 SFT를 거친 Fijik 2.0 350M 모델이 출시되었습니다. lfm2.5의 커스텀 라이선스에 대응하기 위해 Apache-2.0 오픈 라이선스를 채택했습니다.
사용자가 Google의 Gemma 4 31B 모델을 기반으로 레이어 스케일링 기법을 적용하여 44B 규모의 모델로 확장하는 실험을 진행했습니다. LLaMA Pro 방식에서 영감을 얻어 60개 레이어를 88개로 늘려 모델의 용량을 확보했습니다.
RTX 3090 환경에서 Qwen3.6 27b, Gemma4 26B, Ornith1.0 35B 모델을 대상으로 로컬 벤치마크를 수행한 결과입니다. inspect-ai를 활용해 일반 지식, 추론, 코딩 성능을 비교 분석했습니다.
Gemma-4-31B 모델을 카피라이팅 및 창작 작문에 특화하여 미세 조정(Fine-tuning)한 사례를 소개합니다. 상투적인 표현을 배제하고 직접 반응형 카피라이팅 스타일을 구현하여 벤치마크 테스트에서 높은 성능을 입증했습니다.
Gemma 4 31b 모델을 기반으로 SWA 레이어 재설계 및 Attention 기반 Residual Networks를 적용하여 26b 규모의 고성능 모델로 재구축하는 프로젝트를 소개합니다. 모델 크기를 줄이면서도 전역적 일관성과 긴 문맥 처리 능력을 향상시키는 것을 목표로 합니다.
1-bit 모델인 Bonsai-8B와 IBM Granite의 CPU 도구 호출(tool calling) 성능을 비교 분석한 연구입니다. 1-bit 모델은 원시 상태에서는 성능이 낮지만, GBNF 문법을 적용할 경우 매우 높은 도구 호출 정확도를 보임을 확인했습니다.
Gemma 4 32B를 활용하여 음성 대화가 가능한 오픈 소스 파이프라인 데모를 소개합니다. Nvidia Parakeet, Cerebras 서빙, Qwen3TTS를 결합하여 OpenAI의 Realtime API를 대체할 수 있는 빠른 속도의 로컬 실행 환경을 구현했습니다.
2026년 6월 기준 최신 오픈 모델 및 파인튜닝 모델들의 동향을 정리한 리포트입니다. NVIDIA, AMD, Intel 등 주요 하드웨어 제조사별 최적화 기술과 함께 다양한 신규 모델 출시 소식을 다룹니다.
Ascend에서 학습된 92B 파라미터 규모의 MoE 모델인 openPangu-2.0-Flash를 소개합니다. MLA, DSA, SWA를 결합한 효율적인 어텐션 구조와 MTP 헤드를 통한 빠른 추론 성능을 특징으로 합니다.
Hugging Face에서 트렌딩 모델 4위를 기록 중인 Ornith-1.0-35B-uncensored-heretic 모델을 소개합니다. 이 모델은 매우 낮은 거부율(9/100)과 낮은 KLD(0.0019)를 특징으로 하는 검열되지 않은 모델입니다.