Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.

LG AI Research가 750B 파라미터 규모의 K-EXAONE 2.0 750B A37B 모델을 출시했습니다. 기존 v1 대비 규모가 3배 커졌으며, 10개 언어 지원 및 긴 문맥 처리와 에이전트 도구 사용 능력에서 뛰어난 성능을 보입니다.
Nanbeige-4.2-3B 모델의 성능과 효율성을 테스트한 결과, 벤치마크 수치와 달리 실제 코딩 작업에서는 기대에 미치지 못함을 확인했습니다. 이 모델은 레이어 순환 구조로 인해 컨텍스트 사용량이 과도하며, VRAM 점유율이 높고 작업 정확도가 낮다는 한계가 있습니다.

Gray Box는 사용자의 아이디어와 노트를 캡처하고 LLM을 통해 자동으로 정리해주는 로컬 우선(local-first) 오픈 소스 도구입니다. Markdown 파일 기반으로 데이터 영속성을 보장하며, LiteLLM을 통해 다양한 모델을 지원합니다.

InternScience가 새로운 35B MoE 에이전트 모델인 'Agents-A1'을 출시했습니다. 이 모델은 체급 대비 뛰어난 성능을 바탕으로 Qwen3.6 및 DeepSeek V4 Pro 등을 능가하며, 매우 빠른 추론 속도를 제공합니다.

120B 미만 규모의 모델 중 Qwen 시리즈 외에 대안을 찾는 과정에서 InternScience의 Agents-A1 MoE 모델을 발견했습니다. 이 모델은 35B 규모로 소비자용 하드웨어에서 매우 빠른 속도와 우수한 품질을 보여줍니다.

Apple Silicon 환경에서 Gemma 4 26B 모델을 단 2GB의 RAM만으로 실행할 수 있는 오픈 소스 Swift/Metal 추론 엔진인 Turbo-fieldfare를 소개합니다. M2 및 M5 칩셋에서 효율적인 추론 속도를 보여주며 OpenAI 호환 로컬 서버 기능도 제공합니다.

llama.cpp 환경에서 모델의 추론 예산을 효율적으로 관리하는 MindControl 기법의 벤치마크 결과를 소개합니다. 모델이 스스로의 사고 예산을 인지하도록 유도하여, 성능 저하를 최소화하면서도 토큰 소비량을 획기적으로 줄이는 방식을 제안합니다.
중국의 오픈 웨이트 AI 모델 배포는 단순한 관대함이 아닌, 산업 정책과 소프트 파워를 결합한 전략적 행보입니다. 이는 과거 미국이 인터넷과 우주 기술을 통해 영향력을 확대했던 방식과 유사한 강대국 전략의 일환으로 분석됩니다.
Baseten이 Kimi k2.6의 비전 인코더를 GLM 5.2 모델에 병합하여 GLM 5.2 Vision 모델을 Hugging Face에 공개했습니다. 기존 GLM 5.2의 비전 기능 부재를 보완한 모델로 주목받고 있습니다.
JAX/XLA 모델 프로파일링 시 발생하는 거대한 TensorBoard 트레이스 파일 크기를 90% 이상 줄여주는 오픈 소스 도구인 XProf Cubism Reducer를 소개합니다. 공간적 다운샘플링과 그리드 집계 기술을 통해 핵심 성능 인사이트를 유지하면서 파일 용량을 획기적으로 압축합니다.

오픈 소스 .NET 추론 엔진인 TensorSharp가 GGUF 모델을 위한 멀티 GPU 텐서 병렬 처리(Tensor Parallelism) 기능을 지원합니다. CUDA, Vulkan, Metal 등 다양한 백엔드를 통해 여러 GPU에 걸친 효율적인 모델 실행을 지원합니다.
로컬 llama-server 운영 시 사용자별 API 키 관리와 속도 제한을 구현하기 위해 작성된 미니멀한 Python 프록시를 소개합니다. SQLite를 활용하여 약 1,100줄의 코드로 가볍게 구현되었으며, 추론 성능에 영향을 주지 않는 매우 낮은 지연 시간을 자랑합니다.

Nvidia 등 기술 리더들이 지지하는 오픈 웨이트 AI 생태계와 Anthropic 등 폐쇄형 모델 진영 간의 갈등을 분석합니다. 오픈 소스 모델의 경제적 효과와 안전성 논쟁, 그리고 글로벌 기술 패권 경쟁을 다룹니다.

Unsloth를 통해 Kimi K3 모델을 로컬 환경에서 사용할 수 있도록 다양한 비트(8, 4, 2, 1)로 양자화하여 공개했습니다. 특히 1-bit 양자화 모델은 원본 대비 크기를 약 3배 줄이면서도 78.9%의 높은 정확도를 유지합니다.

Python docstring 데이터 50억 토큰을 사용하여 사전 학습된 700M 파라미터 규모의 모델을 소개합니다. 이 모델은 채팅용 미세 조정 없이 다음 토큰 예측을 목적으로 설계되었습니다.
llama.cpp 프로젝트에 GLM-5.2 모델을 위한 NextN/MTP 방식의 추측적 디코딩(Speculative Decoding) 지원이 추가되었습니다. 이를 통해 GLM_DSA 모델의 추론 속도를 최적화할 수 있습니다.
llama.cpp가 draft-mtp 아키텍처를 사용하는 GGUF 모델 로드 시 MTP 텐서를 기본적으로 로드하도록 업데이트되었습니다. 이로 인해 추측적 디코딩 활성화 여부와 관계없이 추가적인 VRAM/RAM 사용량이 발생할 수 있습니다.
로컬 RAG 환경에서 잘못된 정보(Poisoned/Stale sources)가 제공되었을 때, 11개 오픈 웨이트 모델이 얼마나 확신을 가지고 거짓 정보를 주장하는지 실험한 연구 결과입니다. 모델의 크기보다는 모델이 권위 있는 정보에 얼마나 쉽게 굴복하는지에 따라 성능 차이가 나타남을 보여줍니다.
LLM의 컨텍스트 관리를 위해 인간의 작업 기억(Working Memory) 방식을 모방한 'Dynamic Context Pruning(DCP)' 기법을 제안합니다. 하위 작업 완료 시 세부 사항을 압축하고 요약본만 남겨 컨텍스트 크기를 선제적으로 줄이는 방식입니다.

768GB DDR5와 RTX 5090 2개를 활용한 홈 랩 환경에서 Kimi K3 모델 구동 테스트 결과를 공유합니다. llama.cpp 포크 버전과 GGUF 양자화 모델을 사용하여 예상보다 높은 성능을 확인했습니다.