Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
에이전트의 도구 선택(Tool Selection) 과정에서 시맨틱 임베딩 대신 BM25를 사용하는 것이 더 효과적임을 분석합니다. 짧고 구조화된 도구 설명의 특성상 코사인 유사도는 변별력이 떨어지며, BM25가 더 높은 정확도를 보였습니다.

Gemma 4 모델에 QAT와 MTP 기술을 적용하여 RTX 3090과 같은 24GB 이하 GPU 환경에서 추론 속도(TPS)를 1.2~1.8배 향상시킨 사례를 소개합니다. llama-server 설정을 통해 멀티모달 및 텍스트 모델 모두에서 유의미한 성능 개선을 확인했습니다.

Luce Spark는 16GB GPU 환경에서 35B 규모의 MoE 모델을 효율적으로 실행할 수 있게 해주는 오픈소스 기술입니다. 실시간 라우팅 데이터를 기반으로 자주 사용되는 '핫(hot)' 전문가를 GPU에 유지하고 나머지는 RAM에 두는 보정된 배치 방식을 사용합니다.
NanoQuant 논문의 방법론을 바탕으로 밀집 트랜스포머 모델을 1비트 미만으로 압축하는 이진 양자화 구현체를 소개합니다. 행렬 인수분해를 통해 효율적인 압축을 달성하며, 소비자용 하드웨어에서도 미세 조정이 가능하도록 설계되었습니다.
OpenEnv가 Hugging Face, PyTorch, Unsloth 등 주요 AI 기업 및 기관들의 위원회 체제로 전환됩니다. 에이전트 실행 환경을 오픈 소스로 구축하여 에이전트 학습의 미래를 개방적으로 발전시키는 것을 목표로 합니다.
AlphaEvolve 스타일의 오픈 소스 시스템인 LEVI를 소개합니다. LEVI는 적절한 탐색 아키텍처를 통해 소형 모델로도 대형 모델을 능가하는 성능을 내며, 기존 프레임워크 대비 비용을 최대 35배 절감할 수 있습니다.
라틴 아메리카 데이터를 기반으로 학습된 Latam GPT 1.0 모델이 출시되었습니다. 미국이나 중국 모델보다 해당 지역의 언어와 문화에 최적화된 소버린 AI(Sovereign AI) 구축을 목표로 합니다.
Hopper 시스템에서 DeepSeek v4 Flash 모델을 사용하여 초당 약 200 토큰의 속도를 달성하는 최적화 방법을 소개합니다. vLLM의 MTP 코드를 패치하고 Canada-Quant의 양자화 모델을 활용하여 효율성을 높였습니다.
LocalLLaMA 커뮤니티 내 게시물 품질에 대한 주관적인 티어 리스트를 정리한 글입니다. 유용한 모델 출시, 최적화 정보, 하드웨어 성능 데이터 등 가치 있는 정보와 무의미한 밈, 광고성 게시물을 구분하여 제시합니다.
llama.cpp의 파이프라인 병렬화가 단일 요청 시 불필요한 VRAM을 소모할 수 있음을 분석합니다. 컴파일 옵션 조정을 통해 연산 버퍼 할당을 줄여 VRAM 효율을 높이는 방법을 제안합니다.
OpenAI와 Anthropic의 데이터 에이전트 구축 방식 차이를 분석하며, 에이전트의 성능이 데이터 인프라의 품질에 달려 있음을 설명합니다. 단순 파일 접근을 넘어 메타데이터와 시맨틱 레이어의 중요성을 강조합니다.
JetBrains에서 출시한 Mellum 2 12B MoE 모델의 성능과 속도를 리뷰합니다. 12B 파라미터 중 2.5B만 활성화되는 MoE 구조를 통해 매우 빠른 추론 속도와 뛰어난 도구 호출(Tool Calling) 능력을 보여줍니다.
로컬 LLM 구동 시 Windows와 Linux 환경의 성능 차이를 분석한 실험 결과입니다. NVIDIA 드라이버의 '시스템 메모리 폴백' 기능 유무가 VRAM 부족 상황에서 성능 급락을 방지하는 핵심 요인임을 밝혀냈습니다.
RTX 5070 Ti 및 5080(16GB VRAM) 환경에서 멀티모달 추론을 실행하기 위한 설정과 벤치마크 정보를 공유합니다. 사용자가 자신의 GPU 사양으로 모델 실행 가능 여부를 판단하는 데 도움을 주기 위한 가이드입니다.
소규모 로컬 LLM을 위한 경량 오픈 소스 웹 검색 도구인 TinySearch v0.2.0이 출시되었습니다. 이번 업데이트를 통해 SearXNG를 기본 검색 백엔드로 지원하여 검색 엔진 의존성을 낮추고 안정성을 높였습니다.
OpenAI의 2026년 예상 손실액이 주식 기반 보상(SBC)을 포함할 경우 기존 발표보다 훨씬 높은 250억~260억 달러에 달할 것이라는 분석입니다. 이는 기업의 자금 소진 기간(runway)을 단축시키며, 수익성 전환 시점과 IPO 시점에 중대한 재무적 변수가 될 전망입니다.
llama.cpp의 빠른 업데이트 주기에 대응하기 위해 개발된 Go 기반의 경량 버전 관리 도구 'lvm'을 소개합니다. 사용자는 nvm과 유사한 방식으로 다양한 빌드를 간편하게 설치, 전환 및 관리할 수 있습니다.
LLM 에이전트의 보안 테스트를 위한 오픈 소스 CLI 도구인 RedThread를 소개합니다. 에이전트가 실제 환경에 접근하기 전, 로컬 스테이징 환경에서 공격 시나리오를 재현하고 비교할 수 있도록 설계되었습니다.

Apodex-1.0 Smol 모델 시리즈(0.8B, 2B, 4B)가 출시되었습니다. 이 모델들은 장기적 과업 수행 시 에이전트 루프 내에서 사실 확인 및 도구 호출 검증과 같은 특정 하위 작업을 전문적으로 처리하도록 설계된 오픈 가중치 모델입니다.
Openclaw Agent를 활용하여 GPT 5.5, Claude Fable/Mythos 5 등 6개 주요 AI 모델의 코딩 및 게임 제작 능력을 비교 테스트했습니다. 동일한 프롬프트를 사용하여 플레이 가능한 다마고치 게임을 구현하는 성능과 비용을 분석했습니다.