Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
여러 AI 도구에서 반복되는 MCP 서버 설정 문제를 해결하기 위해 로컬 우선 방식의 게이트웨이인 'Conduit'을 개발했습니다. 모든 MCP 서버를 중앙에서 관리하며, 모델의 컨텍스트를 절약하기 위해 필요한 도구만 검색하여 사용하는 메타 도구 방식을 채택했습니다.
llama.cpp를 활용하여 로컬 LLM의 추론 성능을 최적화하는 실용적인 가이드를 제공합니다. VRAM 관리, KV 캐시, MoE 배치 및 CPU 튜닝 등 성능 향상을 위한 핵심 기술을 다룹니다.
192개의 프롬프트를 사용하여 다양한 로컬 텍스트-이미지(text-to-image) 모델의 성능을 비교 분석한 테스트 결과입니다. 텍스트 생성, 인체 해부학, 공간 구성 등 여러 측면을 평가하였으며 VLM을 활용한 정량적 분석을 포함합니다.
멀티 소켓 CPU 시스템에서 LLM 추론 성능을 극대화하기 위해 ik_llama.cpp에 '--numa mirror' 모드를 추가했습니다. 이 모드는 모델 가중치와 KV 캐시를 각 소켓에 복제하여 원격 메모리 접근으로 인한 성능 저하를 방지합니다.
Apostate 프로젝트를 통해 Qwen 3.6 27B 모델의 안전 정렬을 제거한 모델을 Hugging Face에 출시했습니다. 모델의 성능 저하를 최소화하면서 거절률을 92%에서 7.6%로 대폭 낮추는 데 성공했습니다.
VLM(Vision Language Model)의 성능을 측정하기 위한 2차 벤치마크 업데이트 결과입니다. 하드웨어 VRAM 용량별 최적 모델을 제안하며, 사고(Thinking) 모드가 시각 지능에는 오히려 부정적인 영향을 미칠 수 있음을 밝힙니다.
사이드 프로젝트 HobbyLM을 통해 500M 파라미터 LLM과 330M 파라미터 이미지 생성기를 처음부터 사전 학습 및 사후 학습한 과정을 공유합니다. Claude SDK 기반의 에이전트 하네스를 활용해 최적의 아키텍처를 탐색하고 옴니 모델을 구축했습니다.
Qwen Coder를 코딩 보조 프로세서(sidecar)로 활용하기 위한 실험 결과입니다. 기존의 과도한 제약 사항을 수정하여 직접적인 코드 생성이 가능하도록 설정을 변경하며 A/B 테스트를 진행했습니다.
2개의 Radeon R9700 GPU를 사용하여 llama.cpp 환경에서 Qwen 3.6 27B 모델을 구동한 멀티 GPU 설정 및 성능 테스트 결과입니다. ROCm 환경에서의 토큰 생성 속도, 프리필 처리량, MTP 초안 수락률 및 프롬프트 캐시 효율성을 상세히 분석합니다.
다양한 AI 에이전트 설정 파일(AGENTS.md, .cursorrules 등)의 컨벤션을 정리한 가이드를 소개합니다. 각 파일의 실제 채택 정도를 adopted, emerging, proposed 태그로 구분하여 실질적인 표준을 파악할 수 있도록 돕습니다.
Gemma 4의 QAT(Quantization-Aware Training) 모델이 KV 캐시 양자화에 대해 높은 성능을 유지함을 보여줍니다. KL 발산(KLD) 지표를 통해 양자화 시에도 모델의 어텐션 성능이 잘 보존됨을 확인했습니다.
사용자가 설계한 맵을 로컬 LLM 에이전트가 탈출하는 역방향 탈출 게임 프로젝트를 소개합니다. 'Think then Act' 구조를 통해 소형 모델도 구조화된 행동을 수행할 수 있도록 설계되었습니다.
GLM-5.2 오픈 웨이트 모델이 DeepSWE 벤치마크에서 GPT-5.4와 Gemini를 능가하는 코딩 성능을 기록했습니다. 하지만 과도한 출력 토큰 사용으로 인해 작업당 비용 효율성은 GPT-5.5나 Claude Opus 4.8보다 현저히 낮습니다.
AllenAI가 자연어 지침을 바탕으로 3D 포인트 궤적을 예측하는 MolmoMotion 비전-언어 모델을 출시했습니다. 짧은 RGB 관측 이력을 통해 미래의 3D 공간 내 객체 이동을 예측하는 것이 특징입니다.
SupraLabs가 텍스트, 이미지, 비디오를 단일 토큰 스트림으로 처리하는 ~30M 파라미터 규모의 Any-to-Any 멀티모달 Transformer 모델인 Supra-A2A-Nano-Exp를 공개했습니다. 별도의 비전 인코더나 확산 모델 없이 공유된 어휘집을 통해 모든 모달리티를 언어 모델링 방식으로 통합한 실험적 프로토타입입니다.
llama.cpp B70 빌드에서 SYCL 백엔드를 사용한 Gemma 4 및 Qwen 모델의 성능 벤치마크 결과입니다. 다양한 모델 크기와 양자화 설정에 따른 토큰 생성 속도(t/s)를 측정하였습니다.
Rust 기반의 로컬 우선 시맨틱 메모리 시스템인 semantic-memory가 출시되었습니다. SQLite를 활용한 하이브리드 검색과 타입 지정 그래프 에지를 통해 AI 에이전트 및 RAG 애플리케이션에 지속적인 메모리를 제공합니다.
DiffusionGemma 모델 테스트 중 배치 토큰 설정이 성능과 정확도에 미치는 영향을 발견했습니다. 적절한 설정 시 RTX 4090에서 높은 생성 속도와 우수한 MMLU-Pro 성능을 보여주었습니다.
단순한 이론적 스펙(TFLOPS, 대역폭)이 실제 AI 모델 구동 성능을 보장하지 않음을 Radeon RX 7900 XTX와 NVIDIA GeForce RTX 5070 Ti의 비교를 통해 설명합니다. 실제 벤치마크 결과, 스펙상 우위에 있던 7900 XTX보다 5070 Ti가 더 나은 성능을 보여줍니다.
여러 코딩 에이전트를 동시에 사용할 때 발생하는 워크스페이스 혼선 문제를 해결하기 위한 에이전트 오케스트레이션 아키텍처를 제안합니다. 코드, 결과물(artifacts), 비밀 정보(secrets)를 각각 독립된 디렉토리로 분리하여 보안과 관리 효율성을 높이는 구조를 다룹니다.