Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.

RecGPT-V3는 Taobao의 추천 시스템을 위해 설계된 상태 유지형 하이브리드 모달 모델입니다. Memory Hub, 하이브리드 모달 파운데이션 모델, 잠재 의도 추론 기술을 통해 계산 효율성을 높이고 추천 성능을 극대화했습니다.

코딩 에이전트의 결정 과정과 사용자 선호도 저장 방식을 시각적 결정 트리로 변환하는 방법을 탐구합니다. Claude Code와 Codex의 메모리 파일을 분석하여 에이전트의 동작 원리를 파악할 수 있는 오픈 소스 도구를 소개합니다.

Hugging Face CEO가 OpenAI에 급진적 투명성과 사이버 방어 역량 강화를 위한 1억 달러 규모의 컴퓨팅 자원 지원을 요청했습니다. 이는 자율 에이전트의 사이버 공격 위협에 대응하기 위한 협력을 강조한 것입니다.
Memanto 메모리 코어에 대한 레드팀 테스트 결과, 에이전트 생성 시의 레이스 컨디션(TOCTOU)과 메모리 회상 과정에서의 신뢰도 누락 등 보안 및 아키텍처 결함이 발견되었습니다. 발견된 취약점들은 pytest를 통한 PoC 검증과 함께 수정 패치가 적용되어 해결되었습니다.

GPU 없이 llama.cpp만을 사용하여 PC와 스마트폰에서 구동 가능한 POCKET-35B 모델 시리즈를 소개합니다. 기기 사양에 따라 다양한 양자화 버전을 제공하며, 특히 한국어 최적화 모델을 포함하고 있습니다.

GigaChat 3.1 Lightning을 기반으로 구축된 오디오 네이티브 LLM인 GigaChat Audio 10B를 소개합니다. Conformer 음성 인코더와 MoE 디코더를 결합하여 텍스트 품질을 유지하면서도 뛰어난 음성 이해 능력을 갖추었습니다.
llama.cpp가 Model Context Protocol(MCP)을 완벽하게 지원하게 되었습니다. 이제 stdio 서버 통합을 통해 WebUI에서 에이전트형 채팅이 가능하며, 로컬 모델 기반의 강력한 에이전트형 코더를 구축할 수 있습니다.

Bitwize가 Apple Silicon의 MLX를 활용하여 100% 온디바이스로 작동하는 오픈 소스 macOS 회의록 및 글쓰기 앱 'Logue'를 공개했습니다. 클라우드 전송 없이 로컬에서 실시간 전사, 화자 분리, LLM 요약 및 글쓰기 보조 기능을 제공하여 개인정보 보호를 극대화했습니다.

GTX 1080 Ti와 P102-100 GPU 3개를 결합한 시스템에서 Gemma4 및 Qwen3.6 등 다양한 LLM의 성능을 비교한 벤치마크 결과입니다. llama.cpp Vulkan 빌드를 사용하여 모델별 추론 속도(tg128, pp512)를 측정했습니다.

4GB VRAM을 가진 노트북 환경에서 로컬 AI 에이전트 워크스페이스인 Bike4Mind의 성능을 테스트한 결과입니다. Qwen 2B 모델이 도구 호출, 비전, RAG 기능을 수행하는 데 있어 속도와 메모리 효율 측면에서 가장 최적의 성능(sweet spot)을 보여주었습니다.

서로 다른 차원을 가진 이질적인 LLM 임베딩 간의 의미적 거리를 계산하기 위해 미세 조정 없이 '상대적 표현법'을 사용하는 기술을 소개합니다. Lowdin Symmetric Orthogonalization을 통해 앵커 프레임워크를 구축하여 모델 특유의 비등방성 문제를 해결하고 통합된 좌표계로 매핑합니다.
소프트웨어 엔지니어링 수명 주기 전반을 지원하는 오픈 소스 AI 에이전트 오케스트레이터 SEOS 3.0.0이 출시되었습니다. 100% 로컬 환경에서 작동하며 멀티 에이전트 협업과 지능형 문서 엔진을 통해 보안과 효율성을 동시에 제공합니다.
llama.cpp를 포크하여 MoE 모델의 전문가 가중치를 SSD에서 스트리밍하는 기술을 통해, RAM 용량을 초과하는 대규모 모델을 MacBook에서 실행할 수 있게 합니다. Slipstream 앱은 필요한 가중치만 제한된 RAM 캐시로 불러와 성능 저하를 최소화하며 온디바이스 실행을 지원합니다.

WebGPU를 활용하여 브라우저 및 Electron/Tauri 환경에서 LFM 2.5 230M 모델을 초당 1440 토큰의 속도로 구동하는 기술을 소개합니다. Nvidia와 Apple Silicon의 하드웨어 특성에 최적화된 커널을 통해 높은 성능을 구현했습니다.
LLM을 활용한 복잡한 분석 시 신뢰도를 높이기 위해 사용할 수 있는 구조적 분석 및 검증 SOP(표준 운영 절차)를 소개합니다. 질문 고정, 증거 상태 분리, 상충하는 체제 유지 등 논리적 오류를 방지하기 위한 7단계 가이드를 제공합니다.
대화 문맥(Conversational Context)과 구조화된 SOP를 결합하여 AI의 추론 능력을 안정화하는 방법론을 제안합니다. 문맥을 통해 워크플로우를 개발하고, SOP를 통해 이를 압축 및 반복 실행함으로써 모델의 추론 경로를 개선할 수 있습니다.

실제 Three.js 그래픽 구현 과제를 통해 주요 AI 모델들의 코딩 성능을 비교 분석했습니다. 벤치마크 점수 대신 시각적 품질, 애니메이션, 엔지니어링 실행력 등 실질적인 프로젝트 수행 능력을 기준으로 순위를 매겼습니다.
llama.cpp에 도입된 네이티브 MTP(Multi Token Prediction) 기반 투기적 디코딩 기술을 정리합니다. Dense 모델에서는 1.4~2.2배의 성능 향상을 보이지만, MoE 모델에서는 이득이 적거나 거의 없는 것으로 나타났습니다.
CachyLLama는 로컬 에이전트 실행 시 발생하는 프롬프트 처리 병목 현상을 해결하기 위해 SSD 기반 KV 캐싱을 지원하는 llama.cpp 포크입니다. 중급 사양 하드웨어에서 시스템 프롬프트와 대화 기록을 디스크에 저장하여 재사용함으로써 프롬프트 평가 시간을 획기적으로 단축합니다.

NVIDIA ModelExpress(MX)를 통해 모델 가중치 배포 속도를 혁신적으로 개선했습니다. GPU-to-GPU RDMA 기술을 활용하여 DeepSeek-V4 Pro의 시작 시간을 8분에서 2분 미만으로 단축했습니다.