Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.

Microsoft Research에서 개발한 Fara1.5-27B는 스크린샷을 기반으로 웹 브라우저를 조작하는 멀티모달 컴퓨터 사용 에이전트입니다. Qwen3.5-27B를 기반으로 하며, 시각적 인지를 통해 클릭, 타이핑 등 복잡한 웹 작업을 엔드투엔드로 수행합니다.

Microsoft가 공개한 Mage-Flow는 4B 규모의 컴팩트한 생성 스택으로, 텍스트 기반 이미지 생성 및 편집을 지원합니다. 토크나이저와 백본의 공동 설계를 통해 적은 컴퓨팅 자원으로도 고해상도 및 다양한 종횡도의 고품질 이미지를 효율적으로 생성합니다.

Gemma 4 E2B 모델이 자신의 답변 정확도를 스스로 판단할 수 있도록 은닉 상태(hidden state)를 활용한 프로브 레이어를 학습시킨 연구 결과입니다. 이를 통해 모델은 신뢰도 점수를 제공하며, 낮은 신뢰도 시 더 큰 모델로 작업을 라우팅하는 하이브리드 전략을 가능하게 합니다.
Kimi K3 모델이 사이버 가드레일로 인해 탐지하지 못했던 15가지의 심각한 보안 버그를 수정했다는 소식입니다. Hugging Face의 보안 사고 보고를 바탕으로 모델의 보안 취약점 개선 사례를 다룹니다.
16개의 AMD MI50 GPU를 활용하여 llama.cpp RPC 기반으로 GLM-5.2 모델을 구동한 성능 테스트 결과입니다. 10.7k 컨텍스트 환경에서 약 10.2 tok/s의 출력 속도를 기록하며 분산 VRAM 환경에서의 추론 성능을 보여줍니다.

llama.cpp의 포크 프로젝트인 MindControl은 샘플링 과정에서 특정 문구를 주입하여 소규모 로컬 모델의 추론 과정을 가이드합니다. 모델이 사고 예산(thinking budget)을 인지하고 적절한 시점에 결론을 도출하도록 유도하여 추론의 신뢰성을 높입니다.
GPU 프로파일링과 텔레메트리 데이터를 활용하여 vLLM, SGLang 등의 추론 엔진 플래그를 자동으로 최적화하는 graphsignal-run 도구를 소개합니다. 트래픽 패턴에 따라 설정을 점진적으로 조정하여 최적의 성능을 도출합니다.
Laguna-S-2.1 모델을 RTX 3080 기반의 구형 게이밍 PC 환경에서 구동한 사례를 공유합니다. VRAM과 RAM 사용량이 매우 높지만, 특정 설정(IQ4_XS, 128k 컨텍스트)을 통해 실사용 가능한 수준의 성능을 확인했습니다.

GLM 5.2 모델이 소스 코드 재구축 능력을 평가하는 ProgramBench 리더보드에서 3위를 달성했습니다. 바이너리 파일만으로 코드를 복원하는 도전적인 과제에서 매우 높은 성능을 보여주었습니다.

에이전트가 작업에 필요한 도구와 기술만 선별적으로 확인하도록 최적화하여 응답당 토큰 사용량을 76% 절감했습니다. 불필요한 정보를 숨김으로써 효율적인 에이전트 운영이 가능해졌습니다.

로컬 AI 추론 벤치마크와 모델 성능 데이터를 통합 관리하는 플랫폼 'localmaxxing'이 출시되었습니다. 다양한 하드웨어와 모델 버전에 대한 실행 기록을 제공하며, 향후 맞춤형 평가 시스템과 하드웨어 마켓플레이스 기능을 확장할 계획입니다.
llama.cpp를 활용하여 MoE 모델의 전문가(experts)를 디스크 대신 VRAM 캐시로 관리하는 최적화 전략을 소개합니다. 이를 통해 DGX Spark 환경에서 Kimi 2.7 모델로 높은 추론 성능을 달성하는 벤치마크 결과를 제시합니다.

사용자가 Poolside의 Laguna S 2.1 모델을 테스트하기 위해 V620 GPU 3개를 활용한 하드웨어 환경을 구축했습니다. 96GB의 VRAM을 통해 256K 컨텍스트를 처리하며, 비용 대비 준수한 성능을 확인했습니다.

llama.cpp 프로젝트에 Laguna XS.2 및 M.1 모델 지원이 추가되었습니다. Laguna 시리즈는 에이전트 기반 코딩과 장기 작업을 위해 설계된 MoE(Mixture-of-Experts) 모델입니다.

ASCIITermDraw-Bench는 LLM과 VLM의 ASCII 다이어그램 생성 및 편집 능력을 평가하는 새로운 벤치마크입니다. 아키텍처, 네트워크 토폴로지 등 4개 영역 80개 태스크를 통해 인간과 AI 간의 시각적 소통 능력을 구조적·의미적 점수로 정밀하게 측정합니다.

Upstage가 에이전트 작업과 긴 컨텍스트 처리에 최적화된 250B MoE 모델인 Solar Open 2를 공개했습니다. 하이브리드 어텐션 아키텍처를 통해 대형 모델의 성능을 유지하면서도 소형 모델 수준의 효율적인 추론 비용을 제공합니다.
Laguna-S-2.1 모델이 중간 난이도 질문에서 사고 과정을 생략하는 문제를 해결하기 위해 채팅 템플릿을 수정하는 방법을 제안합니다. <think> 태그 뒤에 줄바꿈을 추가함으로써 모델이 추론 과정을 강제하도록 유도할 수 있습니다.
AMD Strix Halo 환경에서 Laguna S 2.1 모델 테스트를 위해 llama.cpp 포크를 컨테이너 기반으로 빌드하는 과정을 다룹니다. ROCm/HIP 설정, 의존성 패키지 해결, 소스 코드 수정 및 벤치마크 실행 중 발생한 오류와 해결 방안을 기술합니다.

새로운 오픈 벤치마크인 Encode Bench를 통해 모델의 Base64 인코딩 능력과 지능 지수 간의 상관관계를 분석합니다. 연구 결과, Base64 생성 능력은 모델의 다단계 신뢰성과 추론 능력을 측정하는 투박하지만 유용한 지표가 될 수 있음을 보여줍니다.
Mojo를 사용하여 Apple Silicon M4 Max 환경에서 GPT-2를 학습할 수 있는 Metal GPU 커널을 직접 구현했습니다. PyTorch MPS 대비 최대 1.71배의 성능 향상을 달성했으나, Apple의 MLX 프레임워크에는 미치지 못하는 결과를 보였습니다.