Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
고압적인 프롬프트가 AI 모델의 추론 루프와 환각을 유발한다는 가설을 검증한 연구입니다. '부드러운 양육' 방식의 프롬프팅을 통해 모델의 인지적 결빙을 방지하고, 모르는 것을 정직하게 말하게 하여 응답 속도와 정확도를 개선했습니다.
llama.cpp 프로젝트에 13B 규모의 빈티지 언어 모델인 talkie-1930-13b-it 지원이 추가되었습니다. 이 모델은 1931년 이전의 텍스트로 학습되어 과거의 언어 스타일을 시뮬레이션하도록 설계되었습니다.
Harbor v0.4.19 업데이트를 통해 vllm, sglang, llama.cpp와 같은 로컬 추론 백엔드를 사용하여 에이전트 코딩 도구를 실행할 수 있습니다. 최적화된 LLM 게이트웨이를 통해 웹 검색 도구를 자동으로 주입하고 프록시하는 기능을 제공합니다.
MacBook 환경에서 Qwen3.6 모델을 활용한 로컬 AI 및 에이전틱 워크플로우 구축 시 발생하는 충돌과 성능 저하 문제를 해결하는 최적화 가이드를 제공합니다. 메모리 제한 설정, 모델 양자화 선택, 실행 도구 선정 등 안정적인 운영을 위한 구체적인 팁을 다룹니다.
저예산 Dual RTX 3060 구성을 통해 Qwen 3.6-27B 모델을 구동한 성능 테스트 결과입니다. 7900 XTX 대비 안정적인 연산 성능과 30-50 t/s의 디코딩 속도를 확인했습니다.
WSL 환경의 llama.cpp 워크플로우를 GUI로 관리할 수 있는 Windows 데스크톱 앱인 'llama.cpp Console'을 소개합니다. 터미널 작업 없이 빌드, 모델 다운로드, 실행 파라미터 설정 및 모니터링을 직관적으로 수행할 수 있습니다.
Intel Arrow Lake NPU를 활용하여 스마트 홈용 ASR(자동 음성 인식) 작업을 수행한 성능 비교 결과입니다. CPU 대비 속도와 에너지 효율 면에서 압도적인 성능 향상을 확인했습니다.
AMD Strix Halo 사용자를 위해 llama.cpp에서 MoE 모델의 PP(Prompt Processing) 성능을 최대 30% 향상시킬 수 있는 최적화 방법을 소개합니다. 이 방법은 거절된 PR의 코드를 직접 적용하여 낮은 컨텍스트 환경에서 큰 성능 이득을 얻을 수 있습니다.
CUDA 환경에서 KV 캐시 양자화 속도를 높이기 위한 Fast Walsh-Hadamard Transform(FWHT) 구현이 추가되었습니다. 이를 통해 prefill 성능은 약 1-2%, text generation 성능은 약 7-9% 향상되는 결과를 보였습니다.
Qwen 2.5 모델을 자기회귀(AR) 방식에서 확산(Diffusion) 방식으로 재정렬하는 open-dllm 연구를 기반으로, RTX 5090을 활용한 로컬 학습 시도를 다룹니다. QLoRA와 nvfp4를 사용하여 VRAM 한계를 극복하고 학습 효율을 높이는 실험적 과정을 기록하고 있습니다.
10년 된 구형 Dell 워크스테이션과 GTX 1060 6GB 환경에서 qwen3.6-35B 모델을 LMStudio로 실행하는 데 성공한 사례입니다. GGUF 양자화와 CPU/GPU 오프로딩 설정을 통해 실용적인 추론 속도를 확보했습니다.
LLM의 추론 시간 탐색 성능을 높이기 위해 다양한 보상 함수를 예측하고 솔루션의 다양성을 확보하는 벡터 정책 최적화(VPO) 알고리즘을 제안합니다. 기존 스칼라 보상 최적화 방식의 한계를 극복하여, 테스트 시간 탐색 시 더 넓은 탐색 공간을 제공합니다.
V100 GPU 클러스터를 활용하여 법률 초안 작성을 위한 로컬 AI 환경을 구축한 사례입니다. vLLM 대신 llama.cpp를 사용하여 MoE 모델의 효율성을 극대화했으며, Dense 모델보다 MoE 모델이 실질적인 추론 속도 면에서 유리함을 입증했습니다.
NuExtract3는 문서 이해를 위해 설계된 4B 파라미터 규모의 비전-언어 추론 모델입니다. 구조화된 정보 추출과 이미지-마크다운 변환 기능을 결합하여 OCR 및 RAG 전처리에 최적화되어 있습니다.
Pangram의 EditLens 데이터셋을 활용하여 Qwen 3.5 0.8B 모델을 미세 조정해 AI 생성 콘텐츠 탐지기를 개발했습니다. 이 모델은 Chrome 확장 프로그램 'Slop Hammer'를 통해 로컬 환경에서 텍스트의 AI 생성 확률 분포를 즉시 확인할 수 있습니다.
LLM의 긴 문맥 추론 시 발생하는 Full Attention의 비용 문제를 해결하기 위해 RTPurbo를 제안합니다. 모델의 본질적인 희소성을 활용하여 단 수백 번의 학습 단계만으로 Full Attention 모델을 효율적인 Sparse 모델로 전이할 수 있습니다.
Orange Pi AIPro(Ascend 310B) 환경에서 MiniCPM-V 4.6을 구동하기 위해 프레임워크 오버헤드를 제거한 커스텀 C++ 추론 엔진을 개발했습니다. AscendC 커널 최적화를 통해 기존 베이스라인 대비 추론 속도를 약 2배 향상시켰습니다.
RDNA3 아키텍처(7900 XTX 등)를 위해 최적화된 새로운 오픈 소스 ROCm 네이티브 LLM 추론 엔진인 hipEngine을 소개합니다. HIP/C++ 기반의 핫 패스와 AMD 네이티브 라이브러리를 활용하여 Qwen 3.6 모델에서 llama.cpp를 상회하는 프리필 성능을 보여줍니다.
Qwen 모델을 활용하여 로그라이크 게임인 DCSS를 플레이하는 실험 결과입니다. MTP(Multi-Token Prediction) 버전의 도구 호출 버그를 확인했으며, 일반 Qwen 모델은 게임 플레이 및 길 찾기에서 준수한 성능을 보였습니다.
llama.cpp의 llama-server에 추가된 네이티브 도구 기능을 활용하여 웹 RAG를 구현하는 방법을 설명합니다. firejail과 smolmachines를 이용한 다중 샌드박싱 환경을 구축하여 exec_shell_command를 안전하게 실행하는 워크플로우를 제안합니다.