Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
본 기사는 AMD MI50 GPU 32개를 활용하여 대규모 언어 모델(LLM) 추론 시스템을 구축하고 그 성능을 공유합니다. 이 설정은 16개 GPU가 장착된 두 개의 노드를 10G 이더넷으로 연결한 형태로, Kimi-K2.6 모델에서 초당 9.7 토큰의 출력 및 263 토큰의 입력 처리 속도를 달성했습니다. 전력 소모는 피크 추론 시 약 4,800W에 달하며, 시스템 성능 향상을 위해 PCIe 대역폭 최적화와 vLLM 소프트웨어 스택 개선이 필요함을 언급합니다.
본 논문은 사용자가 물리적 객체에 느끼는 애착을 AI 동반자로 확장하는 '쌍중이체(Doppelgänger)' 프레임워크인 Deco를 제안합니다. Deco는 다중 모달 LLM과 증강 현실을 통합하여, 디지털 에이전트가 물리적 동반자의 감정적 유대와 역사를 계승하고 확장할 수 있도록 합니다. 연구 결과에 따르면, Deco는 기존의 디지털 동반자보다 인식된 동반성 및 감정적 유대 측면에서 우수하며, 사용자의 주관적 웰빙 개선과 지속적인 참여를 입증했습니다.
이 기술 기사는 대규모 언어 모델(LLM)과 AI 에이전트를 활용하여 Proxmox VE 환경을 제어하는 방법을 소개합니다. 이를 통해 사용자는 복잡한 시스템 관리 작업을 자연어 명령만으로 수행할 수 있게 됩니다. 관련 프로젝트 코드는 GitHub를 통해 제공됩니다.
최근 API 기반 AI 모델의 품질 저하 및 가격 상승 추세와 더불어, 30B급 대규모 밀집(Dense) 모델이 등장하면서 사용자들이 자체 시스템 구축에 대한 관심이 높아지고 있습니다. 하지만 이러한 고성능 모델을 직접 구동하기 위한 체계적인 의사결정 가이드라인이나 방법론은 부족한 실정입니다.
Sentence Transformers는 의미론적 임베딩 생성을 위한 핵심 오픈 소스 라이브러리로, 2019년 Nils Reimers에 의해 개발된 이래 NLP 연구 및 실무 분야에서 광범위하게 채택되어 왔습니다. 최근 Hugging Face Hub와 공식적으로 통합되면서 그 영향력이 더욱 커졌으며, 현재는 커뮤니티 주도 오픈 소스 프로젝트로서 지속적인 성장을 예고하고 있습니다.
AMD가 AM5 플랫폼의 Ryzen 9000 시리즈 프로세서에 대한 AGESA 업데이트를 통해 특정 조건(ECC UDIMM 사용 및 제조사 정격이 5200 MT/s 이상)을 만족하는 ECC UDIMM 메모리의 최대 주파수를 5200 MT/s로 제한하고 있습니다. 이는 시스템 안정성 확보와 관련된 조치로 보이며, 사용자들은 이 변경 사항에 대해 주의를 기울여야 합니다.
AI 에이전트 시대가 도래함에 따라 기업의 조직 구조와 인력 운영 방식에 근본적인 변화가 요구되고 있습니다. Meta는 대규모 감원과 채용 동결을 통해 효율성을 극대화하는 모습을 보였으며, NVIDIA는 직원 대비 AI 에이전트를 압도적으로 많이 배치하여 업무 자동화를 가속화하고 있습니다. 이러한 사례들은 미래 조직 설계의 핵심 방향이 '인간 노동력' 중심에서 'AI-에이전트 시스템' 중심으로 이동하고 있음을 시사합니다.
Rapid-MLX는 Apple Silicon 환경에 최적화된 고성능 로컬 AI 엔진입니다. Ollama 대비 월등히 빠른 속도를 자랑하며, 특히 낮은 TTFT(Time To First Token)와 높은 도구 호출 성공률을 통해 사용자 경험과 기능성을 극대화했습니다. 이 엔진은 프롬프트 캐싱 및 17개의 도구 파서를 통합하여 효율적이고 강력한 로컬 AI 구동 환경을 제공합니다.
OpenBMB/VoxCPM은 토크나이저(tokenizer)를 사용하지 않는 혁신적인 다국어 텍스트-음성 변환(TTS) 모델입니다. 이 모델은 단순한 음성 합성을 넘어, 크리에이티브한 보이스 디자인과 고품질의 실감 나는 보이스 클로닝 기능을 제공합니다. 따라서 다양한 언어와 목적에 맞는 전문적이고 창의적인 음성 콘텐츠 제작이 가능합니다.
이 글은 엔지니어가 아닌 일반 사용자가 2015년형 맥북 에어(8GB RAM)와 같은 구형 저사양 장비에서 Claude Code와 같은 AI 모델을 24시간 지속적으로 구동하는 방법을 다루고 있습니다. 필자는 6개월간의 실험 끝에, 총 17,328번의 진화 사이클과 수많은 자동화 작업을 통해 이 시스템을 구축했으며, 그 프레임워크를 오픈소스로 공개했습니다.
Windows 사용자로서 성능 차이를 확인하기 위해 Windows 11과 Lubuntu 26.04 환경에서 llama.cpp를 이용한 벤치마크를 수행했습니다. 이 테스트는 RTX 5080 및 i9-14900KF 하드웨어 구성을 기반으로 진행되었으며, CUDA 13.1을 사용하고 Vulkan 벤치마크도 포함하여 성능 비교를 시도했습니다.
llama.cpp의 새로운 `--spec-type ngram-mod` 기능을 Qwen3.6 27B 모델을 사용하여 OpenCode 버그 추적 세션에서 테스트했습니다. 이 기능은 성능이 가변적이지만, 동일한 코드베이스를 다룰 때 상당한 속도 향상을 제공하는 것으로 나타났습니다.
최신 대규모 언어 모델(LLM)을 실행할 때 VRAM 용량이 가장 중요한 요소입니다. 따라서 최신 고용량 VRAM 카드가 아니더라도, 16GB VRAM의 메인 GPU와 구형이지만 최소한 6GB 이상의 VRAM을 가진 보조 카드를 조합하여 사용하는 것이 효과적일 수 있습니다.
본 기술 기사는 대규모 언어 모델(LLM)인 Qwen 3.6-35B-A3B의 KV 캐시 최적화 및 성능 테스트 결과를 다루고 있습니다. 특히, Perplexity와 KL 발산 같은 품질 지표를 사용하여 컨텍스트 크기 4096에서 모델의 안정성을 검증했습니다. 또한, 요청된 비대칭 K/V 조합과 64K 데이터 포인트에 대한 추가적인 분석을 수행했음을 보여줍니다.
이 기사는 특정 고성능 워크스테이션 구성(RTX 4070S, AMD 9800x3D 등)을 사용하여 대규모 언어 모델(LLM)의 추론 속도를 테스트한 결과를 다룹니다. 특히 Qwen3.6 (27B+35B) 및 Gemma 4 (26B A4B+31B)와 같은 초대형 모델들을 12GB VRAM 환경에서 구동하며 성능을 검증합니다.
이 기술 기사는 로컬 환경에서 대규모 언어 모델(LLM)을 구동하기 위한 오픈소스 애플리케이션 'Warpdrv'를 소개합니다. 이 앱은 사용자가 CUDA (RTX Pro 5000)와 Strix Halo (ROCm) 등 다양한 하드웨어 조합에서 Qwen 35b 및 27b 같은 대형 모델을 효율적으로 실행할 수 있도록 도와줍니다. 특히, 코딩 작업에 최적화된 로컬 모델 라우터 기능과 여러 LLM 서버 인스턴스를 관리하는 편의 기능을 제공합니다. 또한, Strix Halo와 같은 새로운 아키텍처에서 ROCm 환경을 성공적으로 설정하고 `llama.cpp`를 빌드하기 위한 상세한 단계별 가이드(커널 설치, GRUB 파라미터 수정 등)도 포함하여, 고급 사용자들에게 실질적인 도움을 제공합니다.
VRAM 용량이 제한적인 환경에서 llama.cpp 라이브러리를 활용하여 Qwen3.5-35B-A3B 모델을 DFlash 추론적 디코딩 방식으로 성공적으로 구동했습니다. 이 기술은 메모리 제약이 있는 하드웨어에서도 대규모 언어 모델(LLM)의 효율적인 추론을 가능하게 합니다.
일본이 군집 전투 및 소모성 임무에 활용할 초저가 골판지 드론을 배치하고 있습니다. 이 드론은 플랫팩 AirKamuy 150 모델로, 가격이 약 2,000달러에 불과하여 기존의 고가 군사 드론 대비 매우 경제적입니다.
이 프로젝트는 인공지능(AI)을 활용하여 방대한 분량의 장편 소설을 자동으로 생성하는 시스템입니다. 단순히 텍스트를 이어 붙이는 것을 넘어, 이야기의 앞뒤 맥락을 유지하고 복선(foreshadowing)을 자연스럽게 연결하며 서사를 구축하는 것이 핵심 기능입니다.
본 논문은 고위험 방위 및 보안 분야와 같이 인간 개입이 필수적인 컴퓨팅 집약적 HPC 환경을 위한 비동기 인간-AI 협업 워크플로우 프레임워크를 제안합니다. 이 프레임워크는 HPC 클러스터, 로컬 머신, 클라우드 등 하이브리드 인프라 전반에 걸쳐 작동하며, 컴퓨팅 작업을 중단하지 않고 정의된 체크포인트에서 인간의 입력을 받아 비차단적 감시 및 적응형 워크플로우를 가능하게 합니다. 이를 통해 자원 대기 시간을 최소화하고 운영 AI 시스템의 효율성과 이동성을 크게 향상시킬 수 있습니다.