Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
추론 과정에서 모델이 동일한 문구를 반복하며 컨텍스트를 소진하는 '둠 루프(Doom Loops)' 현상을 분석합니다. 기존의 반복 페널티 방식이나 강화학습 기반 해결책의 한계를 지적하며 새로운 최적화 방향을 제시합니다.
8xB200 노드에서 GLM-5.2 모델을 최적으로 서빙하기 위한 NVFP4 정밀도와 TP=4 복제본 구성의 이점을 분석합니다. 대역폭 제한 문제를 해결하기 위해 NVFP4를 사용하면 TP=8 설정보다 약 2배 높은 성능을 낼 수 있음을 보여줍니다.
실시간 대화에 최적화된 0.6B 파라미터 규모의 스트리밍 TTS 모델 Gepard 1.0이 오픈 소스로 공개되었습니다. 스트리밍 우선 설계로 약 50ms의 매우 낮은 첫 오디오 도달 시간(TTFA)과 높은 실시간 계수를 제공합니다.
llama.cpp에 새롭게 병합된 DFlash 기술을 Qwen 3.6 27B 모델에 적용하여 성능을 테스트했습니다. 투기적 디코딩(Speculative Decoding) 방식을 통해 36K 컨텍스트 환경에서 기존 대비 최대 4.44배의 속도 향상을 확인했습니다.
Qwen3.6-27B 모델의 KV 양자화가 KLD(Kullback-Leibler Divergence)에 미치는 영향을 실험적으로 분석했습니다. 다양한 양자화 수준(Q8, Q6, Q5)과 KV 양자화 조합을 비교하여 성능 저하를 최소화하는 최적의 설정을 제안합니다.
mistral.rs v0.9.0 업데이트를 통해 x86 및 ARM 환경에서 llama.cpp 대비 최대 1.8배 빠른 CPU 디코딩 속도를 달성했습니다. AVX2, AVX512, NEON 등 다양한 CPU 명령어 세트를 최적화하여 전반적인 성능을 향상시켰습니다.
Anthropic의 Jacobian Lens 논문을 활용하여 Gemma 및 Qwen 등 오픈 모델의 내부 작동 방식을 분석했습니다. 모델의 워크스페이스 상태를 통해 답변의 정확도와 환각 발생 여부를 예측할 수 있음을 실험적으로 증명했습니다.
Liquid AI가 추론 모델의 실패 모드인 '둠 루프(doom loop)'를 제거하는 오픈 소스 기술인 Antidoom을 출시했습니다. 이 기술을 적용하면 LFM2.5 및 Qwen3.5 모델에서 둠 루프 발생률을 획기적으로 낮출 수 있습니다.
Mac 환경에서 DeepSeek의 DSpark drafter를 무손실로 실행할 수 있는 MLX 포트인 mlx-dspark를 공개했습니다. Apple Silicon의 특성을 고려하여 최적화되었으며, 기존 mlx_lm 대비 약 1.4~1.6배의 속도 향상을 제공합니다.
4GB VRAM 환경에서 Gemma 4 E2B 모델을 활용해 비전, 오디오, 추론을 통합 수행하는 로컬 도구 ScreenMind를 소개합니다. pHash 캐싱과 최적화된 파이프라인을 통해 저사양 GPU에서도 효율적인 실시간 화면 모니터링 및 RAG 기능을 구현했습니다.
소형 로컬 모델과 대형 코딩 모델을 체이닝하여 VRAM을 효율적으로 관리하는 도구인 Prompt-Chaining을 소개합니다. 로컬 모델로 프롬프트를 최적화한 뒤 클라우드 모델로 코드를 생성하여 비용을 절감하고 효율을 높입니다.
로이터 통신의 중국 AI 모델 해외 접속 제한 보도가 사실과 다름을 반박합니다. 중국 정부의 실제 논의는 모델 접속 차단이 아닌, 해외 인수 및 기술 유출 방지를 통한 지식 재산권 보호에 집중되어 있습니다.
클래식 판타지 RP 에이전트의 성능을 측정하기 위해 세분화된 카테고리와 히트맵 방식을 도입한 벤치마크 업데이트 결과입니다. LLM 판사를 활용해 창의성보다는 기계적 준수 사항(상태 추적, 구조화된 출력 등)을 정밀하게 평가합니다.
llama.cpp에 Hy3 모델 지원을 위한 PR이 반영되었으며, GGUF 포맷 모델이 출시되었습니다. 사용자는 고사양 하드웨어 환경에서 안정적인 추론 속도를 확인했습니다.
PixWorld는 3D 장면 생성과 재구성을 통합하는 단일 픽셀 공간 확산 모델입니다. VAE 없이 미분 가능한 렌더링을 통해 3D 가우시안 필드를 직접 감독하며, 기하학 인지 손실을 도입하여 구조적 일관성을 확보합니다.
추론 시 backward pass 없이 지속적 학습을 수행하는 3M 파라미터 규모의 Fast-weight Memory Transformer 연구를 소개합니다. 이 모델은 별도의 TTT나 optimizer 없이 forward pass만으로 새로운 규칙을 메모리 뱅크에 저장하고 일반화할 수 있습니다.
NVIDIA가 Iterative Puzzle 압축 프레임워크를 통해 개발한 Nemotron-Labs-3-Puzzle-75B-A9B 모델을 공개했습니다. 이 모델은 하이브리드 MoE 아키텍처를 사용하여 파라미터 수를 줄이면서도 추론 효율성과 정확도를 극대화했습니다.
HOLA 아키텍처가 매우 작은 KV 캐시를 사용하면서도 Full Attention보다 16% 더 나은 Perplexity를 달성했음을 분석합니다. 기존의 속도 향상 중심 기술들보다 선형 어텐션 기반의 정확도 개선이 갖는 가치를 강조합니다.
NVIDIA가 Nemotron-Cascade-2-30B-A3B를 기반으로 한 통합 오디오-텍스트 LLM인 Nemotron-Labs-Audex-30B-A3B를 공개했습니다. 이 모델은 텍스트 추론 능력을 유지하면서 오디오 인코더와 확장된 어휘를 통해 음성 인식, 번역, TTS 등 강력한 오디오 작업 능력을 제공합니다.
언어 모델의 암기(Memorization)와 일반화(Generalization)를 분리하여 모델의 용량을 측정하는 새로운 방법론을 제안합니다. GPT 스타일 모델의 파라미터당 용량이 약 3.6비트임을 밝히고, 모델 용량과 데이터 크기 사이의 스케일링 법칙을 도출했습니다.