Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
Hugging Face가 어떤 코딩 에이전트들이 Hub를 사용하고 있는지 분석한 공개 데이터셋을 출시했습니다. User Agent 토큰을 기반으로 생성된 이 데이터셋은 에이전트들의 Hub 활용 패턴을 보여줍니다.
llama.cpp의 커스텀 브랜치를 사용하여 DeepSeek V4 Pro 모델의 성능 최적화 및 벤치마크 결과를 공유합니다. 메모리 효율성 개선과 전문가 오프로딩(expert offloading)을 통한 실행 성능 향상을 다룹니다.
듀얼 RTX 3090 시스템에서 P2P(Peer-to-Peer) 모드 활성화에 따른 성능 변화를 벤치마크한 결과입니다. Qwen2.5-27B 모델을 활용해 테스트했으며, 설정의 실질적인 효용성을 검증했습니다.
Surface Evolver라는 물리 시뮬레이션 도구를 활용하여 LLM의 커스텀 데이터 형식 작성 능력을 평가하는 새로운 벤치마크를 소개합니다. 모델이 문서를 참조하고 시뮬레이션을 디버깅하는 에이전틱 루프 능력을 측정합니다.
로컬 환경에서 실행되는 DeepSeek V4 Flash가 API 기반의 Claude Sonnet 및 Opus보다 실제 코딩 작업 완료 속도 면에서 더 뛰어난 성능을 보인다는 벤치마크 결과입니다. 품질은 Opus가 우세하지만, 속도와 효율성 측면에서 로컬 모델의 실용성이 입증되었습니다.
Claude Code 사용자가 로컬 모델을 위해 ANTHROPIC_BASE_URL을 설정할 때 작동하는 내부 메커니즘을 분석한 내용입니다. 코드 내 암호화된 목록을 디코딩한 결과, 특정 중국 도메인과 AI 연구소 관련 키워드, API 게이트웨이 목록이 포함되어 있음이 밝혀졌습니다.
4개의 DGX Spark 환경에서 GLM-5.2 NVFP4 모델을 실행할 때 발생하던 MTP(Multi-Token Prediction) 수락률 저하 버그를 해결한 보고서입니다. vLLM 설정 파이프라인의 오류를 수정하여 128K 컨텍스트에서도 성능 저하 없이 높은 토큰 생성 속도를 확보했습니다.
audio.cpp가 GGML 기반의 대규모 오디오 확장 기능을 출시했습니다. 음악 및 효과음 생성, 음원 분리 기능을 포함하며, C++/GGML 네이티브 경로를 통해 기존 Python 대비 빠른 추론 성능을 제공합니다.
Gemma4-31B 모델에 identity-initialized layer insertion 방식을 적용해 레이어를 확장한 실험 결과, 성능이 오히려 저하됨을 확인했습니다. 삽입된 레이어들이 잔차 스트림에 유의미하게 기여하지 못하고 항등 함수에 가깝게 머무는 현상이 성능 하락의 원인으로 분석되었습니다.
합성 의료 데이터를 활용한 RAG 벤치마크를 통해 모델 수정보다 데이터 표현 방식의 개선이 성능 향상에 더 결정적임을 입증했습니다. Small-to-Big 검색과 집계 정보를 담은 롤업 문서를 활용할 때 가장 높은 성능을 보였습니다.
232M 파라미터 규모의 실험적 모델인 Hierarchos의 연구 결과를 소개합니다. RWKV 백본과 계층적 매니저/워커 루프, 미분 가능한 슬롯 기반 장기 메모리를 결합한 하이브리드 비-Transformer 아키텍처를 통해 모델의 효율성과 일관성을 증명했습니다.
llama.cpp의 DSA lightning indexer 지원 문제를 해결하기 위해 CUDA 커널을 직접 패치하여 DeepSeek V4 Flash 모델의 1M 컨텍스트 실행을 가능하게 했습니다. RTX 5090 환경에서 VRAM 사용량을 획기적으로 줄여 대규모 컨텍스트를 로컬에서 효율적으로 처리할 수 있음을 검증했습니다.
Granite 4 350M을 기반으로 지속적 사전 학습과 커스텀 SFT를 거친 Fijik 2.0 350M 모델이 출시되었습니다. lfm2.5의 커스텀 라이선스에 대응하기 위해 Apache-2.0 오픈 라이선스를 채택했습니다.
llama.cpp의 새로운 Pull Request를 통해 Intel ARC GPU에서 프롬프트 처리(PP) 속도가 대폭 향상되었습니다. 테스트 결과, B580 환경에서 처리 속도가 245t/s에서 462t/s로 크게 개선되었습니다.
사용자가 Google의 Gemma 4 31B 모델을 기반으로 레이어 스케일링 기법을 적용하여 44B 규모의 모델로 확장하는 실험을 진행했습니다. LLaMA Pro 방식에서 영감을 얻어 60개 레이어를 88개로 늘려 모델의 용량을 확보했습니다.
RTX 3090 환경에서 Qwen3.6 27b, Gemma4 26B, Ornith1.0 35B 모델을 대상으로 로컬 벤치마크를 수행한 결과입니다. inspect-ai를 활용해 일반 지식, 추론, 코딩 성능을 비교 분석했습니다.
6개의 NVIDIA P40 GPU를 활용하여 Minimax M2.7_Q3_XL 모델을 구동하는 홈 랩 구축 사례와 벤치마크 결과를 공유합니다. 다양한 컨텍스트 길이와 배치 사이즈에 따른 성능 변화를 분석하여 최적의 설정을 제안합니다.
Gemma-4-31B 모델을 카피라이팅 및 창작 작문에 특화하여 미세 조정(Fine-tuning)한 사례를 소개합니다. 상투적인 표현을 배제하고 직접 반응형 카피라이팅 스타일을 구현하여 벤치마크 테스트에서 높은 성능을 입증했습니다.
Gemma 4 모델을 WebGPU 커널을 통해 구현하여 초당 255 토큰의 빠른 속도를 달성했습니다. 이는 로컬 프라이빗 모델이 고성능 작업을 효율적으로 수행할 수 있는 가능성을 보여줍니다.
Gemma 4 31b 모델을 기반으로 SWA 레이어 재설계 및 Attention 기반 Residual Networks를 적용하여 26b 규모의 고성능 모델로 재구축하는 프로젝트를 소개합니다. 모델 크기를 줄이면서도 전역적 일관성과 긴 문맥 처리 능력을 향상시키는 것을 목표로 합니다.