Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
BitTorrent와 Nostr 프로토콜을 결합하여 오픈 웨이트 LLM을 탈중앙화 방식으로 공유하고 검증하는 프로젝트 llama.garden을 소개합니다. 웹시드(webseeds)를 통해 HuggingFace 데이터의 무결성을 검증하고, Nostr의 수요 신호 전달을 통해 모델 배포의 지속 가능성을 확보합니다.
TurboOCR v3는 C++와 CUDA를 기반으로 한 고속 로컬 문서 OCR 서버입니다. RTX 5090 환경에서 초당 약 520장의 이미지를 처리하며, 레이아웃 분석부터 표, 수식, 마크다운 변환까지 지원합니다.
EPYC 프로세서를 활용한 하이브리드 AI 추론 시스템의 성능 벤치마크 결과입니다. 다양한 EPYC 모델과 DDR5 메모리 설정에 따른 LLM 추론 속도(t/s)를 비교 분석했습니다.
Qwen 3.6 27B 모델을 대상으로 다양한 llama.cpp 포크 엔진과 투기적 디코딩(Speculative Decoding) 기법의 성능을 비교 분석한 벤치마크 결과입니다. 단일 RTX 3090 환경에서 ik_llama 포크를 활용해 코드 생성 시 최대 100 TPS에 근접하는 성능을 확인했습니다.
GLM 5.2 모델을 활용하여 다중 파일 기반의 컴퓨터 비전 스튜디오 구축 프로젝트를 수행한 실무 테스트 결과입니다. 모델이 복잡한 계획 수립, 다중 파일 간의 일관성 유지, 합리적인 기술적 트레이드오프 결정 능력을 갖추었음을 확인했습니다.
HydraHead는 레이어 단위가 아닌 헤드 수준의 기능적 이질성을 활용하여 Full Attention과 Linear Attention을 결합한 새로운 하이브리드 어텐션 아키텍처입니다. 해석 가능성 분석을 통해 검색에 중요한 헤드를 식별하고, 스케일 정규화 융합 모듈을 통해 효율적인 긴 문맥 처리를 구현합니다.
Meta가 OpenAI, Google, Character.AI의 챗봇을 대상으로 미성년자 관점의 위기 프롬프트를 활용한 비밀 테스트를 진행했습니다. 수백 명의 계약업체를 통해 자살, 성, 약물 등 민감한 주제에 대한 AI의 반응을 대규모로 검증했습니다.
Huawei가 512K 컨텍스트 길이를 지원하는 OpenPangu-2.0-Flash 모델을 오픈 소스로 공개했습니다. 이 모델은 총 92B 파라미터 중 6B만 활성화되는 구조이며, 가중치와 추론 및 학습 코드가 함께 제공됩니다.
Ascend에서 개발한 92B 규모의 MoE 모델인 openPangu-2.0-Flash를 소개합니다. 512k의 긴 컨텍스트 길이를 지원하며, 통합 SFT와 강화학습(RL)을 통해 사고 능력을 최적화했습니다.
Cerebras와 Gemma 해커톤을 통해 제작된 프로젝트로, 로봇 Reachy Mini와 Eliza가 Gemma 31B VLM을 사용하여 실시간으로 포커 게임을 즐기는 시스템입니다. 웹캠과 로봇 카메라를 통해 카드를 추적하며, 음성 명령만으로 게임을 진행하는 오케스트레이션 기술을 보여줍니다.
Qwen3.6-35B-A3B 모델에 규범 보존 이중 투영 기술을 적용하여, 모델의 지능 저하 없이 거부 메커니즘을 제거하는 데 성공했습니다. 하이브리드 어텐션과 3D 전문가 텐서 구조를 고려한 정밀한 Abliteration을 통해 거부율 0%와 벤치마크 성능 유지를 동시에 달성했습니다.
llama.cpp의 루프 방지 기능을 개선한 개인 포크 버전을 소개합니다. 실시간 토큰 모니터링을 통해 반복적인 출력 사이클을 감지하고, 온도를 조절하여 모델이 루프에서 벗어나도록 돕는 샘플러를 구현했습니다.
Qwen3.5/3.6 모델의 토큰 생성 속도를 높이기 위해 MTP(Multi-Token Prediction) 텐서만을 포함한 GGUF 서브셋을 공개했습니다. 이 모델들은 특정 모델의 성능 가속화나 MTP 텐서 이식(grafting) 실험을 목적으로 설계되었습니다.
Tesla V100 16GB GPU를 활용한 로컬 LLM 추론 성능 벤치마크 결과입니다. 단일 및 NVLink를 통한 듀얼 모듈 구성 시의 토큰 생성 속도와 TCC 모드 설정에 따른 성능 향상 폭을 분석했습니다.
Microsoft의 FastContext 논문을 바탕으로, 저장소 탐색 과정을 메인 에이전트에서 분리하여 토큰 비용을 절감하는 실험을 진행했습니다. 검색 힌트(retrieval hints) 방식을 적용한 결과, 성능 저하 없이 총 토큰 사용량을 약 43.8% 감소시킬 수 있음을 확인했습니다.
평범한 노트북 사양에서 Qwen3.6 모델을 활용해 로컬 코딩 에이전트 환경을 구축하는 방법을 소개합니다. 로컬 모델과 클라우드 모델(GLM 5.2)을 혼합하여 비용 효율적으로 코드 리뷰 및 작업 계획을 수행하는 워크플로우를 공유합니다.
Qwen3.6-27B 모델을 3개의 비평가(critics)로 구성된 코딩 하네스에서 실행한 결과, 프론티어 모델 수준의 품질을 확보할 수 있었습니다. 계획 단계에는 강력한 모델을, 실행 단계에는 저렴한 모델을 사용하는 하이브리드 전략의 유효성을 확인했습니다.
직접 라벨링한 900개의 의료 스캔 문서를 활용하여 의료 VQA 성능을 테스트한 결과입니다. 기존 코딩 벤치마크와는 다른 양상이 나타났으며, 모델별 추론 속도와 사고 과정의 차이를 분석했습니다.
Ollama 사용자의 대화 패턴을 압축하여 시스템 프롬프트로 자동 주입하는 CLI 사이드카 도구인 fg-sync를 소개합니다. 초차원 컴퓨팅 기술을 활용해 대량의 세션 데이터를 매우 작은 크기로 압축하여 효율적인 컨텍스트 관리를 지원합니다.
Krea-2-Turbo 모델의 빠른 생성 속도와 높은 품질, 그리고 검열 해제 및 이미지 편집 기능을 소개합니다. SGLang diffusion 설치와 특정 프롬프트를 활용해 모델의 제한 사항을 우회하고 스타일 일관성을 유지하는 방법을 다룹니다.