Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
Jensen Huang의 오픈 모델 지지 서한이 단순한 오픈 소스 옹호가 아닌, 미국의 AI 리더십을 공고히 하기 위한 지정학적 전략임을 분석합니다. 이는 미국 모델을 글로벌 표준으로 만들어 중국의 AI 패권을 견제하려는 의도를 담고 있습니다.
API 키 없이 로컬 LLM에서 실행 가능한 50가지 AI 기술(SKILL.md)을 오픈소스로 공개했습니다. 프롬프트 엔지니어링을 넘어선 설명 엔지니어링의 중요성과 MCP 프로토콜 활용, 로컬 실행의 프라이버시 이점 등 1년간의 개발 경험을 공유합니다.
Intel Z890과 같은 소비자용 플랫폼은 PCIe P2P 통신을 방해하는 하드웨어/펌웨어 제한으로 인해 멀티 GPU 구성에 부적합합니다. 이로 인해 AI 학습 및 추론 워크로드에서 대역폭이 급감하고 성능 저하가 발생합니다.

로컬 LLM의 긴 컨텍스트 추론 시 발생하는 KV-cache 메모리 문제를 해결하기 위한 오픈 소스 압축 프레임워크 DKV를 소개합니다. 앵커 기반 표현과 저차원 압축 기술을 통해 메모리 요구 사항을 줄이며, CLI와 MLX/CUDA 백엔드를 지원합니다.

4M 및 10M 미만의 파라미터를 가진 초소형 완전 TTS 모델인 Inflect v2가 출시되었습니다. 외부 보코더 없이 CPU/CUDA 환경에서 로컬로 실행 가능하며, 크기 대비 뛰어난 음성 품질과 실시간 추론 성능을 제공합니다.

Microsoft 웹사이트의 특정 페이지에서 OpenAI가 오픈 웨이트(Open Weight) AI 서한의 서명자로 표시된 것이 발견되었습니다. 이는 기업의 공식 입장 변화나 전략적 움직임과 관련될 수 있어 주목받고 있습니다.

InstructSAM 모델을 llama.cpp 환경에서 실행할 수 있도록 GGUF 형식으로 변환하고 C++로 포팅하는 과정을 다룹니다. 멀티모달 데이터셋 합성 파이프라인을 단순화하기 위해 세그멘테이션 헤드가 통합된 모델을 양자화하여 효율적으로 사용하는 방법을 제시합니다.
OrangePi AI Studio Pro 환경에서 vLLM을 실행하기 위해 rtGetDevMsg 스텁을 구현하여 장치 기능을 모사하는 데 성공했습니다. 이를 통해 torch_npu가 정상 작동하도록 하여 해당 장치에서 vLLM을 활용할 수 있게 되었습니다.

LLM의 공간 인지 능력과 기억력을 측정하기 위해 미로 탈출을 활용한 새로운 벤치마크를 제안합니다. 모델이 도구 호출을 통해 열쇠를 찾고 문을 여는 과정을 통해 공간적 추론과 도구 활용 능력을 평가합니다.
120B 규모의 새로운 모델인 Laguna S 2.1이 복잡한 메모리 제약 조건이 있는 알고리즘 문제를 해결하는 과정을 다룹니다. 긴 사고 과정(thinking tokens)을 통해 기존 Qwen 모델이 실패한 고난도 코딩 문제를 성공적으로 해결했음을 보여줍니다.

MTP(Multi-Token Prediction)의 성능을 극대화하기 위한 튜닝 방법과 벤치마크 결과를 소개합니다. 모델과 하드웨어 조합에 따라 n_max 설정값이 성능에 큰 영향을 미치며, 모델 제품군별로 최적의 확장성이 다름을 보여줍니다.

2026년 7월 기준, 23개 오픈 웨이트 모델의 20B-500B 파라미터 아키텍처를 분석한 서베이 결과입니다. Kimi K3 Swarm을 활용해 어텐션 설계의 차이점과 최신 기술 트렌드를 심도 있게 비교 분석했습니다.

LLM 배포 효율을 높이기 위해 기존의 손실 압축 방식과 무손실 방식 사이의 중간 지점인 '통계적 무손실 양자화'를 제안합니다. 태스크 무손실과 분포 무손실이라는 두 가지 개념을 통해 정확도와 추론 속도 사이의 트레이드오프를 최적화하는 방법을 다룹니다.

GPT 5.6 Sol 에이전트 군집이 Kimi K3 모델의 추론 속도를 65 tok/s에서 406 tok/s로 대폭 최적화했습니다. 에이전트들이 협업하여 연산자 융합 및 새로운 커널 알고리즘을 개발하는 과정을 시각화하여 보여줍니다.
Laguna S2.1 모델을 로컬 환경에서 테스트한 실제 사용 사례를 다룹니다. 이 모델은 일반적인 플래닝 작업에는 부적합하지만, 과도할 정도로 심층적인 추론 스타일 덕분에 복잡한 디버깅 작업에서 탁월한 성능을 보입니다.
이론 물리학과 정보 이론을 결합하여 AI의 사고 체계를 확장하는 'Omega Codex' 프롬프트 프레임워크를 소개합니다. 고밀도 전문 용어와 수학적 구조를 활용해 AI가 양자-계산적 관점에서 문제를 분석하도록 설계되었습니다.

Zagreus-0.4B-por는 포르투갈어 특화 소규모 오픈 소스 언어 모델입니다. 0.4B의 작은 파라미터 크기에도 불구하고 포르투갈어의 언어적 특성을 효과적으로 포착하도록 설계되었습니다.

Microsoft 주도로 NVIDIA, Meta, Microsoft, Palantir 등 20개 이상의 기업이 오픈 웨이트 모델 규제에 반대하는 공개 서한을 발표했습니다. 이들은 모델 증류와 도용을 명확히 구분해야 한다고 주장하며 기술 리더십을 강조했습니다.

SupraLabs에서 소형 언어 모델(SLM)의 추론 능력을 향상시키기 위한 500만 개의 샘플을 포함한 Reasoning Corpus 데이터셋을 출시했습니다. 이 데이터셋은 사고 사슬(CoT)과 ChatML 형식을 포함하며, SFT 및 미세 조정에 최적화되어 있습니다.

FLUX 3는 이미지, 비디오, 오디오 및 액션 예측을 지원하는 통합 멀티모달 플로우 모델입니다. 시각적 지능의 백본 역할을 수행하며, 다양한 스타일에서 실제와 유사한 고품질 결과물을 생성합니다.