Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
LLM이 자신의 불확실성을 수치화하는 다양한 방법론을 분석합니다. 화이트박스 방식과 블랙박스 방식의 차이점을 설명하며, 텍스트 기반 신뢰도 유도 및 언어적 불확실성 활용법을 다룹니다.
Fractale-350M-base는 긴 컨텍스트 대신 학습된 '빠른 가중치 메모리(fast-weight memory)'를 사용하는 386M 파라미터 규모의 베이스 모델입니다. 8개의 벡터 뱅크를 통해 정보를 저장하며, 메모리가 순전파 과정의 일부로 통합되어 검색 없이도 효율적인 정보 유지가 가능함을 입증했습니다.

본 기사는 프로덕션 인프라 침입 사고 대응 과정을 다루며, 자체 AI 시스템을 이용해 이상 징후를 탐지했음을 설명합니다. 상용 API의 안전 가드레일로 인해 분석이 막히자, 오픈 웨이트 모델(GLM 5.2)을 활용하여 포렌식 분석을 수행한 경험을 공유하고 있습니다.

본 논문은 소비자 기기 환경에서 LLM 추론 시 발생하는 메모리 제약을 해결하기 위해 ATSInfer라는 하이브리드 CPU-GPU 시스템을 제안합니다. 기존의 레이어/전문가 단위 스케줄링 방식의 한계를 극복하고, 텐서 단위 오프로딩과 비동기 CPU-GPU 조정을 통해 효율성을 높였습니다. 테스트 결과, Prefill 및 Decode 처리량에서 큰 폭의 성능 향상을 입증했습니다.
본 논문은 AI 에이전트가 행동하기 직전에 어떤 신호를 모니터링해야 하는지 탐구합니다. 'Beyond the Black Box: Interpretability of Agentic AI Tool Use'라는 연구를 통해, 메커니즘적 해석 가능성을 활용하여 도구 사용 결정 과정의 투명성을 높이는 방법을 제시합니다.

ASCIITermDraw-Bench는 VLM이 순수 텍스트(ASCII)만을 사용하여 다이어그램을 생성하고 편집하는 능력을 평가하는 새로운 벤치마크입니다. 기존의 코딩이나 추론 중심 벤치마크와 달리, 이 테스트는 상자, 레이블, 연결선 등을 정밀하게 배치하는 시각적 구조화 능력을 측정합니다. 이 벤치마크는 아키텍처 다이어그램 생성 및 이미지 기반 편집 등 네 가지 영역을 포함하며, 구조적 점수와 의미론적 점수를 통해 엄격하게 평가됩니다.

Qwen3.6-37B 모델의 파인튜닝 성능을 여러 테스트(메모리, 에이전시, 코딩)를 통해 비교 분석한 내용입니다. 전반적으로 BottleCap (BC) 버전이 속도 면에서 우위를 보였으며, 일부 영역에서는 베이스 모델 대비 개선점을 확인했습니다.

Dean W. Ball은 Kimi와 같은 중국의 강력한 AI 모델에 주목하며, 정부가 이러한 유능한 오픈 웨이트 모델을 허용하는 점에 의문을 제기했습니다. 그는 오픈 웨이트 모델이 AI 자본 지출 속도를 늦추고 국가 통제형 공공 인프라로 변모할 수 있다고 분석합니다.
본 글은 검증된 지식을 KV 상태로 저장하고, 이를 새로운 계산과 바이트 단위로 복원하는 방법을 발표합니다. Gemma 4 12B 모델에 적용했을 때, 기존 라우팅 시스템의 성능을 AIME 2025에서 76.7%에서 90.0%로 향상시킨 연구 결과를 제시했습니다.

Kimi K3가 웹 브라우저 환경에서 macOS 27을 재현하는 데 성공했습니다. 이는 AI 모델의 시각적 이해력과 복잡한 인터페이스를 구현하는 능력을 보여주는 사례입니다.
본문은 AI 모델의 성능 차이를 ELO 점수와 승률로 분석하며, 30점 정도의 격차는 사용자에게 알아차리기 어려울 수 있음을 지적합니다. Kimi-k3가 주목받는 이유는 그 성능 격차가 '충분히 가깝게' 느껴지기 때문이며, 모델별 강점이 다름을 보여줍니다.

Kimi K3 모델이 DeepSWE 벤치마크에서 3위를 차지하며 주목받고 있습니다. 이는 Claude Fable 및 GPT-5.6 Sol과 유사한 최첨단 성능을 보여준 최초의 오픈 웨이트 모델이라는 점에서 의미가 큽니다.
본 기사는 llama.cpp를 활용하여 DeepSeek V4 Flash 모델을 1백만 컨텍스트 크기에서 테스트한 결과를 공유합니다. 다양한 최적화 설정을 적용했음에도 불구하고, 프리필은 650~700 토큰/초, 디코드는 17 토큰/초의 성능이 측정되었습니다. 전반적인 속도는 아직 Qwen 모델에 비해 부족하지만, llama.cpp를 통해 추가적인 최적화 가능성이 남아있음을 시사합니다.

Blackwell 장치에 최적화된 llama.cpp 포크 프로젝트가 GitHub에 공개되었습니다. 이 프로젝트는 특정 하드웨어(Blackwell) 환경에서 LLM 구동의 성능 향상에 초점을 맞추고 있습니다.
본 글은 향후 몇 년간의 AI 경쟁 구도에 대한 전망을 제시하며, 특히 중국 시장에 초점을 맞추고 있습니다. 필자는 2028년까지 오픈소스 모델이 폐쇄형(closed) 모델을 능가할 것이라는 예측을 공유했습니다.
Kimi.ai가 'k3'라는 이름의 비디오 콘텐츠를 곧 출시할 예정임을 티징했습니다. 이 모델은 codename kivine으로 알려져 있으며, 기존 fable보다 성능은 좋지만 속도는 느리다는 특징을 가집니다. 관련 리뷰 영상도 이미 공개되어 있습니다.

오픈 웨이트 모델들이 클로즈드 모델의 성능 격차를 빠르게 따라잡고 있으며, Kimi K3과 같은 사례는 오픈 모델이 단순히 추격하는 단계를 넘어 최전선을 능가할 시점이 임박했음을 시사합니다.

OpenLLM-France가 개발한 Luciole-23B-Instruct-1.1은 오픈 소스 다국어 인과 언어 모델입니다. 이 모델은 BPI France의 지원을 받아 Jean Zay에서 세 단계에 걸쳐 SFT와 DPO를 거쳐 파인튜닝 및 정렬되었습니다. 수학, 코딩, RAG 등 다양한 분야의 지식을 학습했습니다.

Kimi K3 모델이 웹 및 앱 환경에 출시되었습니다. 이 모델은 2.8T 파라미터와 1M 컨텍스트 창을 자랑하며, 코딩, 에이전트 작업, 장기 추론 등 여러 분야에서 뛰어난 성능을 보여줍니다.
대규모 언어 모델(LLM)이 JSON과 같은 구조화된 데이터를 반복적으로 생성하는 '반복 함정' 현상을 분석했습니다. 특히 Qwen3-VL-30B와 Gemma 등의 모델들이 동일한 유효한 JSON 객체를 계속해서 출력하는 문제를 다루며, 해당 현상의 원인과 작동 방식을 정리했습니다.