Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.

kwaipilot가 MoE 구조를 채택한 오픈 웨이트 모델 KAT-Coder-V2.5-Dev를 출시했습니다. SFT와 RL 학습을 통해 에이전틱 코딩 분야에서 SOTA 성능을 달성했으며, 도구 레이블 오류 및 반복 동작을 크게 개선했습니다.

모바일 기기에서 35B MoE 모델을 활용해 즉석에서 Snake 게임 코드를 생성하고 실행하는 기술을 소개합니다. BigMoeOnEdge 기술을 통해 대규모 MoE 모델을 RAM 제한 없이 모바일 CPU에서 효율적으로 구동할 수 있음을 보여줍니다.
DeepSeek 창업자 Liang Wenfeng는 투자자 미팅을 통해 상업적 수익보다 AGI 달성을 최우선 목표로 삼고 있음을 밝혔습니다. 그는 오픈 소스 전략이 AI 시장의 거대한 가치를 선점하기 위한 필수적인 선택이며, 자원 격차를 극복하기 위해 스케일링 법칙을 신뢰한다고 강조했습니다.

ASCIITermDraw-bench를 통해 최신 VLM 모델들의 ASCII 다이어그램 생성 능력을 벤치마킹한 결과입니다. 현재 SOTA 모델들도 복잡한 구조적 레이아웃과 정밀한 시스템 설계를 텍스트로 구현하는 데 한계를 보이고 있습니다.

Ascend NPU SuperPOD 환경에서 DeepSeek-V4 모델의 효율적인 사후 학습을 위한 최적화 프레임워크인 SLAI T-Rex를 제안합니다. 계층적 최적화를 통해 MFU를 34.22%까지 끌어올렸으며, 운영 연구(OR) 특화 데이터 파이프라인을 통해 높은 추론 성능을 달성했습니다.

HPD-Parsing은 계층적 병렬 디코딩(HPD) 패러다임을 통해 고처리량과 고정확도를 동시에 달성한 1B 규모의 문서 파싱 모델입니다. 메인 레이아웃 브랜치와 병렬 콘텐츠 브랜치를 활용하여 문서 구조를 조정하고 콘텐츠를 병렬로 생성함으로써 기존 모델 대비 압도적인 처리 속도를 구현했습니다.
최근 오픈 모델 출시 시 제기되는 '모델 증류(distillation)' 의혹이 기술적으로 과장되어 있음을 지적합니다. 단순한 텍스트 출력 기반의 합성 데이터 생성과 로짓(logits)을 활용한 진정한 의미의 증류를 구분해야 한다고 주장합니다.

저렴한 USB-이더넷 어댑터를 사용하여 멀티 노드 GPU 환경을 구축하는 방법을 소개합니다. 고가의 네트워킹 장비 없이도 일반 이더넷 케이블을 통한 포인트 투 포인트 연결로 대규모 모델을 실행할 수 있음을 보여줍니다.
LongCat-2 모델 학습에 사용된 중국산 AI ASIC 가속기의 기술적 특징을 분석합니다. Nvidia GPU 없이도 1.6조 파라미터 규모의 모델을 안정적으로 학습할 수 있음을 보여주며, 슈퍼포드 구조와 메모리 최적화 기법을 활용한 설계 방식을 다룹니다.

Vast AI에서 RTX 3080 4장을 활용해 Qwen2.5-27B 모델의 코드 생성 성능을 벤치마킹한 결과입니다. 저렴한 중고 부품 조합으로 높은 컨텍스트 처리 속도와 가성비를 갖춘 강력한 AI 워크스테이션 구축이 가능함을 보여줍니다.
r/wallstreetbets 서브레딧을 기반으로 한 24/7 AI 라디오 스테이션 구축 사례를 소개합니다. Gemma 4, ACE-Step, Krea 등 다양한 로컬 호스팅 모델을 활용하여 음악, 가사, 뉴스 요약 및 이미지 생성을 자동화합니다.
Laguna S 2.1 모델에서 추론 단계(reasoning phase)가 작동하지 않는 이슈를 분석합니다. 채팅 템플릿 설정 및 preserve_thinking 옵션과 관련된 버그 가능성을 제시하며, Qwen 템플릿을 통한 해결 방안을 제안합니다.
SAOD(Session-Adaptive Orthogonal Distillation) 기술을 통해 744B 규모의 거대 모델을 100GB 미만으로 압축하는 연구를 소개합니다. 이를 통해 8GB VRAM 환경에서도 70-100B MoE 모델을 실행할 수 있는 가능성을 제시합니다.

archex는 코딩 에이전트를 위한 로컬 우선 및 결정론적 코드 컨텍스트 생성 도구입니다. BM25F와 그래프 확장을 사용하여 저장소를 효율적인 컨텍스트 번들로 변환하며, 기존 방식 대비 높은 재현율과 낮은 토큰 비용을 제공합니다.

Poolside가 Laguna S 2.1 모델의 루핑(looping) 문제를 해결한 Full Precision 및 FP8 업데이트 버전을 출시할 예정입니다.
Poolside의 Laguna S 2.1 모델을 OpenCode를 통해 코딩 성능 테스트한 결과, 기대치에 미치지 못하는 성능을 보였습니다. 모델이 생성 도중 반복적으로 멈추거나 여러 번의 프롬프트 입력이 필요한 등 불안정한 모습을 보였습니다.

Fish Audio의 S2 모델을 Apple Silicon의 MPS 환경에서 최적화한 McFish 프로젝트를 소개합니다. 양자화와 KV 캐시 최적화를 통해 추론 속도를 획기적으로 개선했습니다.
Bad Theory Labs가 에이전트 코딩 및 도구 사용에 최적화된 27B 오픈 웨이트 모델 BTL-3를 공개했습니다. 독자적인 양자화 기술을 통해 8.39GB의 단일 파일로 압축하면서도 모델 지능의 92.2%를 유지하며, 로컬 환경에서 강력한 에이전트 성능을 제공합니다.

Arcee AI와 미국 에너지부(DOE)가 과학 연구를 위한 1조 파라미터 규모의 오픈 웨이트 모델인 Genesis-Science-1(GS1) 개발을 발표했습니다. GS1은 올해 말 기술 보고서와 함께 오픈 소스로 출시될 예정이며, 국가 연구소와 기관들이 민감한 데이터를 안전하게 처리할 수 있는 독자적인 모델 환경을 제공하는 것을 목표로 합니다.
순수 C99로 구현된 CPU 전용 LLM 추론 엔진인 Project Zero를 소개합니다. 외부 의존성 없이 단일 바이너리로 작동하며, bitnet.cpp 대비 Intel Xeon 환경에서 약 1.8배 빠른 성능을 보여줍니다.