Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
창의적인 도서 집필을 목적으로 설계된 PageStorm Research Preview 모델을 발표합니다. 이 모델은 LongPage 데이터셋을 기반으로 하며, 단일 턴으로 도서 규모의 긴 글을 작성할 수 있도록 구축되었습니다.
Qwen 3.6 27B 모델을 대상으로 다양한 llama.cpp 포크 엔진과 투기적 디코딩(Speculative Decoding) 기법의 성능을 비교 분석한 벤치마크 결과입니다. 단일 RTX 3090 환경에서 ik_llama 포크를 활용해 코드 생성 시 최대 100 TPS에 근접하는 성능을 확인했습니다.
HydraHead는 레이어 단위가 아닌 헤드 수준의 기능적 이질성을 활용하여 Full Attention과 Linear Attention을 결합한 새로운 하이브리드 어텐션 아키텍처입니다. 해석 가능성 분석을 통해 검색에 중요한 헤드를 식별하고, 스케일 정규화 융합 모듈을 통해 효율적인 긴 문맥 처리를 구현합니다.
Huawei가 512K 컨텍스트 길이를 지원하는 OpenPangu-2.0-Flash 모델을 오픈 소스로 공개했습니다. 이 모델은 총 92B 파라미터 중 6B만 활성화되는 구조이며, 가중치와 추론 및 학습 코드가 함께 제공됩니다.
Ascend에서 개발한 92B 규모의 MoE 모델인 openPangu-2.0-Flash를 소개합니다. 512k의 긴 컨텍스트 길이를 지원하며, 통합 SFT와 강화학습(RL)을 통해 사고 능력을 최적화했습니다.
Qwen3.6-35B-A3B 모델에 규범 보존 이중 투영 기술을 적용하여, 모델의 지능 저하 없이 거부 메커니즘을 제거하는 데 성공했습니다. 하이브리드 어텐션과 3D 전문가 텐서 구조를 고려한 정밀한 Abliteration을 통해 거부율 0%와 벤치마크 성능 유지를 동시에 달성했습니다.
직접 라벨링한 900개의 의료 스캔 문서를 활용하여 의료 VQA 성능을 테스트한 결과입니다. 기존 코딩 벤치마크와는 다른 양상이 나타났으며, 모델별 추론 속도와 사고 과정의 차이를 분석했습니다.
VLM을 활용하여 로봇 비디오를 세부 하위 작업으로 자동 변환하는 새로운 파이프라인을 구축했습니다. 이 방식은 인간 주석 처리 대비 비용을 19배 절감하며, 장기적 과제 수행을 위한 정밀한 학습 신호 생성에 효과적입니다.
HuiHui abliterated 모델이 Vanilla 3.6-35B-a3B 모델보다 수학 및 코딩 벤치마크에서 더 높은 성능을 보였습니다. 거절 메커니즘을 제거하는 과정이 특정 추론 작업에서 긍정적인 영향을 미칠 수 있음을 시사합니다.
Qwen 3.5를 기반으로 미세 조정된 오픈 소스 모델 MaralGPT Mythos 9B 2606이 출시되었습니다. 이 모델은 검열이 없는 개방적인 특성을 가지며, 100만 토큰의 확장된 컨텍스트 윈도우를 지원합니다.
대형 모델의 절차적 기술을 소형 모델로 전이할 수 있는지 확인하기 위한 실험적 방법론을 소개합니다. Three.js를 활용해 모델의 계획 능력과 구조적 실행력을 테스트하며, 스캐폴딩(scaffolding)을 통해 소형 모델의 성능 개선 가능성을 탐색합니다.
이미지를 제어 가능한 캐릭터로 변환하는 로컬 실행형 800M 모델을 소개합니다. 디퓨전 포싱과 인과적 디퓨전 방식을 사용하여 프레임 간 안정성을 높였으며, 소비자용 GPU에서도 원활하게 작동합니다.
Ornith-1.0-35B GGUF 모델에 네이티브 MTP(Multi-Token Prediction) 투기적 디코딩 기술을 접목하여 추론 성능을 개선했습니다. IQ4_XS 양자화 모델에 MTP 헤드를 결합하여 단일 스트림 디코딩 속도를 약 1.3~1.35배 향상시켰으며, 높은 모델 충실도를 유지합니다.
3B 활성 파라미터를 가진 MoE(Mixture of Experts) 구조의 Ornith 1.0-35b 모델에 대한 리뷰입니다. 낮은 활성 파라미터에도 불구하고 속도, 정확도, 지능 측면에서 뛰어난 성능을 보여줍니다.
DeepSpec은 투기적 디코딩(Speculative Decoding)을 위한 초안 모델을 학습하고 평가하는 풀스택 코드베이스입니다. 데이터 준비부터 모델 구현, 평가 스크립트까지 포함하며 다양한 알고리즘과 체크포인트를 제공합니다.
Clark Labs가 Sana 1.6B 텍스트-이미지 변환기를 삼진법(ternary) 방식으로 양자화하여 공개했습니다. FP16 대비 모델 크기를 약 8.6배 줄이면서도 유사한 품질을 유지하는 것이 특징입니다.
55개의 LLM을 대상으로 수행한 상호 블라인드 평가 연구를 통해 모델 제품군 간의 평가 편향을 분석했습니다. 연구 결과, 대부분의 모델 제품군에서 자기 계열 모델에게 높은 점수를 주는 '내집단 편향'이 발견되었으며, Mistral의 경우 오히려 부정적인 편향이 나타나는 이례적인 결과도 확인되었습니다.
Qwen 3.5의 미세 조정 버전으로 추정되는 최적화된 오픈 모델들의 뛰어난 코딩 성능과 추론 속도를 분석합니다. 다양한 GPU 환경에서 테스트한 결과, 특정 코딩 작업에서 매우 높은 효율성을 보여줍니다.
양자화 수준이 Speculative Decoding(추측적 디코딩)의 MTP 초안 수락률에 미치는 영향을 분석한 연구입니다. 양자화 비트가 낮아질수록 초안 깊이가 깊어질 때 수락률이 감소하며, 하드웨어 아키텍처에 따라 최적의 초안 깊이가 다름을 보여줍니다.
소형 모델의 눈에 띄는 실패 사례를 측정하기 위한 새로운 벤치마크인 ObviousBench.com이 공개되었습니다. 모델의 크기, 비용, 속도 및 추론 능력 설정에 따른 성능 트레이드오프를 분석하는 데 중점을 둡니다.