Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
Spectral Labs가 새로운 보정 인식 양자화 방식인 SpectralQuant를 통해 Qwen3.5 0.8B 모델의 성능을 극대화했습니다. 이 방식은 모델의 민감한 가중치를 보호하여 표준 Q4_K_M 용량에서도 BF16 모델과의 성능 격차를 96.5%까지 회복했습니다.
SupraLabs가 출시한 SupraSafety-18M은 18M 파라미터 규모의 초소형 콘텐츠 모더레이션 모델입니다. 에지 디바이스 및 저지연 환경에 최적화된 BERT 스타일의 이진 텍스트 분류기입니다.
NVIDIA의 Nemotron-3-Super-120B-A12B 모델이 hybrid Mamba와 MoE 구조를 통해 504K 토큰의 긴 컨텍스트에서도 높은 성능을 유지함을 입증했습니다. Mamba 레이어의 특성상 KV 캐시 비용이 적어 긴 문맥에서도 디코딩 속도가 안정적이며, Needle-in-haystack 테스트에서 완벽한 회상 능력을 보여주었습니다.
OpenAI가 GPT-5.6 제품군을 공식 프리뷰하며 Sol Ultra, Sol, Terra, Luna 모델을 공개했습니다. GPT-5.6 Sol Ultra는 TerminalBench 2.1에서 Claude Mythos 5를 능가하는 성능을 보여주었습니다.
VLM(Vision Language Model)을 실제 운영 환경과 유사한 비디오 데이터로 평가할 수 있는 오픈소스 프레임워크를 공개했습니다. 프레임 샘플링과 장면 경계 설정 등 최적의 평가 구성을 위한 방법론과 트레이스 실행 기능을 제공합니다.
사용자 맞춤형 비디오 기반 VLM 평가를 위한 오픈소스 프레임워크를 공개했습니다. 실제 운영 환경과 유사한 푸티지를 활용하여 정확도, 지연 시간, 비용을 종합적으로 평가할 수 있는 트레이스 실행 기능을 제공합니다.
VLM(Vision-Language Model)의 비디오 기반 평가를 위한 오픈소스 프레임워크를 공개했습니다. 실제 운영 환경과 유사한 푸티지를 활용하여 품질, 지연 시간, 비용을 고려한 최적의 설정을 결정할 수 있도록 돕습니다.
JetSpec은 병렬 트리 초안 작성(Parallel Tree Drafting) 기술을 통해 LLM의 투기적 디코딩 성능을 최적화하는 연구입니다. 무손실 상태를 유지하며 MATH-500에서 최대 9.64배의 속도 향상을 달성하고, B200 GPU에서 약 1000 TPS의 추론 속도를 구현합니다.
DeepReinforce AI에서 다양한 파라미터 규모를 가진 Ornith-1.0 모델 시리즈를 Hugging Face에 출시했습니다. 9B부터 397B MoE 모델까지 포함하며, 여러 벤치마크에서 SOTA 성능을 기록했습니다.
Gemma-4-12B 모델의 지능 손실 없이 안전 필터를 제거한 Uncensored 모델이 출시되었습니다. 정밀한 어블레이션 기법과 CoT 미세 조정을 결합하여 복잡한 추론 능력을 유지하면서도 제한 없는 답변이 가능하도록 설계되었습니다.
새로운 샘플러와 검증기 기술을 통해 0.5B 초소형 모델의 코딩 성능을 2~4B급 모델 수준으로 끌어올리는 연구를 소개합니다. 가중치 변경 없이도 성능 향상이 가능하지만, 백트래킹 과정에서 디코딩 속도 저하와 VRAM 요구량 증가라는 트레이드오프가 존재합니다.
NVIDIA가 Nemotron 3 Nano 백본을 기반으로 한 확산 기반(diffusion-based) 언어 모델인 Nemotron-TwoTower-30B-A3B-Base-BF16을 출시했습니다. 이 모델은 기존 자기회귀 방식 대신 확산 디노이저 타워를 사용하여 생성 효율을 극대화했습니다.
SupraLabs가 표 형식의 기상 데이터를 분류하기 위한 소형 FT-Transformer 모델인 SupraWeather-Nano-Preview를 출시했습니다. 이 모델은 텍스트 입력 없이 숫자 기반의 기상 특징을 입력받아 기상 현상을 분류하는 아키텍처 실험용 모델입니다.
에이전트적 사고 능력을 갖춘 Nex-N2-Mini-Ultra-Uncensored-Heretic 모델이 출시되었습니다. Abliteration 기술을 적용하여 모델의 거부율을 낮추는 데 성공했습니다.
Baidu가 단 한 번의 포워드 패스로 수십 페이지를 전사할 수 있는 Unlimited-OCR을 출시했습니다. 새로운 R-SWA 어텐션 메커니즘을 통해 KV 캐시 문제를 해결하고 대량의 문서 처리 효율을 극대화했습니다.
KaLM-Reranker-V1은 쿼리와 구절의 계산을 분리하여 효율성을 높인 새로운 재순위화 모델입니다. Matryoshka 임베딩 풀링과 교차 주의 집중을 결합하여, Late Interaction 방식이 아니면서도 그에 준하는 강력한 성능을 제공합니다.
이탈리아 스타트업 Domyn이 400B 규모의 새로운 EU 모델 개발 계획을 발표했습니다. 이들은 이미 260B 규모의 기업용 폐쇄형 모델과 10B 규모의 오픈 소스 모델을 출시한 바 있습니다.
ModelScope에 출시된 Unlimited-OCR은 단일 이미지부터 다중 페이지 PDF까지 지원하는 3.3B 파라미터 규모의 다국어 모델입니다. 전체 문서 파싱과 32K의 긴 출력 길이를 지원하며, OpenAI 호환 스트리밍 요청이 가능합니다.
Qwen이 에이전트 환경 시뮬레이션을 위해 학습된 언어 세계 모델인 Qwen-AgentWorld-35B-A3B를 출시했습니다. 이 모델은 MoE 구조를 사용하여 MCP, 터미널, Android, 웹 등 7가지 도메인에서의 환경 변화를 예측합니다.
Qwen2.5-35B-A3B 및 Gemma2-9B 모델의 KV 캐시 양자화 성능을 KLD 매핑을 통해 분석한 연구 결과입니다. 양자화 비트 수에 따른 모델별 민감도 차이와 압축 효율성을 다룹니다.