Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
선형 어텐션 모델의 메모리 손실 문제를 해결하기 위해 해마(Hippocampus) 구조를 도입한 HOLA를 제안합니다. 고정된 순환 상태와 함께 정확한 KV 캐시를 병행 사용하여 긴 문맥에서도 높은 니들 리콜 성능을 유지합니다.
Ornith 397B 모델의 추론 능력을 테스트한 결과, Claude Opus 수준의 고난도 수학 문제 해결 능력을 보여주었습니다. 특히 동적 계획법과 역방향 귀납법이 필요한 복잡한 확률 문제를 완벽하게 풀어내며 강력한 성능을 입증했습니다.
Ant Group이 경계 기반 마스킹(boundary-driven masking) 기술을 적용한 DINO 계열 비전 백본인 LingBot-Vision을 공개했습니다. 이 모델은 자기지도 학습을 통해 객체의 경계를 효과적으로 학습하며, 특히 NYUv2 데이터셋에서 뛰어난 성능을 보여줍니다.
ThinkingCap-Qwen3.6-27B 모델은 추론 과정을 기존 Qwen3.6 대비 약 50% 단축하면서도 동일한 정확도를 유지합니다. 수학, 코드, 에이전트 활용 등 다양한 벤치마크를 통해 엄격한 통계적 검증을 거쳤습니다.
Kyutai의 Pocket TTS는 5초의 오디오만으로 목소리를 복제할 수 있는 100M 파라미터 규모의 스트리밍 언어 모델입니다. CPU 환경에서도 구동 가능하며, Mimi 신경 코덱을 기반으로 일정한 지연 시간과 스트리밍 기능을 제공합니다.
Sberbank에서 새로운 GigaChat3.5-432B-A28B 모델을 출시했습니다. 베이스 버전과 함께 GGUF 포맷 버전도 제공되어 llama.cpp를 통한 활용이 가능할 전망입니다.
Tencent가 새로운 오픈 모델 Hy3를 공개했습니다. 총 295B 파라미터 중 21B가 활성화되는 구조를 가지며, 라이선스가 Apache 2.0으로 변경되어 커뮤니티 활용도가 높아졌습니다.
H200 환경에서 FP8 및 FP8 KV를 적용한 GLM 5.2 모델의 Terminal-Bench 2.1 성능을 테스트한 결과입니다. 총 89개 작업 중 79.8%의 통과율을 기록하며 모델의 효율성을 검증했습니다.
2억 7천만 파라미터 규모의 언어 모델을 처음부터 직접 개발한 연구 프로젝트입니다. RoPE, RMSNorm, SwiGLU 등 최신 아키텍처를 적용하여 로컬 추론에 최적화된 커스텀 트랜스포머 모델을 구축했습니다.
LLM에 영업 전략을 부여하기 위해 모델 프리 강화학습(Model-free RL)을 활용하는 새로운 연구 방법론을 공개했습니다. 합성 데이터셋 대신 수치 기반의 영업 규칙을 사용하여 PPO 모델을 훈련시키고, 이를 LLM의 잔차 스트림에 주입하여 응답을 보강합니다.
MrFlow는 별도의 학습 없이 사전 학습된 Flow Matching 모델의 생성 속도를 획기적으로 높이는 다중 해상도 가속 전략을 제안합니다. 저해상도 구조 생성 후 GAN 기반 초해상도와 고주파 재샘플링을 결합하여, 품질 저하를 최소화하면서 최대 10배 이상의 엔드투엔드 가속을 달성합니다.
에이전트 워크로드에서 65K-128K 롱 컨텍스트 성능을 분석하기 위해 13개 모델을 벤치마킹한 결과입니다. 분석 결과, 토큰 생성 속도보다 프리필(prefill) 단계가 성능을 지배하며, KV 헤드 수가 파라미터 수보다 성능에 더 큰 영향을 미침을 확인했습니다.
8개의 로컬 모델을 대상으로 판타지 RP 및 에이전틱 능력을 평가한 벤치마크 결과입니다. gemma-4-31B가 가장 높은 합격률을 기록했으며, 모델별로 특정 하위 작업에서 성능 저하가 발생하는 불균형 현상이 관찰되었습니다.
GEAR는 토크나이저와 자기회귀(AR) 생성기를 엔드투엔드로 공동 학습시키는 새로운 시각적 생성 모델 프레임워크입니다. 소프트 할당 브릿지를 통해 미분 불가능 문제를 해결하고, AR 모델이 예측하기 쉬운 방향으로 토크나이저를 유도하여 학습 효율과 생성 품질을 극대화합니다.
Google Research에서 개발한 TabFM은 표 형식 데이터(tabular data)를 위한 제로샷 파운데이션 모델입니다. 별도의 파인튜닝이나 하이퍼파라미터 탐색 없이, 학습 예시를 컨텍스트로 전달하여 단 한 번의 순전파만으로 분류 및 회귀 작업을 수행합니다.
Claude Fable이 PyTorch 베이스라인 대비 18배 이상의 속도 향상을 제공하는 메가커널을 개발했습니다. 이는 Blackwell GPU 환경에서 Kimi-Linear W4A16 디코딩 성능을 극대화하며, Anthropic의 자동 연구 역량을 보여줍니다.
Gemma와 Huggingface가 주최하는 Fast Gemma 챌린지에 대한 소개입니다. 멀티 에이전트 협업을 통해 Google의 gemma-4-E4B-it 모델의 추론 속도(TPS)를 극대화하는 것을 목표로 합니다.
BlockPilot은 확산 기반 투기적 디코딩의 효율성을 높이기 위해 샘플별로 최적의 블록 크기를 예측하는 인스턴스 적응형 정책을 제안합니다. prefilling 단계의 표현을 활용해 최소한의 오버헤드로 추론 속도를 획기적으로 개선합니다.
LLM 추론 시 메모리 효율을 높이기 위한 KV 캐시 프루닝 기술의 한계인 '입력/도메인별 임계값 의존성'을 해결하는 ReFreeKV를 제안합니다. 임계값 제약 없이 예산 할당을 적응적으로 조정하여 다양한 입력 환경에서도 성능 저하 없이 효율적인 압축을 달성합니다.
Qwen 27B 모델을 4090+3090 시스템에서 테스트한 결과, 매우 빠른 디코딩 및 프리필 속도를 보여주었습니다. 특히 대규모 코드베이스를 안정적으로 처리하며 기존 스키마를 유지하는 뛰어난 코드 생성 능력을 입증했습니다.