Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
NVIDIA가 Nemotron-Cascade-2-30B-A3B를 기반으로 한 통합 오디오-텍스트 LLM인 Nemotron-Labs-Audex-30B-A3B를 공개했습니다. 이 모델은 텍스트 추론 능력을 유지하면서 오디오 인코더와 확장된 어휘를 통해 음성 인식, 번역, TTS 등 강력한 오디오 작업 능력을 제공합니다.
언어 모델의 암기(Memorization)와 일반화(Generalization)를 분리하여 모델의 용량을 측정하는 새로운 방법론을 제안합니다. GPT 스타일 모델의 파라미터당 용량이 약 3.6비트임을 밝히고, 모델 용량과 데이터 크기 사이의 스케일링 법칙을 도출했습니다.
스마트폰과 같은 모바일 엣지 디바이스에서 1B~7B 규모의 LLM 성능을 벤치마킹한 연구를 분석합니다. 다양한 SoC 환경에서 지연 시간, 메모리 점유율, 양자화 방식 및 최적의 스레드 설정 등 실질적인 배포 지표를 다룹니다.
커스텀 Silia 아키텍처를 기반으로 한 117M 파라미터 규모의 소형 모델 학습 결과와 연구 내용을 소개합니다. H100 GPU를 사용하여 5시간 만에 81M 토큰을 학습 완료하였으며, 모델 구조와 추론 방법 및 논문을 공유합니다.
Anthropic이 모델의 내부 사고 과정을 분석하는 연구를 발표하며 J-Space 렌즈 코드를 공개했습니다. Qwen 3.6 27B 모델을 활용한 J-Space 데모가 함께 소개되었습니다.
선형 어텐션 모델의 메모리 손실 문제를 해결하기 위해 해마(Hippocampus) 구조를 도입한 HOLA를 제안합니다. 고정된 순환 상태와 함께 정확한 KV 캐시를 병행 사용하여 긴 문맥에서도 높은 니들 리콜 성능을 유지합니다.
Ornith 397B 모델의 추론 능력을 테스트한 결과, Claude Opus 수준의 고난도 수학 문제 해결 능력을 보여주었습니다. 특히 동적 계획법과 역방향 귀납법이 필요한 복잡한 확률 문제를 완벽하게 풀어내며 강력한 성능을 입증했습니다.
Ant Group이 경계 기반 마스킹(boundary-driven masking) 기술을 적용한 DINO 계열 비전 백본인 LingBot-Vision을 공개했습니다. 이 모델은 자기지도 학습을 통해 객체의 경계를 효과적으로 학습하며, 특히 NYUv2 데이터셋에서 뛰어난 성능을 보여줍니다.
ThinkingCap-Qwen3.6-27B 모델은 추론 과정을 기존 Qwen3.6 대비 약 50% 단축하면서도 동일한 정확도를 유지합니다. 수학, 코드, 에이전트 활용 등 다양한 벤치마크를 통해 엄격한 통계적 검증을 거쳤습니다.
Kyutai의 Pocket TTS는 5초의 오디오만으로 목소리를 복제할 수 있는 100M 파라미터 규모의 스트리밍 언어 모델입니다. CPU 환경에서도 구동 가능하며, Mimi 신경 코덱을 기반으로 일정한 지연 시간과 스트리밍 기능을 제공합니다.
Sberbank에서 새로운 GigaChat3.5-432B-A28B 모델을 출시했습니다. 베이스 버전과 함께 GGUF 포맷 버전도 제공되어 llama.cpp를 통한 활용이 가능할 전망입니다.
Tencent가 새로운 오픈 모델 Hy3를 공개했습니다. 총 295B 파라미터 중 21B가 활성화되는 구조를 가지며, 라이선스가 Apache 2.0으로 변경되어 커뮤니티 활용도가 높아졌습니다.
H200 환경에서 FP8 및 FP8 KV를 적용한 GLM 5.2 모델의 Terminal-Bench 2.1 성능을 테스트한 결과입니다. 총 89개 작업 중 79.8%의 통과율을 기록하며 모델의 효율성을 검증했습니다.
2억 7천만 파라미터 규모의 언어 모델을 처음부터 직접 개발한 연구 프로젝트입니다. RoPE, RMSNorm, SwiGLU 등 최신 아키텍처를 적용하여 로컬 추론에 최적화된 커스텀 트랜스포머 모델을 구축했습니다.
LLM에 영업 전략을 부여하기 위해 모델 프리 강화학습(Model-free RL)을 활용하는 새로운 연구 방법론을 공개했습니다. 합성 데이터셋 대신 수치 기반의 영업 규칙을 사용하여 PPO 모델을 훈련시키고, 이를 LLM의 잔차 스트림에 주입하여 응답을 보강합니다.
MrFlow는 별도의 학습 없이 사전 학습된 Flow Matching 모델의 생성 속도를 획기적으로 높이는 다중 해상도 가속 전략을 제안합니다. 저해상도 구조 생성 후 GAN 기반 초해상도와 고주파 재샘플링을 결합하여, 품질 저하를 최소화하면서 최대 10배 이상의 엔드투엔드 가속을 달성합니다.
에이전트 워크로드에서 65K-128K 롱 컨텍스트 성능을 분석하기 위해 13개 모델을 벤치마킹한 결과입니다. 분석 결과, 토큰 생성 속도보다 프리필(prefill) 단계가 성능을 지배하며, KV 헤드 수가 파라미터 수보다 성능에 더 큰 영향을 미침을 확인했습니다.
8개의 로컬 모델을 대상으로 판타지 RP 및 에이전틱 능력을 평가한 벤치마크 결과입니다. gemma-4-31B가 가장 높은 합격률을 기록했으며, 모델별로 특정 하위 작업에서 성능 저하가 발생하는 불균형 현상이 관찰되었습니다.
GEAR는 토크나이저와 자기회귀(AR) 생성기를 엔드투엔드로 공동 학습시키는 새로운 시각적 생성 모델 프레임워크입니다. 소프트 할당 브릿지를 통해 미분 불가능 문제를 해결하고, AR 모델이 예측하기 쉬운 방향으로 토크나이저를 유도하여 학습 효율과 생성 품질을 극대화합니다.
Google Research에서 개발한 TabFM은 표 형식 데이터(tabular data)를 위한 제로샷 파운데이션 모델입니다. 별도의 파인튜닝이나 하이퍼파라미터 탐색 없이, 학습 예시를 컨텍스트로 전달하여 단 한 번의 순전파만으로 분류 및 회귀 작업을 수행합니다.