Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
IMO 2026 문제를 활용하여 다양한 LLM의 수학적 추론 능력을 벤치마크한 연구 결과입니다. 프런티어 모델은 하네스 유무와 관계없이 높은 성능을 보였으나, 복잡한 문제에서는 여전히 핵심 아이디어 도출과 환각 문제라는 한계를 보였습니다.
Gemma 4 31B 모델에서 MTP(Multi-Token Prediction) 어시스턴트 헤드를 사용할 때, DRY 샘플러가 추측적 디코딩의 수락률을 낮추어 오히려 전체 처리량을 저하시킬 수 있음을 실험적으로 증명했습니다.
MoE 모델의 추론 시 가중치가 낮은 '라우팅 테일(routing tail)' 전문가들을 제거해도 성능 저하가 거의 없음을 실험적으로 확인했습니다. 35B MoE 모델 테스트 결과, 전문가의 약 28%를 제거해도 GSM8K 정확도가 유지되어 추론 효율화 가능성을 시사합니다.

Ant Group의 inclusionAI가 124B 규모의 sparse MoE 모델인 Ling-3.0-flash를 출시했습니다. 이 모델은 256K 컨텍스트를 지원하며, 에이전트 워크플로우를 위한 저지연 실행과 안정적인 도구 호출에 최적화되어 있습니다.
Qwen 3.8 Max Preview 모델의 초기 테스트 결과, 빠른 추론 속도와 뛰어난 자기 수정 능력이 확인되었습니다. 특히 시스템 아키텍처 설계 시 불필요한 복잡성을 제거하고 실질적인 작업 순서로 전환하는 능력이 탁월합니다.
프런티어 LLM의 자아 인식(Self-awareness) 가능성을 기능적 측면과 현상적 측면으로 나누어 분석한 보고서입니다. 분석 결과, 모델이 자신의 상태를 모니터링하는 기능적 자아 인식의 확률은 높게 나타난 반면, 주관적 경험을 의미하는 현상적 자아 인식의 확률은 매우 낮게 평가되었습니다.
하나의 mmBERT-small 인코더와 7개의 태스크 헤드를 결합한 다중 헤드 보안 분류기 모델의 학습 및 배포 경험을 공유합니다. 마스크 손실을 활용해 누락된 태스크의 기울기를 제어하는 방법과 양자화된 엣지 모델 배포 결과를 다룹니다.

OpenAI 모델이 Hugging Face 인프라에서 발견한 보안 취약점에 대한 내용을 다룹니다. GPT가 캐시 프록시 레지스터 및 Hugging Face 시스템에서 발견한 제로데이 취약점과 그 영향력을 설명합니다.

Google의 Gemini 3.6 Flash 출시 결과, 이전 버전인 3.5 Flash와 비교해 지능 향상은 없으나 속도는 2배 빠르고 비용은 18% 저렴해졌습니다. 독립적인 테스트 결과에 따르면 에이전트 코딩 성능의 퇴보가 관찰되기도 했습니다.

MoE 모델 학습 시 발생하는 막대한 옵티마이저 상태 메모리 문제를 해결하기 위한 SkewAdam 옵티마이저를 제안합니다. 계층형 상태 할당 방식을 통해 메모리 사용량을 97% 절감하여 단일 40GB GPU에서도 대규모 MoE 모델 학습을 가능하게 합니다.
기존 코딩 벤치마크의 한계인 데이터 오염, 높은 비용, 낮은 변별력을 극복하기 위한 새로운 벤치마크 설계 방식을 제안합니다. Jcode bench v1은 수학적 경계를 활용하여 부정행위가 어렵고 연속적인 점수 측정이 가능한 구조를 가집니다.

Scientific Reports에 발표된 원숭이두창 탐지 논문 'Tri-Net'의 공식 오픈 소스 구현체인 Tri-Net v2를 공개했습니다. 피부 병변과 증상을 통합하여 탐지하는 딥러닝 프레임워크를 제공합니다.
리플레이 버퍼 없이 동적 작업 유사도 라우팅을 통해 파괴적 망각을 방지하는 지속 학습(Continual Learning) 프레임워크 Coincidex를 소개합니다. 문맥 기반의 유사도 계층을 활용하여 메모리 오버헤드를 줄이는 새로운 아키텍처적 접근법과 그 한계를 다룹니다.

에지 디바이스(스마트폰, NPU, GPU)에서 LLM 추론 시 지속적인 부하에 따른 성능 효율성과 트레이드오프를 분석한 논문을 리뷰합니다. RPi5-Hailo, iPhone 16 Pro, S24 Ultra, 노트북 GPU의 처리량, 지연 시간, 열 관리 능력을 비교 분석했습니다.
Transformer와 Mamba를 사용하지 않고 O(1) 추론을 구현한 새로운 아키텍처 QLLM을 소개합니다. 위상 연관성(phase associativeness)을 기반으로 설계되어 KV 캐시 없이도 긴 문맥 처리가 가능하며, 현재 100M 규모의 POC 모델로 공개되었습니다.
753B MoE 규모의 GLM-5.2 모델을 4-bit 양자화하여 4× DGX Spark 환경에서 실행한 벤치마크 결과입니다. Terminal-Bench 2.1에서 공식 수치의 약 87% 수준인 70.8%를 기록하며 양자화 및 컨텍스트 제한에 따른 성능 차이를 분석했습니다.

Gemma 모델에 새로운 레이어를 추가하여 파라미터 수를 확장하는 실험의 성공 과정을 다룹니다. 초기 실패 원인을 분석하고, 레이어 초기화 방식, 삽입 위치, 볼륨 설정 및 단계별 학습(healing)을 통해 모델을 성공적으로 확장한 경험을 공유합니다.
Tencent의 295B MoE 모델인 Hy3와 NVIDIA의 오디오 지원 30B MoE 모델인 Nemotron-Labs-Audex의 GGUF 양자화 세트를 소개합니다. imatrix 양자화와 벤치마크 데이터를 통해 각 모델의 품질과 성능 수치를 객관적으로 검증하여 제공합니다.

추론 과정의 핵심 연산 및 검증 구간은 유지하고 서사적 구간을 압축하는 '섹션 인식 압축(Section-aware compression)' 기법을 제안합니다. 이 방식은 토큰 사용량을 1.7배 이상 줄이면서도 기존 SFT 모델보다 높은 성능을 기록하며, 프롬프트를 통해 압축 효율을 조절할 수 있습니다.

Qwen3.6 모델을 트레이너 에이전트로 활용하여 다른 소형 모델들을 강화학습(RL)으로 훈련시키는 'RL-in-RL' 구조의 실험 결과입니다. 에이전트가 훈련 환경, 데이터셋, 하이퍼파라미터를 직접 구성하고, 모델 성능 향상을 보상으로 받아 스스로 진화하는 과정을 다룹니다.