Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
PyTorch를 사용하여 249M 파라미터 규모의 MoE Transformer를 밑바닥부터 직접 구현한 연구 프로젝트입니다. GQA, SwiGLU, RoPE 등 현대적 LLM의 핵심 구성 요소를 직접 구현하여 모델 구조에 대한 깊은 이해를 목표로 합니다.
포르투갈에서 자체 개발한 9B 파라미터 규모의 LLM인 Amalia를 출시했습니다. Hugging Face를 통해 SFT 및 DPO 모델이 공개되었으며, Apache 2.0 라이선스를 따릅니다.
Mistral이 형식 검증 분야에 특화된 오픈 소스 모델 Leanstral 1.5를 출시했습니다. 6B의 활성 파라미터를 사용하여 수학적 증명 및 코드 검증에서 최첨단 성능을 보여줍니다.
MathFormer는 4M 파라미터의 작은 seq2seq 모델로 기호 수학 작업에서 98.6%의 높은 정확도를 달성했습니다. 이는 모델이 수학적 추론 대신 구조적 토큰 변환 패턴을 학습할 가능성을 시사하며, LLM의 수학적 능력에 대한 새로운 시각을 제공합니다.
Google의 Gemma4-31B 모델을 기반으로 레이어를 확장하여 44B 규모의 모델을 직접 구축한 사례를 공유합니다. LLaMA Pro 방식의 identity-init을 적용하여 레이어를 88개로 늘렸으며, 한국어 법률 및 STEM 데이터로 미세 조정하여 새로운 도메인 지식 수용 능력을 실험했습니다.
M5 Max 128GB 환경에서 7개의 오픈 웨이트 모델을 대상으로 코드 이해 및 생성 능력을 벤치마킹했습니다. 모델의 크기, 양자화 방식(MXFP8, MLX 등), 추론 속도와 답변 품질 사이의 트레이드오프를 분석했습니다.
폐쇄형 모델과 오픈 모델의 벤치마크 성능 격차가 순수 모델 아키텍처 차이가 아닐 수 있음을 지적합니다. Anthropic의 Claude처럼 RAG, 프롬프트 전처리, 내부 도구 호출 등 보이지 않는 기술적 보완이 성능 향상에 기여할 가능성을 분석합니다.
1,100만 편의 논문을 SPECTER 2로 인코딩하고 UMAP으로 시각화하여 연구 트렌드를 파악할 수 있는 지도를 구축했습니다. 시간 슬라이스 기능과 자동 수집 스크립트를 통해 최신 연구 동향을 거시적으로 탐색할 수 있습니다.
사전 학습된 고정 k-MoE 모델에 사후 적응형 게이팅(Post-hoc Adaptive MoE Gating)을 적용하여 토큰당 전문가 수를 가변적으로 조절하는 실험적 연구입니다. Qwen3.6-35B 모델을 대상으로 llama.cpp 환경에서 제로 게이팅 방식을 통해 실증적 벤치마킹을 수행했습니다.
Google이 ICML 및 STOC 컨퍼런스에서 약 10,000편의 논문을 검토하기 위해 에이전트 기반 AI 피어 리뷰어를 도입했습니다. 이 시스템은 제로샷 프롬프팅 대비 수학적 오류 탐지율을 34% 향상시키며 대규모 자동 과학 리뷰의 가능성을 입증했습니다.
GLM 5.2 Q1_S와 Qwen 27B Q8 모델의 양자화 수준에 따른 성능을 비교한 테스트 결과입니다. 낮은 양자화의 작은 모델(GLM 5.2 Q1_S)이 높은 양자화의 더 큰 모델(Qwen 27B Q8)보다 복잡한 코딩 작업에서 더 뛰어난 추론 능력을 보여주었습니다.
Transformer의 작동 원리를 행렬 곱셈 단계부터 시각적으로 이해할 수 있도록 구현한 웹 기반 시뮬레이터입니다. 임베딩부터 로짓 생성까지의 전 과정을 스프레드시트 방식으로 보여주며 가중치 편집이 가능합니다.
ICED는 대규모 언어 모델(LLM)의 지시 이행 및 추론 능력을 소형 언어 모델(SLM)로 효율적으로 압축하여 전달하는 학습 프레임워크입니다. 이를 통해 공개된 SLM-FRIDGE-0.5B 모델은 Qwen2.5-0.5B 아키텍처를 기반으로 높은 벤치마크 성능을 보여줍니다.
Orthrus diffusion head를 기반으로 한 Qwen 3.5, 3.6 및 Gemma 4 모델의 출시를 예고합니다. 모델 체크포인트와 함께 엔드 투 엔드 학습 및 평가 코드가 오픈 소스로 공개될 예정입니다.
머신러닝의 기초가 되는 다변량 확률 모델과 지수 가족(Exponential families)의 수학적 원리를 다룹니다. 시그모이드 함수 유도부터 혼합 모델, 확률적 그래픽 모델까지 심도 있는 이론적 배경을 설명합니다.
기존 RoPE의 한계를 넘어 시퀀스 내 위치를 다차원적으로 해석하는 HDD-RoPE 알고리즘을 제안합니다. 데이터 의존적인 회전량을 통해 모델이 문단이나 문장 같은 구조적 위치를 더 효과적으로 학습할 수 있도록 설계되었습니다.
MTP(Multi-Token Prediction) 기술이 적용된 Gemma4-26B-A4B 및 31B-QAT Uncensored Balanced 모델이 출시되었습니다. 이 모델들은 추측적 디코딩을 통해 속도를 최대 53% 향상시켰으며, 검열을 완화하여 창의적 글쓰기와 RP에 최적화되었습니다.
EdgeRazor는 에지 AI를 위해 설계된 경량 프레임워크로, 혼합 정밀도 양자화 인식 증류 기술을 통해 LLM을 효율적으로 압축합니다. 최소한의 코드 수정으로 기존 훈련 파이프라인에 통합되어 성능을 유지하면서도 저비용·고효율 계산을 지원합니다.
DeepSWE는 프론티어 모델의 실제 코드 작성 능력을 평가하기 위해 설계된 새로운 벤치마크입니다. 데이터 오염을 방지하고 실제 소프트웨어 엔지니어링의 복잡성을 반영하며, 신뢰할 수 있는 검증 방식을 제공합니다.
Gemma-3-12B 모델을 대상으로 비어휘적 문맥이 모델의 은닉 상태(Hidden-State)와 거부 행동에 미치는 영향을 분석한 연구입니다. 특정 텍스트를 입력하면 모델이 답변 스타일이 다른 내부 영역으로 이동하며, 이는 가중치 변화 없이도 모델의 태도를 변화시킬 수 있음을 보여줍니다.