Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.

Hugging Face가 이론 물리학 문제 해결을 위해 구축한 멀티 에이전트 스캐폴드인 'Physics Intern'을 소개합니다. 이 시스템은 CritPt 벤치마크에서 SOTA를 기록했으며, Codex 및 Claude Code와 연동 가능한 기술 세트로 구성되어 있습니다.
Carbon 모델에 추측 디코딩(Speculative Decoding) 기술이 도입되어 llama.cpp를 통한 DNA 서열 생성 속도가 2~3배 향상되었습니다. 이를 통해 대규모 게놈 데이터를 로컬 환경에서 더욱 효율적으로 처리할 수 있습니다.
llama.cpp가 Qwen3.6 모델 제품군을 지원하기 위해 MTP(Multi-Token Prediction) 기능을 추가했습니다. 이번 업데이트는 일반적인 하드웨어 환경에서 로컬 AI 추론 성능을 획기적으로 향상시키는 중요한 이정표가 될 것으로 기대됩니다.
Hugging Face에 Late-interaction retrieval의 성능을 개선하는 새로운 커널인 MaxSim이 출시되었습니다. 이 커널은 Metal의 simdgroup_matrix 및 WMMA를 활용한 타일링 스코어링 방식을 통해 기존 방식 대비 3~5배의 속도 향상을 제공합니다.
Unsloth의 4-bit 양자화 모델과 llama.cpp를 활용하여 Qwen2.5-35B-A3B 모델을 개인 노트북에서 24시간 무료로 실행할 수 있는 방법을 소개합니다.
본 기술 기사는 100만 토큰(1M)의 대규모 컨텍스트 길이를 성공적으로 구현했음을 발표합니다. 이 성과는 Qwen3-30B-A3B MoE 모델을 활용하여 달성되었으며, 구체적인 트레이닝 환경 및 최적화 기술들(예: 8 노드 구성, DSz3+ Ulysses SP=4, FA3, torch.compile 등)이 적용된 결과입니다.
최근 온라인에서 유포된 논문들은 GPT-5.5, Opus 4.7 등 주요 프론티어 모델들의 파라미터 수를 역공학하여 제시하고 있습니다. 그러나 글쓴이는 해당 논문을 조사한 결과 심각한 문제점들을 발견했으며, 이를 수정했을 때 GPT-5.5의 실제 파라미터 수는 약 1.5조 개로 추정된다고 주장합니다.
transformers 라이브러리는 Expert Parallelism(EP)을 활용하여 Mixture of Experts(MoE) 모델의 학습 속도를 획기적으로 높이는 작업을 진행하고 있습니다. 이 과정에서 PyTorch의 `torch._grouped_mm`와 같은 효율적인 구현 방식이 발견되었으며, 이는 여러 전문가에게 분산된 행렬 곱셈을 단일 호출로 처리할 수 있게 합니다.
작성자는 'ml-intern'이라는 도구를 사용해 모델 학습을 시도했으며, 이 과정에 대해 흥미를 느끼고 있습니다. 비록 Opus나 GPT-5와는 다른 분위기일지라도, 모델 학습에 필요한 데이터셋 생성 작업이 계속 진행되고 있다는 점에 주목하고 있습니다.
본 기사는 Hugging Face 생태계가 원래 인간 간의 협업을 위해 설계되었지만, 이 능력을 다수의 AI 에이전트(agent-agent)에게 적용했을 때 어떤 시너지가 발생하는지에 대해 탐구합니다. 이를 위해 사용자가 자신의 에이전트를 가져와서 활용할 수 있는 간단한 '에이전트-에이전트 협업' 도구 세트를 구축했습니다.
Smol Training Playbook 출시를 예고하는 이 글은 최첨단(SOTA) 대규모 언어 모델(LLM)을 성공적으로 훈련시키는 데 필요한 모든 지식을 집대성하여 공유할 예정입니다. 이를 통해 독자들은 자체 LLM을 구축하고 훈련하는 과정에서 마주칠 수 있는 전략적 어려움과 비용 문제를 미리 파악할 수 있습니다.