Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
본 논문은 LLM의 학습 방식에 대한 한계를 극복하기 위해 'fast-slow 학습 프레임워크(FST)'를 제안합니다. 기존의 파라미터 업데이트 기반 학습은 치명적 망각을 유발하고, 인컨텍스트 러닝만으로는 성능 향상에 한계가 있습니다. FST는 모델 파라미터를 일반적인 추론 행동을 유지하는 '느린 가중치(slow weights)'와 태스크 특화 정보를 흡수하는 '빠른 가중치(fast weights)'로 분리하여 학습합니다. FST를 통해 학습된 모델은 기존 RL 방식보다 샘플 효율성이 높고 성능 점근선이 높아지며, 베이스 LLM과의 유사성을 유지하여 치명적 망각을 줄이고 후속 태스크에 대한 가소성(plasticity)까지 보존할 수 있습니다.
본 논문은 트랜스포머 모델의 효율성과 성능 간의 트레이드오프를 개선하기 위해 SATFormer라는 새로운 아키텍처를 제안합니다. 기존 방법들이 초기 표현을 후기 레이어에 균일하게 복사하는 방식과 달리, SATFormer는 토큰별, 헤더별, 컨텍스트 의존적인 게이트 메커니즘을 사용하여 각 어텐션 헤드가 첫 번째 레이어의 값 스트림(value stream)에 접근해야 하는 시점과 위치를 학습합니다. 그 결과, 기존 트랜스포머 및 경쟁 모델 대비 검증 손실 개선은 물론, 유사한 처리량으로 더 높은 성능을 달성하며 효율성을 크게 향상시켰습니다.
이 기술 기사는 멀티 GPU 환경에서 발생하는 PCIe 병목 현상을 해결하는 방법을 다룹니다. 특히, Nvidia의 최신 소비자 GPU(예: 4090/5090)가 NVLink를 제거하면서 두 개의 카드 간 데이터 전송 속도가 PCIe 피어 투 피어로 약 30 GB/s로 떨어지는 문제를 지적합니다. 이를 해결하기 위해 PCA와 ctypes를 활용하여 GPU의 NVENC 실리콘을 PCIe 대역폭 배율기(bandwidth multiplier)로 사용하는 접근 방식을 제안하고 있습니다.
본 기사는 제한된 파라미터와 컴퓨팅 자원(Parameter Golf) 환경에서 State Space Models (SSMs)이 Transformer 구조에 비해 가지는 구조적 어려움을 실증적으로 분석합니다. 특히, SSM의 `in_proj` 레이어가 Attention QKV보다 압축 시 더 큰 손실을 보이며, 특정 모델 크기(SP4096 vs SP8192)에서 성능 개선 방향이 일관되지 않음을 보여줍니다. 또한 Mamba-3 Triton 커널에 대한 다양한 최적화 실험을 통해 메모리 및 정밀도 관점에서의 성능 향상 기회도 탐구합니다.