Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
LLM의 사회적 사건 이해 및 예측 능력을 측정하기 위한 새로운 벤치마크인 SocietyBench를 소개합니다. 실제 사건을 반사실적(counterfactual) 시나리오로 변환하여 모델의 사전 학습 지식 개입을 차단하고, 확률 교정과 시간적 정확도를 기준으로 모델의 능력을 평가합니다.

LLM이 표 형식 데이터(tabular data) 예측에서 고전적 모델보다 성능이 낮은 이유를 분석한 연구입니다. 실험 결과, 데이터의 차원(dimensionality)이 증가함에 따라 LLM의 성능이 급격히 저하되는 것이 결정적인 실패 요인임을 밝혀냈습니다.
사전 학습된 트랜스포머 모델의 회로 추출을 효율화하기 위한 '희소 가중치 분해(SWD)' 방법론을 제안합니다. 별도의 모델 훈련 없이 가중치 행렬을 두 개의 희소 인자로 분해하여, 기존 방식보다 훨씬 적은 데이터로도 높은 충실도를 유지하며 해석 가능한 회로 단위를 추출할 수 있습니다.
다변량 시계열 이상 탐지(TSAD)를 위해 시계열을 이미지로 변환하는 메타 워크플로우인 PRISM을 제안합니다. 7,000개 이상의 실험을 통해 기존 시간 영역 베이스라인 대비 뛰어난 성능을 입증하였으며, 새로운 채널화 방식인 MSM을 소개합니다.
확산 모델의 정렬 과정에서 발생하는 시간적 신용 할당 문제를 해결하기 위해 '잠재 보상 레지스터'를 제안합니다. DiT 입력에 레지스터 토큰을 추가하여 중간 단계의 잠재 변수로부터 직접 보상을 추정하며, 효율적인 학습 및 추론 전략을 제공합니다.
공학적 골격근 조직(ESMs)의 수축 역학을 분석하기 위해 물리 기반 트랜스포머 네트워크(PFNN)를 제안합니다. CNN-Transformer 구조에 물리 모델을 통합하여 복잡한 운동학적 매개변수를 자동 추출하며, 합성 데이터와 비지도 학습을 통해 데이터 부족 문제를 해결합니다.
GFlowNets의 순방향 정책 학습을 정보 기하학 관점에서 공식화한 연구입니다. Fisher-Rao 메트릭을 활용한 자연 경사(Natural Gradient) 업데이트 방식을 제안하며, 궤적 Fisher 정보를 계산하는 세 가지 방법론을 제시합니다.
LLM의 추론 시간 연산(inference-time compute)을 활용한 테스트 시간 스케일링의 다양한 알고리즘과 체계적인 프레임워크를 제안합니다. 세 가지 구조적 체제와 평가 원칙, 재현성 요구 사항을 정의하며 대규모 추론 흔적 데이터를 공개합니다.
본 연구는 합성 조직병리 이미지의 품질을 평가하기 위한 새로운 방법론을 제안합니다. 기존 FID, IS 지표의 한계를 극복하기 위해 디지털 병리 파운데이션 모델을 활용한 수정된 지표를 도입하고, 다운스트림 태스크와의 상관관계를 검증했습니다.
언어 모델의 자연어 습득을 가속화하기 위해 형식적 유도를 활용한 'Logic-PPT' 사전-사전 학습 전략을 제안합니다. 100B 토큰 규모의 실험 결과, 표준 방식보다 훨씬 적은 토큰으로 높은 정확도를 달성하며 기술 습득을 가속화함을 입증했습니다.
Muon 최적화 도구를 Mamba-2 상태 공간 모델(SSM)에 적용하여 성능을 분석한 연구입니다. 특정 가중치 그룹, 특히 출력 투영(output projection)에 Muon을 적용했을 때 토큰 효율성이 크게 향상됨을 확인했습니다.
Thinking Machines Lab에서 출시한 975B 규모의 오픈 웨이트 MoE 모델 Inkling을 소개합니다. 이 모델은 맞춤화(customization)를 목적으로 설계되었으며, Apache 2.0 라이선스로 공개되어 기업들이 미세 조정하기에 최적화되어 있습니다.
DeepSeek V4 Flash 0731은 매우 저렴한 비용으로 프런티어급 코딩 성능을 제공하는 소형 에이전트 모델입니다. 동일한 아키텍처임에도 훈련 및 사후 훈련 최적화를 통해 벤치마크 성능을 대폭 향상시켰습니다.
페르소나 스킬을 통한 에이전트 개인화 과정에서 발생하는 개인정보 유출 및 사칭 위험을 분석한 연구입니다. 새로운 벤치마크인 AntiSkillBench를 통해 스킬 증류 전략에 따른 보안 취약점과 기존 방어 체계의 한계를 체계적으로 평가합니다.
LLM이 생성한 과학적 리뷰가 인간의 동료 검토(Peer Review) 및 컨퍼런스 결정과 얼마나 일치하는지 분석한 연구입니다. OpenAI, Google, Anthropic의 모델을 ICLR 2026 제출 논문에 적용하여 비교했습니다.
LLM 집단 지성에서 출력의 분산이 실제 인식적 수정으로 이어지는지 진단하는 블랙박스 방법론을 제안합니다. GPT-4o-mini와 Gemini-2.5-flash를 통해 실험한 결과, 모델별로 분산 증가가 인식적 입장 변화에 미치는 영향이 다름을 확인했습니다.
아랍어 이슬람 질의응답에서 LLM의 환각을 탐지하고 검증된 답변을 복구하는 시스템을 제안합니다. Gemma-4-12B-it 모델을 미세 조정하여 환각 여부 판단과 최적의 답변 선택을 수행하며 높은 성능을 입증했습니다.
수의학 분야의 신뢰성을 높이기 위해 생성된 답변의 주장이 인용된 출처와 얼마나 일치하는지 평가하는 VetScore를 제안합니다. 각 주장의 위해 가능성을 고려하여 위험 조정 점수를 계산하는 다단계 평가 방식을 사용합니다.
다국어 다중 에이전트 시스템에서 발생하는 계획 실패 원인을 분석하고, 이를 해결하기 위한 새로운 분류 체계인 TART를 제안합니다. TART는 플래너와 하위 에이전트 간의 정보 전달을 최적화하여 저자원 언어에서의 성능 저하 문제를 효과적으로 완화합니다.
심층 신경망 학습 초기 단계의 텔레메트리 데이터를 활용하여 최종 학습 결과를 예측하는 연구를 소개합니다. 초기 5개 에포크의 데이터만으로도 높은 정확도로 최종 정확도와 학습 실패 여부를 예측할 수 있음을 입증했습니다.