Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.

긴 컨텍스트의 지침(SOP)을 준수하며 업무를 수행하는 에이전트의 능력을 평가하기 위한 새로운 벤치마크 HANDBOOK.md를 소개합니다. 65개의 작업과 20~124페이지 분량의 정책 문서를 통해 에이전트가 장기적인 도구 사용 과정에서 규칙을 얼마나 잘 지키는지 측정합니다.
Anthropic이 공개한 Claude Mythos Preview와 Project Glasswing은 AI를 활용해 암호화 라이브러리의 취약점을 식별하고 공격 체인을 구축하는 능력을 보여줍니다. 이는 보안 연구의 새로운 지평을 열었으나, 동시에 방어자들에게 강력한 경고를 전달합니다.
정치 및 선거 정보 중재자로서 LLM의 성능을 평가하기 위한 새로운 벤치마크인 Polistemics를 소개합니다. 연구 결과, 최신 모델들은 명확한 정보 상황에서는 신뢰할 수 있으나, 모호하거나 모순된 정보가 주어질 경우 성능이 급격히 저하되는 한계를 보였습니다.
일반적인 시퀀스 백본을 유지하면서도 데이터 변환에 대한 소프트 등변성을 확보하는 GARI 프레임워크를 제안합니다. GARI-Net을 통해 군 특화적 재설계 없이도 유전체, 이미지, 3D 포인트 클라우드 등 다양한 모달리티에서 작업 강건성을 높일 수 있습니다.
SAM의 일반화 성능을 높이기 위해 행렬 인식 기하학을 도입한 새로운 최적화 방식을 제안합니다. 층별 스펙트럼 내부 섭동과 Muon 옵티마이저를 결합하여 ViT 및 ResNet 모델에서 최고 수준의 검증 정확도를 달성했습니다.
자율 주행 네트워크의 다중 의도 간 인과적 결합으로 발생하는 '공동 드리프트(Co-Drift)' 문제를 해결하기 위한 MILD 프레임워크를 제안합니다. 교사 증강 전문가 혼합(MoE) 아키텍처를 통해 장애를 선제적으로 예측하고 근본 원인을 정확히 규명합니다.
LLM의 기원을 식별하기 위해 유도된 결정 영역(induced decision regions)을 활용하는 새로운 방법론인 Stemma를 제안합니다. 기존 블랙박스 방식의 한계를 극복하여 모델의 변형이나 배포 환경에서도 높은 정확도로 모델 계보를 추적할 수 있음을 입증했습니다.
3B 파라미터 규모의 멀티모달 안전 분류기인 Shieldstral을 소개합니다. 이 모델은 텍스트 안전 벤치마크에서 대형 모델을 능가하며, 콘텐츠 중재를 이진 질의응답 방식으로 통합하여 높은 효율성을 보여줍니다.
LLM의 내부 잠재 변수를 제어하기 위해 추론 시점의 활성화 편집 대신 입력 프롬프트를 최적화하여 특정 특징을 억제하는 연구를 소개합니다. Llama 모델을 통해 평가 인지 잠재 변수를 억제하는 실험을 진행했으나, 활성화 읽기 가능성이 반드시 행동 제어 가능성으로 이어지지는 않는다는 한계를 발견했습니다.
불규칙한 임상 시계열 데이터(ICTS)를 효과적으로 처리하기 위한 멀티모달 LLM 추론 프레임워크 ClinPRISM을 제안합니다. 다중 척도 인코더와 증류 기술을 통해 데이터의 희소성과 비동기성 문제를 해결하며, 높은 효율성과 성능을 동시에 달성했습니다.
액추에이터 역학을 고려한 쿼드콥터 제어를 위한 물리 인식 엔드-투-엔드 심층 강화학습(DRL) 연구입니다. 고충실도 시뮬레이션 환경에서 DDPG, TD3, PPO, SAC 알고리즘을 비교 평가하여 안정적인 제어 성능을 분석했습니다.
물리학, 천체물리학 분야의 연구 제안서 작성 및 평가에서 LLM의 역량을 조사한 연구입니다. LLM은 인간과 대등한 수준의 계획서를 생성할 수 있으나, AI 검토자는 AI가 작성한 제안서에 편향된 높은 점수를 주는 경향이 확인되었습니다.
실제 임상 현장의 복잡성을 반영하기 위해 개발된 다회차 멀티모달 임상 진단 평가 벤치마크 ClinMM-Bench를 소개합니다. 15개의 MLLMs를 평가한 결과, 모델들이 진단 방향은 식별하나 신뢰할 수 있는 추론 생성에는 한계가 있음을 확인했습니다.
GARFIELD는 이미지와 희소한 제약 조건을 바탕으로 장면 운동학의 확률적 잠재 표현을 학습하는 새로운 모델입니다. 기존 방식보다 훨씬 빠른 속도로 미래 궤적을 샘플링하며, 움직임의 불확실성을 정교하게 모델링하여 효율적인 모션 플래닝을 가능하게 합니다.
LLM이 인간의 대화 방식처럼 상대방의 문법적 특성에 맞추는 '구문 수렴' 현상을 연구했습니다. Llama와 Gemma 모델을 분석한 결과, 지시어 튜닝된 모델이 사전 학습 모델보다 인간의 구문을 더 많이 재사용하며 높은 의미적 유사성을 보임을 확인했습니다.
유방 촬영술 분류 성능을 높이기 위해 데이터셋의 난이도 신호를 활용하는 DITL 프레임워크를 제안합니다. 이 방식은 적응형 가중치와 학습 가능한 마진을 통해 대규모 및 소규모 데이터셋 모두에서 최첨단 성능을 달성했습니다.
비디오 및 이미지 생성 모델의 느린 샘플링 속도를 개선하기 위한 새로운 궤적 기반 증류 방법인 PDD를 제안합니다. 기존 방식의 모드 붕괴 문제를 해결하며, 적은 계산 횟수로도 고품질의 다양한 결과물을 생성할 수 있습니다.
텍스트, 테이블, 지식 그래프(KG) 간의 정보 불일치를 탐지하는 연구를 소개합니다. 새로운 분류 체계와 자동화 프레임워크인 Kontrast를 통해 모달리티 간의 충돌을 식별하고 지식의 일관성을 검증합니다.
UniMem은 태스크 스트림 환경에서 안정성과 가소성의 균형을 맞추기 위해 제안된 자율적 메모리 관리 프레임워크입니다. 에피소드 메모리와 파라메트릭 메모리를 셀프 라우팅 토큰으로 적응적으로 조정하여 효율적인 태스크 실행을 지원합니다.
MoE-LoRA 모델에서 토큰별 불확실성에 따라 전문가 수를 동적으로 조절하는 CARE(Confidence-Adaptive Routing of Experts) 기법을 제안합니다. Nucleus 샘플링 방식을 활용해 연산 효율성을 높이면서도 성능을 개선했습니다.