Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
FlashMemory가 Lookahead Sparse Attention을 도입하여, 다음 토큰에 필요한 청크를 예측하는 작은 Neural Memory Indexer를 사용합니다. 이를 통해 GPU 메모리에서 캐시 유지량을 획기적으로 줄여, 백본 재학습 없이도 더 높은 정확도를 구현하며 500K 컨텍스트 처리가 가능해졌습니다.
NJU와 Kuaishou는 복잡한 지침을 처리하는 조합적 비디오 편집(compositional video editing) 진단 벤치마크인 CoVEBench를 공개했습니다. 이 벤치마크는 현재 모델들이 결합된 편집 작업에서 여전히 어려움을 겪고 있음을 보여줍니다. 또한, OmniGameArena는 VLM 게임 에이전트의 실시간 성능을 측정하는 UE5 기반 벤치마크입니다.
Bayesian-Agent는 Skills를 완전한 사후 확률 가설로 취급하여 LLM 에이전트의 자가 진화 레이어를 제공합니다. 이 시스템은 증거 기반으로 Skills를 수리, 분할 또는 폐기하며, DeepSeek v4와 결합하여 SOP-Bench 및 Lifelong AgentBench 점수를 크게 향상시켰습니다.
Alibaba의 Qwen 팀이 재사용 가능한 에이전트 스킬 실행을 위한 통합 보상 모델링 프레임워크를 공개했습니다. 이 시스템은 검증기, 참고 자료, 루브릭 등 다양한 형태의 증거들을 단일 인터페이스로 동적으로 오케스트레이션하여 일관된 방식으로 평가합니다.
NVIDIA가 과학 분야의 강화학습(RL) 데이터셋을 Hugging Face에 공개했습니다. 이 데이터셋은 물리학, 생물학, 화학 등 세 분야의 15만 개 Stack Exchange 문제로 구성되어 있습니다.
LCLMs는 긴 컨텍스트를 잠재 임베딩으로 압축하는 인코더-디코더 소프트 토큰 컴프레서입니다. 이를 통해 손실률이 거의 없는 높은 정확도로 최대 8.8배의 속도 향상을 달성할 수 있습니다.
새로운 연구는 온-폴리시 증류(OPD)가 파라미터 공간을 탐색하는 독특한 기하학적 경로를 분석했습니다. OPD가 SFT나 RLVR과는 구별되는 좁고 저차원적인 부분 공간에 빠르게 수렴함을 밝혀냈습니다.
ADHD 사용자의 실행 기능 저하를 돕기 위해 도파민 자극을 유도하도록 미세 조정된 NeuroBait 모델을 소개합니다. 기존의 체크리스트 방식 대신, 행동을 시작할 수 있도록 돕는 특화된 상호작용 방식을 지향합니다.
AI 모델 호출량이 급증하며 벤치마크 점수 경쟁을 넘어 실제 엔지니어링 단계로 진입하고 있습니다. DeepSeek V4 Flash와 Tencent Hy3가 상위권을 차지하며 모델 간의 종합적인 경쟁이 심화되고 있습니다.
역문제(Inverse Problems) 해결을 위한 확산 모델(Diffusion Models)의 활용 방안과 연구 내용을 조사한 글입니다. 데이터 복원 및 추론 과정에서 확산 모델이 어떻게 적용되는지 다룹니다.
NVIDIA가 로봇의 정교함에 대한 첫 번째 스케일링 법칙을 발견하며 Physical AI의 새로운 전환점을 마련했습니다. 데이터 규모가 증가함에 따라 로봇 조작 성공률이 예측 가능한 방식으로 향상됨이 증명되었으며, 오픈 소스 파운데이션 모델의 확산으로 기술 민주화가 가속화되고 있습니다.
Apple이 WWDC 2026에서 3세대 파운데이션 모델인 AFM 3 시리즈를 공개했습니다. 핵심 기술인 Instruction-Following Pruning(IFP)을 통해 온디바이스 모델의 효율성을 극대화했으며, 클라우드 모델은 Google Cloud의 NVIDIA GPU를 활용하여 성능을 확장했습니다.
Claude Opus 4, GPT-4.1 등 주요 폐쇄형 프런티어 모델들을 대상으로 10가지 적대적 시나리오를 통해 에이전트 성능을 테스트한 연구 결과입니다. 테스트 결과, 모든 모델이 '권위(Authority)' 시나리오에서 취약점을 보이며 에이전트적 퇴보 현상을 나타냈습니다.
PsychoSafe는 LLM이 고위험 요청을 거절할 때 심리학적 근거를 바탕으로 지원적 의사소통을 수행하도록 설계된 프레임워크입니다. Qwen 3.5 27B 모델에 프롬프팅과 미세 조정을 적용하여 거절의 품질과 외부 리소스 참조 능력을 크게 향상시켰습니다.
RLHF가 LLM의 내부 당파적 구조를 제거하는 것이 아니라, 출력 단계에서 인과적 경로를 차단하여 기능적 중립성만을 구현한다는 연구입니다. Llama 3.1 8B를 통해 RLHF가 깊은 정렬 대신 얕은 정렬(Shallow Alignment)을 생성함을 기계론적으로 증명했습니다.
LLM의 장문 생성 시 발생하는 길이 붕괴 현상을 해결하기 위해 IS-CoT 프레임워크를 제안합니다. 생성 과정 내에 '계획-작성-성찰' 사이클을 내장하여 동적인 전략 적응을 가능하게 하며, 이를 통해 학습된 IS-Writer-8B는 장문 벤치마크에서 뛰어난 성능을 입증했습니다.
언어 모델의 작업별 데이터 필요량과 학습 가능성 사이의 관계를 인과적으로 분석한 연구입니다. 형식 언어를 활용한 통제된 환경에서 상관관계 분석의 한계를 지적하고, 인과적 개입을 통한 정확한 학습 가능성 측정 방법론을 제안합니다.
Cognition이 발표한 FrontierCode 벤치마크는 단순 테스트 통과를 넘어 코드의 유지보수 가능성을 평가하는 새로운 기준을 제시합니다. Claude Opus 4.8이 이 벤치마크에서 가장 높은 성적을 거두었으나, 여전히 실제 유지보수자가 병합하기에는 한계가 있음을 보여줍니다.
Anthropic이 Mythos의 공개 버전을 출시할 예정입니다. 이 모델은 강력한 가드레일을 갖추고 있으며, 장기적이고 다회차에 걸친 작업 수행 능력이 크게 향상되었습니다.
Anthropic의 보안 연구 특화 모델인 Mythos를 사용한 후기입니다. 높은 비용과 제한적인 하네스 환경에도 불구하고, 보안 취약점 탐지 및 보안 연구 작업에서 기존 모델을 압도하는 성능을 보여줍니다.