Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
LLM의 지속적 학습 과정에서 발생하는 가소성 상실(Plasticity Loss) 현상을 연구했습니다. 모델 크기가 커질수록 가소성 상실의 발생이 지연되지만, 파라미터 확장만으로는 이를 완전히 해결할 수 없음을 확인했습니다.
도메인 특화 LLM 압축을 위한 경험적 스케일링 법칙을 제안하는 연구입니다. 데이터셋 크기, 압축률, 지도 형식 등이 도메인 지식 및 일반 지식 성능에 미치는 영향을 정량화했습니다.
UniDrive는 자율 주행의 위험 이해를 위해 시간적 추론과 고해상도 인지를 결합한 통합 시각-언어 및 그라운딩 프레임워크입니다. 다중 프레임 입력과 게이트형 교차 주의 집중 모듈을 통해 정밀한 공간적 증거와 동적 컨텍스트를 정렬하여 위험을 설명합니다.
DeepBD는 유전적 선천성 결함 진단을 위해 LLM 기반의 에이전트 워크플로를 활용하는 연구입니다. 증거 엔진과 전문 모듈을 통해 변이 우선순위를 지정하며, 기존 모델인 Exomiser 등을 능가하는 높은 Recall 성능을 입증했습니다.
인간 행동 인식(HAR) 분야에서 장치 및 센서의 이질성으로 발생하는 분포 변화가 도메인 일반화에 미치는 영향을 체계적으로 분석한 연구입니다. 4가지 유형의 분포 변화를 평가하고, 기존 도메인 일반화 알고리즘의 한계를 드러내는 새로운 벤치마크를 제안합니다.
LLM의 환각 현상을 탐지하기 위해 레이어별 그래디언트 패턴을 분석하는 Grad Detect 방법론을 제안합니다. 단 한 번의 순전파-역전파 과정을 통해 출력 신호만으로는 알 수 없는 내부 정보를 활용하여 환각 및 모델 기권 여부를 정확히 예측합니다.
비디오 질의응답(VideoQA) 모델의 답변 근거를 검증하기 위한 새로운 벤치마크 EG-VQA를 제안합니다. 시간적 증거 주석을 통해 모델의 답변과 비디오 내용 간의 일치성을 평가하며, 이를 해결하기 위한 모델 EG-Reasoner를 선보입니다.
OrbitForge는 텍스트 기반 비디오 생성 모델을 활용하여 고품질의 3D Gaussian Splatting 장면을 생성하는 새로운 어댑터 기술입니다. 비디오의 시점 누락을 탐지하고 이를 보완하여 일관성 있는 3D 장면을 재구성함으로써 기존 방식의 한계를 극복합니다.
양방향 조건부 흐름 매칭(Bi-CFM)을 활용하여 카오스 시스템의 역문제를 해결하는 새로운 연구를 소개합니다. 초기 상태와 최종 상태 간의 양방향 매핑을 통해 오차 누적을 완화하며, 보존 법칙을 준수하는 CBi-CFM을 통해 천체 역학 등 실제 복잡한 시스템에서도 높은 정확도를 입증했습니다.
LLM과 구조화된 대수적 변이 문법을 결합한 SCE 프레임워크를 통해 새로운 양자 LDPC 코드를 발견하는 연구를 소개합니다. LLM이 직접 코드를 설계하는 대신 계층적 변이를 통해 대수적 사양을 진화시킴으로써 비아벨 군 기반의 경쟁력 있는 코드 패밀리를 찾아냈습니다.
에이전트 기반 데이터 분석 시스템의 복잡한 출력을 정확히 평가하기 위한 새로운 인간-AI 채점 캐스케이드 방법론을 제안합니다. LAMBDA 시스템을 통해 자동 채점기의 신뢰성을 검증하고, 채점 품질을 높이는 다양한 전략을 연구했습니다.
LLM 기반 대화형 어시스턴트의 비기능적 요구사항(NFR) 평가 방법론을 다룬 연구입니다. HIPAA 규제 준수 도메인을 대상으로 멀티턴 대화의 정확도와 사용자 만족도를 분석하여, 단순 기능적 정확성을 넘어선 새로운 평가 지표의 필요성을 제시합니다.
인코더-디코더 언어 모델의 성능을 극대화하기 위해 태스크와 사전 학습 목적 함수를 매칭하는 MTO 프레임워크를 제안합니다. 이 방식은 퓨샷 설정에서 기존 방식 대비 120% 이상의 성능 향상을 보이며, 프롬프트 튜닝 최적화에도 효과적입니다.
범용 에이전트가 직면하는 세계 모델의 파편화 문제를 해결하기 위해 '구조적 인증(Structural Certification)' 프레임워크를 제안합니다. 표준적인 최악의 경우 분석의 한계를 극복하고, 특정 전이를 국소화하여 에이전트의 성능을 보증하는 알고리즘을 제시합니다.
IV-CoT는 텍스트-이미지 생성 시 객체 수, 공간 관계 등 구조적 프롬프트 준수 능력을 향상시키기 위한 새로운 프레임워크입니다. 구조적 계획과 외형 렌더링을 분리하여 암시적 시각적 사고 사슬을 통해 정교한 이미지 생성을 가능하게 합니다.
AI 기반 보완 대체 의사소통(AAC) 인터페이스 설계 시 발생하는 복잡성과 평가의 어려움을 다룹니다. 사용자의 교차적 특성을 반영할 수 있는 새로운 평가 방법론을 제안하며, AI가 AAC 사용자에게 미치는 영향과 문제 해결 방안을 탐구합니다.
FLUX3D는 이미지로부터 고충실도 3D 가우시안 스플래팅(3DGS)을 생성하는 새로운 프레임워크입니다. DA-SLAT와 SMDiT 기술을 통해 기존 방식의 표현 및 정렬 병목 현상을 해결하여 시각적 세부 사항을 획기적으로 개선했습니다.
OpenThoughts-Agent(OT-Agent)는 에이전트 모델 학습을 위한 완전 공개 데이터 큐레이션 파이프라인을 제안합니다. 10만 개의 학습 데이터로 Qwen3-32B를 미세 조정하여 기존 Nemotron-Terminal-32B보다 높은 벤치마크 성능을 달성했습니다.
InSight는 VLA 모델이 원시 행동(primitive-action) 수준에서 조종 가능하도록 하여 자율적인 기술 습득을 지원하는 프레임워크입니다. VLM을 활용해 시연을 세분화하고, 누락된 기술을 스스로 학습하는 데이터 플라이휠 구조를 통해 인간의 추가 시연 없이도 새로운 과제를 수행합니다.
희귀 질환 진단을 위해 추론 강화 학습을 적용한 32B 규모의 오픈 소스 LLM인 RaDaR를 소개합니다. RaDaR는 합성 데이터를 활용해 학습되었으며, 임상 시험 결과 의사의 진단 정확도를 크게 향상시키고 진단 리드 타임을 단축하는 성과를 보였습니다.