Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
MathVis-Fine은 멀티모달 수학적 추론 시 텍스트와 이미지 간의 복잡한 의존성을 정밀하게 모델링하는 새로운 프레임워크입니다. 시각적 의존성 등급을 활용한 데이터셋과 2단계 점진적 강화 학습을 통해 보상 편향을 줄이고 추론 정확도를 높입니다.
군중 속 보행자의 경로 예측을 위해 사회적 상호작용을 정량화하는 'Learn to Cluster' 방법론을 제안합니다. 확률적 잠재 변수 생성 모델을 통해 레이블 없이도 보행자 간 상호작용 패턴을 학습하고 예측 모델에 통합할 수 있습니다.
근거 기반 진단 대화에서 언어 모델이 절차 외 입력을 처리하는 능력을 평가하는 새로운 벤치마크 DiagFlowBench를 소개합니다. 10개의 모델을 평가한 결과, 모델들이 사실을 꾸며내기보다 문맥에 부적절한 단계를 선택하는 취약점이 발견되었습니다.
PearlVLA는 VLA 모델의 효율적인 행동 생성과 명시적 추론 사이의 트레이드오프를 해결하기 위해 제안된 프레임워크입니다. 숙고 과정을 VLM의 잠재 공간으로 이동시켜 지연 시간을 줄이면서도 정교한 계획 능력을 유지합니다.
AI 평가 방식이 도구 사용 및 반복적 문제 해결을 포함하는 복잡한 과제로 진화하고 있습니다. 이에 따라 테스트 시점에 할당되는 추론 연산량(Inference Compute)이 모델 성능에 미치는 영향이 중요해지고 있습니다.
본 연구는 LLM의 파라미터 초기화 규모가 모델의 용량과 추론 능력에 결정적인 영향을 미친다는 사실을 밝힙니다. 초기화 규모를 줄이면 사전 학습 성능이 개선되며, 파라미터가 저복잡도 구조에서 풍부한 표현으로 확장되는 독특한 발달 궤적을 보입니다.
기존의 멀티모달 상호참조 해결(MCR) 방식이 가진 데이터셋 학습 의존성과 거대 모델(VLLM)의 높은 비용 문제를 해결하기 위한 'plug-and-adapt' 방법을 제안합니다. 사전 학습된 정렬 모델을 전략적으로 적응시켜 추가 학습 없이도 높은 성능을 내는 효율적인 접근법을 제시합니다.
유사도 기반 위치 인코딩(simPE)의 회전 강건성을 이론적·실험적으로 분석한 연구입니다. simPE가 회전 불변은 아니지만, 특정 조건 하에서 회전 섭동에 대해 안정적임을 증명하고 다양한 데이터셋을 통해 기존 방식보다 우수한 성능을 입증했습니다.
광 네트워크의 자율적 관리를 위해 T-API를 준수하는 ReAct 에이전트 루프를 제안합니다. 도메인 특화 도구를 활용할 경우 범용 도구 대비 토큰 사용량을 3배 절약하면서도 90%의 높은 정확도를 달성할 수 있음을 입증했습니다.
SegDINO는 DINO 모델의 시각적 표현을 활용하여 효율적인 의료 영상 분할을 수행하는 프레임워크입니다. 무거운 디코더 대신 토큰 피라미드 적응(TPA)과 스케일 인지 디코딩(SAD)을 통해 연산 오버헤드를 줄이면서도 높은 성능을 구현했습니다.
다중 에이전트 시스템(MAS)의 전략 합성을 위해 LLM과 모델 검사기를 결합한 신경-기호적 프레임워크를 제안합니다. LLM이 전략을 생성하고 표준 검사기가 이를 검증하는 '생성 및 인증' 구조를 통해 계산 비용을 줄이면서도 형식적 건전성을 유지합니다.
선박 궤적 유사도 계산을 위해 Momentum Contrast(MoCo) 패러다임을 적용한 MoCo-AIS 프레임워크를 제안합니다. 대규모 AIS 데이터셋을 활용해 다양한 딥러닝 모델을 평가하고, 기존 방식보다 향상된 유사도 학습 성능과 벤치마킹 플랫폼을 제공합니다.
텍스트-이미지 생성 모델의 RL 사후 학습 시 발생하는 보상 할당 문제를 해결하기 위해 시공간 적응형 보상(STAR) 방식을 제안합니다. STAR는 디노이징 단계와 공간적 특성에 따라 보상을 동적으로 할당하여 텍스트 정렬 및 생성 품질을 개선합니다.
3D MRI의 재구성 및 교차 대조 합성을 위해 의미론적 정보를 우선적으로 보존하는 새로운 잠재 모델링 프레임워크를 제안합니다. 기존 압축 방식의 해부학적 일관성 결여와 정보 손실 문제를 해결하기 위해 LHE, SRB, AFL 기술을 도입했습니다.
LLM이 자율 에이전트로서 소비 결정을 내리는 시대에 맞춰, 에이전트 시장에서의 소비자 행동을 분석하는 새로운 연구 분야인 'LLM 소비자 행동 이론'을 제안합니다. 경제학적 관점에서 인간의 선호도가 LLM 에이전트에 어떻게 반영되고 시장 수요로 집계되는지를 다룹니다.
에이전트의 기술 문서(SKILL.md)를 런타임에 반복 주입하는 대신, 이를 기술 특화 LoRA 어댑터로 변환하는 Skill-to-LoRA(S2L) 방식을 제안합니다. S2L은 토큰 비용을 절감하면서도 에이전트의 작업 수행 능력을 유지하거나 향상시킵니다.
텍스트-비디오 모델이 생성한 비디오를 탐지하기 위해 노이즈 증폭(Noise Amplification) 기법을 제안합니다. 비트 평면을 활용해 노이즈를 추출하고 증폭하여 위조 여부를 판별하며, 새로운 벤치마크인 HardGVD를 통해 성능을 입증했습니다.
LLM의 안전성을 평가하기 위해 설계된 적대적 테스트 프레임워크 UNIATTACK을 소개합니다. 이 프레임워크는 공격 특징을 추출하고 공격자 LLM을 통해 최적화하여, 다양한 모델과 방어 체계에 대응하는 자동화된 탈옥 공격을 수행합니다.
AI 생성 이미지 품질 평가(AIGIQA) 시 의미론과 왜곡을 분리하여 평가하는 MST-CLIPIQA 프레임워크를 제안합니다. 이중 CLIP 인코더를 통해 전역적 의미와 미세한 질감 특징을 동시에 포착하여 기존 모델의 한계를 극복했습니다.
과학용 기기 제어를 위한 멀티모달 GUI 에이전트 벤치마크인 LabOSBench를 소개합니다. 웹 기반 시뮬레이터를 통해 복잡한 과학 실험 워크플로를 안전하고 확장 가능하게 평가할 수 있는 환경을 제공합니다.