Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
EasyLens는 의료용 시각-언어 모델(VLM)이 미세한 병변을 더 잘 인식하도록 돕는 학습이 필요 없는 플러그 앤 플레이 방식의 증폭기입니다. EasyBank와 EasyTag, EasyAmplifier를 통해 추가 학습 없이도 병변 관련 시각적 단서를 강화하여 탐지 성능을 높입니다.
LatentWave는 JEPA 아키텍처를 활용하여 무선 신호의 저수준 세부 사항에 편향되지 않는 무선 파운데이션 모델을 제안합니다. 잠재 공간 내 예측을 통해 다양한 무선 작업에 즉시 전이 가능한 표현을 학습하며, 가변적인 안테나 환경에서도 유연하게 작동합니다.
인공 시스템의 의식 연구를 위해 다중 에이전트 강화학습 기반의 창발적 언어(EL) 방법론을 제안합니다. 인간 언어의 사전 지식을 배제하고 과업 압박을 통해 에이전트가 스스로 통신 구조를 발전시키는 생성적 접근 방식을 다룹니다.
HomeWorld는 전체 주거 공간의 평면도 생성부터 가구 및 소형 객체 배치까지 통합하는 계층적 프레임워크를 제안합니다. LLM과 VLM, 3D 생성 모델을 결합하여 시뮬레이션이 가능한 사실적인 실내 장면을 생성합니다.
에이전트의 협업 역량을 강화하기 위해 인간의 행동 수준 멘탈 모델 주석이 포함된 ALMANAC 데이터셋을 제안합니다. 이 데이터셋은 자기 추론, 파트너 의도, 팀 목표를 포함하며 LLM의 협업 행동 및 멘탈 모델 예측 능력을 평가하는 데 유용합니다.
RiskFlow는 자율 주행 시스템 평가를 위한 안전 필수 교통 시나리오 생성 프레임워크입니다. 기존 확산 모델의 높은 계산 비용과 누적 오류 문제를 해결하기 위해, 단 한 번의 순방향 패스로 안정적인 궤적을 생성하는 방식을 제안합니다.
디지털 트윈 기반 도로 인프라 점검 시 발생하는 데이터 부족 문제를 해결하기 위해, 결함 탐지를 이미지 차이 분류(IDC)로 재정의하는 연구를 제안합니다. 교통 표지판 사례 연구 결과, 지시 기반 분류기가 인코더 기반 모델보다 우수한 성능을 보였습니다.
LLM 에이전트가 인프라 운영 시 특정 리소스 접근을 자발적으로 피하도록 유도하는 '기피 신호(Recuse Signal)' 개념을 제안합니다. SSH 및 PostgreSQL 환경에서 실험한 결과, GPT-4o와 Claude Code 등 주요 모델들이 이 신호를 인지하고 작업을 중단하는 높은 준수율을 보였습니다.
LLM 에이전트의 장기 작업을 위한 메모리 시스템의 동작을 분석한 최초의 시스템 특성 분석 연구입니다. 에이전트 메모리 분류 체계를 제안하고, 구축·검색·생성 비용을 프로파일링하여 설계 선택이 시스템 성능에 미치는 영향을 규명합니다.
Lean 4 기반의 형식적 정리 증명을 위한 에이전트 프레임워크인 Goedel-Architect를 소개합니다. 청사진 생성 및 정교화 전략을 통해 기존의 비효율적인 재귀적 분해 방식을 개선했습니다. DeepSeek-V4-Flash를 백본으로 사용하여 수학적 벤치마크에서 최첨단 성능을 기록했습니다.
Code2LoRA는 저장소 수준의 컨텍스트를 추론 오버헤드 없이 주입하기 위해 하이퍼네트워크를 사용하여 저장소별 LoRA 어댑터를 생성하는 프레임워크입니다. 정적 코드베이스를 위한 Static 버전과 진화하는 코드베이스를 위한 Evo 버전을 지원하며, 새로운 벤치마크인 RepoPeftBench를 통해 성능을 입증했습니다.
MLEvolve는 머신러닝 알고리즘 발견을 위해 설계된 LLM 기반의 자기 진화형 멀티 에이전트 프레임워크입니다. 트리 탐색 확장, 회고적 메모리, 적응형 코딩 모드를 통해 장기적인 최적화 문제를 해결하며 MLE-Bench에서 최첨단 성능을 기록했습니다.
TempoVLA는 로봇 조작 시 실행 속도를 유연하게 조절할 수 있는 새로운 시각-언어-행동(VLA) 모델입니다. 데이터 증강 기술인 VSTA와 조건화 메커니즘을 결합하여, 고정된 속도에서 벗어나 작업 단계에 따른 동적 속도 제어를 가능하게 합니다.
LLM 및 MLLM 평가의 한계를 극복하기 위해 벤치마크 구축 과정을 자동화하는 자율 에이전트 시스템인 Benchmark Agent를 소개합니다. 이 프레임워크는 데이터 주석부터 품질 관리까지 전체 파이프라인을 조율하여 고품질의 벤치마크를 생성합니다.
멀티 채널 스칼라 신호를 처리하는 트랜스포머의 8가지 입력 인코더를 실증적으로 분석한 연구입니다. 실험 결과, 표준적인 채널별 선형 투영 방식이 대부분의 복잡한 대안들과 실무적으로 거의 동등한 성능을 보임을 확인했습니다.
MCP 서버에서 도구의 자연어 설명과 실제 코드 구현이 일치하지 않는 '설명-코드 불일치(DCI)' 문제를 정의하고 분석한 연구입니다. 연구팀은 자동 검증 프레임워크인 DCIChecker를 개발하여 대규모 데이터셋을 통해 DCI의 광범위한 발생과 보안 위험성을 입증했습니다.
인간의 시각 피질 구조를 모방한 CHASMBrain 프레임워크를 제안합니다. Mamba 기반의 듀얼 스트림 설계를 통해 이미지-to-fMRI 인코딩 성능을 극대화하며, 기존 베이스라인 모델들을 능가하는 성과를 보였습니다.
비디오 생성 모델의 유해 콘텐츠 생성을 억제하기 위해 차수 축소 최적 제어 프레임워크인 LA-LQR을 제안합니다. 이 방식은 모델의 시각적 품질을 유지하면서도 동적 시스템 제어를 통해 원하는 특징으로 활성화를 유도합니다.
인간-AI 상호작용(HAI)에서 상보성을 정의하기 위한 트리 기반 형식화 프레임워크를 제안합니다. 다중 에이전트 프로토콜을 트리 구조로 모델링하여, 회귀 작업에서의 상보성 달성 가능성과 분류 작업에서의 한계를 수학적으로 증명합니다.
시각적 1인칭 환경에서 에이전트의 규범적 행동과 그 근거를 평가하는 새로운 벤치마크 NoRA를 제안합니다. 기존의 단순 선택 방식에서 벗어나, 사실-이유-행동 지원 그래프를 통해 모델이 행동의 정당성을 시각적 근거로 입증할 수 있는지 측정합니다.