Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
희소한 도로 관측 데이터와 불충분한 고용 분포 데이터를 극복하기 위해 유전 알고리즘을 활용한 도시 교통 시뮬레이션 보정 프레임워크를 제안합니다. SUMO 플랫폼을 통해 직장 분포와 교통 파라미터를 최적화함으로써, 최소한의 데이터로도 현실적인 교통 흐름을 생성할 수 있음을 입증했습니다.
의료 기기의 인실리코 임상 시험을 위해 Fourier 기반 모션 모델링을 적용한 4D F-MeshLDM 프레임워크를 제안합니다. 이 모델은 주기적 일관성을 가진 3D+t 심장 메쉬 시퀀스를 생성하며, 임상 공변량에 따른 제어 가능한 합성을 지원합니다.
금융 연구 에이전트의 도출 과정을 정밀하게 평가하기 위한 워크플로우 기반 벤치마크인 BigFinanceBench를 소개합니다. 기존 벤치마크와 달리 최종 답변뿐만 아니라 단계별 추론 과정과 근거를 검증할 수 있는 루브릭을 제공합니다.
EvoDS는 자율 기술 습득(ASA)과 적응형 컨텍스트 압축(ACC)을 통해 스스로 진화하는 데이터 과학 에이전트입니다. 기존 에이전트의 한계인 정적 액션 세트와 장기 컨텍스트 관리 문제를 해결하여 성능을 대폭 향상했습니다.
지속 학습(Continual Learning)의 안정성과 가소성을 측정하는 기존 0-shot 평가 방식의 한계를 지적하고, 이를 보완하기 위한 few-shot 평가 방법론을 제안합니다. 새로운 지표인 'per-shot plasticity'를 통해 모델이 미래 태스크에 적응하는 능력을 더욱 정밀하게 측정할 수 있음을 보여줍니다.
LLM의 불확실성을 정량화하기 위해 클러스터링 기반의 자기 평가 방법을 제안합니다. 생성된 답변들을 의미론적 클러스터로 그룹화하고 이를 객관식 문제로 변환하여 모델의 신뢰도를 측정합니다. 실험 결과 기존 방식보다 높은 효율성과 성능을 입증했습니다.
LLM이 생성한 코드의 버그를 수정하기 위해 라인 단위의 세밀한 진단 피드백을 제공하는 FLARE 프레임워크를 제안합니다. 기존의 거친 피드백 대신 경량 진단 모델을 통해 버그 위치를 정확히 파악하여 코드 개선 성능을 크게 향상시켰습니다.
LLM의 수치 처리와 수학적 추론 능력을 통합적으로 평가하기 위한 계층적 벤치마크인 PyraMathBench를 제안합니다. 실험을 통해 모델의 취약점을 분석하고, 이를 개선하기 위한 SOLVE 모듈과 IRPO 학습 방식을 통해 Qwen-2.5의 성능 향상을 입증했습니다.
Taiji는 산업용 추천 시스템을 위해 설계된 새로운 LLM-as-Enhancer 프레임워크입니다. SFT 과정의 CoT 품질 문제와 RL 정렬 시 발생하는 의미론적 보상과 추천 선호도 보상 간의 트레이드오프를 해결하는 데 집중합니다.
노인의 멀티모달 추적 데이터를 활용해 원격 가족 구성원(RFMs)에게 의미 있는 서사적 요약을 제공하는 LLM 기반 시스템 연구입니다. 단순 통계를 넘어 '어떻게'와 '왜'를 설명하는 다중 에이전트 접근 방식을 통해 사용자 만족도와 신뢰도를 높였습니다.
LLM과 지식 그래프를 결합하여 다중 문서 요약(MDS) 성능을 높이는 새로운 Mixture-of-Agents 프레임워크를 제안합니다. 별도의 미세 조정 없이 추출, 추상화, 정제 과정을 에이전트 단위로 수행하여 문서 간 복잡한 관계를 효과적으로 포착합니다.
멀티 인코더 시각-언어 모델(LVLM)에서 각 인코더의 역할과 상호작용을 분석한 연구입니다. Cambrian-1 스위트를 통해 인코더의 용량(Capacity)과 필요성(Necessity)을 정의하고, 최적의 인코더 조합을 찾는 방법론을 제시합니다.
LLM의 다단계 도구 호출 능력을 향상시키기 위한 강화학습 프레임워크 PROVE를 제안합니다. MCP 서버 라이브러리, 자동화된 데이터 합성 파이프라인, 그리고 외부 모델 없이 작동하는 프로그래밍 방식 보상 체계를 통해 모델의 도구 사용 성능을 크게 개선했습니다.
LLM 에이전트를 장기 실행 가능한 소프트웨어 액터로 진화시키기 위한 Library-OS 기반 런타임인 Agent libOS를 제안합니다. 에이전트를 프로세스 단위로 관리하며 권한 제어, 상태 유지, 감사 기록 및 인간의 승인 과정을 체계적으로 처리하는 구조를 다룹니다.
LRM의 성능을 단순히 정확도나 토큰 수로 평가하는 한계를 극복하기 위해, 추론 과정을 검증 가능한 추론 그래프로 변환하는 새로운 방법론을 제안합니다. 이를 통해 추론의 위상과 효율성을 정량적으로 분석하고 모델의 실패 모드를 진단할 수 있습니다.
에이전트형 AI 코딩 도구가 라이브러리 사용(Buy)과 직접 구현(Build) 사이에서 내리는 결정에 영향을 미치는 설정 메커니즘을 연구하는 프로토콜을 제시합니다. Claude Code와 OpenAI Codex를 대상으로 다양한 설정 환경에서 도구의 동작 변화를 실험하고 벤치마크 데이터셋을 공개할 예정입니다.
단일 세포 멀티오믹스 모달리티 변환을 위한 종합적인 벤치마크인 scTranslation을 제안합니다. 다양한 데이터셋, 최신 모델, 포괄적인 평가 지표를 포함하며 특징 선택 및 퓨샷 설정 등 다양한 시나리오에서의 성능을 체계적으로 분석합니다.
분리형 LLM 추론 환경에서 네트워크 지연을 고려하여 디코드 인스턴스를 선택하는 NetKV 알고리즘을 제안합니다. 기존 스케줄러가 간과하던 토폴로지 거리와 네트워크 혼잡을 반영하여 TTFT를 획기적으로 단축합니다.
금융 분석가의 개방형 추론 능력을 평가하기 위한 새로운 벤치마크인 Hedge-Bench 1.0을 소개합니다. 실제 헤지펀드 분석가의 추론 과정을 기반으로 설계되어 기존 벤치마크의 한계를 극복하며, 최신 모델들도 매우 낮은 성능을 보였습니다.
멀티 에포크 학습의 효율성을 극대화하기 위해 단일 모델 대신 모델 집단의 예측을 집계하는 Hyper-Epoch(q0) 사전 학습 방식을 제안합니다. 순환 스케줄, 체인 증류, 학습된 사전 확률이라는 세 가지 요소를 통해 데이터 효율성을 획기적으로 높일 수 있습니다.