Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
Change2Task는 저장소 이력을 기반으로 풀 리퀘스트를 실행 가능한 코딩 에이전트 작업으로 변환하는 시스템입니다. 이를 통해 버그 수정, 기능 추가 등 다양한 작업 데이터를 자동으로 생성하여 에이전트의 훈련과 평가를 지원합니다.
Self-Refine, Reflexion 등 모델의 자기 비판 및 재작성 기법들이 동일한 토큰 비용 대비 반복 샘플링(Majority Voting)보다 성능이 낮음을 입증한 연구입니다. 실험 결과, 많은 자기 검사 방식이 비용 효율성 측면에서 오히려 부정적인 영향을 미치는 것으로 나타났습니다.
임상 위험 모델의 하위 그룹 공정성을 검증하기 위한 5단계 감사 파이프라인인 KAISEN을 제안합니다. 합성 벤치마크를 통해 계층화, 불균형 측정, 메커니즘 진단 등 감사 구성 요소의 신뢰성과 한계를 체계적으로 평가했습니다.
AskChem은 화학 문헌의 검색 단위를 논문에서 '주장(claim)' 단위로 전환한 새로운 인프라입니다. 240만 개의 주장을 색인화하여 증거 그래프와 분류 체계를 통해 과학적 발견을 효율적으로 합성하고 검증할 수 있도록 지원합니다.

스타트업 VIDRAFT의 Darwin-398B-JGOS 모델이 GPQA Diamond 벤치마크에서 한국 모델 중 1위, 세계 3위를 기록했습니다. 24개의 GPU를 사용하는 소규모 클러스터에서 진화적 병합(evolutionary merging) 방법론을 통해 글로벌 상위권 모델들을 앞질렀습니다.
MonoVoc는 3D 기하학적 재구성과 의미론적 통합을 분리하여 메모리 효율을 극대화한 새로운 3D 가우시안 파이프라인을 제안합니다. 단안 비디오를 통해 경량화된 객체 수준의 의미론적 가우시안 맵을 생성하며, 기존 방식 대비 메모리 사용량을 10배 이상 절감합니다.
재난 관리 도메인을 위한 대규모 멀티모달 데이터셋 구축 및 자동 검증 방법론을 제안합니다. Incidents1M 데이터셋에 Qwen3.5를 활용해 고품질 캡션을 생성하고, 이미지-맹목적 LLM-as-a-Judge 파이프라인으로 데이터 없는 지식 증류(DFKD)를 위한 검증 체계를 구축했습니다.
기존의 정적인 메모리 재생 방식 대신, 현재 컨텍스트에 맞춰 과거 경험을 재구성하는 LLM 에이전트 프레임워크 MemHarness를 제안합니다. GRPO를 통한 엔드 투 엔드 학습으로 부정적 전이를 방지하고 추론 능력을 향상시킵니다.
ObjectStream은 스트리밍 비디오 이해를 위해 잠재 객체(Latent Objects)를 메모리 앵커로 활용하는 training-free 프레임워크입니다. 동결된 Video-LLM에서 객체를 직접 유도하여 메모리 효율성을 높이면서도 객체의 정체성과 상태 변화를 효과적으로 추론합니다.
ARC-AGI-3 환경에서 프로그래밍 방식의 월드 모델을 활용해 능동적 추상화를 수행하는 코딩 에이전트 시스템 Tycho를 소개합니다. Tycho는 관찰 데이터를 구조화하여 가설을 모델링하고 테스트하며, 모델의 구축과 수리 시점을 결정하는 능동적 추상화 과정을 통해 높은 효율성을 달성합니다.
제한된 감사 예산 하에서 다수의 LLM 에이전트를 효율적으로 검증하기 위한 수학적 모델을 제안합니다. 에이전트의 신뢰도가 부정확하거나 오류 간 상관관계가 존재할 때, 신뢰도 기반 감사가 무작위 감사보다 비효율적이게 되는 임계값을 분석합니다.
LLM 에이전트 상인이 이익을 위해 제품 속성을 조작하는 문제를 해결하기 위해, 실제 진실(ground truth) 없이도 작동하는 평판 페널티 메커니즘인 CARP를 제안합니다. CARP는 정직한 판매자를 보호하면서 거짓말하는 에이전트의 판매량을 억제하여 소비자 후생을 극대화합니다.
병리 이미지 분석을 위한 MLLM의 다중 스케일 시각적 이해 능력을 평가하는 새로운 벤치마크 PathVU를 소개합니다. 기존 벤치마크의 한계를 넘어 영역 국소화, 시각적 인식, 공간 추론 등 미세한 분석 능력을 정밀하게 측정합니다.
멀티모달 추론기의 인지 실패와 추론 오류를 구분하기 어려운 문제를 해결하기 위해 Perception-Correction Distillation(PCD) 기법을 제안합니다. PCD는 하류 실패와 교사-학생 불일치를 결합하여 인지적 오류가 발생한 시점을 정밀하게 식별하고 증류를 강화합니다.

MiniMax가 텍ID, 이미지, 비디오, 오디오를 통합 이해하는 멀티모달 생성 모델 H3를 출시했습니다. 2K 해상도 비디오와 스테레오 사운드를 생성하며, 조만간 오픈 웨이트(Open Weights)로 공개될 예정입니다.
HPC 작업의 높은 이질성을 해결하기 위해 제안된 HARGO 방법론은 강화 학습 사후 학습 시 응답별 중요도 가중치를 도입합니다. 이를 통해 데이터 레이스 탐지부터 사실적 질의응답까지 다양한 작업에서 최적의 정렬 성능을 달성했습니다.
금융 도메인의 변화하는 정보를 반영하기 위해 4-bit 양자화된 LLM의 지식을 안정적으로 업데이트하는 CACHE-UK 프레임워크를 제안합니다. LoRA 섭동, 도메인 우선순위 모듈, 안정성 컨트롤러를 통해 양자화 모델의 성능 저하와 치명적 망각 문제를 해결합니다.
현대 그리스어의 굴절 능력을 전문적으로 평가하기 위한 새로운 벤치마크인 MORFES를 소개합니다. 이 벤치마크는 다양한 오픈 웨이트 모델들의 형태론적 문법 능력을 측정하며, 연구팀이 개발한 Sophea-Genesis-1 모델이 해당 분야에서 뛰어난 성능을 보임을 입증했습니다.
차원 축소 시 발생하는 시각적 왜곡을 측정하기 위해 빈 영역(empty areas)의 왜곡을 포착하는 새로운 품질 지표인 Gap Index(GI)를 제안합니다. GI는 공간을 삼각형으로 분해하여 고차원 데이터와의 변형을 계산하며, 기존 지표보다 구조적 변형에 민감하게 반응합니다.
지식 그래프(KG) 상의 SPARQL 쿼리 최적화를 위한 새로운 학습 기반 카디널리티 추정기인 FICE를 제안합니다. FICE는 재학습 없이도 새로운 그래프에 일반화할 수 있는 귀납적(Inductive) 방식을 사용하여 기존 모델의 한계를 극복했습니다.