Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
ART(Art-based Reinforcement Training)는 동결된 MLLM의 시각적 입력만을 최적화하여 미세 조정을 수행하는 새로운 PEFT 기술입니다. 기존 LoRA나 소프트 프롬프팅과 달리 계산 그래프를 수정하지 않아 vLLM 같은 고처리량 엔진에서도 활용이 가능합니다.
차량 통신용 딥러닝 채널 추정기의 OOD 일반화 성능을 향상시키고 내부 메커니즘을 설명하기 위한 REACH 프레임워크를 제안합니다. 그래디언트 기반 해석 가능성 분석을 통해 핵심 특징을 식별하고, 이를 바탕으로 성능 저하를 최소화하면서 모델을 효율적으로 압축합니다.
MAE, JEPA, BERT의 원리를 결합한 새로운 자기지도 학습 아키텍처인 RePAIR를 소개합니다. 체스 데이터를 활용해 순차적 데이터 내 객체를 의미 있는 표현으로 인코딩하며, 강화학습 없이도 기물의 움직임을 추론할 수 있음을 입증했습니다.
LLM 기반 코드 번역의 논리적 오류를 줄이기 위해 다중 의미 증강 및 자기 교정 프레임워크인 Multisage를 제안합니다. 소스 코드에서 구조화된 의미를 추출하고 이를 검증하여 번역 성능을 획기적으로 높였습니다.
레이블 시프트 상황에서 Conformal Bayes를 활용해 통계적으로 유효한 예측 집합을 생성하는 두 가지 접근 방식을 연구합니다. 사후 교정과 학습 중 적응 방식의 메커니즘 차이를 분석하고, 실험을 통해 각 방식의 커버리지 유지 및 구간 너비 효율성을 비교합니다.
Hugging Face 팀이 최첨단 기술(SOTA)을 확인할 수 있는 paperswithcode.co를 재출시했습니다. arXiv와 Hugging Face의 논문을 자동 파싱하여 리더보드를 생성하며, 폐쇄형 모델의 평가 결과 포함 여부를 설정할 수 있는 기능이 추가되었습니다.
Transformer 기반 펩타이드 시퀀싱 모델이 입력 스펙트럼보다 생성된 시퀀스 확률에 과도하게 의존하는 문제를 해결하기 위한 MemNovo를 제안합니다. MemNovo는 스펙트럼 메모리 뱅크를 활용해 물리적 증거를 디코딩 단계에 직접 주입함으로써 정보 병목 현상을 완화합니다.
자성 재료의 특성 예측 시 발생하는 불확실성을 정량화하기 위한 머신러닝 연구를 소개합니다. 가우시안 NLL 손실과 드롭아웃 기반 베이지안 근사를 활용하여 모델의 신뢰성을 평가하고, 이를 그래프 신경망(GNN) 기반의 보자력 예측 작업으로 확장하는 방법을 다룹니다.
자율 주행 로그에서 가치 있는 시나리오를 추출하는 AutoMine 방법론을 제안합니다. LLM과 VLM을 활용한 자기 개선 기술과 의미 보존형 프롬프트 증강을 통해 데이터 기반 평가의 효율성을 높였습니다.
ctDNA 검출 한계 이하의 희미한 신호를 감지하기 위해 Censored-Poisson 베이지안 잠재 성장 모델인 'Span'을 제안합니다. 이 모델은 비검출 데이터를 유의미한 정보로 활용하여 유방암 진행을 기존 방식보다 약 두 배 더 정확하게 예측합니다.
본 연구는 대화 시스템의 정서적 지원 강화를 위해 감정적 검증(Emotional validation)에 초점을 맞췄습니다. 이를 위해 120k 규모의 영어-일본어 다국어 코퍼스 M-EDESConv와 음성 테스트 세트 M-TESC를 공개했습니다. 또한, 다국어 감정 인식 게이트 유닛 MEGUMI 및 EmoValidBench 벤치마크를 제안하며 LLM의 정서 이해 개선 필요성을 제시합니다.
휴머노이드 로봇의 이동과 조작을 동시에 학습할 때, 단일 통합 비평가보다 이중 비평가 구조가 성능 면에서 훨씬 우수함을 입증한 연구입니다. 실험 결과 이중 비평가가 타겟 도달 속도와 성공률 모두에서 통합형을 압도했습니다.
LLM의 내부 표현과 인간의 뇌 신경 신호 간의 대응 관계를 분석하고, 뇌 유도 프레임워크를 통해 모델의 추론 능력을 향상시키는 연구입니다. fMRI 신호를 활용해 모델 표현을 조종함으로써 다양한 LLM에서 추론 정확도를 크게 개선했습니다.
실험 노트의 비정형 데이터를 과학적 AI 에이전트가 활용 가능한 검증 가능한 기술로 변환하는 Notes2Skills 프레임워크를 제안합니다. 저자의 불확실성을 보존하여 AI가 잠정적 판단과 확정적 결론을 혼동하지 않도록 설계되었습니다.
GraspLLM은 LLM의 의미론적 이해와 그래프 구조 이해를 결합하여 텍스트 속성 그래프(TAGs)의 제로샷 일반화 성능을 높이는 프레임워크입니다. 모티프 인식 대조 학습과 최적의 문맥적 서브그래프 추출을 통해 데이터셋과 태스크에 구애받지 않는 강력한 구조적 정보를 추출합니다.
체화된 공간 지능(Embodied Spatial Intelligence) 평가를 위한 자율 에이전트 시스템인 Embodied-BenchClaw를 제안합니다. 5단계 파이프라인과 3개의 에이전트를 통해 지속적으로 업데이트 가능한 벤치마크 패키지를 자동으로 생성합니다.
Anthropic이 출시한 최상위 Mythos 클래스 모델인 Claude Fable 5의 성능과 요금 체계를 리뷰합니다. Opus 대비 2배 높은 가격에도 불구하고 압도적인 정밀도와 속도를 보여주며, 복잡한 엔지니어링 태스크에서 SOTA급 성능을 기록했습니다.
수어 번역(SLT) 성능 향상을 위해 LLM과 비디오 스티칭 기술을 활용한 새로운 코퍼스 증강 방식을 제안합니다. 추가적인 인간 주석이나 생성형 비디오 모델 없이도 고품질의 합성 비디오-텍스트 쌍을 생성하여 모델의 일반화 능력을 높입니다.
AI 에이전트가 자율적으로 과학적 연구 루프를 수행할 수 있도록 돕는 범용 프레임워크 'Arbor'를 소개합니다. 가설 트리 정교화(HTR) 방식을 통해 전략적 코디네이터와 실행기가 협력하며, 누적된 통찰력을 바탕으로 연구를 지속합니다. 실제 연구 과제에서 기존 모델 대비 월등한 성능을 입증했습니다.
ACM Multimedia AVI Challenge 2026을 위한 비동기식 비디오 인터뷰 기반 성격 및 인지 능력 예측 솔루션을 제안합니다. CLIP, Whisper, RoBERTa 등 사전 학습된 모델을 미세 조정 없이 사용하는 동결된 멀티모달 인코더 방식을 통해 소규모 샘플 환경에서의 성능을 입증했습니다.