Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
소프트 접두사(Soft Prefixes)를 활용하여 LLM의 삼단논법 추론 안정성을 진단한 연구입니다. Qwen 및 Gemma 모델을 대상으로 실험한 결과, 특정 연속 벡터가 모델의 논리적 판단을 의도적으로 오답으로 유도하며, 이는 논리적 연산보다는 광범위한 답변 선호도 편향에 기인함을 밝혀냈습니다.
로봇의 실내 내비게이션 시 고정된 안전 마진 문제를 해결하기 위해 적응형 여유 공간 선호도를 학습하는 안전 비평가 모델을 제안합니다. 확산 기반 플래너의 궤적 중 최적을 선택하도록 설계되었으며, 시뮬레이션 학습 후 휴머노이드 로봇에 성공적으로 전이되었습니다.
GigaPath-Flash와 GigaTIME-Flash는 대규모 조직병리 데이터 분석을 위한 효율적인 파운데이션 모델입니다. 지식 증류 기술을 통해 계산 비용을 획기적으로 줄이면서도 높은 성능을 유지하며, 오픈 웨이트로 공개되어 정밀 의료 연구를 지원합니다.
엣지 디바이스에서 저지연 EEG 분류를 위해 비트 연산 기반의 미분 가능한 논리 게이트 네트워크(Diff-Logic)를 제안합니다. 기존 MLP 대비 뛰어난 속도와 메모리 효율성을 보여주며, 자원 제한적인 BCI 환경에 최적화된 패러다임을 제시합니다.
본 연구는 LLM이 3D 공간 제약 조건 하에서 분자 결합을 설계하는 능력을 체계적으로 분석합니다. 새로운 벤치마킹 전략인 3D-Fit을 통해 LLM의 공간적 추론 능력을 평가하며, 기존 확산 모델 대비 성능과 확장 가능성을 탐구합니다.
자율 발견 시스템(OpenEvolve, TTT-Discover 등)의 하네스 설계가 특정 문제에 최적화되어야 함을 입증하는 연구입니다. 실험 결과, 모든 상황에 우월한 범용 하네스는 없으며 초기 성능을 바탕으로 자원을 재할당하는 적응형 방식이 더 효과적임을 밝혔습니다.
정신 건강 분야를 중심으로 LLM의 윤리적 정렬을 평가하고 개선하기 위한 모듈형 프레임워크를 제안합니다. 이 프레임워크는 새로운 모델과 벤치마크를 유연하게 통합할 수 있는 확장 가능한 구조를 갖추고 있습니다.
Isabelle/HOL 환경에서 일차 모달 논리(FML)를 심층 및 얕은 임베딩 방식으로 확장하는 연구를 소개합니다. 상수 도메인 Kripke 의미론을 활용하여 세 가지 임베딩 방식을 제안하며, Löwenheim-Skolem 정리를 메커제니제이션하여 충실성 증명을 자동화했습니다.
지오폴리머 혼합물 설계 시 소규모 및 이질적 데이터를 활용하기 위한 점진적 트랜스포머(INCRT) 기반의 역설계 프레임워크를 제안합니다. 물리적 제약과 위상 인식을 결합하여 신뢰할 수 있는 혼합물 후보를 선별하는 데 중점을 둡니다.
비디오 LLM의 블랙박스 문제를 해결하기 위해 시공간적 증거를 함께 출력하는 E-VQA 과제를 제안합니다. 인간 검증 벤치마크인 ST-Evidence와 160k 규모의 데이터셋을 통해 설명 가능한 비디오 이해 성능을 크게 향상시켰습니다.
TerraZero는 대규모 강화학습을 위한 절차적 주행 시뮬레이터이자 셀프 플레이 훈련 스택입니다. 인간의 데몬스트레이션 없이도 GPU 기반의 고속 시뮬레이션을 통해 자율 주행 에이전트를 효율적으로 훈련하며, 뛰어난 제로샷 일반화 성능을 보여줍니다.
개인의 변화하는 루틴과 건강 데이터를 반영하여 스스로 진화하는 오픈 소스 에이전트 아키텍처 HealthClaw를 소개합니다. 장기 기억과 안전 규칙을 분리하여 답변 정확도를 획기적으로 높이고 프롬프트 컨텍스트 노출을 줄였습니다.
AI 벤치마크 평가에 활용되는 문항 반응 이론(IRT)의 신뢰성을 분석한 연구입니다. AI 데이터의 특수성이 기존 IRT 추정 도구의 성능과 신뢰성에 미치는 영향을 시뮬레이션을 통해 체계적으로 조사했습니다.
텍스트와 시각 정보 간의 불일치를 활용해 멀티모달 풍자 및 사이버불링을 탐지하는 HCIG 프레임워크를 제안합니다. 그래프 어텐션 네트워크를 통해 토큰, 구, 전역 수준의 계층적 의미 불일치를 모델링하여 기존 방식보다 정교한 추론을 수행합니다.
강화학습에서 도메인 간 역학 불일치 문제를 해결하기 위해 확산 모델을 활용한 DADiff 프레임워크를 제안합니다. 생성 궤적의 차이를 이용해 역학을 추정하고, 보상 수정 및 데이터 선택 방식을 통해 타겟 도메인으로의 정책 적응을 수행합니다.
본 논문은 LLM의 복잡한 추론 능력을 이해하기 위해 사전 학습(Pre-training)부터 강화학습(RL)까지 전체 파이프라인을 연구합니다. 체스 게임이라는 통제된 테스트베드를 사용하여, RL 성능이 사전 학습 단계에서 형성되는 손실로부터 예측 가능하며, 어려운 문제에서는 SFT만으로는 얻기 어려웠던 능력을 발현함을 입증했습니다.
CRAFT는 기존 평가 시스템의 한계를 극복하고, LLM이 실패한 근본적인 역량(capability)을 진단하는 새로운 방법을 제시합니다. 이는 루브릭 기반 평가 데이터셋을 모델 특정 약점 진단으로 변환하여 계층적 역량 트리로 클러스터링합니다. 이 과정을 통해 목표 지능형 지도 학습 파인튜닝 데이터를 생성할 수 있습니다.
본 논문은 AI 시스템의 거버넌스 측면에서 감사 가능한 신뢰성 수준을 확보하기 위한 경량 방법론을 제안합니다. 이 방법론은 형식적 프레임워크와 라이프사이클 거버넌스 절차 두 가지 구성 요소로 이루어져 있습니다. 이를 통해 AI의 변화를 시간 흐름에 따라 문서화하고 모니터링할 수 있는 증거 기반을 제공합니다.
본 논문은 다중 에이전트 시스템(MAS)과 단일 에이전트 시스템(SAS)의 차이를 정보 병목 관점에서 분석했습니다. MAS가 경계가 있는 중계 메시지를 사용하는 반면, SAS는 전체 컨텍스트를 공유한다는 점에 주목합니다. 연구 결과, MAS의 이점은 압축으로 인한 정보 손실보다 중복 컨텍스트 감소로 얻는 효율성 개선이 클 때 발생함을 보여줍니다.
본 논문은 인간의 능동적 관찰 능력과 MLLMs의 시각 인지 능력을 비교하며, 현재 모델들이 이 부분에서 취약함을 지적합니다. 'ActiveVision'이라는 새로운 벤치마크를 제시하여, 단일 정적 설명이 아닌 반복적인 시각적 추론을 요구하는 17개 과제로 구성했습니다. 평가 결과, GPT-5.5와 Claude Fable 5 등 최신 모델들이 이 능동 관찰 테스트에서 현저히 낮은 성능을 보였습니다.