Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
본 논문은 대규모 파라미터의 멀티모달 감정 언어 모델(MLLMs)이 필수적인지에 의문을 제기하며, 지식 증류를 통해 경량화된 MER 프레임워크인 Light-MER를 제안합니다. 이 방법은 거대 교사 모델의 지식을 서브-10억 파라미터 학생 모델로 전이하여, 높은 감정 인식 성능과 뛰어난 배포 효율성을 동시에 달성하는 것을 목표로 합니다.
본 논문은 대규모 언어 모델(LLMs)의 화학 지능 강화를 위해 반응 메커니즘 학습의 중요성을 강조합니다. 기존 LLM들이 거시적 예측에 머물러 환각 문제를 겪는 한계를 극복하고자, 새로운 대규모 추론 데이터셋과 FukuyamaBench라는 까다로운 벤치마크를 구축했습니다. 이를 통해 Qwen3-30B-A3B 모델이 메커니즘 인지 학습을 거쳐 높은 정확도를 달성했음을 입증했습니다.
본 논문은 자체 개선 LLM 에이전트 시스템의 핵심 문제인 '신뢰할 수 있는 평가 지표 부재'에 대한 새로운 접근 방식을 제시합니다. 제안된 방법론은 지표 자체를 진화시키고, 자의 기준(arbitrary criteria)을 통해 정확한 지표를 복구하며, 외부 감사와 기준 준수 메커니즘을 통해 안전성을 확보하는 것을 목표로 합니다.
본 연구는 언어 모델이 내재된 지식에 과도하게 의존하는 문제를 해결하기 위해 Knowledge--''Less'' Language Models (KLLMs)를 제안합니다. KLLMs는 개체명 익명화 코퍼스에서 사전 학습되어, 사실적 지도 학습 경로를 제거함으로써 폐쇄형 회상을 줄이고 문맥 기반 추론 능력을 강화했습니다. 이 모델은 검색 증강 환경에서 높은 견고성과 신뢰성을 보여줍니다.
본 연구는 언어 모델이 주어진 선택지들 중 하나의 답을 골라야 할 때, 모델들이 어떤 단어를 선호하고 얼마나 일치하는지를 분석했습니다. 44개 모델에게 '아무 단어로도' 질문했을 때, 상당수의 모델이 'serendipity'를 선택하는 수렴 현상을 발견했습니다.
본 기사는 Diffusion large language models (dLLMs)가 가진 이론적 병렬 생성 이점을 실제 속도 향상으로 구현하는 데 필요한 효율적인 추론 메커니즘을 조사합니다. 특히, 확산 인식 캐싱과 같은 특화된 기술의 중요성을 강조하며, 통합 지연 시간 분해 프레임워크를 제시하여 알고리즘, 아키텍처, 시스템 수준의 가속화 요인을 체계적으로 분석하고 재현 가능한 벤치마킹 방법을 제안합니다.
본 연구는 LLM 기반 연구 에이전트의 개방형 출력을 평가하는 루브릭 생성에 대한 체계적인 메타 평가를 제시합니다. 논문 재현 분야에서 특히 유용한 이 접근 방식은, 루브릭을 체크리스트 형식으로 재구성하고 다양한 설정을 테스트했습니다. 그 결과, 증강된 설정이 다운스트림 평가 정렬을 개선하며 인간 기준선에 근접함을 확인했지만, LLM 생성 루브릭의 한계점도 함께 제시했습니다.
본 논문은 의료 대화에서 환자의 오개념(misconception)을 식별하고 교정하는 LLM의 능력을 평가하기 위해 ThReadMed-QA 데이터셋을 소개합니다. 실험 결과, 최신 모델들도 다중 턴 컨텍스트가 진행됨에 따라 오개념 교정 성능이 크게 저하되는 경향을 보였습니다. 이는 오류 전파(error propagation) 문제가 심각함을 시사하며, 지속적인 평가 프레임워크의 필요성을 강조합니다.
본 논문은 LLM 에이전트의 장기 기억을 단순한 사실 집합이 아닌, '기억-망각-업데이트' 등의 명시적 연산 생애 주기로 정의합니다. 이를 평가하기 위해 MemOps라는 새로운 벤치마크를 제안하며, 메모리 이벤트를 구조화된 추적으로 표현하여 다양한 실패 모드를 진단할 수 있게 합니다.
본 논문은 정답(ground-truth)이 없는 환경에서 LLM 심사관의 신뢰성을 평가했습니다. 실험 결과, 참조 답변이 없을 때 심사 모델들이 부정확한 답변을 과대평가하는 경향을 보였습니다. 또한, 프롬프트에 참조 정보를 추가하면 심사 모델의 판단이 크게 개선됨을 입증했습니다.
본 연구는 코드 조각만으로 출처를 추적하고, 인간과 LLM이 사용하는 보안 패턴의 차이를 분석하는 오픈 소스 파이프라인을 구축했습니다. 9개 언어 모델과 Stack Overflow API를 활용하여 민감한 프로그래밍 작업 31가지에 대한 샘플을 수집하고, 이를 통해 출처 분류기 및 보안 패턴 비교 분석 결과를 제시합니다.
본 논문은 Dockerfile 드리프트(Dockerfile과 소스코드 간의 불일치)를 자동 복구하는 컨텍스트 인식 프레임워크 Cadre를 제안합니다. Cadre는 Context-aware Dependency Graph (CDG)를 구축하여 명령어 간 의존성을 파악하고, 실패와 관련된 컨텍스트에서 목표화된 패치를 생성합니다. 또한, 실제 CI 로그에서 드리프트 사례를 채굴하는 DodeX 파이프라인을 소개하며, 이를 통해 벤치마크 $D^3$을 구축했습니다.
본 논문은 코드 속성 그래프(CPG)와 시간적 실행 그래프(TEG)를 활용하여 다중 관점에서 프로그램 복구(APR)를 수행하는 에이전트 기반 프레임워크 CT-Repair를 제안합니다. 이 프레임워크는 세 개의 유한 상태 기계 가이드 에이전트를 통해 정적, 동적, 하이브리드 증거를 분석하고 독립적인 복구 전략을 생성합니다. 평가 결과, CT-Repair는 기존 모델 대비 높은 복구율과 효율성을 입증했습니다.
본 논문은 LLM의 환각(hallucination) 문제를 해결하기 위해 EG-VAR (Evidence-Grounded Verified Agentic Reasoning)이라는 새로운 아키텍처를 제안합니다. 이는 Lean 4 기반의 도구 증명 커널을 활용하여 모든 출력이 입증된 증거와 유효한 추론 체인에서 파생되도록 보장합니다. 이 시스템은 높은 소스 충실도와 감사 가능한 추적을 제공하며, 고위험 경험적 주장에 대한 기술적 거버넌스 인터페이스 역할을 합니다.
본 논문은 글로벌 소프트웨어 개발 분야에서 역량 평가의 공정성과 책임성을 다룬다. 동아프리카와 북서유럽 출신 엔지니어들을 비교 분석한 결과, 측정된 성과와 인식되는 역량 사이에 격차가 존재함을 발견했다. 특히 유럽 참가자들이 아프리카 엔지니어들의 역량을 체계적으로 과소평가하는 경향을 보였다.
본 논문은 자율주행 시스템(ADS)의 안전성 확보를 위해, 가설 검증 및 의도 분석에 기반한 계층적 결함 위치 파악 프레임워크 HINT를 제안합니다. HINT는 오류 발생 기록을 다중 모드 추상화로 변환하고 인과 추론으로 책임 모듈을 식별하며, 재시뮬레이션 없이 신뢰성 일관성 검사를 통해 의심 코드를 찾아냅니다.
본 논문은 딥러닝 시스템의 결함 탐지 및 진단을 위한 새로운 공공 데이터셋 Deep4ge를 제시합니다. 이 데이터셋은 Stack Overflow에서 수집한 DNN 프로그램 기반으로, 다양한 종류의 오류가 주입된 14,227개의 훈련 실행을 포함합니다. Deep4ge는 에포크별 훈련 동작과 여러 특징(가중치, 기울기 등)을 기록하여 결함 탐지 및 진단에 활용될 수 있습니다.
본 논문은 LLM 추론 프레임워크의 복잡성과 유지보수 비용 문제를 해결하기 위해 'LLM-as-Compiler' 접근 방식인 metainfer를 제안합니다. 사용자가 런타임 제약 조건만 지정하면, LLM 기반 다중 에이전트 시스템과 계약 지식 기반을 결합하여 맞춤형 추론 프레임워크를 자동으로 생성합니다.
본 논문은 트랜스포머 모델의 편향 문제를 해결하기 위해 어텐션 헤드 레벨에서 개입하는 새로운 방법을 제안합니다. ROBIN이라는 화이트박스 디버깅 기법을 통해 특정 어텐션 헤드를 국소화하고, 해당 헤드의 출력에서 편향된 부분 공간을 제거하여 공정성을 개선함을 보여줍니다.
본 논문은 양자 프로그램 검증에 필수적인 '양자 약한 전제 조건'을 재검토합니다. 특히 예상 실행 시간 분석 관점에서 새로운 사전 기대값 프레임워크를 제시하며, 상한 없이도 전제 조건을 추론할 수 있게 합니다.