Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
소프트웨어 성능 최적화 능력을 평가하기 위한 새로운 저장소 수준 벤치마크인 SWE-Pro를 소개합니다. 기존 벤치마크의 한계를 넘어 실행 시간과 메모리 사용량 간의 트레이드오프를 정밀하게 측정합니다. 평가 결과, 현재 LLM은 전문가 수준의 최적화 성능에 크게 미치지 못함을 확인했습니다.
LLM 기반 음성 언어 이해(SLU)에서 발생하는 다중 의도 예측의 불일치 문제를 해결하기 위한 SFL-MTSC 프레임워크를 제안합니다. 의미론적 프레임 수준에서 의도별 분해와 클러스터링을 통해 예측의 일관성을 높이는 구조적 집계 방식을 사용합니다.
LLM 에이전트의 강화학습 효율을 높이기 위해 상태-행동 신용 불일치 문제를 해결하는 BiPACE 방법론을 제안합니다. BiGPO와 PACE를 결합하여 추가적인 비평가나 롤아웃 없이도 에이전트의 성공률을 크게 향상시킵니다.
저자원 언어인 우르두어의 수학적 추론 능력을 강화하기 위해 개발된 Riazi-8B 모델을 소개합니다. Wikipedia를 활용한 지속적 사전 학습과 GSM8K 기반의 CoT 데이터를 통한 미세 조정을 통해 성능을 최적화했습니다.
오픈 웨이트 모델에서 도구 호출과 JSON 스키마 제약이 동시에 적용될 때 도구 호출이 억제되는 '도구 억제(Tool Suppression)' 현상을 분석한 연구입니다. JSON 스키마 제약이 토큰 마스크를 통해 도구 호출 토큰 접근을 차단하는 원인을 밝히고, 이를 해결하기 위한 '투명한 2패스 실행' 전략을 제안합니다.
LLM 기반 캐릭터 에이전트의 사실적 과잉과 스타일 단조로움을 해결하기 위한 3계층 메모리 아키텍처 REVERIEMEM을 제안합니다. 에피소드, 의미, 성격 계층을 통해 캐릭터의 관점을 유지하며 내러티브 생성 능력을 크게 향상시켰습니다.
본 논문은 일반 RAG부터 GraphRAG, Agentic RAG까지 다양한 RAG 변형 모델을 비교 평가하는 프레임워크를 제안합니다. 새로운 컨텍스트 엔지니어링 기법을 통해 토큰 사용량을 최대 53% 절감하고, 검색-생성 간극(retrieval-generation gap) 문제를 분석합니다.
BITEMBED는 LLM 기반 텍스트 임베딩의 높은 추론 비용과 저장 공간 문제를 해결하기 위한 극저비트 프레임워크입니다. BitNet 스타일의 양자화 기술과 지식 증류를 통해 성능 저하를 최소화하면서도 효율적인 임베딩 생성을 가능하게 합니다.
RAG 시스템의 코퍼스 오염 공격을 탐지하기 위한 경량 프레임워크 TRACE를 제안합니다. 토큰 영향력 귀속 기술을 활용하여 추가적인 LLM 검증 없이도 악의적인 문서를 식별하고 타겟 답변을 추적할 수 있습니다.
LLM의 안전성을 출력 결과가 아닌 내부 표현(internal representations)을 통해 측정하는 화이트박스 평가 방식인 SafeVec과 RAS 지표를 제안합니다. 이 방식은 기존의 출력 기반 평가보다 비용이 적고 빠르며, 모델의 거절 정렬 상태를 0-100 점수로 정밀하게 측정할 수 있습니다.
OPERA는 LLM의 개방형 작업 정렬을 위해 Perplexity 기반의 내재적 보상을 사용하는 강화학습 방법론을 제안합니다. 외부 판사의 편향 문제를 해결하고, 데이터 합성 및 Perplexity 우선순위 롤아웃을 통해 고품질 추론 궤적을 생성합니다. Qwen3-8B에 적용 시 오픈 소스 SOTA를 기록하며 일부 폐쇄형 모델과 대등한 성능을 보였습니다.
컴퓨터 사용 에이전트의 신뢰성을 높이기 위한 불확실성 정량화(UQ) 연구와 새로운 벤치마크인 Argus를 소개합니다. 다양한 VLM과 데이터셋 환경에서 UQ 방법론의 안정성을 분석하고, 모델 및 인터페이스 변화에 따른 성능 전이 특성을 규명합니다.
제한된 메모리 자원 하에서 언어를 학습하고 생성하는 과정에 대한 이론적 프레임워크를 제시합니다. DFA를 활용하여 공간 효율적인 언어 생성의 한계와 메모리 예산에 따른 생성 성능의 변화를 수학적으로 규명합니다.
LLM의 안전성 평가를 위해 기존 LLM 기반 판사 대신 ModernBERT와 같은 인코더 분류기를 사용하는 방식의 성능을 체계적으로 비교 연구했습니다. 인코더 분류기가 비용과 지연 시간을 줄이면서도 유해 출력을 효과적으로 식별할 수 있는지 다양한 공격 기법과 지표를 통해 검증했습니다.
LLM이 브랜드 정보를 인용하는 방식에 대한 연구로, 13개 언어와 128개 브랜드를 분석했습니다. AI는 주로 브랜드 소유 사이트가 아닌 제3자 소스를 통해 정보를 제공하며, 특정 도메인에 인용이 집중되는 경향을 보입니다.
도구 환경의 비신뢰성을 고려한 새로운 에이전트 벤치마크 ToolBench-X를 소개합니다. 기존 벤치마크가 신뢰할 수 있는 환경을 가정하는 것과 달리, 이 연구는 다양한 오류 상황에서도 에이전트가 과업을 완수할 수 있는 회복 능력을 평가합니다.
SARA는 MoE 아키텍처에서 저자원 언어의 성능을 높이기 위해 고자원 언어의 의미론적 앵커를 활용하는 프레임워크입니다. 라우팅 분포를 직접 정렬하여 언어 간 전문가 공유를 극대화함으로써 다국어 능력을 향상시킵니다.
방대한 업무 문서 컬렉션에서 희소한 증거를 찾아 추론하는 능력을 평가하는 새로운 벤치마크 Agora를 소개합니다. 기존 모델들은 컨텍스트 윈도우를 초과하는 데이터 규모와 복잡한 탐색 요구사항으로 인해 낮은 정확도를 보였습니다.
확산 모델의 언러닝 과정에서 유해 개념과 함께 삭제되는 무해한 공존 개념(CARE) 문제를 해결하기 위한 연구입니다. CARE 점수와 이를 보호하는 ReCARE 프레임워크를 제안하여 대상 개념만 정밀하게 삭제하면서 모델의 유용성을 유지합니다.
대화형 상품 검색 어시스턴트의 효율성을 높이기 위한 속성 지향적 선호도 도출 프레임워크인 D2D를 제안합니다. 제품 속성 구조를 활용해 정보량이 많은 쿼리에 우선순위를 부여함으로써, 정확한 추천과 대화 시간 단축을 동시에 달성합니다.