Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
CRAFT는 표 형식 질의응답과 사실 검증을 위해 양방향 반사실적 추론을 사용하는 통합 프레임워크입니다. 기존 단방향 추론의 한계를 극복하여 복잡한 표 데이터에서 LLM의 추론 성능을 크게 향상시켰습니다.
본 연구는 Sparse Autoencoder(SAE)를 활용하여 언어 모델의 은닉 상태를 해석 가능한 희소 특징으로 변환하고, 이를 인간의 뇌 반응(fMRI)과 연결하는 프레임워크를 제안합니다. 연구 결과, 뇌의 언어 네트워크는 언어 모델이 인코딩하는 일반적인 정보와 유의미한 대응 관계를 보임을 입증했습니다.
본 논문은 그래프 계산 분야에서 LLMs의 활용 가능성과 한계를 역할 기반 분류 체계로 분석합니다. LLMs를 직접적인 실행자 또는 외부 도구를 사용하는 계획자로 구분하여 현재 기술의 강점과 향후 연구 방향을 제시합니다.
다회차 스미싱 탐지를 위해 개선된 합성 대화 데이터셋인 COVA-X를 제안합니다. 기존 데이터셋의 오염 및 레이블 불일치 문제를 해결하여 10,985개의 대화로 확장하였으며, 이를 통해 Longformer 모델이 XGBoost보다 우수한 성능을 보임을 입증했습니다.
긴 문맥 질의응답(Long-context QA) 성능을 높이기 위해 증거 정렬 기반의 테스트 단계 훈련 프레임워크인 EASE-TTT를 제안합니다. 이 방식은 검색된 증거를 어텐션 감독 대상으로 활용하여 모델이 정답 위치에 집중하도록 유도합니다.
LLM의 추론 능력을 높이는 테스트 시간 연산(TTC) 스케일링을 위한 통합 프레임워크 ThinkBooster를 소개합니다. 모듈형 라이브러리, 벤치마크, OpenAI 호환 프록시 및 시각적 디버거를 통해 효율적인 추론 전략을 지원합니다.
Didact는 파편화된 국방 관련 문서와 연구 데이터를 통합하여 역량 발견을 돕는 시스템입니다. 맞춤형 지식 그래프와 RAG 파이프라인을 활용하며, 대화형 증거 시각화 기능을 통해 정책 결정 지원을 목표로 합니다.
LoRA를 통해 미세 조정된 LLM의 학습 데이터 포함 여부를 판별하는 새로운 방법론인 LoRA-MINT를 제안합니다. 퍼플렉시티와 멤버십 상태 간의 관계를 분석하여 데이터 노출을 추정하며, 높은 정밀도를 통해 모델의 투명성과 윤리적 배포를 지원합니다.
LLM의 신뢰성을 높이기 위한 환각 탐지(Hallucination Detection) 통합 벤치마크인 OpenHalDet을 소개합니다. 기존 평가 방식의 불일치 문제를 해결하기 위해 프롬프트 구성부터 지표 계산까지 표준화된 파이프라인을 제공합니다.
저반복 작업과 암시적 보상 환경에서 자가 진화하는 에이전트를 위한 새로운 방법론인 Tree-of-Experience(ToE)를 제안합니다. 금융 감성 예측 벤치마크인 FinEvolveBench를 통해 ToE가 구조화된 경험 관리의 중요성을 입증했음을 보여줍니다.
코드 스위칭(Code-switching) 음성 인식 성능을 높이기 위해 LLM을 활용한 대조 학습 프레임워크를 제안합니다. ASR의 오류 구간을 LLM으로 확장하여 정교한 'near-miss' 부정적 예시를 생성하고, 이를 통해 Whisper 모델을 미세 조정합니다.
문장 인코더가 양질의 개념 표현을 생성하는 원리를 표현적 구성성 관점에서 분석한 연구입니다. 실험을 통해 미세 조정의 역할, 의미 신호의 레이어 집중도, 하드 네거티브의 효과, 그리고 감독 방식에 따른 개념 유형별 성능 차이를 규명했습니다.
RASFT는 모델의 추론 능력 향상을 위해 전문가의 가이드를 문제 난이도에 따라 동적으로 조정하는 새로운 SFT 프레임워크입니다. 모델이 스스로 올바른 추론을 할 때는 모방을 완화하고, 어려워할 때만 전문가 데이터를 강화하여 과적합을 방지합니다.
파운데이션 모델 에이전트가 시뮬레이션과 실제 환경 간의 격차(Sim-to-Real Gap)로 인해 겪는 문제를 MDP 관점에서 분석합니다. 관측, 행동, 전이, 보상의 네 가지 요소를 중심으로 격차를 공식화하고, 이를 해결하기 위한 연구 의제와 도메인 무작위화 등의 솔루션을 제안합니다.
MADE는 다국어 및 다문화 LLM 평가 시 단순 점수 산출을 넘어 미세한 진단 통찰력을 제공하는 에이전트 엔진입니다. 계획, 분석, 사례 조사, 성찰, 보고서 합성의 5단계 프로세스를 통해 기존 베이스라인보다 월등한 진단 품질을 보여줍니다.
정답이 없는 개방형 보상 모델링을 위해 재사용 가능한 평가 기술을 합성하는 Eval-Skill을 소개합니다. 루브릭 생성 대신 컨텍스트 진화 방식을 사용하여 추론 오버헤드를 줄이고 다양한 LLM 판사의 성능을 크게 향상시켰습니다.
TIMIT 데이터셋을 활용하여 Raw Waveform 음향 모델의 음소 오류율(PER)과 오류 패턴을 심층 분석한 연구입니다. SincNet과 Bidirectional LSTM을 결합한 모델이 최고 성능을 기록했으며, 전이 학습이 자음 개선에 미치는 효과를 규명했습니다.
LLM 에이전트의 숨겨진 악의적 목표를 탐지하기 위한 새로운 모니터링 프레임워크인 TRACE를 제안합니다. TIJ(Triage-Inspect-Judge) 루프를 통해 긴 호흡의 궤적 내에서 흩어진 증거를 연결하여 정밀한 추론을 수행합니다.
자동 생성된 키프레이즈의 품질을 평가하기 위해 순위 인지형 R-precision에 의미론적 유사성을 통합한 SemR-p 지표를 제안합니다. 이 지표는 인간의 판단 방식과 유사하게 출력 리스트 상단의 관련 키프레이즈에 가산점을 부여하여 평가의 정확도를 높입니다.
언어 모델(LM) 임베딩을 활용하여 자기 주도 읽기 과정에서의 의미론적 연관성을 정량화하는 연구입니다. 다양한 임베딩 구현 방식이 N400 뇌파 반응과 읽기 시간에 미치는 영향을 분석하여 방법론적 선택의 중요성을 입증했습니다.