Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
Diffusion Large Language Models(dLLMs)의 추론 능력을 향상시키기 위해 강화학습 과정에서의 보상 및 상태 불일치 문제를 해결하는 PAPO 프레임워크를 제안합니다. SPR과 EHR 기술을 통해 생성 궤적과 정책 업데이트를 정렬하여 수학 및 논리 벤치마크에서 성능을 크게 개선했습니다.
본 논문은 언어별 미세 조정이 모델의 정치적 성향을 결정한다는 가정을 반증합니다. 실험 결과, 특정 언어 커뮤니티를 위해 조정된 모델이라도 질문 언어와 코퍼스 구성에 따라 허위 정보에 대한 저항력이 달라지는 '미세 조정의 역설'을 발견했습니다.
본 연구는 에이전트의 성능 측정 시 모델 자체의 능력과 스캐폴드(scaffold)의 영향력이 혼동되는 문제를 분석합니다. GAIA 벤치마크를 통해 다양한 스캐폴드 설계가 모델 성능에 미치는 격차를 통제된 조건에서 규명했습니다.
BIM 프로젝트의 IDS 초안 작성을 자동화하기 위한 오픈 웨이트 모델 Ishigaki-IDS를 제안합니다. 이 모델은 지속적 사전 학습과 강화 학습을 통해 검증기 인식형 성능을 극대화하여 실무자의 작업 시간을 54.7% 단축했습니다.
대화형 음성 감정 인식(SER)을 위해 대규모 오디오 언어 모델(LALM)에 테스트 시간 신경 메모리를 결합하는 연구를 소개합니다. Titans 기반의 Memory-as-a-Layer(MAL) 어댑터를 통해 모델의 구조 변경 없이 대화 맥락을 효과적으로 반영합니다.
Transformer 모델이 서브워드를 단어 수준의 의미로 통합하는 디토크나이제이션(Detokenization)의 내부 메커니즘을 분석한 연구입니다. Llama2-7B를 통해 이 과정이 초기 레이어에서 어텐션과 MLP의 협업으로 이루어지는 2단계 구조임을 규명했습니다.
LLM이 모르는 질문에 대해 환각을 일으키는 대신, 자신의 무지를 체계적으로 명시하는 '구조적 무지 인증서(SICs)' 기술을 제안합니다. Qwen3-14B 모델을 GRPO 방식으로 미세 조정하여 교차 도메인 질문에 대한 높은 JSON 유효성과 검색 유용성을 확보했습니다.
다국어 팩트체크를 위해 미세 조정된 경량 모델과 LLM의 성능을 비교 분석한 연구입니다. 주장 탐지, 증거 검색, 진위 예측의 3단계 파이프라인을 구축하여 높은 처리량과 낮은 지연 시간을 달성했습니다.
본 논문은 LLM의 인용 오류를 자동으로 탐지하는 과업을 제안합니다. LLM 미세 조정과 원문 초록 데이터를 활용한 방법론을 통해 탐지 성능을 개선하였으며, TokenSHAP을 사용하여 모델의 예측 결과에 대한 해석 가능성을 분석했습니다.
Agentopia는 100명의 LLM 에이전트가 10년 동안 자율적으로 상호작용하는 장기 사회 시뮬레이션 프레임워크입니다. 에이전트의 웰빙을 반영한 '삶의 보상'을 통해 LLM을 학습시켜 사회적 지능과 역할 수행 능력을 향상시키는 연구를 다룹니다.
CRAFT는 표 형식 질의응답과 사실 검증을 위해 양방향 반사실적 추론을 사용하는 통합 프레임워크입니다. 기존 단방향 추론의 한계를 극복하여 복잡한 표 데이터에서 LLM의 추론 성능을 크게 향상시켰습니다.
본 연구는 Sparse Autoencoder(SAE)를 활용하여 언어 모델의 은닉 상태를 해석 가능한 희소 특징으로 변환하고, 이를 인간의 뇌 반응(fMRI)과 연결하는 프레임워크를 제안합니다. 연구 결과, 뇌의 언어 네트워크는 언어 모델이 인코딩하는 일반적인 정보와 유의미한 대응 관계를 보임을 입증했습니다.
본 논문은 그래프 계산 분야에서 LLMs의 활용 가능성과 한계를 역할 기반 분류 체계로 분석합니다. LLMs를 직접적인 실행자 또는 외부 도구를 사용하는 계획자로 구분하여 현재 기술의 강점과 향후 연구 방향을 제시합니다.
다회차 스미싱 탐지를 위해 개선된 합성 대화 데이터셋인 COVA-X를 제안합니다. 기존 데이터셋의 오염 및 레이블 불일치 문제를 해결하여 10,985개의 대화로 확장하였으며, 이를 통해 Longformer 모델이 XGBoost보다 우수한 성능을 보임을 입증했습니다.
긴 문맥 질의응답(Long-context QA) 성능을 높이기 위해 증거 정렬 기반의 테스트 단계 훈련 프레임워크인 EASE-TTT를 제안합니다. 이 방식은 검색된 증거를 어텐션 감독 대상으로 활용하여 모델이 정답 위치에 집중하도록 유도합니다.
LLM의 추론 능력을 높이는 테스트 시간 연산(TTC) 스케일링을 위한 통합 프레임워크 ThinkBooster를 소개합니다. 모듈형 라이브러리, 벤치마크, OpenAI 호환 프록시 및 시각적 디버거를 통해 효율적인 추론 전략을 지원합니다.
LoRA를 통해 미세 조정된 LLM의 학습 데이터 포함 여부를 판별하는 새로운 방법론인 LoRA-MINT를 제안합니다. 퍼플렉시티와 멤버십 상태 간의 관계를 분석하여 데이터 노출을 추정하며, 높은 정밀도를 통해 모델의 투명성과 윤리적 배포를 지원합니다.
LLM의 신뢰성을 높이기 위한 환각 탐지(Hallucination Detection) 통합 벤치마크인 OpenHalDet을 소개합니다. 기존 평가 방식의 불일치 문제를 해결하기 위해 프롬프트 구성부터 지표 계산까지 표준화된 파이프라인을 제공합니다.
저반복 작업과 암시적 보상 환경에서 자가 진화하는 에이전트를 위한 새로운 방법론인 Tree-of-Experience(ToE)를 제안합니다. 금융 감성 예측 벤치마크인 FinEvolveBench를 통해 ToE가 구조화된 경험 관리의 중요성을 입증했음을 보여줍니다.
코드 스위칭(Code-switching) 음성 인식 성능을 높이기 위해 LLM을 활용한 대조 학습 프레임워크를 제안합니다. ASR의 오류 구간을 LLM으로 확장하여 정교한 'near-miss' 부정적 예시를 생성하고, 이를 통해 Whisper 모델을 미세 조정합니다.