Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
LLM의 데이터 암기 문제를 해결하기 위해 뉴런 활성화 대신 출력 벡터를 수정하는 새로운 편집 방식을 제안합니다. MLP 뉴런의 출력 벡터를 최소한으로 수정하여 잔차 스트림에 대한 기여도를 재지정함으로써, 모델 성능 저하 없이 암기된 시퀀스를 효과적으로 억제합니다.
SWE-Future는 코딩 에이전트의 벤치마크 오염 문제를 해결하기 위해 미래의 소프트웨어 엔지니어링 태스크를 예측하고 합성하는 새로운 방법론을 제안합니다. 저장소의 과거 데이터를 기반으로 미래의 기능 구현, 버그 수정, 리팩터링 작업을 예측하여 현실적인 합성 데이터를 생성합니다.
SAMA는 데이터 부족 문제를 해결하기 위해 의미론적 앵커를 활용한 통합 멀티모달 정보 추출(MIE) 증강 프레임워크입니다. CME-MLLM과 앵커 보존 확산 메커니즘을 통해 고충실도의 합성 데이터를 생성하며, 기존 방식보다 뛰어난 성능을 입증했습니다.
의미론적 유사성과 구조적 의존성을 결합하여 소프트웨어 산출물의 변경 영향 분석(CIA)을 수행하는 새로운 연구를 제안합니다. 별도의 학습 없이 이종 산출물 그래프를 활용해 텍스트 유사도와 그래프 전파를 융합함으로써 기존 도구의 사각지대를 해결합니다.
LLM의 개인정보(PII) 비식별화 성능을 맥락적 무결성 관점에서 평가하기 위한 새로운 벤치마크인 RedactionBench를 소개합니다. 기존 NER 방식의 한계를 극복하기 위해 문자 수준 지표인 R-Score를 도입하였으며, 다양한 모델의 맥락적 비식별화 성능을 분석했습니다.
긴 문서 검색 시 단일 벡터 인코딩으로 인해 결정적인 정보가 희석되는 문제를 해결하기 위해 DICE(Document Inference via Chunk Evidence)를 제안합니다. DICE는 문서를 청크 단위로 인코딩한 후 이를 집계하는 training-free 전략으로, 긴 문맥에서도 높은 검색 성능을 유지합니다.
CAPRA는 멀티 에이전트 LLM 시스템을 활용하여 소프트웨어 아키텍처 결과물을 자동 평가하고 피드백을 생성하는 연구를 제시합니다. gpt-4o와 멀티모달 추출 기술을 사용하여 텍txt와 UML 다이어그램을 분석하며, 환각을 줄이기 위한 결정론적 증거 앵커링 기법을 도입했습니다.
바이브 코딩(Vibe Coding) 환경에서 LLM이 생성하는 코드의 변동성 문제를 분석하고, 이를 해결하기 위한 '재생에 의한 변동성(VbR)' 개념을 제안합니다. LLM을 유도 엔진으로 활용하여 선언적 명세로부터 맞춤형 바이너리를 생성하는 새로운 소프트웨어 제품 라인(SPL) 접근 방식을 다룹니다.
방사선 보고서의 임상적 정확성을 평가하기 위해 LLM 기반의 새로운 지표를 연구합니다. 기존 모델들이 무해한 표현 변화에 과도한 벌점을 주는 판별 편향을 확인하였으며, 이를 해결하기 위해 경량화된 해석 가능한 지표를 제안합니다.
HandwritingAgent는 대규모 추론 모델을 활용하여 SVG 형식의 자연스러운 필기 시퀀스를 합성하는 언어 기반 에이전트입니다. 기존 모델의 높은 계산 비용과 제어 능력 부족을 해결하며, 텍스트와 참조 이미지를 통해 정교한 필기 스타일 제어가 가능합니다.
다중 주체 공유 메모리 환경을 위한 새로운 벤치마크인 GateMem을 소개합니다. 이 연구는 에이전트의 메모리 유용성, 권한 기반 액세스 제어, 그리고 능동적 망각 능력을 의료, 사무 등 다양한 도메인에서 평가합니다.
긴 문맥 추론 능력을 향상시키기 위해 보상 엔지니어링 대신 데이터 중심의 접근 방식을 제안합니다. 검색, 증거 합성, 추론 작업을 포함한 8개의 데이터셋 레시피를 통해 Qwen 모델의 벤치마크 성능과 에이전트 작업 수행 능력을 크게 개선했습니다.
ScholarSum은 지식 그래프와 학생-교사 방식의 상호작용을 활용하여 과학 문헌의 생성적 요약을 수행하는 프레임워크입니다. 지식 그래프를 통해 전역적 논리를 포착하고, 교사 역할을 하는 검토자가 초안을 반복적으로 정교화하여 사실적 충실성을 높입니다.
시퀀스 레이블링의 표현력 한계를 극복하기 위해 확산 모델(Diffusion)을 활용하는 새로운 연구를 소개합니다. 기존 CRF 방식의 장거리 의존성 문제를 해결하여 품사 태깅(POS-tagging) 오류를 16.5% 감소시켰습니다.
금융 분야의 데이터 부족 문제를 해결하기 위해 합성 데이터를 활용한 지식 증류(distillation) 프레임워크를 제안합니다. 클러스터링 기반의 시드 선택을 통해 소형 모델이 최소한의 라벨링만으로도 높은 금융 감성 분석 성능을 달성할 수 있음을 입증했습니다.
프롬프트 최적화를 위한 확률적 탐색 프레임워크인 SPO와 에이전트 유도 탐색 방식인 SAGE를 제안합니다. SAGE는 멀티 에이전트 파이프라인을 통해 프롬프트 공간을 탐색하며, 실제 챗봇 서비스 적용 시 사용자 유지율을 높이는 성과를 보였습니다.
의료 커뮤니케이션 품질을 개선하기 위해 언어 모델 가이드 기반의 반사실적 추천 파이프라인을 제안하는 연구입니다. 어조, 개인화 등 해석 가능한 특징을 활용하여 의료적 정확성을 유지하면서도 환자의 긍정적 피드백을 높이는 최소한의 문구 변화를 추천합니다.
REVES는 테스트 시간 스케일링을 위해 수정 및 검증 증강 학습을 제안하는 2단계 반복 프레임워크입니다. 성공적인 복구 과정 중의 'near-miss' 답변을 활용하여 모델이 오류를 식별하고 수정하는 능력을 극대화합니다. 코딩, 수학, 제약 충족 퍼즐 등 다양한 벤치마크에서 기존 RL 방식보다 뛰어난 성능을 입증했습니다.
PLCopen XML의 그래픽 래더 다이어그램을 SMT 기반 모델 체킹으로 검증하기 위한 Graph-ESBMC-PLC 프레임워크를 제안합니다. DFS 기반 리졸버를 통해 그래픽 인코딩을 유효한 GOTO 중간 표현으로 변환하여 IEC 스캔 사이클 의미론에 부합하는 형식 검증을 수행합니다.
비유적 표현과 부정(Negation)이 결합된 텍스트를 LLM이 얼마나 정확하게 해석하는지 평가한 연구입니다. 새로운 주석 데이터셋을 개발하여 모델 성능을 테스트했으며, 프롬프트 스타일에 따라 성능 차이가 크게 나타남을 확인했습니다.