Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
로컬 토큰과 먼 토큰의 표현 요구량이 다르다는 가설을 바탕으로 거리 적응형 표현(DAR) 기술을 제안합니다. 로컬 컨텍스트는 전체 차원을 유지하고 먼 토큰은 차원을 축소하여, 성능 저하 없이 KV 캐시 효율성을 높이는 연구입니다.
저자원 환경에서의 중국어 방언 판별을 위해 전이 학습과 데이터 증강을 결합한 새로운 프레임워크(CDDTLDA)를 제안합니다. 소스 측 ASR 모델을 활용하고 셀프 어텐션 메커니즘으로 공통 의미 특징을 포착하여 성능을 극대화했습니다.
다양한 문화적 하위 공동체의 선호도를 반영할 수 있는 새로운 보상 모델 학습 알고리즘인 SCPO를 제안합니다. 기존 정렬 방식의 편향을 완화하고 데이터 효율성을 높여 글로벌 관점의 LLM 정렬을 목표로 합니다.
의료용 LLM의 실질적인 의사 보조 능력을 평가하기 위한 새로운 벤치마크인 PhysAssistBench를 소개합니다. 이 벤치마크는 환자, 의사, EHR 시스템 간의 복잡한 상호작용을 시뮬레이션하여 모델의 통합적인 임상 역량을 테스트합니다.
정보 추출(IE) 작업의 성능을 최적화하기 위해 베이지안 업데이트와 파티클 필터링을 결합한 BCL 프레임워크를 제안합니다. 이 방식은 레이블 표현을 체계적으로 정교화하여 시퀀스 레이블링과 관계 분류 모두에서 일관된 성능 개선을 보여줍니다.
LLM의 화용론적 추론 능력을 향상시키기 위한 자기 지도 학습 프레임워크인 PragReST를 제안합니다. 반사실적 추론 흔적을 생성하고 강화 학습을 통해 모델이 암시된 의미를 더 잘 이해하도록 돕습니다.
스마트 홈 환경에서 대화 문맥에 따라 발생하는 점진적 생략 명령을 해석하는 문제와 이를 해결하기 위한 PEC-Home 데이터셋을 소개합니다. LLM이 생략된 표현의 지시 대상 및 의도 모호성을 해결하는 데 여전히 한계가 있음을 실험을 통해 입증했습니다.
LLM이 안전을 위해 학습된 얼라인먼트로 인해 명시적 증거를 무시하고 정당한 결론을 거부하는 '미스파이어드 얼라인먼트' 현상을 분석합니다. 새로운 벤치마크 VETO와 지표 MAR을 통해 최신 모델들이 고정관념 관련 질문에서 증거를 무시하는 경향을 정량화했습니다.
대규모 멀티 에이전트 시스템(MAS)에서 서브 에이전트의 신뢰성을 높이기 위한 EARS 프레임워크를 제안합니다. 서브 에이전트가 단순히 답변을 거부하는 대신, 실패 원인과 근거를 코디네이터에게 전달하여 시스템의 전체 응답 통과율을 향상시킵니다.
RegMix-D는 LLM 사전 학습 시 데이터 믹스를 동적으로 조정하는 새로운 방법론을 제안합니다. 기존의 정적 믹스 방식과 달리, 프록시 실행의 전체 손실 궤적을 활용하여 학습 단계별 최적의 데이터 비율을 예측합니다.
어텐션 메커니즘을 진동자 네트워크의 '좌절된 동기화(Frustrated Synchronization)' 관점에서 재해석한 FSN 아키텍처를 제안합니다. FSN은 기존 Transformer보다 적은 파라미터와 학습 예산으로도 더 낮은 검증 손실을 기록하며 우수한 성능을 입증했습니다.
시뮬레이션 세계를 기반으로 한 새로운 예측 벤치마크인 ForecastBench-Sim을 소개합니다. Freeciv 게임 엔진을 활용하여 현실 세계의 제약을 극복하고, 인과적 질문과 희귀 사건을 포함한 다양한 예측 과제를 제공합니다.
교착어인 터키어의 특성을 반영하여 형태소 경계를 인식하는 신경망 토크나이저 및 임베더인 Morpheus를 제안합니다. 이 모델은 손실 없는 토큰화와 효율적인 워드 임베딩 생성을 동시에 수행하며, 기존 서브워드 방식보다 높은 형태소 정렬 성능과 낮은 메모리 사용량을 보여줍니다.
대만 법률 시스템에 특화된 LLM 성능 측정 벤치마크인 TW-LegalBench를 제안합니다. 객관식, 주관식 에세이, 판결 예측 등 세 가지 유형의 과제를 통해 13개 모델을 평가했습니다.
LLM이 독해 평가에서 학생의 숙련도를 구분하는 '문항 변별도'를 얼마나 정확히 측정할 수 있는지 연구했습니다. 42개의 모델을 평가한 결과, 직접 예측과 응답 기반 방식 모두 인간의 변별도와 낮은 상관관계를 보여 LLM 기반 심리측정의 한계를 드러냈습니다.
민사 소송의 인과적 의존성을 모델링하기 위해 개발된 생애 주기 상호작용 환경인 LegalWorld를 소개합니다. 기존 벤치마크의 한계를 넘어 5단계의 연결된 시나리오와 LongJud-Bench를 통해 법률 에이전트의 일관성과 능력을 평가합니다.
LLM의 데이터 암기 문제를 해결하기 위해 뉴런 활성화 대신 출력 벡터를 수정하는 새로운 편집 방식을 제안합니다. MLP 뉴런의 출력 벡터를 최소한으로 수정하여 잔차 스트림에 대한 기여도를 재지정함으로써, 모델 성능 저하 없이 암기된 시퀀스를 효과적으로 억제합니다.
SAMA는 데이터 부족 문제를 해결하기 위해 의미론적 앵커를 활용한 통합 멀티모달 정보 추출(MIE) 증강 프레임워크입니다. CME-MLLM과 앵커 보존 확산 메커니즘을 통해 고충실도의 합성 데이터를 생성하며, 기존 방식보다 뛰어난 성능을 입증했습니다.
LLM의 개인정보(PII) 비식별화 성능을 맥락적 무결성 관점에서 평가하기 위한 새로운 벤치마크인 RedactionBench를 소개합니다. 기존 NER 방식의 한계를 극복하기 위해 문자 수준 지표인 R-Score를 도입하였으며, 다양한 모델의 맥락적 비식별화 성능을 분석했습니다.
긴 문서 검색 시 단일 벡터 인코딩으로 인해 결정적인 정보가 희석되는 문제를 해결하기 위해 DICE(Document Inference via Chunk Evidence)를 제안합니다. DICE는 문서를 청크 단위로 인코딩한 후 이를 집계하는 training-free 전략으로, 긴 문맥에서도 높은 검색 성능을 유지합니다.