Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
MedGame은 LLM을 활용해 정적인 임상 사례를 구조화된 스토리텔링 게임으로 변환하는 프레임워크입니다. 이중 엔진 설계를 통해 임상 내러티브를 생성하고 멀티모달 오케스트레이션을 수행하며, 성능 평가를 위한 MedGame Bench를 함께 제안합니다.
LLM의 서구 중심적 가치 편향을 해결하기 위해 스리랑카의 사회적 가치를 반영한 LKValues 리소스를 제안합니다. 40개의 사회적 가치를 도출하고, 이를 바탕으로 지시어 코퍼스(LKvaluesIT)와 평가 벤치마크(LKvaluesBench)를 구축했습니다.
언어 모델이 비동일 등위 접속(unlike coordination)을 학습할 때 직접적인 데이터 노출이 필수적인지 연구했습니다. GPT-2를 활용한 실험 결과, 모델은 동일 등위 접속 학습만으로도 비동일 사례를 성공적으로 일반화할 수 있음을 확인했습니다.
PoTRE는 인지적 이질성을 활용하여 LLM의 복잡한 추론 능력을 향상시키는 새로운 프레임워크입니다. 네 가지 특화된 에이전트와 적응형 집계 계층을 통해 장기 계획 및 오류 수정 문제를 해결하며, 주요 벤치마크에서 SOTA 성능을 기록했습니다.
LLM이 Schwartz의 10가지 기본 가치를 얼마나 정확하게 인식하는지 분석한 연구입니다. 모델이 올바른 가치 영역은 잘 찾아내지만, 인접한 가치들 사이에서 특정 방향으로 혼동을 일으키는 경향이 있음을 밝혀냈습니다.
사전 학습된 언어 모델의 프롬프팅 전략과 학습 목적 간의 정렬을 예측하는 '마스커빌리티 지수(MI)'를 제안합니다. MI는 마스크 스타일과 접두사 스타일 프롬프팅 중 어떤 것이 적합한지 정량적으로 측정하며, 이는 모델의 지식 추출 성능과 높은 상관관계를 보입니다.
의료 이미지 인코더 간의 표현 수렴 현상을 분석한 연구로, 이러한 수렴이 모델 규모나 임상 지도 학습이 아닌 자기 지도 학습(Self-supervision) 목표에 의해 주도됨을 밝힙니다. 연구 결과, 인코더 간 정렬은 양상 내에서만 제한적으로 발생하며 임상적 판단과는 차이가 있음을 확인했습니다.
LLM이 유해한 출력을 생성할 확률에 대한 엄격한 확률적 경계를 계산하는 새로운 프레임워크를 제안합니다. 잠재 공간의 특징을 활용해 유해 가능성이 높은 생성 경로를 우선 탐색함으로써, 유해 확률이 매우 낮은 상황에서도 견고한 하한을 효율적으로 도출합니다.
PyroDash는 SLM과 LLM의 토큰 수준 협업을 통해 추론 비용을 절감하는 프레임워크입니다. SLM이 제어 토큰을 통해 LLM에 도움을 요청하는 방식으로 작동하며, 별도의 라우터 없이도 높은 정확도와 비용 효율성을 동시에 달성합니다.
기존 자연어 오토인코더 방식의 활성화 설명 평가가 모델의 실제 사실 관계를 반영하지 못하는 문제를 지적합니다. 이를 해결하기 위해 모델과 함께 학습되는 선형 헤드인 RECAP을 제안하여, 모델의 내부 콘텐츠를 독립적이고 신뢰할 수 있게 디코딩할 수 있음을 증명합니다.
생성형 AI가 생성한 저품질 콘텐츠가 도서 시장에 급증하며 시장 구조를 변화시키고 있습니다. 연구 결과, AI 생성 도서의 판매량은 늘고 있으나 매출 증가 속도는 이를 따라가지 못해 도서당 매출이 하락하는 양상을 보입니다.
시각-언어 모델(VLM)이 이미지와 질문의 제시 순서에 따라 성능 차이를 보이는 '양식 순서 실패' 문제를 분석하고, 이를 해결하기 위한 테스트 시간 훈련(TTT) 방법을 제안합니다. 이 방법은 모델의 중간 레이어에서 발생하는 표현의 불일치를 복구하여 순서 간 성능 격차를 줄이고 전체적인 성능을 향상시킵니다.
LLM이 인간처럼 경험을 재사용 가능한 추상화로 증류하여 문제 해결 능력을 높일 수 있는지 연구합니다. 수학적 추론 과정에서 추출한 자연어 추상화를 검색하거나 강화학습에 활용하여 성능을 향상시켰습니다.
프롬프트의 형식, 명령어 개수, 컨텍스트 길이가 LLM의 명령어 준수 능력과 환각 발생에 미치는 영향을 연구합니다. 마크다운, 텍스트, 표 등 다양한 형식과 시스템 프롬프트의 한계를 분석합니다.
NLI(자연어 추론) 분야의 인간 레이블 변동성(HLV) 연구에서 이전 연구가 주장한 단조성 연산자와 레이블 일치도 간의 상관관계를 재검증했습니다. 연구 결과, 이전의 부정적 경계는 모집단의 특성이 아니라 특정 선택 조건에 따른 구조적 현상일 가능성이 높음을 밝혀냈습니다.
RLAES는 강화학습을 통해 LLM의 에세이 채점과 피드백 생성을 동시에 최적화하는 통합 프레임워크입니다. 루브릭 기반 평가(RFE)와 적응형 게이트 최적화(AGFO)를 도입하여 피드백 품질을 높이고 채점 성능을 극대화했습니다.
AdaFlash는 디퓨전 Drafter의 높은 분산 문제를 해결하여 투기적 디코딩의 효율을 높이는 프레임워크입니다. 온폴리시 증류(OPD)와 적응형 길이 헤드를 통해 도메인 및 토큰 수준의 변동성을 줄이고 추론 처리량을 극대화합니다.
LLM의 고자원 언어 편향으로 인한 교차 언어적 사실 불일치 문제를 해결하기 위한 추론 시간 스티어링 전략을 연구합니다. 페르소나 프롬프팅, CAA, DPO 등 네 가지 개입 전략을 Gemma 3 12B Instruct 모델로 실험하여 그 효능을 비교 분석했습니다.
다자간 회의 상황에서 MLLM의 마음 이론(ToM) 추론 능력을 평가하기 위한 새로운 벤치마크인 MeetingToM을 제안합니다. 가짜 합의와 같은 복잡한 사회적 역학을 계층적으로 평가하며, 현재 모델들의 한계를 분석합니다.
장문 생성 모델의 사실적 완결성을 평가하기 위한 새로운 벤치마크인 GAMUT을 소개합니다. 2단계 메타 루브릭 프레임워크를 통해 복잡한 사실 관계와 콘텐츠의 구조적 중요성을 정밀하게 측정합니다.