Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
AI가 생성하는 이야기의 문화적 현지화 방식을 템플릿 기반과 총체적 방식으로 구분하여 분석하는 연구입니다. 어휘적 차이를 제거한 후에도 공통된 서사 템플릿이 존재함을 확인하였으며, 특정 국가의 문화적 표식이 편향되거나 모욕적일 수 있음을 밝혔습니다.
확산 언어 모델을 활용한 투기적 디코딩의 효율성을 높이기 위해, 양방향 생성과 좌측-우측 검증 간의 간극을 줄이는 세 가지 훈련 기법을 제안합니다. 이를 통해 추가 연산 없이도 초안 수락 길이를 21-76% 향상시켰습니다.
사전 학습된 자기지도 학습(SSL) 음성 모델이 코이산 언어의 클릭 자음과 같은 희귀 음소를 얼마나 잘 인식하는지 연구했습니다. Wav2Vec2와 HuBERT 모델을 미세 조정하여 실험한 결과, SSL이 희귀 음소에 대해서도 뛰어난 일반화 성능을 보임을 확인했습니다.
LLM의 그래프 추론 능력을 측정하기 위한 새로운 벤치마크인 GraphInfer-Bench를 소개합니다. 기존 Graph-QA와 달리 단일 노드나 경로 검색만으로는 해결할 수 없는 고차원적 추론 태스크를 정의하며, 다양한 모델의 성능 격차를 분석합니다.
토러스(Torus) 상에서 위상 동기화를 활용하는 새로운 셀프 어텐션 메커니즘인 Kuramoto Attention을 제안합니다. 이 레이어는 게이트된 코사인 유사도와 원형 평균을 통해 토큰을 업데이트하며, 제약된 기하학적 구조를 가진 실행 가능한 언어 모델임을 입증했습니다.
활성화 스티어링(Activation steering)의 성공 여부를 생성 초기 단계의 은닉 상태를 통해 예측하는 연구를 소개합니다. 새로운 테스트베드 ASTEER을 통해 모델의 내부 역학을 분석하고, GBDT 분류기를 활용해 적은 비용으로 최적의 스티어링 강도를 찾아내는 방법을 제안합니다.
입장 탐지(Stance Detection) 성능을 높이기 위해 추론 수준의 합성을 활용하는 멀티 에이전트 프레임워크를 제안합니다. 매니저가 입력 복잡도에 따라 워커 에이전트를 적응적으로 할당하여, 단순 투표 대신 추론 과정을 합성함으로써 복잡한 문맥을 더 정확히 분석합니다.
공동 독서 플랫폼에서 사용자들이 문서를 하이라이트할 때 형성되는 독자 하위 그룹의 구조를 분석한 연구입니다. 실험 결과, 독자들은 문서 내에서 강력한 파벌적(factional) 그룹을 형성하지만, 이 그룹화가 문서 간에 안정적으로 유지되는지는 불분명합니다.
본 연구는 음소(phoneme) 기반 자동 음성 인식(ASR) 시스템인 WhisperIPA와 ZIPA의 인구통계학적 편향성을 평가합니다. 인종, 연령, 성별, 억양에 따른 성능 격차를 분석하여 더욱 포용적인 음성 인식 모델 개발을 위한 통찰을 제공합니다.
언어 모델을 활용하여 텍스트 입력을 위한 물리적 키의 최소 개수를 탐색한 연구입니다. 3개의 키와 GPT-4o를 조합했을 때 실용적인 수준의 정확도를 달성할 수 있음을 입증했습니다.
언어 모델이 답변 형식 변화에 민감하게 반응하는 문제를 해결하기 위해 교차 형식 강건성을 정의하고 연구했습니다. FormatMix와 같은 다중 형식 학습이 모델의 성능과 강건성을 동시에 향상시킴을 확인했습니다.
본 연구는 생성형 LLM의 미지 백도어를 제거하기 위해 '더미 백도어'를 활용하는 새로운 방어 메커니즘을 제안합니다. 서로 다른 백도어가 공유하는 내부 활성화 패턴을 이용해, 의도적으로 삽입된 더미 백도어를 미세 조정함으로써 미지의 공격까지 효과적으로 완화합니다.
독자들이 문서의 특정 구절에 남기는 하이라이트 정보를 바탕으로, 데이터가 쌓이기 전 텍스트만으로 집단적 중요도를 예측하는 연구입니다. 학습된 모델이 단순 위치 기반 베이스라인보다 높은 정밀도를 보임을 입증했습니다.
도시 계획 분야에서 LLM의 전문적 추론 능력을 평가하기 위한 새로운 벤치마크 프레임워크인 UPBench를 소개합니다. 25개의 모델을 평가한 결과, 모델들이 고차원적 분석에서는 강점을 보이지만 제도적 맥락과 규제적 판단에는 한계가 있음을 발견했습니다.
LLM 에이전트의 장기 과업 수행 시 발생하는 컨텍스트 과부하 문제를 해결하기 위해 계층적 메모리 구조인 HORMA를 제안합니다. 경험을 파일 시스템처럼 구조화하여 상세 정보를 유지하면서도 효율적인 탐색과 검색이 가능하도록 설계되었습니다.
LLM 에이전트의 성능 저하 원인을 정확히 파악하기 위해 계층별로 격리하여 평가하는 '계층 격리 평가' 방법론을 제안합니다. No-LLM 방식의 결정론적 테스트 하네스를 통해 각 구성 요소의 결함을 빠르게 국지화하고 CI 환경에서 검증할 수 있습니다.
UR-BERT는 로마자 전사 기반의 텍text-to-speech(TTS) 인코더로, 기존 G2P 방식의 언어 제한을 극복하여 495개 언어까지 확장이 가능합니다. 음성 토큰 예측 목적 함수를 도입하여 음성 인지적 음소 표현을 학습함으로써 음성 충실도와 정렬 성능을 높였습니다.
무인 상태로 실행되는 장기 계획 LLM 에이전트의 신뢰성 문제를 해결하기 위한 'Autopilot' 실행 모델을 제안합니다. 에이전트가 검증되지 않은 성공을 허위로 보고하는 것을 방지하기 위해 유한 상태 머신(FSM)을 활용하여 작업 상태를 구조적으로 관리합니다.
의료 AI 에이전트의 도구 사용 및 실행 능력을 평가하기 위한 새로운 벤치마크인 MedCTA를 소개합니다. 멀티모달 임상 데이터를 기반으로 도구 선택부터 실행 안정성까지 프로세스 전반을 엄격하게 평가합니다.
RLCSD는 온폴리시 자기 증류 과정에서 발생하는 '특권 유도 스타일 드리프트' 문제를 해결하기 위한 새로운 강화학습 방법론입니다. 정답과 오답 힌트 간의 간극을 대조함으로써 모델이 스타일 변화 대신 작업 수행 토큰에 집중하도록 유도합니다.