Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
지난 30년간 81개국 5,281편의 문헌정보학(LIS) 논문을 분석하여 국가별 연구 방법론의 비동기성을 규명했습니다. 딥러닝 모델을 활용해 연구 방법을 자동 분류하고, 국가별 고유한 연구 프로필과 국제적 분포 간의 차이를 분석했습니다.
LLM의 안전 학습이 영어 중심이라 저자원 언어나 코드 스위칭 상황에서 취약하다는 점을 지적합니다. STEER 공격 기법을 통해 유해한 의도를 유지하면서 거부 반응을 억제하는 방식의 공격 성공률을 입증했습니다.
SkillCoach는 LLM 에이전트의 기술 사용(Skill-Use)을 평가하고 향상시키기 위한 자기 진화형 루브릭 프레임워크입니다. 실제 실행 데이터로부터 프로세스 루브릭을 도출하여 기술 선택, 준수, 구성, 성찰의 네 가지 차원을 정밀하게 평가합니다.
PairCoder++는 LLM이 구조화된 아티팩트를 생성할 때 발생하는 오류를 줄이기 위해 두 에이전트가 페어 프로그래밍을 수행하는 새로운 패러다임을 제시합니다. Driver와 Navigator 에이전트가 역할을 교대하며 툴체인 기반의 검증 과정을 거침으로써, Blender나 TikZ와 같은 다양한 벤치마크에서 성능을 크게 향상시켰습니다.
Spec-AUF는 추측적 디코딩(Speculative Decoding) 과정에서 발생하는 훈련과 추론 사이의 불일치를 해결하기 위한 새로운 학습 방법론입니다. Masked Block Drafter가 첫 번째 예측 실패 지점까지만 손실을 계산하도록 하여, 수락된 접두사에 더 집중하도록 유도합니다.
의존 길이 최소화(DLM)가 기능적 의존과 어휘적 의존이라는 두 가지 수준에서 다르게 작동함을 분석한 연구입니다. 문법은 기능적 관계를 짧게 유지하여 구조를 최적화하고, 어휘적 관계는 처리 압력에 따라 변동성을 보임을 밝혔습니다.
Qwen3.5-27B 모델이 터키어 추론 과정(<think> 블록)을 직접 생성하도록 학습시키는 TUDUM 파이프라인을 제안합니다. SFT와 GRPO 기반 강화 학습을 적용하여 터키어 사고 과정을 구축하려 시도했으나, 벤치마크 성능 면에서는 복합적인 결과를 보였습니다.
K-12 교육용 콘텐츠의 교수법적 위험을 평가하기 위한 새로운 데이터셋 AIriskEval-edu-db2를 소개합니다. LLM 기반 감사인을 훈련하기 위해 사실적 정확성, 편향성 등 5가지 차원의 위험 루브릭과 설명 가능성 주석을 포함합니다.
PhysMani는 비구조화된 3D 환경에서 동적 객체를 조작하기 위해 물리 원칙을 결합한 3D 가우시안 월드 모델 프레임워크입니다. 가우시안 속도장을 통해 물리적으로 정확한 미래 역학을 예측하며, 새로운 벤치마크인 PhysMani-Bench를 통해 성능을 입증했습니다.
LLM이 과학적 회의론에 직면했을 때 나타내는 강건성을 표현 기하학 관점에서 분석한 연구입니다. 모델별로 반응적 단언, 표면적 유보, 무응답 등 서로 다른 대응 패턴을 보이며, 이러한 특성이 중간 레이어의 활성화 패턴과 연관됨을 밝힙니다.
NAVER LABS Europe이 IWSLT 2026 지시 이행 음성 처리 쇼트 트랙에서 공동 1위를 달성한 연구를 소개합니다. SpeechMapper를 활용한 음성-LLM 임베딩 프로젝터 업데이트와 합성 데이터셋 fakACL을 통해 모델 성능을 극대화했습니다.
본 연구는 지도 학습 데이터 없이 제로샷 프롬프팅이나 피드백을 활용한 대화 담화 파싱(DDP)의 명확화(Clarification) 성능을 분석합니다. 실험 결과, 단순 입력 재작성은 오히려 파싱 성능을 저하시킬 수 있으며, 명확화는 선택적 개입 문제로 접근해야 함을 시사합니다.
Mandarin 단음절어의 음성 지속 시간과 f0 윤곽선을 예측하기 위해 문맥화된 임베딩(CEs)을 활용하는 연구입니다. CEs가 유형 및 토큰 수준 모두에서 지속 시간을 효과적으로 예측하며, 예측된 윤곽선이 실제 경험적 윤곽선에 근사함을 입증했습니다.
멀티모달 LLM의 미술사 지식 및 시각적 추론 능력을 평가하기 위한 새로운 벤치마크인 EduArt를 소개합니다. 인간이 작성한 871개의 문항을 통해 모델의 학문적 역량을 다각도로 분석하며, 단순 객관식 점수와 실제 지식 활용 능력 사이의 격차를 규명합니다.
SpeechCombine은 지시어 튜닝 없이 단 한 번의 음성 사전 학습만으로 지시 이행이 가능한 음성 언어 모델(SLM)을 제안합니다. 텍스트 LLM의 지식과 음성 도메인 능력을 결합하여 방대한 데이터 의존성을 줄이는 새로운 학습 방향을 제시합니다.
베트남어 텍스트 인코더의 한계를 극복하기 위해 개발된 새로운 BERT 기반 언어 모델 BamiBERT를 소개합니다. 129GB 규모의 코퍼스로 학습되었으며, 확장된 컨텍스트 길이와 외부 단어 분절 없는 원시 입력 처리 능력을 갖추고 있습니다.
CheckRLM은 추론 언어 모델(RLM)의 추론 체인에서 발생하는 사실적 오류를 탐지하고 수정하는 프레임워크입니다. RAG를 활용해 지식 불일치를 식별하고 외부 지식으로 정밀하게 수정함으로써 장기 추론의 신뢰성을 높입니다.
의료 AI 벤치마킹에서 LLM 평가자가 임상적 주의력을 재현할 수 있는지 분석한 연구입니다. 독일어 임상 벤치마크 MedQADE를 통해 LLM이 통계적으로는 의사와 유사한 점수를 부여하지만, 실제 임상적 메타인지와 기권 행동은 결여되어 있음을 밝혀냈습니다.
RAG 기술을 활용하여 대학 이해관계자를 위한 멀티모달 채팅 어시스턴트 개발 연구를 소개합니다. LLM과 VLM을 결합하여 텍스트와 이미지 질의를 처리하며, 양자화 추론을 통해 효율적인 배포를 구현했습니다.
AI의 창의성을 통합적으로 측정하기 위한 새로운 벤치마크인 AGC-Bench를 소개합니다. 78개의 데이터셋과 편향이 교정된 AGC-Judge 모델을 통해 LLM의 창의적 능력을 정밀하게 평가하며, 일반 지능과 분리된 창의성 요인을 입증했습니다.