Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
본 논문은 SemEval-2026 Task 9를 위해 다국어, 다문화 및 다이벤트 온라인 극단화 콘텐츠 탐지 시스템을 제안합니다. 이 시스템은 22개 언어를 대상으로 이진 분류, 대상 분류, 표현식 식별의 세 가지 하위 작업을 수행합니다. 연구팀은 XLM-RoBERTa와 mDeBERTa를 결합한 이종 앙상블 모델과 멀티태스크 학습, 클래스 가중치 등의 기법을 적용하여 극심한 라벨 불균형 문제를 해결하고 높은 성능을 달성했습니다.
본 논문은 콘텐츠 모더레이션 및 평가에 사용되는 루브릭(rubric) 수정이 인간 평가자와 LLM 기반 자동 평가자 간의 점수 일치도에 미치는 영향을 통계적으로 분석했습니다. 특히, '전체적(holistic)' 판단을 요구하는 복잡한 기준과 '분석적(analytic)'으로 분해된 기준 중 어떤 방식이 더 나은지 탐구합니다. 연구 결과, 루브릭의 위치 편향을 줄이는 수정이 인간-자동 평가자 간 일치도를 높였으나, 루브릭 복잡성이 높아지고 보수적인 집계 방법을 사용할 경우 일치도가 감소하는 경향을 보여주었습니다.
웃음은 인간 소통의 핵심 요소이지만, 오디오에서 이를 정확하게 탐지하고 세분화하는 것은 어려운 과제입니다. 기존 기계 학습 방법들은 수동 주석에 의존하며 영어 중심의 데이터셋이 많다는 한계를 가집니다. 본 논문에서는 웃음 세분화 문제를 에너지 기반 시퀀스의 이상 탐지로 재정의한 무감독 다국어 방법을 제안합니다. 이 방법은 BYOL-A 인코더로 학습된 오디오 표현에 Isolation Forest를 적용하여, 비영어권 환경에서도 우수한 성능을 입증했습니다.
UniPrefill은 대형 언어 모델(LLMs)의 긴 컨텍스트 처리 추론 효율성을 개선하기 위해 제안된 전역적인 Prefill 가속 프레임워크입니다. 기존 연구들이 희소 어텐션에만 집중되어 있어 다양한 아키텍처나 연속적 배치 환경에서 성능 저하를 겪고 통합이 어려웠던 문제를 해결합니다. UniPrefill은 모든 모델 아키텍처에 적용 가능하며, vLLM과 같은 현대 추론 엔진의 스케줄링 전략을 확장하여 Prefill-Decode 동시 처리 및 텐서 병렬 처리를 지원함으로써 Time-To-First-Token (TTFT)에서 최대 2.1배의 속도 향상을 달성합니다.
본 논문은 현대 LLM의 설계 선택 중 하나인 '토큰 인덱스 폐기' 문제에 주목하며, 이것이 희귀 토큰 과소 학습과 컨텍스트 붕괴라는 두 가지 구조적 실패를 초래한다고 지적합니다. 이를 해결하기 위해 TIDE(Token Identity Embedding)라는 새로운 아키텍처를 제안합니다. TIDE는 표준 트랜스포머에 '임베딩 메모리'를 추가하여, 토큰 인덱스를 컨텍스트와 독립적인 의미 벡터로 변환하고 이 정보를 모든 레이어에 주입함으로써 모델의 표현력을 강화합니다.
SEQUOR는 실제 대화에서 추출된 제약 조건으로 구성된 자동 멀티-턴 벤치마크입니다. 이 벤치마크는 모델이 장기간의 복잡한 대화 흐름 속에서도 사용자의 지시를 얼마나 일관성 있게 따르는지 평가합니다. 연구 결과에 따르면, 대화 시간이 길어질수록, 그리고 여러 제약 조건을 동시에 따라야 할 때 지시 준수 정확도가 현저하게 감소하는 경향이 관찰되었습니다.
본 논문은 트랜스포머의 핵심 토큰 혼합 메커니즘인 어텐션이 Nadaraya-Watson 회귀로 해석될 수 있음을 밝히고, 이를 기반으로 새로운 아키텍처 Cubit을 제안합니다. Cubit은 Kernel Ridge Regression (KRR) 의 폐쇄형 해를 활용하여 기존의 어텐션 계산 방식을 수정하고, 커널 유사성 및 역행렬을 통한 정규화를 결합했습니다. 실험 결과에 따르면, Cubit은 특히 시퀀스 길이가 길어질수록 트랜스포머 대비 더 강력한 장거리 시퀀스 모델링 능력을 보여줍니다.
본 논문은 극단적인 시퀀스 길이에서 인과 트랜스포머를 훈련할 때 발생하는 스케일된 점곱 주의(SDPA)의 시간 및 메모리 제약을 해결하기 위해 'Lighthouse Attention'이라는 새로운 계층적 주의 알고리즘을 제안합니다. 이 방법은 적응적 압축, 대칭 압축 전략을 통해 병렬성을 높이고, 쿼리, 키, 밸류를 동시에 풀링하여 효율성을 극대화했습니다. 또한, 대부분의 시간 동안 Lighthouse Attention으로 사전 훈련하고 짧은 과정으로 전체 주의 모델을 복원하는 2단계 훈련 접근법을 제시하여 성능과 속도를 모두 개선했습니다.
본 논문은 대규모 언어 모델(LLM)의 비효율적인 사전 학습 문제를 해결하기 위해 '토큰 중첩(Token Superposition, TST)'이라는 간단한 플러그인 방법을 제안합니다. TST는 기존의 병렬성, 옵티마이저 등 핵심 구성 요소를 변경하지 않으면서도 FLOPs당 데이터 처리량을 크게 향상시키는 것이 특징입니다. 이 방법은 연속된 토큰들을 하나의 '가방(bag)'으로 결합하여 훈련하고, 표준 훈련으로 복구하는 두 단계로 이루어지며, 실제 실험에서 최대 2.5배의 사전 학습 시간 단축 효과를 입증했습니다.
본 논문은 원격 인지 재활 세션의 대량 상호작용 데이터로부터 자동화된 임상 보고서를 생성하는 두 가지 접근법(규칙 기반 템플릿 시스템과 LLM 기반 접근법)을 비교합니다. 연구는 이 두 시스템이 임상 신뢰성, 일관성, 그리고 언어적 유창성 측면에서 어떤 트레이드오프를 보이는지 평가했습니다. 결과적으로, 템플릿 기반 시스템은 구조화된 보고서 작성에 강점을 보였으나, LLM은 더 간결하고 자연스러운 출력을 생성하는 것으로 나타났습니다.
본 논문은 L2 학습자가 의성어를 처리할 때 발생하는 인지 노력을 측정하기 위해 눈 추적 데이터셋을 개발하고 검증했습니다. 이 데이터셋은 CEFR 레벨별 포르투갈어 모국어 화자에게서 수집된 눈 추적 지표를 포함하며, 언어 능력과 회귀 움직임 간의 관계를 보여주며 유효성을 입증합니다. 궁극적으로 이 자원은 인간의 비유적 이해 모델을 평가하고 대규모 언어 모델(LLM)이 인간적인 방식으로 정렬되는지를 측정하는 인지 기반 벤치마크로 활용될 수 있습니다.
본 논문은 인도네시아 트위터 데이터셋을 활용하여 이분법적 혐오 표현 감지에 대한 두 가지 접근 방식, 즉 PyCaret AutoML과 CNN-BiLSTM의 성능을 비교합니다. 연구는 전통적인 TF-IDF 및 사전 기반 카운팅을 사용하는 모델링 분지와 밀도 토큰 학습 및 양방향 문맥 포착에 중점을 둔 신경망 분지를 비교했습니다. 그 결과, CNN-BiLSTM이 높은 정확도(83.8%)와 F1 점수(81.2%)를 달성하며 가장 우수한 성능을 보였고, 이는 전통적인 모델 대비 상당한 개선임을 입증합니다.
UniVer는 조건부 최적 전송(Conditional Optimal Transport, COT) 문제를 활용하여 대형 언어 모델의 추측 해독(Speculative Decoding) 과정을 통합적으로 형식화하는 새로운 방법을 제안합니다. 기존 방식들이 다단계 및 다 드래프트 측면을 분리하여 처리했던 한계를 극복하고, 수직 의존성을 접두어 확률로 추상화하여 수평 드래프트 선택에 능동적으로 활용합니다. 이를 통해 UniVer는 트리 레벨 전체를 함께 최적화하는 검증 알고리즘을 구현하며, 기존 방식 대비 높은 효율성 개선과 정확도 유지라는 이점을 입증했습니다.
FAAST는 사전 학습된 모델의 효율적인 지도 학습 적응을 위해 제안된 새로운 방법론입니다. 이 방법은 단일 패스(single pass)로 라벨링된 예시들을 분석적으로 빠른 가중치(fast weights)로 컴파일하여, 메모리나 컨텍스트 의존성을 제거합니다. 그 결과, FAAST는 상수 시간 추론을 달성하고 기존의 역전파 기반 적응 방식과 동등하거나 더 나은 성능을 보이면서도 적응 시간을 90% 이상 단축하고 메모리 사용량을 크게 절감하는 효율적인 솔루션을 제공합니다.
본 논문은 오디오 언어 모델(ALM)에 대한 적대적 공격(제일브레이킹)의 비효율성을 분석하고, 이를 개선하기 위한 새로운 최적화 기법을 제안합니다. 기존 공격 방식이 전체 웨이브포름을 밀도 있게 업데이트하는 반면, 연구진은 오디오 토큰 경량 에너지가 불균일하여 일부 작은 영역만 최적화를 지배한다는 것을 발견했습니다. 이에 따라, 고경량 에너지 토큰과 정렬된 웨이브포름에만 집중하고 나머지는 마스킹하는 '토큰 인식 기울기 최적화(TAGO)'를 제안했으며, 이는 기존 방식 대비 강력한 공격 성공률을 유지하면서도 상당한 희소화를 달성함을 입증했습니다.
본 논문은 대규모 언어 모델(LLM)의 후 훈련 과정이 전체 깊이에 걸쳐 작업 기울기를 전파하는 기존 방식을 비싸고 침습적이라고 지적하며, 새로운 방법인 LoPT(Local-Learning Post-Training)를 제안합니다. LoPT는 트랜스포머 구조의 중간 지점에 단일 기울기 경계를 설정하여 후 훈련을 수행합니다. 이 방식은 작업 목표로부터 학습하는 부분과 표현 보존을 위한 부분을 분리하고, 초기 레이어에 대한 직접적인 간섭을 최소화하면서도 높은 효율성과 성능을 달성합니다.
본 논문은 텍스트 기반 정신 건강 예측 모델이 실제 환경에서 직면하는 과신심 및 불확실성 추정 문제를 해결하기 위한 다중 관점 학습 프레임워크를 제안합니다. 이 프레임워크는 인코더와 디코더의 정보를 통합하고, 주관적 논리(Subjective Logic) 기반의 증거 융합 전략을 사용하여 신뢰할 수 있는 불확실성을 명시적으로 모델링합니다. 실험 결과, Dreaddit 등 실제 데이터셋에서 높은 정확도를 달성하며, 예측 성능뿐만 아니라 위험 민감도 응용에 필수적인 견고성과 해석 가능성을 입증했습니다.
MRI-Eval은 기존의 객관식 문제(MCQ) 기반 MRI LLM 벤치마크의 한계를 극복하기 위해 개발된 계층적 평가 도구입니다. 이 벤치마크는 교재, GE 스캐너 매뉴얼 등 다양한 출처를 활용하여 총 1365개의 문항을 포함하며, 특히 MRI 물리 및 특정 제조사(GE) 스캐너 운영 지식에 대한 모델의 깊이 있는 이해도를 측정하는 데 중점을 둡니다. 연구 결과, 높은 MCQ 점수가 실제 벤더별 운영 지식이나 자유 텍스트 회상 능력까지 보장하지 못함을 보여주었으며, LLM이 특정 프로토콜 가이드라인을 따를 때 주의가 필요함을 시사합니다.
본 연구는 일본어-중국어 번역의 신뢰성 문제를 해결하기 위해 RAG(Retrieval-Augmented Generation)와 프롬프팅을 결합한 시스템을 제안합니다. 이 시스템은 언어 분석 모듈과 위험 예측 기능을 통해 문맥적 정보를 추출하고, 이를 GPT-4o 기반의 향상된 프롬프트에 삽입하여 번역 품질을 높입니다. 테스트 결과, 지식 베이스 크기가 커질수록 BLEU 점수가 유의미하게 증가하며, RAG+프롬프트 접근 방식이 복잡한 문장 구조(NMCC)를 포함하는 일본어-중국어 번역 성능을 해석 가능하고 감사 가능한 방식으로 개선함을 입증했습니다.
본 논문은 LLM 기반 응급실(ED) 분류 시스템의 공정성을 평가하기 위한 'EQUITRIAGE'라는 프레임워크를 제시합니다. 이 연구는 5개 모델을 사용하여 MIMIC-IV 데이터셋에서 성별에 따른 편향성(undertriage)을 감사했으며, 대부분의 모델이 임상적 증거와 유사하게 여전히 높은 플립률과 방향성 여성 불분류 경향을 보임을 확인했습니다. 또한, 인종/성별 정보 비공개 등의 개입 기법이 일부 편향성을 줄일 수 있지만, 공정성 속성이 서로 다르며 모델 의존적인 감사 과정이 필수적임을 강조합니다.