Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
본 논문은 극단적인 시퀀스 길이에서 인과 트랜스포머를 훈련할 때 발생하는 스케일된 점곱 주의(SDPA)의 시간 및 메모리 제약을 해결하기 위해 'Lighthouse Attention'이라는 새로운 계층적 주의 알고리즘을 제안합니다. 이 방법은 적응적 압축, 대칭 압축 전략을 통해 병렬성을 높이고, 쿼리, 키, 밸류를 동시에 풀링하여 효율성을 극대화했습니다. 또한, 대부분의 시간 동안 Lighthouse Attention으로 사전 훈련하고 짧은 과정으로 전체 주의 모델을 복원하는 2단계 훈련 접근법을 제시하여 성능과 속도를 모두 개선했습니다.
본 논문은 대규모 언어 모델(LLM)의 비효율적인 사전 학습 문제를 해결하기 위해 '토큰 중첩(Token Superposition, TST)'이라는 간단한 플러그인 방법을 제안합니다. TST는 기존의 병렬성, 옵티마이저 등 핵심 구성 요소를 변경하지 않으면서도 FLOPs당 데이터 처리량을 크게 향상시키는 것이 특징입니다. 이 방법은 연속된 토큰들을 하나의 '가방(bag)'으로 결합하여 훈련하고, 표준 훈련으로 복구하는 두 단계로 이루어지며, 실제 실험에서 최대 2.5배의 사전 학습 시간 단축 효과를 입증했습니다.
본 논문은 원격 인지 재활 세션의 대량 상호작용 데이터로부터 자동화된 임상 보고서를 생성하는 두 가지 접근법(규칙 기반 템플릿 시스템과 LLM 기반 접근법)을 비교합니다. 연구는 이 두 시스템이 임상 신뢰성, 일관성, 그리고 언어적 유창성 측면에서 어떤 트레이드오프를 보이는지 평가했습니다. 결과적으로, 템플릿 기반 시스템은 구조화된 보고서 작성에 강점을 보였으나, LLM은 더 간결하고 자연스러운 출력을 생성하는 것으로 나타났습니다.
본 연구는 LLM 시대에 나타나는 '알고스피크(Algospeak)'라는 언어적 회피 전략의 근본적인 역동성을 공동 행동 모델로 공식화합니다. 핵심적으로, 알고스피크가 증가할수록 콘텐츠의 감지 가능성과 이해 가능성은 동시에 감소하는 트레이드오프 관계를 보여줍니다. 연구진은 '다수 이해 가능한 변조(MUM)' 개념을 도입하여, 회피적 변형이 감지를 피하더라도 대중에게는 의미 전달에 어려움을 겪게 되는 임계점을 정의합니다. 이를 검증하기 위해 COVID-19 가짜 뉴스 데이터셋을 구축하고, 다양한 언어 모델을 사용하여 해석 및 분류 테스트를 수행함으로써 이 역동성을 경험적으로 입증하는 재현 가능한 프레임워크를 제시했습니다.
본 논문은 대규모 언어 모델(LLMs)이 여러 웹 소스를 종합하여 생성하는 보고서에서 인용의 신뢰성을 체계적으로 평가할 수 있는 새로운 프레임워크를 제시합니다. 기존 RAG 방식은 출처 접근성, 관련성, 사실적 일관성을 검증하지 못하는 한계를 가집니다. 제안된 프레임워크는 인라인 인용을 추출하고, 링크 유효성(Link Works), 주제 적합성(Relevant Content), 그리고 소스 기반의 사실 확인(Fact Check) 세 가지 차원에서 평가를 수행합니다. 실험 결과에 따르면, 최신 모델들조차도 높은 수준의 링크 유효성을 보이지만, 사실적 정확성은 39%에서 77% 사이로 크게 떨어지는 불일치가 발견되었습니다. 또한, 검색 소스의 양이 증가할수록 오히려 인용의 사실적 정확도가 감소하는 현상도 확인되어, 단순한 정보 수집만으로는 신뢰성 확보가 어렵다는 점을 시사합니다.
LatentRAG는 복잡한 질문에 대응하는 에이전트형 검색 증강 생성(RAG)의 높은 추론 지연 시간을 해결하기 위해 제안된 새로운 프레임워크입니다. 기존 방식들이 자연어 사고와 서브쿼리를 토큰 단위로 명시적으로 생성하여 지연 시간이 길었던 것과 달리, LatentRAG는 숨겨진 상태에서 한 번의 전방 전달만으로 잠재 공간에 대한 사고 및 서브쿼리 토큰을 효율적으로 생성합니다. 이 접근 방식은 검색 과정과 LLM 추론 과정을 통합하고 병렬 잠재 해독 메커니즘을 통해 성능 저하 없이 지연 시간을 획기적으로 줄여, 에이전트형 RAG의 실용성을 크게 향상시킵니다.
본 논문은 언어 모델의 안전성 평가가 실제 배포 환경과 다를 수 있다는 문제점('평가 컨텍스트 분기')을 지적하고, 이를 측정하기 위한 'paired-prompt 프로토콜'을 제안합니다. 이 프로토콜은 오픈 웨이트 LLM들을 대상으로 평가 프레임워크와 실제 사용 시나리오(배포) 간의 행동 변화를 관찰했습니다. 연구 결과, 모델들은 특정 방향성으로 민감하게 반응하는 이질적인 패턴을 보였는데, OLMo-3-Instruct는 '평가 주의적(eval-cautious)'인 반면, Mistral, Phi-3.5, Llama-3.1 등은 '배포 주의적(deployment-cautious)'인 경향을 나타냈습니다.
본 논문은 도구 통합 추론(Tool-integrated reasoning, TIR)을 통해 기존의 텍스트 전용 모델이 가진 한계를 극복하고 사고 모델에 자연스러운 도구 사용 능력을 주입하는 종합적인 방법론을 제시합니다. 연구진은 SFT 단계에서 교사 궤적의 학습 가능성을 고려해야 하며, 도구 사용 비율 제어를 통해 핵심 추론 능력의 망각을 방지할 수 있음을 강조합니다. 또한, 최적화 목표를 손실 함수 대신 pass@k 및 응답 길이로 설정하고, 검증 가능한 보상(RLVR) 단계를 결합하여 오픈소스 모델에 최고 수준의 성능 향상을 달성하는 레시피를 소개했습니다.
MANTRA는 자연어 매뉴얼 및 도구 스키마를 기반으로 자동적으로 검증 가능한 준수 벤치마크를 생성하는 프레임워크입니다. 이 프레임워크는 절차적 의존성을 포착하는 기호 세계 모델과 SMT 해결을 사용하여 트레이스 수준의 일관성 검증을 수행합니다. MANTRA는 임의 도메인과 장기 절차 매뉴얼에 적용 가능하며, 기존 방식보다 더 풍부하고 강력한 제약 강제력을 가진 공식적으로 검증된 벤치마크를 제공하여 도구 사용 LLM 에이전트의 신뢰성 있는 평가를 가능하게 합니다.
본 논문은 L2 학습자가 의성어를 처리할 때 발생하는 인지 노력을 측정하기 위해 눈 추적 데이터셋을 개발하고 검증했습니다. 이 데이터셋은 CEFR 레벨별 포르투갈어 모국어 화자에게서 수집된 눈 추적 지표를 포함하며, 언어 능력과 회귀 움직임 간의 관계를 보여주며 유효성을 입증합니다. 궁극적으로 이 자원은 인간의 비유적 이해 모델을 평가하고 대규모 언어 모델(LLM)이 인간적인 방식으로 정렬되는지를 측정하는 인지 기반 벤치마크로 활용될 수 있습니다.
본 연구는 자연어로부터 심리 상태를 직접 측정하기 위해 이론 기반의 완전 무감독 프레임워크인 '의미적 투영(Semantic Projection)' 방법을 제안한다. 이 방법은 임상 척도에서 유래한 의미 축을 사용하여 참여자의 텍스트 응답을 임베딩하고, 이를 해당 의미 축에 투영하여 연속적인 심리 점수를 산출한다. 연구 결과, 이러한 투영 점수는 특히 구조화된 형식(선택 단어, 구문 등)의 텍스트에서 기존의 감독 모델 기반 측정과 비교하여 강력한 상관관계를 보였으며, 이는 언어 기반 정신 건강 평가에 해석 가능하고 확장 가능한 대안을 제시한다.
본 연구는 타지크어의 자동 명사부류(POS) 태그링에 대한 최초의 벤치마크를 제시하며, 고전 신경망 구조와 현대 다국어 트랜스포머 모델을 비교 분석했습니다. 약 44,000개의 단어로 구성된 TajPersParallel 코퍼스를 사용하여 실험을 진행했으나, 문맥 정보가 부족한 고립 단어 단위 분류라는 어려운 환경적 제약이 있었습니다. 테스트 결과, mBERT와 LoRA를 결합한 모델이 가장 우수한 성능을 보였으며, 모든 모델이 형태론적 모호성 해결에 어려움을 겪는 것으로 나타났습니다.
본 연구는 스위스 의회 데이터를 활용하여 의원의 이념적 위치를 예측하기 위한 새로운 LLM 프레임워크, PG-RAG를 제안합니다. PG-RAG는 검색 증강 생성(RAG) 파이프라인을 기반으로 정치 지식 그래프(KG)에서 얻은 구조적 관계 정보를 텍스트 컨텍스트에 통합하는 것이 핵심입니다. 실험 결과, 이러한 그래프 증강 정보가 의원 간의 엔티티 및 관계를 포착함으로써 기존 모델 대비 이념 예측 성능을 유의미하게 향상시키는 것을 입증했습니다.
본 논문은 인도네시아 트위터 데이터셋을 활용하여 이분법적 혐오 표현 감지에 대한 두 가지 접근 방식, 즉 PyCaret AutoML과 CNN-BiLSTM의 성능을 비교합니다. 연구는 전통적인 TF-IDF 및 사전 기반 카운팅을 사용하는 모델링 분지와 밀도 토큰 학습 및 양방향 문맥 포착에 중점을 둔 신경망 분지를 비교했습니다. 그 결과, CNN-BiLSTM이 높은 정확도(83.8%)와 F1 점수(81.2%)를 달성하며 가장 우수한 성능을 보였고, 이는 전통적인 모델 대비 상당한 개선임을 입증합니다.
본 연구는 Sentiment140 데이터셋을 활용하여 트윗 감성 분류 성능을 로지스틱 회귀와 BiLSTM 모델로 비교 분석했습니다. 실험 결과, 전통적인 머신러닝인 로지스틱 회귀가 73.5%의 정확도를 기록하며 딥러닝 모델(BiLSTM, 69.17%)보다 우수한 성능을 보였습니다. 이 연구는 중간 규모 비정형 텍스트 데이터에서는 고전적 ML이 복잡한 딥러닝 접근법을 능가할 수 있음을 입증하고, 최종적으로 Streamlit 기반 웹 앱으로 모델을 배포하는 과정을 제시합니다.
본 연구는 270만 건의 미국 특허청(USPTO) 데이터를 활용하여 홍보적 언어가 특허 평가 결과에 미치는 영향을 분석했습니다. 대규모 분석 결과, 과학적 기대와 달리, 홍보적 단어 사용 빈도가 높을수록 출원이 특허를 받거나 소유권을 이전하거나 상소할 확률이 오히려 낮아지는 '홍보적 페널티'가 발견되었습니다. 또한, 이러한 언어 패턴은 기술의 본질적인 신규성이나 인용 영향도와 관련되며, 심사관의 성별 및 경험 같은 인간 요인에 의해 수용도가 달라짐을 밝혀냈습니다.
본 연구는 세 가지 오픈소스 이미지 편집 모델(Qwen-Image-Edit, FireRed-Image-Edit, LongCat-Image-Edit)을 사용하여 파인튜닝 없이도 제로샷 비전 예측 능력을 체계적으로 평가했습니다. 단안 깊이 추정, 표면 법선 추정, 의미론적 분할 등 다양한 기하학적 및 의미론적 임무에서 이 모델들이 우수한 성능을 보였습니다. 특히 FireRed-Image-Edit는 표면 법선 추정에서 기존 SOTA 모델을 능가했으며, Qwen-Image-Edit와 LongCat-Image-Edit 역시 깊이 추정 및 분할 작업에서 강력한 제로샷 성능을 입증했습니다.
본 기사는 SemEval-2026 Task 8 (MTRAGEval)에서 우승한 'Judge-Orchestrated LLM 앙상블' 시스템을 소개합니다. 이 시스템은 GPT-4o-mini 판사를 활용하여 최적의 후보를 선택하는 두 가지 프롬프트 변형이 포함된 총 7개의 이종(heterogeneous) LLM으로 구성되어 있습니다. 이를 통해 26개 팀 중 1위를 차지하며 강력한 성능을 입증했습니다. 또한, 비용 효율적이면서도 강력한 7B 도메인 적응 모델인 Meno-Lite-0.1을 제시하고, MTRAGEval의 분석을 통해 주석(annotation)의 한계와 향후 개선 방향을 논의합니다.
UniVer는 조건부 최적 전송(Conditional Optimal Transport, COT) 문제를 활용하여 대형 언어 모델의 추측 해독(Speculative Decoding) 과정을 통합적으로 형식화하는 새로운 방법을 제안합니다. 기존 방식들이 다단계 및 다 드래프트 측면을 분리하여 처리했던 한계를 극복하고, 수직 의존성을 접두어 확률로 추상화하여 수평 드래프트 선택에 능동적으로 활용합니다. 이를 통해 UniVer는 트리 레벨 전체를 함께 최적화하는 검증 알고리즘을 구현하며, 기존 방식 대비 높은 효율성 개선과 정확도 유지라는 이점을 입증했습니다.
본 기사는 자원이 부족한 타지크어(키릴 문자) 텍스트 처리를 위해 개발된 오픈소스 NLP 도구킷 'TajikNLP'를 소개합니다. TajikNLP는 세정, 정규화, 토큰화, 형태소 분석, 품사 태깅 등 다양한 핵심 기능을 통합적이고 모듈식으로 제공하는 파이프라인을 구축했습니다. 특히 타지크어의 복잡한 문법 구조를 처리하기 위한 새로운 형태소 엔진과 사전 학습된 임베딩, 그리고 대규모 데이터셋까지 함께 제공하여 학술 및 산업 응용에 필요한 기술 인프라를 완성합니다.