Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
본 논문은 대형 언어 모델(LLMs)이 모호한 인간의 질문과 구조화된 논리 사이의 불일치로 인해 잠재력을 충분히 발휘하지 못하는 문제를 해결하기 위해 ReQueR이라는 모듈러 프레임워크를 제안합니다. ReQueR은 강화학습(RL)을 사용하여 전용 리파이너 정책을 학습시켜 원시 쿼리를 명시적인 논리적 분해로 재작성하며, 이를 통해 동결된 LLMs의 추론 능력을 향상시킵니다. 특히, 이 프레임워크는 소수의 모델에서 학습된 단일 리파이너가 다양한 미지의 모델에 효과적으로 적용될 수 있는 '원-투-매니(one-to-many)' 패러다임을 제시하여 범용성을 크게 높였습니다.
본 논문은 대형 언어 모델(LLMs)의 서사 생성 한계를 극복하기 위해 의존성 인식 다단계 프롬프트 파이프라인을 제안합니다. 이 방법은 세계 구축, NPC/PC 생성, 캠페인 퀘스트 기획, 퀘스트 확장 등 여러 단계를 구조화된 중간 표현(JSON)으로 분해하고 각 단계가 이전 결과를 조건으로 삼도록 설계되었습니다. 이를 통해 서사적 일관성과 구조적 완전성을 유지하며 복잡한 RPG 콘텐츠를 체계적으로 생성할 수 있음을 입증했습니다.
본 연구는 대형 언어 모델(LLMs)의 안전 메커니즘이 영어 중심적이라는 취약점을 다루며, 다국어 환경에서의 제이브레이크 공격에 대한 새로운 방어책을 제시합니다. 기존 방식으로는 크로스-링글 보안 격차가 발생하지만, 본 연구는 재학습 없이 언어 불변적인 의미론적 유사성을 활용하여 영어 기반의 제이브레이크 코드북과 다국어 쿼리 임베딩을 비교하는 외부 방패 역할을 수행합니다. 실험 결과, 표준화된 벤치마크에서는 높은 분리성(AUC 최대 0.99)을 달성하며 공격 성공률을 크게 낮추었으나, 실제 환경의 분포 이동이 발생하는 비정형적인 안전하지 않은 벤치마크에서는 성능 저하가 관찰되었습니다.
이 기술 기사는 '서브릴리널 스티어링(Subliminal Steering)'이라는 개념을 도입하여, 언어 모델이 데이터에 숨겨진 편향을 학습하는 현상(서브릴리널 학습)의 세 가지 주요 미해결 질문을 해결합니다. 기존 연구가 시스템 프롬프트 기반이었다면, 서브릴리널 스티어링은 타겟 샘플의 가능도를 최대화하도록 훈련된 '스티어링 벡터'를 사용하여 편향을 구현하는 변형입니다. 이 방법론을 통해 복잡한 다단어 편향 전달 능력, 모델이 편향뿐만 아니라 스티어링 메커니즘 자체도 학습한다는 점, 그리고 놀라울 정도로 높은 정밀도로 편향이 인코딩됨을 입증했습니다.
본 기사는 인간 피드백 기반 강화학습(RLHF)에서 주석가들의 판단이 가지는 세 가지 개념적 모델—확장(extension), 증거(evidence), 권한(authority)—을 제시합니다. 이 모델들은 주석가가 시스템 설계자의 의도를 확장하는지, 독립적인 사실적 증거를 제공하는지, 아니면 대중의 대표로서 결정권을 행사하는지에 따라 구분됩니다. 저자는 RLHF 파이프라인이 이러한 모델들을 명확히 이해하고 분리하여 적용해야 하며, 단일 통합된 접근 방식보다는 각 주석 유형에 맞는 맞춤형 설계를 추구해야 한다고 주장합니다.
본 논문은 실제 환경에서의 복잡한 데이터 시각화(Data Visualization, DV) 능력을 평가하기 위해 새로운 벤치마크인 DV-World를 제안합니다. 기존의 벤치마크들이 가진 코드 샌드박스 제한이나 단일 언어 작업에 국한된 한계를 극복하고자 했습니다. DV-World는 스프레드시트 조작(DV-Sheet), 데이터 적응 및 재구조화(DV-Evolution), 그리고 현실 세계의 모호한 요구사항을 다루는 능동적 의도 정렬(DV-Interact)이라는 세 가지 도메인을 포함하여 총 260개의 작업을 제공합니다. 실험 결과, 현존하는 최첨단 모델들이 실제 복잡한 데이터 시각화 과제 처리에서 심각한 성능 부족을 보였음을 입증하며, 기업 워크플로우에 필요한 현실적인 테스트베드를 제시합니다.
BARRED(Boundary Alignment Refinement through REflection and Debate)는 맞춤형 정책의 경계선 구축 문제를 해결하기 위해 설계된 프레임워크입니다. 이 방법은 작업 설명과 소수의 레이블링되지 않은 예시만을 사용하여, 도메인 공간을 분해하고 다중 에이전트 논쟁을 통해 고신뢰도의 합성 훈련 데이터를 생성합니다. 실험 결과에 따르면, BARRED로 미세 조정된 작은 언어 모델(SLM)은 최첨단 전용 LLM과 경계선 모델의 성능을 일관되게 능가하며, 대규모 인간 주석 의존성을 제거하여 확장 가능한 솔루션을 제공합니다.
DRAGON은 차트, 지도 등 구조화된 시각 자료에 대한 '증거 기반' 추론 능력을 평가하기 위해 개발된 새로운 벤치마크입니다. 기존의 비전-언어 모델(VLMs)들은 높은 정확도를 보이지만, 예측을 뒷받침하는 구체적인 시각적 증거를 식별하지 못하고 텍스트 상관관계에 의존하는 한계가 있었습니다. DRAGON은 주어진 질문과 정답에 대해 모델이 추론의 근거가 되는 경계 상자(bounding boxes)를 정확히 예측하도록 요구함으로써, 도표 해석의 신뢰성과 해석 가능성을 높이는 것을 목표로 합니다.
비언어 모델(VLMs)이 다중 모드 시스템의 자동 판정자로서 사용되지만, 이들의 점수는 신뢰할 수 있는 지표가 아닙니다. 본 연구는 컨포멀 예측(conformal prediction)을 사용하여 VLM의 점수를 보정된 예측 구간으로 변환함으로써 이러한 문제를 해결합니다. 분석 결과, 평가 불확실성은 작업 유형에 따라 크게 달라지며, 특히 차트나 수학 추론 같은 복잡한 작업에서 신뢰 구간이 더 넓게 확장됨을 보여줍니다.
본 논문은 기존의 파편화된 데이터 큐레이션 방식이 MLLM의 잠재력을 제한하는 문제를 해결하기 위해, 엔티리 중심 의료 데이터 엔지니어링 프레임워크를 제안합니다. 이 프레임워크는 권위 있는 의학 문헌에서 질병, 해부학적 구조 등의 핵심 엔티티를 추출하여 계층적인 '의료 엔티티 트리(MET)'를 구축하는 것이 핵심입니다. MET를 기반으로 노드 기반 검색, 하이브리드 필터링/정렬 파이프라인, 지식 인식 데이터 합성 등 고급 데이터 엔진을 개발했으며, 이를 통해 MLLM의 복잡한 임상 추론 능력을 크게 향상시켰음을 입증했습니다.
본 연구는 한국어 법적 도메인에 특화된 대형 언어 모델(LLM)인 LegalMidm을 소개하고, 그 개발 방법론을 제시합니다. 기존의 범용 또는 비전문적인 LLM들이 가진 정확성 및 신뢰성 문제를 해결하기 위해, 본 연구는 실제 사용 사례 기반(use-case-driven)의 체계적인 훈련 프레임워크를 제안했습니다. 이 접근 방식은 법률 전문가와의 긴밀한 협력과 엄격한 데이터 큐레이션을 통해 한국 법적 도메인의 실질적 필요에 맞는 고품질 데이터를 구축하고 모델을 최적화하는 데 중점을 둡니다.
본 기사는 음성 감정 인식(SER) 연구가 명시된 동기와 실제 수행 사이에 존재하는 간극에 주목하며, 이 문제를 체계적으로 조사했습니다. SER 연구는 매력적인 응용 분야를 목표로 하지만, 일반적으로 사용되는 데이터셋이 이러한 배포 환경의 복잡성을 제대로 반영하지 못하는 경향을 보입니다. 따라서 저자들은 이러한 간극이 윤리적 우려와 오용 가능성을 초래하므로, SER 연구가 구체적인 사용 사례에 기반하여 자신을 재정립해야 한다고 주장합니다.
R$^3$-SQL은 기존 Text-to-SQL 시스템의 두 가지 주요 문제점인 불일치한 점수 부여와 올바른 SQL 부재 문제를 해결하기 위해 제안된 새로운 프레임워크입니다. 이 프레임워크는 실행 결과가 같은 후보들을 그룹화하고, 그룹 내 일관성을 유지하면서 순위를 매깁니다. 또한, 생성된 후보 풀의 리콜을 개선하기 위해 필요할 경우 재표본추출(resampling) 기능을 추가하여 전반적인 성능과 안정성을 높였습니다.
네덜란드어 의료 분야에 필요한 대규모 언어 데이터셋이 구축되었습니다. 연구진은 영어 데이터를 번역하고 일반 텍스트에서 의료 관련 내용을 식별하며 공개 리소스를 통합하는 방식으로 이 코퍼스를 만들었습니다. 결과적으로 약 1억 개의 문서, 350억 토큰 규모의 네덜란드 의료 도메인 언어 코퍼스가 생성되어 Hugging Face를 통해 무료로 제공됩니다.
본 기술 기사는 7개 남슬라브어의 원시 위키미디어 덤프를 고품질 훈련 코퍼스로 변환하는 방법론을 제시합니다. 이 과정은 첫째, 복잡한 위키 마크업에서 자연어 텍스트를 추출하고 정제하며, 둘째, n-gram 기반 필터링 전략을 사용하여 반복적이거나 저품질의 콘텐츠(예: 구조화된 지식 베이스 기사)를 제거하는 두 단계로 진행됩니다. 이를 통해 언어 모델 훈련 및 남슬라브어 비교 연구에 적합한 신뢰성 높고 정보 밀도가 높은 코퍼스를 구축합니다.
본 논문은 작은 모델과 데이터셋에서 좋은 성능을 보여왔지만 하이퍼파라미터 확장에 취약했던 확률적 트랜스포머(PT)의 확장 문제를 해결하는 방법을 제시합니다. 연구진은 Maximal Update Parametrization (muP) 기법을 사용하여 PT 파라미터를 재확장하고, 이를 통해 작은 모델에서 최적화된 하이퍼파라미터를 추가 튜닝 없이 대규모 모델로 전이할 수 있게 했습니다. 그 결과, 최대 4억 개의 파라미터까지 성공적으로 확장되었으며, 동일한 파라미터 예산 하에서 표준 트랜스포머보다 우수한 성능을 입증했습니다.
본 연구는 계산 시스템 내에서 인간과 유사한 방식으로 색상을 명명하는 행동을 모델링하고 개선하는 방법을 제시합니다. 기존의 신경 에이전트 프레임워크가 실용적인 색상 명명 능력을 보여주었음에도 불구하고, 생성된 어휘가 인간 범주의 볼록성(convexity)과 달리 비볼록한 영역을 형성하는 문제를 발견했습니다. 이를 해결하기 위해 희귀 색상 용어의 업샘플링과 다수 청취자 강화 학습 상호작용이라는 두 가지 요소를 도입하여, 시스템이 기하학적으로 더 일관되고 인간에게 가까운 색상 범주를 생성하도록 최적화합니다.
본 기술 기사는 글로벌 AI 규제를 다루기 위해 개발된 다관할권 검색 증강 생성(RAG) 시스템을 소개합니다. 이 시스템은 EU AI Act를 포함한 68개 관할권의 242개 문서를 코퍼스로 활용하며, 유형별 청킹, 조건부 검색 라우팅, 우선순위 기반 리랭킹 등 세 가지 기술적 개선 사항을 적용했습니다. 평가 결과, 본 RAG 시스템은 단일 엔티티 및 다관할권 비교 질문 모두에서 높은 충실도와 답변 관련성을 보여주어 복잡한 규제 코퍼스 탐색에 효과적임을 입증했습니다.
Perspective API의 폐지는 NLP, CSS, LLM 평가 분야에서 자동 독성 측정의 표준이던 도구가 사라짐에 따라 중요한 구조적 변화를 예고합니다. 이로 인해 연구 커뮤니티는 단일 기업의 운영적 정의와 비재현 가능한 결과물에 의존해 왔다는 인식론적 문제에 직면했습니다. 본 논문은 이러한 상황을 독립적이고, 유효하며, 적응 가능하고, 재현 가능한 독성 및 혐오 표현 측정 인프라를 구축해야 할 기회로 보고 기술적 및 거버넌스 요건을 제시합니다.
본 논문은 기존의 지도 학습 방식에 의존하는 신경 기계 번역(NMT) 시스템이 가지는 지속적인 오류 문제를 해결하기 위해 강화 학습 기반의 후학습 패러다임을 제안합니다. 특히, 일반 텍스트 코퍼스와 전문가 피드백만으로 반복적인 개선이 가능한 새로운 프레임워크를 소개하며, 이 접근 방식을 직접 선호 최적화(DPO) 기법을 사용하여 구현했습니다. 실험 결과, DPO 기반 후학습은 영어-독일어 번역 작업에서 COMET 점수를 유의미하게 향상시켜 NMT 모델의 전반적인 품질 개선 가능성을 입증했습니다.