Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
개인정보 보호 문제로 접근이 어려운 상담 데이터를 대체하기 위해 인간이 작성한 프록시 데이터셋인 GEMCo를 제안합니다. GEMCo는 실제 상담 대화와 유사한 전략 및 감정 패턴을 유지하면서도 윤리적 공개가 가능하도록 설계되었습니다.
LLM 기반 데이터베이스 운영 에이전트의 성능을 실제 프로덕션 환경과 유사하게 평가하기 위한 벤치마크인 DBA-Bench를 제안합니다. PostgreSQL 환경에서 복잡한 장애 시나리오를 통해 에이전트의 진단 및 복구 능력을 측정합니다.
MEUSLI는 Whisper 인코더와 오픈 소스 다국어 LLM을 연결하여 28개 유럽 언어를 지원하는 다국어 프로젝터 제품군입니다. ASR뿐만 아니라 음성 번역 및 주제 식별까지 가능한 확장성을 제공하며, 지속 학습을 통해 새로운 언어로의 확장이 용이합니다.
3B 파라미터 규모의 컴팩트한 범용 에이전트 모델인 Nanbeige4.2-3B를 소개합니다. 루프 트랜스포머 구조와 고도화된 RL 파이프라인을 통해 수학, 코딩, 도구 사용 등 다양한 에이전트 작업에서 대형 모델을 능가하는 성능을 보여줍니다.
LLM 평가가 작업 중심에서 능력 중심으로 전환되어야 함을 강조하며, 인지 과학에 기반한 다층 분류 체계를 제안합니다. 14개 영역과 91개 하위 기술로 구성된 이 체계는 연구 조직과 모델 진단을 위한 새로운 프레임워크를 제공합니다.
아랍 문자 기반 저자원 언어의 생물 의학 번역 성능을 높이기 위해 교차 언어 전이와 LoRA 어댑터 병합 전략을 연구했습니다. 고자원 언어를 피벗으로 활용하여 다리어, 파슈토어 등 저자원 언어의 번역 품질을 개선하는 다양한 전이 기법을 평가했습니다.
유니코드 코드 포인트 기반의 기존 지표가 가진 한계를 극복하기 위해 자소 클러스터 단위로 작동하는 오픈 소스 Python 라이브러리 'grapheme-kit'을 소개합니다. 이 라이브러리는 다국어 NLP 환경에서 더 정확한 텍스트 처리와 평가를 지원합니다.
LLM의 자기 진화 과정에서 발생하는 작업 다양성과 검증 신뢰성 사이의 딜레마를 해결하기 위한 Skill Self-Play(Skill-SP) 프레임워크를 제안합니다. 제안자, 해결사, 기술 컨트롤러가 강화학습을 통해 상호작용하며 모델의 도구 사용 및 추론 능력을 지속적으로 향상시킵니다.
서로 다른 토크나이저를 사용하는 모델 간의 온-정책 증류(OPD) 효율을 높이기 위한 Byte-Prefix Marginalization(BPM) 기술을 제안합니다. BPM은 바이트 공간을 활용해 교사 모델의 확률 질량을 학생 모델의 어휘로 정확하게 재표현하여 정보 손실을 최소화합니다.
문법 교재를 활용해 저자원 언어의 기계 번역을 위한 합성 병렬 데이터를 생성하는 파이프라인을 제안합니다. LLM을 통해 문법 규칙과 예문을 추출하여 미세 조정을 수행하며, 다양한 언어 유형에서 성능 향상을 입증했습니다.
백만 토큰 이상의 긴 컨텍스트 환경에서 Multi-Token-Prediction(MTP) 초안 생성 시 발생하는 KV 캐시 읽기 비용 문제를 해결하기 위한 Windowed-MTP 방식을 제안합니다. 슬라이딩 윈도우와 어텐션 싱크를 적용하여 학습 없이도 초안 생성 비용을 획기적으로 절감하면서 타겟 모델의 출력 품질은 그대로 유지합니다.
OpenForgeRL은 복잡한 추론 하네스를 사용하는 AI 에이전트를 엔드투엔드로 학습시키기 위한 오픈 소스 프레임워크입니다. 경량 프록시와 Kubernetes 오케스트레이터를 활용해 학습과 추론을 분리하며, 다양한 환경에서 대규모 에이전트 학습을 가능하게 합니다.
아프리카 27개 언어 변체를 지원하는 오픈 소스 음성 인식(ASR) 베이스 모델 제품군인 DONDO를 소개합니다. w2v-BERT 2.0을 기반으로 하며, 학습률 어닐링 미세 조정과 언어 조건화 메커니즘을 통해 높은 성능을 구현했습니다.
LLM의 장기 메모리 능력을 평가하기 위해 설계된 새로운 벤치마크인 RUMBA를 소개합니다. 러시아어와 영어 서브셋을 지원하며, 시간적 추론과 세션 간 검색 능력을 정밀하게 측정하는 방법론을 제공합니다.
MedGame은 LLM을 활용해 정적인 임상 사례를 구조화된 스토리텔링 게임으로 변환하는 프레임워크입니다. 이중 엔진 설계를 통해 임상 내러티브를 생성하고 멀티모달 오케스트레이션을 수행하며, 성능 평가를 위한 MedGame Bench를 함께 제안합니다.
LLM의 서구 중심적 가치 편향을 해결하기 위해 스리랑카의 사회적 가치를 반영한 LKValues 리소스를 제안합니다. 40개의 사회적 가치를 도출하고, 이를 바탕으로 지시어 코퍼스(LKvaluesIT)와 평가 벤치마크(LKvaluesBench)를 구축했습니다.
언어 모델이 비동일 등위 접속(unlike coordination)을 학습할 때 직접적인 데이터 노출이 필수적인지 연구했습니다. GPT-2를 활용한 실험 결과, 모델은 동일 등위 접속 학습만으로도 비동일 사례를 성공적으로 일반화할 수 있음을 확인했습니다.
PoTRE는 인지적 이질성을 활용하여 LLM의 복잡한 추론 능력을 향상시키는 새로운 프레임워크입니다. 네 가지 특화된 에이전트와 적응형 집계 계층을 통해 장기 계획 및 오류 수정 문제를 해결하며, 주요 벤치마크에서 SOTA 성능을 기록했습니다.
LLM이 Schwartz의 10가지 기본 가치를 얼마나 정확하게 인식하는지 분석한 연구입니다. 모델이 올바른 가치 영역은 잘 찾아내지만, 인접한 가치들 사이에서 특정 방향으로 혼동을 일으키는 경향이 있음을 밝혀냈습니다.
사전 학습된 언어 모델의 프롬프팅 전략과 학습 목적 간의 정렬을 예측하는 '마스커빌리티 지수(MI)'를 제안합니다. MI는 마스크 스타일과 접두사 스타일 프롬프팅 중 어떤 것이 적합한지 정량적으로 측정하며, 이는 모델의 지식 추출 성능과 높은 상관관계를 보입니다.