Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
크메르어 농업 문서를 대상으로 RAG 프레임워크 내 최적의 청킹 전략을 비교 연구했습니다. 재귀적, 크메르어 인식, 문장 기반, LLM 기반 방식 중 300자 크기의 재귀적 청킹이 가장 우수한 성능을 보였습니다.
Agentic CLEAR는 LLM 에이전트의 행동을 시스템, 트레이스, 노드 단위로 자동 평가하는 동적 프레임워크입니다. 기존의 정적이고 수동적인 평가 방식의 한계를 극복하여 고품질의 데이터 기반 피드백을 제공합니다.
본 논문은 독일 민법을 활용하여 RAG(Retrieval-Augmented Generation) 시스템을 위한 다양한 청킹(Chunking) 전략의 성능을 비교 분석합니다. 연구 결과, 복잡한 LLM 기반 기술보다 법률의 고유한 구조인 조항(section)과 항(subsection)을 보존하는 방식이 재현율과 계산 효율성 측면에서 가장 우수한 성능을 보였습니다.
온디바이스 AI 에이전트의 개인정보 보호와 응답성을 위해, 제한된 메모리 환경에서도 사용자 선호도를 효과적으로 반영할 수 있는 EPIC(Efficient Preference-aligned Index Construction) 기술을 제안합니다. EPIC은 원시 데이터에서 선호도 관련 정보만을 선택적으로 추출하여 인덱싱함으로써, 메모리 사용량을 획기적으로 줄이면서도 검색 정확도와 속도를 대폭 향상시킵니다.
SkillsVote는 LLM 에이전트의 경험 궤적을 체계적인 '에이전트 기술(Agent Skills)'로 관리하기 위한 생애주기 거버넌스 프레임워크입니다. 이 시스템은 기술의 수집, 추천, 검증 및 진화 과정을 구조화하여 노이즈가 많은 데이터를 정제하고, 성공적인 기술만을 라이브러리에 업데이트함으로써 에이전트의 성능을 지속적으로 향상시킵니다. 실험 결과, 모델 업데이트 없이도 외부 기술 라이브러리 관리를 통해 Terminal-Bench 2.0 및 SWE-Bench Pro 성능을 유의미하게 개선했습니다.
최근 LLM의 발전으로 코드는 단순한 결과물을 넘어 에이전트의 추론, 행동, 환경 모델링을 위한 핵심 운영 기질(operational substrate)로 진화하고 있습니다. 본 글은 코드를 에이전트 인프라의 기초로 보는 '에이전트 하네스로서의 코드' 관점을 제시하며, 인터페이스, 메커니즘, 다중 에이전트 확장이라는 세 가지 계층을 통해 에이전트 시스템의 통합된 로드맵을 제안합니다.
본 연구는 행동 주도 개발(BDD) 테스트 스위트에서 중복되는 하위 시퀀스(subsequences)를 자동으로 식별하고, 이를 리팩토링할 가치를 평가하는 방법을 제시합니다. 339개 저장소의 Gherkin 코퍼스를 분석하여 총 5백만 개 이상의 슬라이스를 발견하고 약 69만 개의 반복 패턴으로 압축했습니다. 개발된 XGBoost 분류기는 추출 가치 예측에서 규칙 기반 및 LLM Judge보다 높은 성능(F1 = 0.891)을 보여, BDD 리팩토링 기회 탐색에 효과적인 자동화 도구를 제공합니다.
본 연구는 스트리밍 음성-텍스트 번역을 위한 새로운 LLM 기반 아키텍처를 제안합니다. 기존 시스템의 문제점인 느린 속도와 연쇄 오류 문제를 해결하기 위해, 이 모델은 토큰 생성 여부뿐만 아니라 충분한 오디오 입력 확인까지 학습합니다. 실험 결과, 이 시스템은 비스트리밍 방식에 근접한 높은 번역 품질을 유지하면서도 1~2초의 낮은 지연 시간을 달성했습니다.
본 연구는 종단적 전자 건강 기록(EHR) 분석에서 발생하는 LLM의 통계적 추론 및 장기 시간 의존성 포착의 한계를 극복하기 위해 COTCAgent라는 계층적 추론 프레임워크를 제안합니다. 이 에이전트는 시계열-통계 어댑터(TSA), 사고의 사슬 완성(COTC) 계층, 유계 완성 모듈로 구성되어 통계 계산과 언어 생성을 분리하여 엄격하고 신뢰할 수 있는 임상 추론을 가능하게 합니다. 실험 결과, COTCAgent는 기존 모델 대비 높은 정확도를 보여 의료 분야에서의 활용 잠재력을 입증했습니다.
본 연구는 교육 평가 설계를 위해 LLMs와 SLMs의 성능을 체계적으로 비교합니다. 특히 Bloom's taxonomy 수준에 걸친 생성 품질과 신뢰도를 분석하여, 모델 기반 판정(model-based judging)이 전문가 평가 대비 보이는 불일치 및 편향을 탐구했습니다. 연구 결과, SLMs는 개인정보 보호를 유지하면서도 교육학적 관점에서 경쟁력 있는 성능을 보여주었으며, 이는 언어 모델을 자동화된 보조자로서 활용하고 Human-in-the-Loop 접근 방식을 강화할 필요성을 시사합니다.
본 연구는 LLM 에이전트의 핵심 기능인 함수 호출(Function calling)의 지연 시간 문제를 해결하기 위해 AsyncFC라는 순수 실행 계층 프레임워크를 제안합니다. 기존에는 동기식 의미론으로 인해 각 함수 호출 완료 시까지 LLM 디코딩이 차단되어 전체 지연 시간이 길어졌습니다. AsyncFC는 모델 디코딩과 함수 실행을 분리하고, 의존성이 허용되는 경우 함수 간 병렬성을 가능하게 하여 작업 정확도를 유지하면서 엔드 투 엔드 처리 시간을 크게 단축합니다.
본 연구는 패혈증과 같은 복잡한 질환에서 정밀한 임상 타임라인을 재구성하기 위해 검색 증강 멀티모달 정렬(retrieval-augmented multimodal alignment) 프레임워크를 제안합니다. 이 접근 방식은 비정형 텍스트 서사에서 추출된 이벤트의 시간적 모호성을 구조화된 EHR 데이터가 제공하는 정확한 시간적 앵커로 보정하여, 두 모달리티의 장점을 결합합니다. MIMIC-III 및 MIMIC-IV 데이터를 사용한 평가 결과, 제안된 멀티모달 파이프라인은 단일 텍스트 기반 방식 대비 절대적 타임스탬프 정확도(AULTC)와 시간적 일치성을 전반적으로 향상시키는 것으로 나타났습니다.
Lift는 사전 학습된 LLM이 비정형 텍스트에서 초기 테이블을 추출하고, 미세 조정된 SLM이 이 테이블의 오류를 수정하는 '라스트 마일 미세 조정(last-mile fine-tuning)' 파이프라인입니다. 이 접근 방식은 단 1,000개의 학습 예시만으로도 기존 엔드 투 엔드 미세 조정보다 높은 성능을 보여주었으며, 특히 입력 형식의 가변성에 대한 견고성을 입증했습니다.
본 논문은 생성형 AI(GenAI)가 강사의 강의 노트를 기반으로 슬라이드를 생성하는 방안을 조사하고, 강사와 학생의 인식을 분석했습니다. 연구 결과, 코딩 어시스턴트 도구들이 가장 정확하고 교육학적으로 타당한 슬라이드를 생성했으며, 학생들은 GenAI 슬라이드의 품질을 인간이 만든 것과 유사하게 평가하여 AI 생성 여부를 식별하지 못했습니다. 또한, 높은 품질의 슬라이드와 'AI 생성'이라는 출처 사이에 부적 상관관계가 발견되어, 학생들이 낮은 품질을 AI 기원과 연관 짓는 경향이 있음을 시사합니다.
본 기사는 LLM 기반 문법 오류 교정(GEC)의 주요 문제인 과잉 교정을 완화하기 위한 새로운 Training-free 추론 방법을 제안합니다. 이 방법은 모델 수정이나 추가 학습 없이, 단일 모델이 생성한 여러 후보군에 대해 Edit-level Majority Voting을 수행하는 것이 핵심입니다. 영어, 체코어 등 9개 언어의 다양한 벤치마크에서 테스트되었으며, 기존 방식보다 우수한 성능과 안정적인 교정 품질을 입증했습니다.
본 연구는 대규모 언어 모델(LLMs)을 활용한 아동용 영어 스토리 생성의 교육적 한계점, 즉 높은 난이도와 운영 비용 문제를 해결하고자 합니다. 기존 전문가 커리큘럼과 GPT-4o 및 Llama 3.3 70B로 생성된 데이터를 사용하여 세 가지 소형 LLM(8B 파라미터)을 미세 조정하는 방법을 제안합니다. 이 방법론은 모델의 규모보다 '제어 가능성'에 초점을 맞추어, 교육자가 아동의 독서 수준과 안전성을 정밀하게 조절할 수 있는 저렴하고 효과적인 영어 스토리 생성 시스템을 구축했습니다.
월드 모델은 환경의 역학을 학습하여 에이전트가 행동 결과를 예측하게 하지만, 엔터프라이즈 시스템의 경우 역학이 배포 환경과 테넌트별 비즈니스 로직에 따라 끊임없이 변화하는 '배포 시점 변화(deployment shift)' 문제가 발생합니다. 본 연구는 전이 역학이 설정 가능하고 읽을 수 있는 환경에서는 에이전트가 모든 것을 학습할 필요 없이, 추론 시점에 시스템 설정을 읽어 런타임 탐색을 통해 예측을 활성 시스템 인스턴스에 근거하게 함으로써 오프라인 학습의 한계를 보완할 수 있음을 제안합니다. 이를 위해 'CascadeBench'라는 새로운 벤치마크를 도입하여, 설정 가능한 엔터프라이즈 환경에서 에이전트가 고정된 내재적 역학 대신 런타임에 전이 로직을 발견하는 메커니즘을 통합해야 함을 입증했습니다.
본 논문은 특히 중소기업(SMEs)의 마스터 데이터에서 발생하는 범주적 오분류로 인한 회복 불가능한 오류를 방지하기 위한 새로운 지표, '범주적 오류 민감도 지수(ISEC)'를 제안합니다. ISEC는 의미적 거리, 맞춤형 형태 변환 비용, 경험적 빈도를 통합하여 단일하고 수학적으로 견고한 예방적 프레임워크를 구축합니다. 이 지수는 벡터 데이터베이스 아키텍처를 활용하여 계산 효율성을 높였으며, 다양한 산업의 실제 데이터를 통해 그 유효성이 검증되었습니다.
본 연구는 LLM-as-a-Judge가 생성한 난이도 등급 중 인간 평가자(Human Raters)와 불일치할 가능성이 높은 항목을 사전에 예측하고 재평가를 요청하는 방법을 제안합니다. 기존 방식과 달리, 이 방법은 LLM의 생성 시점 확률 신호에 의존하지 않고, 대신 난이도가 서열 척도라는 특성과 임베딩 공간의 기하학적 일관성을 활용하여 불일치 후보를 식별합니다. GPT-OSS-120B 및 Qwen3-235B-A22B 모델을 사용한 실험 결과, 제안된 방법이 기존 확률 기반 방식보다 높은 AUC로 인간 평가자와의 불일치를 예측하는 성능을 입증했습니다.
본 기사는 LLM 에이전트 훈련의 표준 방법인 Rejection Fine-Tuning (RFT)의 한계를 지적하고, 이를 개선한 Step Rejection Fine-Tuning (SRFT)을 제안합니다. RFT는 실패한 전체 궤적을 폐기하는 반면, SRFT는 크리틱 LLM을 사용하여 궤적의 개별 단계(step)가 정확한지 평가합니다. 이 방법을 통해 모델은 오류를 재현하지 않으면서도 오류로부터 회복하는 능력을 학습하며, SWE-bench Verified 테스트에서 RFT보다 더 높은 해결률 향상(3.7% vs 2.4%)을 보여주었습니다.