Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
이 리포지토리는 ICML 2024 논문의 보조 자료로, RAG 시스템을 평가하기 위한 자동화된 프레임워크를 제공합니다. 이 도구는 주어진 지식 코퍼스 기반으로 LLM을 활용하여 작업별 객관식 시험을 생성하고, 이를 통해 다양한 RaG 변형들을 체계적으로 평가하며 개선하는 방법을 제시합니다.
Hugging Face는 DPO(Direct Preference Optimization)를 통해 LLM 미세 조정의 새로운 가능성을 제시했습니다. 이 기사는 DPO가 단순 챗봇 대화를 넘어, 브랜드 목소리나 특정 전문 용어에 맞춰 AI 출력을 정렬하는 광범위한 응용 분야를 설명합니다. 에이전시는 이를 활용해 콘텐츠 제작 워크플로우 비용을 절감할 수 있습니다.
Hugging Face가 TRL 라이브러리에 Delta Weight Sync 기능을 도입하여 수조 개의 파라미터를 가진 대규모 모델의 가중치 전송 문제를 해결했습니다. 이 기능은 거대 AI 모델 학습 및 미세 조정 과정에서 발생하는 데이터 전송 병목 현상을 근본적으로 개선합니다. 에이전시들은 이를 통해 고성능 맞춤형 AI 솔루션 개발에 대한 접근성을 높일 수 있습니다.
본 논문은 검색 증강 생성(RAG)의 성능을 최적화하기 위해 미분 가능한 데이터 보상(Differentiable Data Rewards, DDR) 기법을 제안합니다. 이 방법론은 RAG 시스템의 생성 및 지식 정제 모듈에 적용되어 전반적인 정확도를 높이는 것을 목표로 합니다.
본 논문은 Multi-modal Large Language Models (MLLMs)이 다중 모드 검색 문서를 활용하여 질문에 답하는 능력을 평가하는 $M^2RAG$ 벤치마크를 제안합니다. 이 벤치마크는 이미지 캡셔닝, multi-modal QA 등 네 가지 작업을 포함하며, Multi-Modal Retrieval Augmented Instruction Tuning (MM-RAIT) 방법을 통해 MLLMs의 지식 활용 효과를 높이는 방식을 제시합니다.
REX-RAG는 검색 증강 생성(RAG)을 위해 강화학습(RL) 기법을 적용한 프레임워크입니다. 이 시스템은 혼합 샘플링과 원칙적인 정책 교정 메커니즘을 통해 추론 막다른 길에서 벗어나 안정적이고 성능이 향상된 답변 생성을 가능하게 합니다. 다단계 추론 및 도메인 외 일반화에 강점을 보이며, 관련 코드를 GitHub에 공개했습니다.
GraphRAG-Bench는 그래프 검색 증강 생성(Graph RAG)의 성능을 평가하기 위해 개발된 도메인 특화 추론 과제 및 데이터셋입니다. 이 벤치마크는 16개 분야, 5가지 질문 유형, 그리고 7백만 단어 분량의 코퍼스를 포함합니다. 모델은 정확도와 더불어 골드 추론 과정과의 의미적 대응을 평가받습니다.
본 패키지는 중국 연구자를 위해 논문 작성, 학술 문서 생성(PPT 등), 과학적 컴퓨팅 세 가지 시나리오를 통합한 AI 스킬 묶음입니다. Claude Code와 Codex에서 직접 사용 가능하며, 여러 코딩 어시스턴트의 기능을 연결하여 원활하게 협업하는 로컬 데스크톱 AI 에이전트 허브 역할을 합니다.
Stanford와 Meta가 'Code as Agent Harness'라는 논문을 발표하며 AI 에이전트 분야에 새로운 패러다임을 제시했습니다. 이 연구는 LLM을 단순한 텍스트 생성기가 아닌, 복잡한 문제 해결을 위한 코딩 및 실행 도구로 활용하는 방법을 다룹니다.
본 문서는 그래프 검색 증강 생성(GraphRAG)의 효과와 적용 시나리오를 체계적으로 분석하기 위해 'GraphRAG-Bench'라는 포괄적인 벤치마크를 제안합니다. GraphRAG는 전통적 RAG보다 복잡한 추론과 계층적 지식 모델링에 강점을 보이지만, 실제 작업에서는 성능이 떨어지는 경우도 있어 그 효과 검증이 필요합니다.
NVIDIA가 SkillSpector라는 오픈소스(OSS)를 공개했습니다. 이 도구는 선택된 스킬이 위험한지 검사하는 기능을 제공하며, 프롬프트 인젝션, 데이터 외부 전송, 악의적인 코드 및 동작 패턴 등을 종합적으로 확인해 줍니다.
Supervisor-Skills는 박사 과정 지도교수의 10년 연구 경험을 AI 스킬 패키지로 구현한 도구입니다. 아이디어 구상부터 문헌 조사, 개요 작성, 벤치마크 설계, 논문 검토 및 최상위 학회 분석까지 구조화된 Prompt/Skill로 제공합니다.
讯飞星辰 MaaS에서 Alibaba의 최신 Qwen 모델을 개발자들에게 무료로 무제한 제공하는 이벤트를 진행합니다. 이번에 개방되는 Qwen 3.6 및 Qwen 3.5 모델은 멀티모달 능력을 지원하며, 코드, 추론, 시각 등 다양한 작업에 활용 가능하고 긴 컨텍스트 창을 갖추고 있습니다.
Anthropic이 새로운 AI 모델 'Mythos'를 곧 공개할 예정입니다. 이 신규 모델은 특히 코딩 및 복잡한 작업 처리 능력에서 큰 발전을 이룰 것으로 기대됩니다. 현재 시장에서는 Mythos가 이번 달 내에 출시될 확률을 높게 점치고 있습니다.
Alibaba의 Qwen 팀이 보상 평가를 에이전트 스킬로 재구성한 Skill-RM을 발표했습니다. 이 모델은 정적인 판단 대신, 필요한 도구를 동적으로 선택하고 작업별 증거를 집계하여 투명하고 구체적인 피드백을 제공합니다.
연구 결과, 성격 테스트와 같은 설문지 기반의 심리 측정 방식이 LLM의 실제 행동을 예측하는 데 한계가 있음이 밝혀졌습니다. Likert 응답은 일관성을 보여도, 생성 확률은 완전히 다른 패턴을 보입니다. 또한, OmniGameArena는 VLM 게임 에이전트의 실시간 벤치마크를 제공합니다.
본 기사는 On-policy distillation (OPD)이라는 새로운 연구 방법을 소개하며, 이것이 LLM을 매개변수 공간에서 재구성하는 방식을 분석합니다. OPD는 주성분 방향 회피 및 희소 업데이트를 통해 강력한 추론 능력을 유지하는 좁은 부분공간으로 빠르게 '고정'되는 특징을 가집니다. 또한, OmniGameArena이라는 VLM 게임 에이전트 실시간 UE5 벤치마크도 함께 제시되었습니다.
본 기사는 액션 월드 모델에서 메모리 메커니즘을 체계적으로 연구한 Echo-Memory에 대해 다룹니다. JD 연구진은 Context, Compression, Spatial, State-Space 등 다양한 메모리 방식을 테스트했으며, 특히 개방 영역 복귀 시 블록 단위의 State-Space 메모리가 우수한 성능을 보임을 제시합니다.
SpatialWorld는 주방부터 도시까지 8개 시뮬레이터와 760개의 인간 어노테이션된 태스크를 제공하는 플랫폼입니다. 이 데이터를 통해 GPT-5조차도 모든 태스크의 17.4%만을 해결할 수 있음을 공개하며, 멀티모달 에이전트의 실제 추론 능력 부족을 지적합니다.
본 글은 기존의 ONE-HOT 방식과 Bag Of Words의 한계를 극복하기 위해 'MULTI-HOT'이라는 새로운 특징 추출 방식을 제안합니다. 이 방식은 단어의 위치 정보(거리)를 가중치로 활용하여 문맥적 의미를 보존하며, 창 분석(Window Analysis)을 통해 문서 전체의 특징 벡터를 생성하는 방법을 설명합니다.