Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.

GigaWorld-Policy-0.5 모델이 로봇 제어에 사용되는 로컬 RTX 4090 환경에서 85ms의 추론 시간을 달성했습니다. 이 모델은 Mixture-of-Transformers 아키텍처를 활용하여 시각적 역학과 액션 생성을 분리함으로써, 실시간 배포가 가능하도록 최적화되었습니다.
SemEval-2026 Task 8의 우승팀인 RaguTeam이 GPT-4o-mini를 기반으로 인스턴스당 7개의 다양한 LLM을 조합하는 '심사위원 주도 앙상블(Judge-led Ensemble)' 방식을 사용하여 대회에서 최고 성과를 거두었습니다. 이들의 접근 방식은 단순히 크기가 큰 초대형 모델들(120B급)의 성능을 능가했습니다. 또한, RaguTeam은 대규모 모델들과 경쟁할 수 있는 고성능 7B 전문 모델인 Meno-Lite-0.1도 공개하여 연구 커뮤니티에 기여했습니다.
이 기술은 LLM(대규모 언어 모델)의 추론 능력을 향상시키기 위해 '무의미한 내용'(예: Lorem Ipsum)을 활용하는 방법을 제시합니다. LoPE(Lorem Ipsum Prompt Enhancement)라는 기법은 특히 GRPO와 같은 방법론이 제로-어드밴티지 문제에 직면할 때, 프롬프트 앞에 무작위 또는 의미 없는 텍스트를 추가하여 모델의 추론 경로를 '직교적'으로 열어줍니다. 이 접근 방식은 17억 개에서 70억 개의 매개변수를 가진 다양한 크기의 모델 전반에 걸쳐 수학적 성능 향상을 입증했습니다.
Stable-GFlowNet은 생성 흐름 네트워크(Generative Flow Networks, GFNs)의 불안정성을 해결하기 위해 설계된 모델입니다. 이 모델은 쌍별 비교와 견고한 마스킹 기법을 활용하여 모드 붕괴를 방지하고 다양성을 유지합니다. 특히 '유창성 안정화 장치(fluency stabilizer)'를 도입함으로써 난해한 출력을 효과적으로 제거하고, 다양한 레드팀 공격 시나리오에서 높은 성능과 안정성을 입증했습니다.
MiniCPM-o 4.5는 실시간으로 보고, 듣고, 말하는 기능을 갖춘 9B 매개변수 모델입니다. 이 모델은 Gemini 2.5 Flash에 근접한 성능을 보이면서도 12GB RAM 미만의 엣지 디바이스에서도 구동될 수 있도록 최적화되었습니다.
이 논문은 언어 에이전트(language agents)를 위한 지속적인 스킬 라이브러리를 구축하는 통합 프레임워크를 제시합니다. 이 프레임워크는 단일 정책을 훈련하여 공유된 보상 신호로부터 스킬을 동시에 선택, 활용 및 증류함으로써 성능을 향상시킵니다. 그 결과, ALFWorld와 WebShop과 같은 환경에서 기존의 스킬 기반 및 강화 학습(RL) 기준 모델들을 능가하는 성능을 보여줍니다.
MiA-Signature는 인지과학적 영감을 받아 전역 기억 활성화(global memory activation)를 컴팩트한 서명으로 압축하는 새로운 방법을 제시합니다. 이 기술은 하모드 선택(harmonic selection)을 활용하여 방대한 컨텍스트 내의 핵심 정보를 효율적으로 포착하고, 이를 RAG 및 에이전트 시스템과 같은 복잡한 추론 환경에서 효과적으로 사용할 수 있게 합니다.
Microsoft가 Hugging Face에 Phi-Ground-Any라는 4B 파라미터 시각 모델을 출시했습니다. 이 모델은 GUI(Graphical User Interface) 환경에서 grounding 작업을 수행하도록 설계되었으며, ScreenSpot-pro와 UI-Vision 같은 벤치마크에서 최고 수준의 성능(SOTA)을 달성했습니다. 이를 통해 AI 에이전트가 화면 요소를 높은 정확도로 인식하고 클릭할 수 있게 하는 데 기여합니다.
이 기술 기사는 Microsoft에서 개발한 Phi-Ground 모델을 소개하며, 이 모델은 특정 도메인이나 작업에 국한되지 않고 광범위하고 일반적인 지식 기반의 추론 능력을 갖추고 있음을 강조합니다. 해당 논문과 허깅페이스 페이지를 통해 사용자는 모델의 구조와 성능을 깊이 있게 이해할 수 있으며, 이를 활용하여 다양한 NLP 애플리케이션에 적용할 수 있습니다.
MARBLE은 다양한 평가 지표(PickScore, HPSv2, OCR, GenEval 등)에서 발생하는 전문 샘플 문제 및 기울기 충돌 문제를 해결하는 새로운 방법론입니다. 이 기술은 복잡한 수동 단계 스케줄링 과정 없이도 효과적으로 작동하여 모델의 성능을 향상시킵니다.
FFDC(Future-Flow Decision Controller)는 World Action Models(WAM)이 미래 현실과의 일관성을 기반으로 예측된 행동을 실행할지 또는 조기에 재계획할지를 적응적으로 결정하게 해주는 경량 검증기입니다. 이 프레임워크는 고정된 청크 단위 실행 방식의 한계를 극복하고, 장기적인 효율성을 유지하면서 로봇 작업의 견고성(robustness)을 향상시킵니다. 그 결과, WAM의 순방향 패스 횟수를 크게 줄이고 실행 시간을 단축하며, 실제 로봇 및 비디오 생성 태스크에서 높은 성공률 개선을 보여줍니다.
HERMES++는 3D 장면 이해와 미래 기하학 예측을 단일 프레임워크로 통합한 통합 주행 세계 모델입니다. 이 모델은 두 가지 핵심 작업 모두에서 기존의 전문적인 접근 방식들보다 뛰어난 성능을 보여줍니다. 사용자는 프로젝트 페이지, 코드 저장소, 그리고 논문 링크를 통해 상세 정보를 얻을 수 있습니다.
FFDC(Flexible Fine-grained Dynamic Chunking)는 기존의 고정된 청크 실행 방식과 달리 적응형 액션 청킹을 가능하게 하여 장기적인 효율성을 유지하면서 견고성을 향상시킵니다. 이 기술은 WAM(World Action Model)의 순방향 패스 횟수를 69% 줄이고, RoboTwin 환경에서 실행 시간을 34% 단축하는 동시에 성공률을 35% 증가시키는 성능 개선을 보여줍니다.
RLDX-1은 인간과 유사한 정교한 손가락 조작(dexterous manipulation)을 목표로 하는 Vision-Language-Action 모델입니다. 이 모델은 Multi-Stream Action Transformer를 기반으로 운동 인식, 장기 기억, 물리 감지 등 다양한 모달리티 정보를 통합하여 작동합니다. ALLEX 작업에서 86.8%의 높은 성능을 달성하며 기존 모델 대비 상당한 개선을 보여주었습니다.
제공된 정보는 특정 논문(https://huggingface.co/papers/2605.03269…)과 관련 컬렉션(https://huggingface.co/collections/RLWRLD/rldx-1…)에 대한 기술적 성능 보고서입니다. 핵심 내용은 해당 모델 또는 시스템이 RTX 5090 GPU에서 실시간 추론을 수행했을 때 스텝당 43.7ms, 즉 22Hz 이상의 높은 프레임 속도를 달성했다는 것입니다. 이는 효율적인 최적화가 이루어졌음을 시사합니다.
OceanPile은 소나(sonar), 수중 이미지, 과학적 텍스트 등 다양한 해양 데이터를 통합하여 구축된 대규모 다중 모달 코퍼스입니다. 이 데이터셋은 지식 그래프 기반의 파이프라인을 통해 OceanCorpus, OceanInstruction, OceanBench와 같은 세 가지 핵심 구성 요소를 생성합니다. 이를 통해 해양 환경에 특화된 AI 모델 학습 및 평가를 위한 강력한 자원을 제공합니다.
OceanPile은 해양 환경에 특화된 대규모 다중 모달 코퍼스를 구축한 프로젝트입니다. 소나(Sonar) 데이터, 수중 이미지, 그리고 과학적 텍스트를 통합하여 OceanCorpus, OceanInstruction, OceanBench라는 세 가지 핵심 자원을 생성합니다. 이 과정은 지식 그래프 안내 파이프라인을 활용하여 해양 기반 AI 모델의 학습 및 평가에 필요한 풍부하고 구조화된 데이터를 제공하는 것을 목표로 합니다.
AllenAI의 MolmoAct2는 실제 로봇 배포 환경에 최적화된 완전 오픈 액션 추론 모델입니다. 이 모델은 720시간이라는 방대한 규모의 오픈 바이만수를 자랑하며, 전문 공간 추론 백본을 통해 지연 시간을 줄이면서도 GPT-5나 Gemini와 같은 대규모 언어 모델(LLM)에 필적하는 적응적 깊이의 추론 능력을 제공합니다.
본 기술 기사는 대규모 시각 언어 모델(LVLMs)이 텍스트 히스토리가 길어짐에 따라 발생하는 '시각 신호 희석' 문제를 해결하는 방법을 제시합니다. 이를 위해, 시각 검색 정보를 텍스트 입력의 성장으로부터 독립적으로 보호하는 병렬 분지 구조를 도입했습니다. 이 방법은 Qwen3-VL 모델에 적은 파라미터(28M)만 추가하여도 복잡한 추론을 위한 지속적인 시각 인식 능력을 향상시킬 수 있습니다.
PVM이라는 새로운 기법을 적용하여 Qwen3-VL-8B 모델의 평균 정확도를 66.7%에서 71.5%로 크게 향상시켰습니다. 이 방법은 최소한의 오버헤드로 복잡한 추론 작업에 필요한 지속적인 시각적 인지 능력을 제공하는 것이 특징입니다.