Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
Baidu가 30억 파라미터 규모의 오픈 OCR 모델인 'Unlimited OCR'을 발표했습니다. Reference Sliding Window Attention(R-SWA) 기술을 통해 40페이지 이상의 긴 문서도 KV 캐시를 일정하게 유지하며 단 한 번의 패스로 전사할 수 있습니다.
AI 기술, 특히 CNN을 활용한 혈액 도말 이미지 분석이 말라리아 진단에서 높은 정확도와 속도를 보여주고 있습니다. 하지만 실제 임상 적용을 위해서는 데이터셋의 다양성 확보와 인프라 문제 해결이 필수적입니다.
오픈 소스 LLM이 GPT-4o 수준에 근접하며 기업의 AI 배포 패러다임이 셀프 호스팅으로 변화하고 있습니다. 양자화 기술과 추론 최적화 덕분에 비용 효율성과 데이터 프라이버시를 확보한 모델 구동이 가능해졌습니다.
arXiv는 전통적인 학술지와 달리 동료 검토를 거치지 않는 배포 메커니즘이며, AI 빌더들에게는 혁신의 가공되지 않은 데이터를 가장 빠르게 접할 수 있는 핵심 정보원입니다. 공식 출판을 기다리기보다 arXiv를 전략적 정보 피드로 활용하여 기술 격차를 줄여야 합니다.

Graphical Lasso와 신경망(Neural Networks)을 결합하여 네트워크 규모의 교통 모델링 및 예측을 수행하는 연구를 다룹니다. 복잡한 교통 네트워크의 구조적 관계를 파악하고 예측 정확도를 높이는 방법론을 제시합니다.
Sakana AI가 출시한 Fugu는 자체 프런티어 모델을 훈련하는 대신, 기존의 강력한 모델들을 지휘하고 라우팅하는 오케스트레이션 시스템입니다. 7B 규모의 작은 모델이 작업을 분석해 최적의 모델에 할당함으로써 주요 벤치마크에서 최상위 모델들과 대등하거나 능가하는 성능을 보여줍니다.
HiLo-Token은 입력 적응형 고주파-저주파 토큰 압축 기술을 통해 확산 모델의 지연 시간을 획기적으로 줄이는 연구입니다. 편집 마스크 크기에 따라 토큰을 효율적으로 가지치기하여 생성 품질을 유지하면서도 최대 3.13배의 속도 향상을 달성했습니다.

Goku는 흐름 기반(Flow-based) 방식을 사용하는 비디오 생성 파운데이션 모델에 관한 연구입니다. 비디오 생성 분야의 새로운 접근법을 제시합니다.
OpenAI의 보상 모델(Reward Model)이 특정 사용자층의 선호도를 과도하게 학습하여 발생한 '고블린 사건'을 다룹니다. 소수 사용자의 피드백이 강화학습 과정에서 편향을 일으켜 모델의 행동 양식을 왜곡하고 출시 지연을 초래한 사례를 분석합니다.

자기 지도 사전 학습(Self-supervised Pre-training)을 활용하여 픽셀 공간에서 엔드 투 엔드 모델링을 수행하는 연구를 다룹니다. 데이터의 레이블 없이도 픽셀 단위의 정보를 직접 학습하는 모델링 기법을 제안합니다.
산불 대피 물류 네트워크의 복잡성을 해결하기 위해 체화된 에이전트 피드백 루프와 희소 연합 표현 학습(SFRL)을 결합한 연구를 소개합니다. 중앙 집중식 모델의 한계를 극복하고 분산된 환경에서 실시간으로 회복 탄력성 있는 대피 경로를 예측하는 방법을 다룹니다.

파운데이션 모델을 활용한 범용 로봇 기술의 발전 방향을 조사하고 메타 분석한 연구 내용을 다룹니다. 로봇 공학에 대규모 모델을 적용하는 최신 동향을 살펴봅니다.
기존 LLM의 사후 수정 방식 대신, 공형 기하 대수(Conformal Geometric Algebra)를 활용해 비일관성을 구조적으로 차단하는 CORE 시스템을 소개합니다. 모든 상태를 versor로 표현하여 대수적 불변량을 강제함으로써, 검사 가능하고 재현 가능한 인지 시스템을 구축하는 방법을 다룹니다.
Google이 Gemini 3.5 Flash에 'Computer Use' 기능을 통합하여 OSWorld 벤치마크에서 78.4점을 기록했습니다. 이는 GPT-5.5와 대등한 성능으로, 모델이 화면과 브라우저를 직접 조작하며 에이전트 역할을 수행할 수 있음을 보여줍니다.
LLM 공격의 성공률(ASR)을 낮추기 위해 악성 프롬프트를 직접 차단하는 대신, 성공한 것처럼 보이는 무의미한 응답을 제공하는 'Misdirection Proxy' 기술을 소개합니다. 이 방식은 공격자가 탈옥에 성공했다고 착각하게 만들어 공격 시도를 지속하게 유도함으로써 ASR을 20%에서 0-2%로 대폭 감소시킵니다.
학술 논문의 이미지 조작 및 중복을 탐지하기 위해 AI 기반의 위험 점수(risk score) 산출 방식을 제안합니다. AI가 의심스러운 부분을 플래깅하면 편집자가 최종 검토하는 인간 중심의 워크플로우를 통해 학술지의 신뢰성을 높일 수 있습니다.

의료 영상 분야의 AI 도입 현황과 FDA 승인 트렌드를 분석합니다. Aidoc와 Viz.ai 같은 주요 플레이어의 성과를 소개하며, 모델의 일반화 격차(generalizability gap) 문제를 지적합니다.

지속 학습(Continual Learning) 과정에서 발생하는 파괴적 망각(Catastrophic Forgetting) 현상의 개념과 원인을 다룹니다. 새로운 데이터를 학습할 때 기존에 습득한 지식이 손실되는 문제를 이해하는 데 중점을 둡니다.
LLM과 강화학습(RL)의 통합을 통해 LLM을 환경과 상호작용하는 에이전트로 진화시키는 최신 연구 동향을 다룹니다. RLHF를 넘어 온라인 RL을 활용한 에이전트 루프 구성 방식과 그에 따른 인프라적 과제를 분석합니다.
Qwen-AgentWorld는 단일 모델 내에서 7가지 서로 다른 에이전트 환경을 시뮬레이션할 수 있는 최초의 언어 세계 모델(Language world model)입니다. 환경별로 별도의 스캐폴딩이 필요했던 기존 에이전트 시스템의 문제를 해결하며, 통합된 내부 표현을 통해 다양한 도메인에서의 에이전트 성능을 극대화합니다.