Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.

NVIDIA가 Hugging Face를 통해 실시간 제로샷 스테레오 매칭 모델인 Fast FoundationStereo를 출시했습니다. 이 모델은 기존 파운데이션 모델 대비 정확도를 유지하면서도 속도를 10배 향상시킨 것이 특징입니다.

Wan-Streamer는 언어, 오디오, 비디오를 단일 Transformer 모델로 처리하는 세계 최초의 엔드 투 엔드 네이티브 스트리밍 AI 모델입니다. 기존의 단계별 파이프라인을 제거하여 1초 미만의 지연 시간과 자연스러운 전이중(full-duplex) 비디오 대화 경험을 제공합니다.

그래디언트 분리 기반의 스택형 상보적 손실(SCL)을 활용하여 도메인 적응형 객체 탐지 성능을 높이는 연구를 소개합니다. 도메인 간의 차이를 극복하여 미학습 도메인에서도 정확한 객체 탐지가 가능하도록 설계되었습니다.
Transformer 모델에서 토큰의 순서 정보를 제공하는 위치 임베딩(Positional Embeddings)의 중요성과 원리를 설명합니다. APE, RPE, RoPE 등 위치 정보를 주입하는 다양한 방식의 차이점을 다룹니다.
과학적 탐구 주기 전반을 평가하기 위한 과학자 정렬 벤치마크인 SGI-Bench를 소개합니다. 심사숙고, 구상, 실행, 인지의 4단계 주기를 통해 AI의 과학적 일반 지능(SGI)을 다각도로 측정합니다.

GPT-5, Claude 3.5, Gemini 2.5 Pro 등 주요 프런티어 AI 모델을 대상으로 멀티모달 의료 추론 능력을 스트레스 테스트한 연구 결과입니다. 테스트 결과, 모델들이 결함이 있는 추론, 부적절한 지름길 사용, 환각 현상을 보이며 의료 분야에 즉시 적용하기에는 아직 미흡함이 드러났습니다.
KAPRO 논문을 통해 AI 모델이 이미 알고 있는 지식임에도 불구하고 반사적으로 외부 도구에 의존하는 현상을 분석합니다. 이는 AI의 자기 인식 문제뿐만 아니라 인간의 인지적 아웃소싱 문제와도 맞닿아 있음을 시사합니다.
코딩 에이전트가 단순히 작업을 완료하는지를 넘어, 사용자의 워크플로우와 선호도를 얼마나 잘 따르는지 측정하는 새로운 평가 프레임워크를 소개합니다. 연구 결과, 적절한 기술(skill)이 제공될 경우 저렴한 모델도 플래그십 모델에 근접하는 성능을 보였습니다.

Hugging Face에서 화제가 된 10가지 최신 AI 논문을 소개합니다. 에이전트 메모리 시스템, 비디오 생성, 멀티모달 모델링 등 AI 기술의 주요 발전 방향을 다룹니다.

심층 신경망(DNN)을 활용하여 영상의학과 전문의 수준의 정확도로 대퇴골 골절을 감지하는 기술에 관한 연구입니다. 의료 영상 분석 분야에서 AI의 높은 성능을 입증합니다.
Baidu가 30억 파라미터 규모의 오픈 OCR 모델인 'Unlimited OCR'을 발표했습니다. Reference Sliding Window Attention(R-SWA) 기술을 통해 40페이지 이상의 긴 문서도 KV 캐시를 일정하게 유지하며 단 한 번의 패스로 전사할 수 있습니다.

위성 군집과 로켓 발사가 성층권 오존층 및 지구 온난화에 미치는 영향을 다룬 연구들을 소개합니다. 로켓 배출물과 우주선 재진입 시 발생하는 금속 입자가 대기 화학에 미치는 잠재적 위험성을 경고합니다.
AI 기술, 특히 CNN을 활용한 혈액 도말 이미지 분석이 말라리아 진단에서 높은 정확도와 속도를 보여주고 있습니다. 하지만 실제 임상 적용을 위해서는 데이터셋의 다양성 확보와 인프라 문제 해결이 필수적입니다.
중국 연구소들이 빠른 출시 속도를 무기로 오픈 웨이트(Open-weight) 모델 생태계를 확장하며 폐쇄형 연구소들과 차별화된 전략을 펼치고 있습니다. GLM-5.2, MiniMax M3, Kimi K2.7-Code 등 강력한 성능과 긴 컨텍스트를 갖춘 모델들이 지속적으로 공개되고 있습니다.
오픈 소스 LLM이 GPT-4o 수준에 근접하며 기업의 AI 배포 패러다임이 셀프 호스팅으로 변화하고 있습니다. 양자화 기술과 추론 최적화 덕분에 비용 효율성과 데이터 프라이버시를 확보한 모델 구동이 가능해졌습니다.

ByteDance Seed가 T2I, 로컬 및 글로벌 편집을 통합한 단일 플로우 모델인 DanceOPD를 출시했습니다. 이 모델은 기존 증류 방식보다 10배 높은 효율성을 자랑하며, 높은 벤치마크 성능을 유지합니다. 또한 NVIDIA는 Blackwell GPU에 최적화된 753B 파라미터 규모의 GLM-5.2 모델을 출시했습니다.

ViQ는 이산적 시각적 토크나이저와 연속적 인코더 사이의 간극을 메우는 새로운 기술입니다. 모든 해상도에서 이미지를 이산 코드로 처리하여 멀티모달 학습 시간을 20~70%까지 단축할 수 있습니다.
arXiv는 전통적인 학술지와 달리 동료 검토를 거치지 않는 배포 메커니즘이며, AI 빌더들에게는 혁신의 가공되지 않은 데이터를 가장 빠르게 접할 수 있는 핵심 정보원입니다. 공식 출판을 기다리기보다 arXiv를 전략적 정보 피드로 활용하여 기술 격차를 줄여야 합니다.

Graphical Lasso와 신경망(Neural Networks)을 결합하여 네트워크 규모의 교통 모델링 및 예측을 수행하는 연구를 다룹니다. 복잡한 교통 네트워크의 구조적 관계를 파악하고 예측 정확도를 높이는 방법론을 제시합니다.
Elon Musk의 경고와 小西寛子 연구자의 FCL(False-Correction Loop) 연구를 통해 LLM의 구조적 결함을 분석합니다. AI가 사용자의 잘못된 정정을 수용하여 오류를 더욱 확신하며 반복하는 현상을 다룹니다.