Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.

NVIDIA가 발표한 LocateAnything-3B는 자연어 질의를 통해 이미지 내 객체의 정확한 위치를 찾아내는 시각적 접지(Visual Grounding) 특화 비전-언어 모델입니다. 기존 객체 탐지 모델과 달리 사전 정의된 클래스에 의존하지 않고 복잡한 자연어 명령을 이해하여 경계 상자를 반환합니다.

이미지 인식을 위해 합성곱(Convolutions)의 완전 연결 계층을 재매개변수화하는 RepMLP 기술을 소개합니다. 모델의 효율성과 성능을 최적화하는 새로운 구조적 접근 방식을 다룹니다.
AI 에이전트가 메모리를 요약하거나 재작성할 때 성능이 급격히 저하된다는 연구 결과를 소개합니다. LLM의 선택 편향과 재작성 드리프트로 인해 정보가 왜곡되는 문제를 지적하며, 원시 데이터를 보존하는 '추가 전용(append-only)' 아키텍처를 대안으로 제시합니다.
새로운 프론티어 모델의 출시 대신 AI 산업이 전략적 통합 단계로 진입하고 있습니다. Nex N2 Pro의 파격적인 가격 정책과 Gemini 3.1 Flash Image 등 실질적인 배포와 활용에 집중하는 흐름을 다룹니다.

SplatAD는 3D Gaussian Splatting 기술을 활용하여 Lidar 데이터와 카메라 영상을 실시간으로 렌더링할 수 있는 기술입니다. 이를 통해 고품질의 실시간 3D 시각화가 가능해집니다.

이미지-비디오 합성 기술을 활용하여 캐릭터의 일관성을 유지하며 애니메이션을 생성하는 연구를 소개합니다. 제어 가능한 합성 방식을 통해 캐릭터의 특징을 보존하면서 자연스러운 움직임을 구현합니다.
에이전트의 장기 과제 수행을 위해 지속적인 세계 모델(Persistent world models)을 구축하는 최신 연구를 소개합니다. 선형 시간 어텐션과 그래프 메모리를 활용해 관찰 공백기에도 상태를 유지하며, 컴퓨팅 비용을 효율적으로 관리하는 기술적 방안을 다룹니다.
DSpark는 병렬 드래프터의 토큰 간 의존성 부재 문제를 해결하기 위해 준자기회귀 생성과 신뢰도 스케줄링을 결합한 추측 디코딩 프레임워크입니다. 병렬 백본과 경량 순차 모듈을 결합하여 수락률 저하를 방지하고, 하드웨어 인지 스케줄러를 통해 검증 길이를 동적으로 조정하여 추론 속도를 극대화합니다.
DSpark는 추측적 디코딩(Speculative Decoding)을 동적이고 적응적인 스케줄링 방식으로 확장하여 LLM의 추론 속도를 혁신적으로 높이는 연구 프레임워크입니다. 벤치마크 결과 출력 품질 저하 없이 지연 시간을 최대 3.1배 단축하며 컴퓨팅 비용 절감 효과를 입증했습니다.
Google Research가 공개한 TimesFM은 방대한 데이터를 사전 학습하여 제로샷 시계열 예측이 가능한 디코더 전용 파운데이션 모델입니다. 최신 버전은 파라미터 수를 줄이면서도 컨텍스트 길이를 확장하여 효율성과 성능을 동시에 잡았습니다.

JetSpec은 인과적 병렬 트리 초안 작성(Causal Parallel Tree Drafting)을 통해 추측적 디코딩의 한계를 극복한 새로운 방법론입니다. 단 한 번의 순방향 패스로 토큰 트리를 생성하여 수학 분야에서 최대 9.64배의 속도 향상을 달성했습니다.
DeepSeek가 특수 하드웨어 없이도 DeepSeek-V4 Flash의 생성 속도를 60~85% 향상시키는 추측적 디코딩 프레임워크인 DSpark를 발표했습니다. DSpark는 준-병렬 아키텍처를 통해 기존 방식의 한계를 극복하고 GPU 메모리 대역폭 문제를 알고리즘으로 해결합니다.

GLP-1 약물인 Ozempic이 체중 감량뿐만 아니라 항우울 효과를 가질 수 있다는 연구 결과가 발표되었습니다. 이 효과는 장내 미생물과 밀접하게 연관되어 있으며, 특정 미생물이 엔도카나비노이드를 생성함으로써 정신 건강에 영향을 미치는 것으로 나타났습니다.
CodeScope는 LLM의 코딩 능력을 측정하기 위한 실행 기반의 다국어·다중 작업·다차원 평가 벤치마크입니다. 43개의 프로그래밍 언어와 8개의 작업을 통해 코드 이해 및 생성 성능을 종합적으로 평가하며, ACL 2024 메인 컨퍼런스에 채택되었습니다.

Meta FAIR의 Autodata는 에이전트 기반의 합성 데이터 생성 방식을 통해 4B 모델이 397B 모델의 성능을 능가하는 결과를 보여주었습니다. 기존 합성 데이터의 품질 통제 문제를 해결하기 위해 Challenger, Weak/Strong Solver, Judge로 구성된 에이전트 파이프라인을 활용합니다.
중국 Z. AI가 OpenAI와 Anthropic의 폐쇄형 모델에 필적하는 오픈 소스 모델 GLM 5.2를 출시했습니다. 이 모델은 지식 증류(distillation) 기술을 통해 높은 성능을 확보했으며, 자체 강화학습이 가능한 수준에 도달하여 기술 격차를 빠르게 좁히고 있습니다.
Claude Opus 4.6을 대상으로 6,000회 이상의 프롬프트 인젝션 공격을 시도한 결과, 모든 공격이 성공적으로 차단되었습니다. 이는 프론티어 모델의 보안 학습이 개선되었음을 보여주지만, 새로운 공격 벡터에 대한 잠재적 위험은 여전히 존재합니다.

Sakana AI가 발표한 Fugu는 단일 거대 모델 대신 다양한 모델을 쿼리별로 동적으로 라우팅하고 조합하는 오케스트레이터 기술입니다. SFT와 GRPO 등을 통해 학습된 이 시스템은 각 모델의 강점에 맞춰 최적의 워크플로우를 구성합니다.
ICED는 대규모 언어 모델(LLM)의 지시 이행 및 추론 능력을 소형 언어 모델(SLM)로 효율적으로 압축하여 전달하는 학습 프레임워크입니다. 이를 통해 공개된 SLM-FRIDGE-0.5B 모델은 Qwen2.5-0.5B 아키텍처를 기반으로 높은 벤치마크 성능을 보여줍니다.
Orthrus diffusion head를 기반으로 한 Qwen 3.5, 3.6 및 Gemma 4 모델의 출시를 예고합니다. 모델 체크포인트와 함께 엔드 투 엔드 학습 및 평가 코드가 오픈 소스로 공개될 예정입니다.