Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
텍스트 생성 과정에서 시각적 제어(Visual Controls)를 삽입하여 언어 모델의 출력을 조절하는 새로운 방법을 다룹니다. 템플릿과 스니펫을 활용해 FAQ 답변이나 재사용 가능한 콘텐츠를 효율적으로 생성하는 기술적 접근을 소개합니다.
DeepSeek가 Claude 대비 약 10배 저렴한 비용으로 멀티모달 기능을 제공하는 DeepSeek Vision을 출시했습니다. 이미지 인식 모드는 단순 OCR을 넘어 차트 분석 및 데이터 추출이 가능하며, 효율적인 KV 캐시 사용을 통해 압도적인 비용 경쟁력을 확보했습니다.
Embodied AI 및 월드 모델 분야의 최신 투자 동향과 연구 논문을 다룹니다. Waymo의 리콜 이슈, 다양한 AI 스타트업의 대규모 펀딩 소식과 함께 로봇 조작을 위한 새로운 프레임워크 및 데이터 전환 연구를 소개합니다.
Z.ai가 MIT 라이선스의 753B 파라미터 MoE 모델인 GLM-5.2를 출시했습니다. 이 모델은 오픈 웨이트 모델 중 성능 1위를 기록했으며, 100만 토큰의 컨텍스트 윈도우를 제공합니다.
AI 기술이 신약 개발의 전통적인 파이프라인을 혁신하여 후보 물질 식별 시간을 5년에서 46일로 단축시키고 있습니다. Insilico Medicine의 사례와 DeepMind의 AlphaFold 3를 통해 AI가 타겟 발견부터 구조 예측까지 어떻게 효율성을 극대화하는지 분석합니다.
이벤트 기반 비전(Event-based Vision) 기술을 위한 딥러닝 방법론을 종합적으로 조사하고 벤치마크를 수행한 연구 논문입니다. 기존 프레임 기반 비전과 차별화되는 이벤트 센서의 특성과 이를 활용한 최신 딥러닝 모델들을 다룹니다.
스마트 농업 마이크로그리드의 에너지 최적화를 위해 생성적 시뮬레이션 벤치마킹과 역 시뮬레이션 검증을 결합한 연구를 소개합니다. 정적 벤치마크의 한계를 극복하고 생성 모델을 통해 복잡하고 역동적인 농업 환경 시나리오를 생성하여 AI 시스템을 검증하는 방법을 다룹니다.
FlashMemory-DeepSeek-V4 논문은 Lookahead Sparse Attention(LSA) 기술을 통해 KV Cache 점유율을 13.5%로 획기적으로 절감하는 방법을 제안합니다. Neural Memory Indexer를 활용해 필요한 캐시 청크만을 예측하여 로드함으로써, 긴 컨텍스트 디코딩 시 발생하는 메모리 병목 문제를 해결합니다.
GLM-5.2는 1M 토큰의 대규모 컨텍스트 윈도우를 지원하여 장기 코딩 작업에 최적화된 모델입니다. IndexShare 기술을 통해 긴 컨텍스트 처리 시 발생하는 연산 비용을 획기적으로 절감하며 실질적인 개발 워크플로우 지원을 목표로 합니다.
MiniMax가 100만 토큰의 컨텍스트 윈도우를 지원하는 오픈 웨이트 멀티모달 모델 M3를 출시했습니다. MSA(MiniMax Sparse Attention) 기술을 통해 긴 컨텍스트 추론 시 발생하는 비용과 연산 병목 문제를 혁신적으로 해결했습니다.
z.ai에서 출시한 오픈 웨이트 모델 GLM-5.2의 성능과 실무 적용 가능성을 테스트한 리뷰입니다. GLM-5.2는 이전 버전 대비 지능 지수가 크게 향상되었으며, 특히 컨텍스트 윈도우가 100만 토큰으로 확장되어 에이전틱 코딩에 최적화되었습니다.
CoALA(Cognitive Architectures for Language Agents) 프레임워크를 통해 언어 에이전트의 인지 구조를 분석합니다. LLM을 단순 추론기가 아닌 메모리, 행동, 결정 루프를 갖춘 인지 시스템의 구성 요소로 정의하며, 지능의 핵심인 메모리 구조화 방안을 제시합니다.
Anthropic의 Claude Fable 5가 Artificial Analysis AI Index에서 1위를 차지한 배경을 분석합니다. 단순한 성능 지표를 넘어 거버넌스, 평가 파이프라인, 장기적 워크플로 시뮬레이션 능력이 새로운 AI 에이전트의 기준이 되고 있음을 설명합니다.
Transformer의 어텐션 메커니즘 대신 학습된 기하학적 관계를 활용하는 새로운 언어 모델 연구인 DRM Language Emitter를 소개합니다. 이 모델은 잠재 상태의 움직임을 통해 언어를 생성하며, 셀프 어텐션이나 KV 캐시 없이도 자기회귀적 생성이 가능함을 탐구합니다.
생성된 데이터셋을 활용하여 분류 모델의 강건성(Robustness)을 높이는 방법에 대해 다룹니다. 현실의 불확실성을 상상력을 통해 데이터로 구현하여 모델의 성능을 개선하는 접근법을 제시합니다.
12개의 다양한 AI 모델을 대상으로 월드컵 경기 예측 실험을 진행하여 모델의 성능과 편향성을 테스트했습니다. 실험 결과, 특정 모델의 우위보다는 모델들이 가진 '정배당 편향(favorite bias)'과 예측 패턴을 확인하는 데 중점을 두었습니다.
최근 LLM 학습 연구에서 단일 점수 형태의 스칼라 보상 대신, 평가 기준(Rubric)을 활용한 구조화된 피드백의 중요성이 부각되고 있습니다. 루브릭 조건부 자기 증류 방식은 모델에게 구체적인 개선 방향을 제공하여 학습 신호의 품질을 높입니다.
Google DeepMind가 발표한 DiffusionGemma 26B는 기존의 자기회귀 방식 대신 이산 확산(Discrete Diffusion) 기술을 사용하여 텍스트를 병렬로 생성하는 오픈 웨이트 모델입니다. 이 방식은 낮은 배치 크기에서도 H100 GPU 기준 초당 1,000개 이상의 토큰을 생성할 수 있어 지연 시간에 민감한 워크로드에 혁신적인 성능을 제공합니다.
Google DeepMind가 발표한 DiffusionGemma는 이미지 생성의 노이즈 제거 방식을 텍스트 생성에 적용하여 초당 1,000개 이상의 토큰을 생성하는 모델입니다. 기존 자기회귀 방식과 달리 텍스트 블록을 병렬로 처리하여 처리량을 약 4배 향상시켰습니다.
STU-Net은 대규모 지도 사전 학습을 통해 확장성과 전이 가능성을 높인 의료 영상 분할 모델입니다. 의료 영상 분야에서 효율적인 학습과 적용을 목표로 합니다.