Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
Chandra OCR 2는 레이아웃 정보를 보존하며 이미지와 PDF를 HTML, Markdown, JSON 등 구조화된 데이터로 변환하는 최첨단 OCR 모델입니다. 90개 이상의 언어와 수학, 표, 필기체 등을 지원하며 olmocr 벤치마크에서 높은 성능을 입증했습니다.
AI 분야의 발전을 이끌 7가지 핵심 연구 동향을 소개합니다. 코딩 LLM의 효율화, 웹 에이전트의 자기 증류, 세계 모델 및 체화된 AI, 강화학습 알고리즘 개선 등 최신 연구 성과를 다룹니다.

GEPO는 이질적인 태스크에서 탐색과 활용의 균형을 맞추기 위해 그룹 엔트로피를 활용하는 GRPO의 경량 확장 버전입니다. 또한 Cura 1T는 재귀적 자기 개선 루프를 통해 의료 벤치마크에서 뛰어난 성능을 보여주는 모델입니다.

SWE-Pruner Pro는 코딩 LLM이 자신의 은닉 상태를 분석하여 토큰을 효율적으로 가지치기하는 기술입니다. 작업 품질을 유지하면서도 최대 39%의 토큰을 절약할 수 있는 효율적인 추론 방식을 제안합니다.
AI 에이전트를 활용하여 연구 논문을 작성하고 실험을 수행하는 새로운 워크플로우를 소개합니다. 단순한 글쓰기 보조를 넘어, 논문 독해, 실험 설계 및 실행, 동료 검토 단계에서 AI 모델을 어떻게 전략적으로 활용하는지 다룹니다.

SWE-Pruner Pro는 코딩 에이전트의 내부 표현을 활용하여 도구 출력의 컨텍스트를 효율적으로 가지치기하는 기술입니다. 별도의 분류기 없이 에이전트 자체의 인코딩을 사용하여 토큰을 최대 39% 절약하며 작업 품질을 유지합니다.

Nvidia가 AI 생성 비디오를 최대 92%의 정확도로 식별할 수 있는 'Synthetic Video Detector(SVD)'를 출시했습니다. 이 도구는 Vision Transformer 기술을 활용해 프레임 단위의 미세한 아티팩트를 분석하여 가짜 영상을 탐지합니다.
AI 기반 사이버 공격에서 공격자가 자신의 흔적(TTPs)을 마스킹하는 방법과 그럼에도 불구하고 숨기기 어려운 공격 동기(Motive)의 비대칭성을 분석합니다. 공격자는 도구와 기법은 바꿀 수 있지만, 타겟 선정과 같은 근본적인 목적은 드러내기 쉽다는 점을 강조합니다.
Moonshot AI의 Kimi K3와 Thinking Machines Lab의 Inkling 등 대규모 오픈 웨이트 모델들이 연이어 출시되었습니다. 또한 OpenAI가 Codex를 ChatGPT에 통합하며 코딩 도구 시장의 변화와 에이전트 인프라 구축이 가속화되고 있습니다.

OpenAI가 풀 듀플렉스(Full-Duplex) 기술을 적용한 새로운 음성 모델 GPT-Live-1을 발표했습니다. 이 모델은 발화와 청취를 동시에 처리하여 사람과 대화하는 듯한 자연스러운 경험을 제공하며, 실시간 번역 및 대기 지시 기능을 지원합니다.

CPU 네이티브 LLM 구축을 위한 30M 파라미터 규모의 파일럿 학습 실험 과정을 공유합니다. 삼진 양자화와 멀티 GPU 스케일링 등은 성공했으나, 서로 다른 토크나이저를 사용하는 교사 모델로부터의 지식 증류(Distillation) 실험은 교차 엔트로피 방식에 미치지 못해 실패했음을 밝힙니다.
오픈 웨이트 모델의 진정한 목적이 개인의 로컬 실행이 아닌, 산업적 규모의 인프라 구축에 있음을 분석합니다. 모델 자체는 무료로 공개되더라도 이를 구동하기 위한 컴퓨팅 자원과 클라우드 생태계에서 수익이 발생하는 비즈니스 모델의 변화를 다룹니다.
Alibaba의 Qwen2.5 오픈 모델은 7B 파라미터 크기로 안드로이드 스마트폰에서도 로컬 실행이 가능합니다. 힌디어와 영어가 섞인 Hinglish를 포함한 20개 이상의 인도 언어를 지원하여 기업과 트레이더에게 비용 효율적인 다국어 AI 솔루션을 제공합니다.
Google의 Gemma 4-26B는 16GB RAM을 탑재한 일반 노트북에서도 실행 가능한 260억 파라미터 규모의 오픈 웨이트 모델입니다. 데이터 프라이버시, 비용 절감, 신뢰성 확보를 위해 기업 환경에서 로컬 AI 추론의 중요성을 강조합니다.
복수 내 종양 관련 대식세포(TAMs)의 높은 이질성을 극복하기 위한 정밀 유세포 분석 전략을 제시합니다. 단순 마커 나열을 넘어 세포 기원, 대사 재프로그래밍, 공간적 상호작용을 고려한 다차원적 접근법을 다룹니다.

양자 최적 제어(QOC)의 한계를 극복하기 위해 LLM 기반의 자율 설계 프레임워크인 QOC-Workbench를 소개합니다. 기존의 수작업 방식에서 벗어나 LLM이 제어 프로토콜을 발견, 검증 및 개선하는 새로운 패러다임을 제시합니다.
복수 내 종양 관련 대식세포(TAMs)의 이질성과 기능적 가소성을 분석하기 위한 심층 유세포 분석 전략을 다룹니다. 단순 마커 검출을 넘어 다중 파라미터 패널과 차원 축소 알고리즘을 활용한 기능적 상태 정량화의 중요성을 강조합니다.
세 명의 최소 에이전트가 소멸하는 공유 메모장을 활용해 자발적으로 문화를 형성하는 과정을 다룬 연구입니다. 개별 메모가 사라지더라도 에이전트 간의 상호작용(스티그머지)을 통해 의미와 합의가 지속될 수 있음을 보여줍니다.
에이전트가 영상을 관찰하고 다음 프레임을 예측하며 스스로 학습하는 '월드 모델(World Models)' 연구를 소개합니다. 특히 멀티 플레이어 환경에서 에이전트 간의 상호 반응을 함께 예측할 때 꿈(시뮬레이션)이 현실과 일치하며 유지됨을 증명합니다.
Princeton과 University of Chicago의 연구에 따르면, LLM은 학습 데이터의 편향을 복제하는 것을 넘어 피드백을 통해 스스로 새로운 채용 편향을 생성할 수 있습니다. 시뮬레이션 결과, 모델들은 무작위 노이즈를 특정 집단에 대한 고정관념으로 오인하여 직업군을 분류하는 위험성을 보였습니다.