Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
AI 에이전트의 규칙 준수율과 추론 깊이를 높이기 위해 코드와 산문 형식을 비교 실험한 연구 사례입니다. 실험 전 가설을 Git에 사전 등록하여 연구의 객리성을 확보했으며, 실험 결과 기존 가설이 데이터와 일치하지 않음을 확인했습니다.
Hugging Face에서 가장 많은 추천을 받은 최신 AI 논문 10편을 소개합니다. 장기 에이전트, 로보틱스 파운데이션 모델, 비디오 이해 등 현재 AI 커뮤니티의 주요 연구 트렌드를 다룹니다.

LLM-as-judge 시스템 구축 시 합성 코퍼스 생성 과정에서 발생하는 구조적 결함과 테스트 오라클 문제를 분석한 연구입니다. 디코딩 파라미터 공유로 인한 데이터 왜곡 현상을 규명하고, 이를 방지하기 위한 검증 프로토콜을 제안합니다.
OvisOCR2는 Qwen3.5-0.8B를 기반으로 한 엔드투엔드 문서 파싱 VLM으로, OmniDocBench v1.6에서 1위를 기록했습니다. 기존 파이프라인 방식과 달리 레이아웃 탐지 단계 없이 단일 모델로 마크다운 형식을 생성하여 높은 정확도와 효율성을 보여줍니다.
Bonsai-27B 및 Ternary-Bonsai-27B 모델의 llama.cpp 및 MLX 백엔드 지원 현황을 업데이트합니다. Binary Q1_0 및 Ternary 지원을 위한 다양한 백엔드(CPU, Metal, CUDA, Vulkan)의 마이그레이션 상태와 향후 GGUF 파일 형식 변경 계획을 다룹니다.

비전 모델이 저해상도 이미지에서 텍스트를 읽지 못할 때, 정보를 누락하는 대신 그럴듯한 가짜 정보를 생성(fabrication)하는 현상을 분석한 연구입니다. 27개의 비전 모델을 대상으로 해상도 변화에 따른 판독성 및 조작률을 테스트하여 모델별 경계선을 지도로 나타냈습니다.

옥스퍼드 대학교의 연구를 통해 역사 아카이브 데이터에 AI를 활용할 때의 가능성과 한계를 분석합니다. 생성형 AI의 할루시네이션과 설명 책임 문제를 지적하며, 신뢰성이 중요한 역사 자료에는 추출형 모델이 더 적합함을 제안합니다.
Ring-Zero 논문은 인간의 CoT 예시 없이 검증 가능한 보상만으로 훈련된 1T 파라미터 MoE 추론 모델을 소개합니다. 모델이 스스로 최적의 추론 워크플로우를 학습하며, 문제 난이도에 따라 추론 토큰 양을 조절하는 계층적 훈련 방식을 제안합니다.
RLHF(인간 피드백 기반 강화학습)의 핵심 단계인 SFT, 보상 모델 학습, PPO 최적화 과정을 설명합니다. 모델의 성능 향상과 보상 해킹 방지를 위한 KL 발산 페널티의 역할을 다룹니다.
AI가 코드를 생성하는 도중 실시간으로 컴파일러 피드백을 제공하는 '생성적 컴파일(Generative Compilation)' 기술을 소개합니다. Sealor라는 변환 도구를 통해 부분 프로그램을 완전한 형태로 변환하여, 생성 과정에서 오류를 조기에 탐지하고 코드의 정확성을 높입니다.
대수적 효과와 리전 기반 메모리 관리를 결합한 새로운 ML 스타일 언어 Yarrow를 소개합니다. 멀티샷 효과 핸들러 환경에서도 리전의 안전성을 보장하는 새로운 프로그램 로직인 Yarrow Logic(YL)을 제안합니다.
BayesPO는 프롬프트 최적화를 이산 토큰에 대한 베이지안 사후 샘플링 문제로 정의하는 새로운 연구 프레임워크입니다. 병렬 템퍼링과 Langevin 기반 Gibbs 샘플러를 결합하여 LLM의 복잡한 에너지 지형에서 전역적 최적 프롬프트를 탐색합니다.
LLM 워터마크 기술이 법적 증거로서 갖는 포렌식적 신뢰성을 실증적으로 평가한 연구입니다. KGW, Unigram, SynthID-Text를 대상으로 패러프레이징 공격을 수행한 결과, 대부분의 워터마크가 쉽게 제거되어 법적 기준을 충족하지 못함을 확인했습니다.
LLM의 분석적 지식 노동 능력을 측정하기 위해 비즈니스 사례 연구법을 활용한 새로운 벤치마크인 BusinessCaseBench를 소개합니다. 실험 결과, Frontier AI 모델들은 복잡한 비즈니스 사례 분석에서 높은 성능을 보이며 빠르게 발전하고 있음을 입증했습니다.
새로운 루프형 트랜스포머 모델인 Loopie 시리즈를 소개합니다. MoE 구조를 활용하여 동일 연산 예산 대비 기존 바닐라 트랜스포머보다 뛰어난 성능을 입증했습니다.
LLM이 컨텍스트 내 문자열을 정확히 복사하지 못하는 원인을 Transformer의 위치 인코딩 문제로 분석합니다. 이를 해결하기 위해 텍text를 2D 그리드로 구성하는 2D-RoPE를 제안하며, 실험을 통해 긴 입력 길이에서도 뛰어난 복사 성능을 입증했습니다.
언어 모델의 인코딩 방식인 토큰, 바이트, 픽셀의 속도-효용 경계를 비교 분석한 연구입니다. 콘텐츠와 용량을 통제한 상태에서 각 인코딩 방식이 보존하는 정보의 특성과 작업별 성능 차이를 규명했습니다.
Xiaomi가 380억 파라미터 규모의 월드 파운데이션 모델 'U0'를 오픈 소스로 공개했습니다. U0는 텍스트-이미지 생성부터 Embodied Video Generation까지 통합된 프레임워크를 제공하며, World Arena 벤치마크 1위를 달성했습니다.
LLM의 코드 생성 성능을 체계적으로 평가하기 위한 새로운 벤치마크 프레임워크인 PROBE를 소개합니다. 기능적 정확성, 솔루션 근접성, 코드 품질이라는 세 가지 차원을 통해 다양한 모델과 언어를 종합적으로 분석합니다.
AI가 기존 문제를 해결하는 능력은 비약적으로 발전했으나, 스스로 가설을 세우고 질문을 던지는 능력은 여전히 한계로 남아 있습니다. Google DeepMind의 데미스 허사비스는 탐색 공간을 정의하는 '질문하는 능력'이 과학적 진보의 핵심임을 강조합니다.