Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
시각적 문서 이해(VDU) 모델이 좌표 대신 텍스트 인용을 사용하는 언어 인터페이스를 통해 증거 귀속 성능을 높이는 연구를 소개합니다. 좌표 기반 방식의 환각 문제를 해결하기 위해 GRPO 레시피를 도입하여 영역 레이블 없이도 정확도를 개선했습니다.
ER 다이어그램의 구조적 이해를 평가하기 위한 최초의 대규모 벤치마크인 ERUnderstand를 소개합니다. 2,960개의 다이어그램을 통해 VLM의 성능을 분석한 결과, 복잡한 관계나 속성에서는 성능이 크게 저하됨을 확인했습니다.
2.8T 파라미터 규모의 MoE 모델인 Kimi K3를 소개합니다. KDA 기술과 Stable LatentMoE를 통해 스케일링 효율을 2.5배 높였으며, 비전 기능과 100만 토큰 컨텍스트를 지원합니다. 모델의 전체 가중치를 공개하여 연구 및 배포를 가속화하고자 합니다.
Claude Opus 4.7과 같은 최첨단 LLM을 활용하여 이온 트랩 양자 컴퓨터용 셔틀링 컴파일러를 자동으로 생성하고 개선하는 연구를 소개합니다. LLM이 생성한 컴파일러는 수동 제작된 방식과 비교해 셔틀링 타임스텝을 최대 76%까지 단축하며 높은 효율성을 입증했습니다.
언어 모델 기반 개체 매칭(Entity Matching)에서 아키텍처, 모델 변체, 모델 크기가 성능에 미치는 영향을 통제된 실험을 통해 분석한 연구입니다. Qwen3 제품군을 활용해 각 요인이 성능 향상에 기여하는 방식을 분리하여 규명했습니다.
파운데이션 모델 에이전트의 다회차 장기 계획 능력을 체계적으로 연구하기 위한 새로운 환경과 방법론을 제안합니다. 사전 학습, GRPO/OPD 사후 학습, 그리고 MOPD를 통한 능력 통합의 3단계 과정을 통해 계획 능력의 습득과 형성 과정을 분석합니다.
ClinFusion은 2D 및 3D 의료 영상을 통합적으로 이해하기 위해 설계된 시각 중심 멀티모달 LLM 시스템입니다. 계층적 시각 인코더와 새로운 평가 프레임워크를 통해 의료 영상 분석 및 보고서 생성에서 최첨단 성능을 달성했습니다.
KANEx는 Kolmogorov-Arnold Networks(KAN)의 구조적 투명성을 활용하여 의료용 시각-언어 모델(VLM)의 설명 가능성을 높이는 프레임워크입니다. KAN의 스플라인 기반 특성을 통해 모델의 추론 근거를 수학적으로 해석 가능한 단위로 제공하며, 의료 AI의 신뢰성을 향상시킵니다.
DataOrchestra는 사전 학습 데이터의 품질을 높이기 위해 각 데이터 예시별로 최적의 처리 파이프라인을 오케스트레이션하는 프레임워크입니다. 데이터의 삭제, 유지, 정제 여부를 결정하고 LLM 기반 재작성 등 맞춤형 연산을 적용하여 모델 성능을 향상시킵니다.
On-Policy Diffusion Distillation(OPD) 과정에서 Classifier-Free Guidance(CFG)가 결합될 때 발생하는 Negative Branch Asymmetry(NBA) 문제를 분석합니다. 기존 방식의 식별 불가능성 문제를 해결하기 위해 양의 예측과 CFG 방향을 분리하여 제약하는 PDM 목적 함수를 제안합니다.
배터리가 없는 간헐적 컴퓨팅 시스템의 시간 유지를 위해 스핀트로닉스 메모리인 MTJ의 확률적 유지 손실을 활용한 FLINT 기술을 제안합니다. 기존 커패시터 방식보다 에너지 효율이 11배 높고 면적은 작으면서도, 소자 노화에 영향을 받지 않고 정밀한 시간 추적이 가능합니다.
MoE 추론 시 발생하는 라우팅 분포 왜곡 문제를 해결하기 위한 분포 인식 프레임워크와 DA-MoE 런타임을 제안합니다. 실시간 라우팅 히스토그램을 활용해 최적의 fused-MoE 커널을 선택함으로써 DeepSeek-V3 등에서 추론 지연 시간을 크게 개선했습니다.
CircuitWeave는 텍스트 명세와 회로도(Schematics)를 결합하여 실행 가능한 RTL을 생성하는 멀티모달 프레임워크입니다. 회로의 토폴로지와 동작 계약을 통합한 '회로 계약'을 통해 텍스트 기반 LLM의 구조적 한계를 극복합니다.
SPARC은 프리실리콘 단계에서 프로세서의 전력 부채널 누설(PSCL)을 자동으로 탐지하고 근본 원인을 분석하는 프레임워크입니다. 정보 흐름 추적(IFT) 기술을 통해 누설을 특정 하드웨어 신호와 소프트웨어 명령어로 매핑하며, 기존 방식보다 8배 빠른 시뮬레이션 속도를 제공합니다.
PIMID는 다양한 메모리 기술과 실행 모델을 지원하는 풀 시스템 시뮬레이터입니다. 기존 시뮬레이터의 한계를 넘어 메모리 계층 구조와 호스트-디바이스 간의 엔드 투 엔드 시간 및 에너지 분석을 제공합니다.
칩렛 설계 시 발생하는 신호 무결성 문제를 해결하기 위해, gem5 시뮬레이터 내에서 런타임 PHY 동작을 정밀하게 모델링하는 DICE 프레임워크를 제안합니다. 기존의 단순화된 모델이 간과하던 채널 상태 변화와 패킷 재전송 등의 동적 효과를 반영하여 시뮬레이션 정확도를 높였습니다.
멀티태스크 RF 신호 인식을 위해 설계된 이기종 신경망 가속기를 제안합니다. CNN과 LSDec 기술을 결합하여 AMR, HT-CC 탐지, GNSS 재밍 분류를 효율적으로 수행하며, 저전력 및 저지연 특성을 갖추어 에지 장치 활용에 최적화되었습니다.
중앙 집계 서버 없이 병원 간 임상 AI 모델을 학습시킬 수 있는 탈중앙화된 개인정보 보호 프레임워크를 제안합니다. 기존 연합 학습(Federated Learning)의 중앙 집중식 아키텍처 한계를 극복하고 데이터 주권과 보안을 강화하는 새로운 네트워크 설계를 탐구합니다.

MiMo-V2.5 모델을 통해 '네이티브 옴니모달'과 '볼트온 멀티모달' 아키텍처의 차이점을 분석합니다. 텍스트 중심의 기존 방식과 달리 통합 시스템 내에서 여러 모달리티를 직접 처리하는 설계의 특징과 이점을 다룹니다.

수평 사고 퀴즈(바다거북의 스프)를 활용해 5개 LLM 모델의 추론 전략을 비교 분석했습니다. 실험 결과 Claude Opus 5가 96%의 정답률로 가장 뛰어난 성능을 보였으며, 모델별로 가설 주도형, 분할 정복 등 각기 다른 추론 패턴을 나타냈습니다.