Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
PolyQ는 온디바이스 LLM 추론을 위해 활성화 인식 채널별 비트 할당이 가능한 End-to-End 양자화 코딩 서명 프레임워크입니다. 이 프레임워크는 컴파일러를 통해 채널들을 비트 균질 블록으로 클러스터링하고, SIMD 및 LUT와 호환되는 커널을 생성합니다. 테스트 결과, PolyQ는 3~6비트에서 기존 대비 높은 품질과 효율성을 보이며 Edge CPU 환경에 적합함을 입증했습니다.
본 논문은 Atari Pong의 5가지 시각적 World Model 에이전트(DreamerV3 등)를 분석하고, 이들의 성능 저하 원인을 진단했습니다. 기존 모델들은 공의 사라짐이나 잘못된 움직임 같은 명확한 실패 사례를 보였습니다. 이에 따라 작업에 중요한 개념을 모델링하는 '개념 기반 공간 정규화(CGSReg)' 기법을 제안하여 World Model의 안정성을 개선함을 입증했습니다.
본 연구는 휴머노이드 로봇의 제어에 필요한 행동 기초 모델(BFM)의 스케일링 방법을 제시합니다. 학습 패러다임, 데이터 전략, 그리고 Humanoid Transformer 아키텍처 세 가지 핵심 요소를 조정하여 성능 향상을 입증했습니다. 이 접근 방식은 시뮬레이션 및 실제 환경에서 기존 대비 제어 충실도와 작업 일반화 측면에서 큰 개선을 보였습니다.
AI가 과학 연구의 주체로 참여하며 '연구의 산업화'를 가속화하고 있습니다. 이는 지식과 판단이 개인에게서 자동화된 파이프라인 모델로 전환됨을 의미합니다. 본 글은 AI 주도 과학이 제기하는 세대 전수 약화, 이론 불투명성, 피어 평가 붕괴 등 광범위한 구조적 질문들을 고찰합니다.
본 연구는 멀티모달 대규모 언어 모델(MLLMs)의 과학적 시각화(SciVis) 리터러시를 평가하기 위한 표준화된 벤치마크 테스트를 개발했습니다. 총 49개 항목으로 구성된 이 테스트는 6개의 MLLMs를 비교했으며, Gemini가 전반적으로 가장 강력한 성능을 보였습니다. MLLMs의 성능은 시각화 기법과 작업 유형에 따라 매우 불균일하며, 특히 정량적 추정이나 복잡한 해석에서 어려움을 겪었습니다.
T2MLR은 이전 토큰의 중간 레이어 표현을 현재 위치 초기 레이어에 융합하는 트랜스포머 기반 잠재적 추론 아키텍처입니다. 이는 자기회귀 디코딩의 한계를 극복하고, 적은 오버헤드로도 시간 경과에 따른 중간 계산 상태를 지속시킵니다. 기존 모델에 순환 경로만 추가하여 미세 조정하는 것만으로도 수학적 추론 능력을 크게 향상시키는 것이 가능합니다.
MedFailBench는 기존 의료 AI 벤치마크가 정답 여부만 측정하는 한계를 극복하기 위해 임상의가 구축한 오픈 소스 안전성 검사 도구입니다. 이 벤치마크는 오류를 심각도와 구체적인 '안전 게이트' 유형별로 라벨링하여 의료 AI의 취약점을 깊이 있게 분석할 수 있도록 합니다.
본 논문은 복잡한 GUI 환경에서 자율 에이전트의 제어 및 계획 수립 문제를 해결하기 위해 Plover라는 시스템을 제안합니다. Plover는 작업 계획과 재계획 과정을 외부화하여, 사용자가 시스템 동작을 검사하고 수정할 수 있는 '계획 중심' 아키텍처를 구현했습니다. 이를 통해 GUI 자동화 에이전트의 투명성과 제어 가능성을 크게 향상시켰습니다.
본 논문은 불확실성 정량화(UQ)에 대한 새로운 관점을 제시하며, 불확실성 측정값이 기본 원시 요소가 아닌 모델링 결정의 결과물임을 주장합니다. '주관적 위험'을 분해하여 인식론적 및 우연적 불확실성을 도출하는 방법을 보여주고, 이를 학습 이론과 연결하여 UQ를 위한 포괄적인 프레임워크로 확장할 수 있음을 제시합니다.
본 논문은 정신 건강 분야의 신뢰성 있는 XAI 시스템 구축을 위해, 우울증 관련 데이터셋 주석화 문제를 해결하는 자체 진화형 프레임워크를 제안합니다. 이 프레임워크는 LLM 지원 레이블링과 전문가 검증을 결합하여 DSM-5-TR에 정렬된 설명 가능한 데이터를 구축하는 것을 목표로 합니다.
본 논문은 저장소 수준의 이슈 위치 파악(localization)에 있어 시각적 증거 활용을 위한 통제된 벤치마크인 MM-IssueLoc을 제안합니다. 이 벤치마크는 23개 언어, 652개의 이슈-PR 인스턴스를 포함하며, 파일 및 함수 수준의 골드 레이블과 시각적 증거를 결합하여 평가합니다. 연구 결과, 기존 시스템들은 멀티모달 위치 파악에서 어려움을 보였으며, 시각적 증거가 중요한 평가 변수임을 입증했습니다.
본 논문은 마스킹된 확산 언어 모델(MDLM)에 강화학습을 적용하는 새로운 방법을 제안합니다. 기존 방식의 한계를 극복하기 위해, 생성 과정을 토큰 배치 결정과 위치 재마스킹 결정이라는 2단계 액션 MDP로 형식화했습니다. 이를 통해 정책 기울기를 두 개의 항으로 분해하고 최적화하여 수학 및 코딩 벤치마크에서 높은 성능을 달성했습니다.
본 논문은 첨단 패키징 환경에서 라우팅 가능성 확보가 중요한 플로어플래닝 및 핀 할당 알고리즘을 제안합니다. 특히, 미분 가능한 라우팅 가능성 기반 접근 방식을 통해 와이어 길이 최소화와 교차 인지(crossing-aware) 핀 할당을 수행하여 높은 효율성을 입증했습니다.
본 논문은 FPGA 가속기 설계를 위한 패턴 기반 설계 공간 탐색(PATTERNDSE) 프레임워크를 제안합니다. PATTERNDSE는 반복적인 계산 패턴을 간결한 스케줄 공간으로 매핑하여, 기존의 방대한 조합적 설계 공간을 효율적으로 줄입니다. 이를 통해 HLS로 평가되는 후보 수를 대폭 감소시키면서도 최적의 성능을 유지할 수 있음을 입증했습니다.

최근 AI 업계에서는 Gemini 3.5 Pro 출시 지연, 중국의 AI 동반자 서비스 규제 강화, 그리고 OpenAI가 청소년 안전 기능을 대폭 개선한 세 가지 상이한 이슈가 주목받았습니다. Google은 코딩 등 복잡한 작업에서 환각 문제를 보여주었으며, OpenAI는 연령 예측 및 부모 통제 기능 등을 도입해 사용자 보호에 초점을 맞추고 있습니다.

연구 AI의 다음 방향은 단순한 논문 요약 채팅을 넘어, 문헌 검토부터 가설 설정, 코드 작성 및 분석까지 전 과정을 통합하는 '연구 작업대(workbench)'로 진화하고 있습니다. OpenScience와 같은 오픈소스 도구는 연구용 IDE에 가까운 기능을 제공하며, 다양한 과학적 데이터를 한 곳에서 다루도록 설계되었습니다.
NeurIPS 2026에서 실시간 대화형 에이전트(RTCA) 워크숍을 개최하며, 자연스러운 멀티모달 상호작용에 초점을 맞춘 논문 및 데모 제출 공고를 받습니다. 이 워크숍은 스트리밍 음성, 비디오, 언어 생성과 같은 실시간 성능과 상호작용적 자연스러움을 핵심 주제로 다룹니다.
GPT-5.6 Sol Pro가 OpenAI의 CDC 증명 프롬프트 방법론을 차용하여, 1996년부터 미해결이었던 볼록 최적화 이론의 복잡성 격차를 메우는 중요한 증명을 성공적으로 생성했습니다. 이 결과는 Lean에서 형식 검증되었으며, AI 모델이 수학적 난제 해결에 기여할 수 있음을 보여줍니다.


Google의 Gemini 3.5 Pro가 200만 토큰 컨텍스트 창으로 출시될 것이라는 보도가 나왔습니다. 이는 Anthropic이나 GPT-5.6 등 경쟁 모델 대비 월등히 큰 규모입니다. 이 거대한 컨텍스트는 전체 코드베이스나 방대한 문서 세트 처리에 활용될 수 있지만, 실제 성능 유지는 여전히 의문시됩니다.
본 글은 G検정 수험생이 모델 경량화 기법(증류, 가지치기, 양자화)을 'AI 모델 다이어트'에 비유하여 쉽게 설명합니다. 고성능 모델을 엣지 디바이스에서 구동하기 위해 필수적인 이 기술들은 각각 지식 전수, 불필요한 가중치 제거, 데이터 정밀도 압축을 수행합니다.