Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
재귀적 자기 개선(RSI) 시대에는 프론티어 모델과 2티어 모델 간의 격차가 더욱 벌어질 것이며, 모델의 범용화 가능성은 낮아질 것으로 전망합니다. RSI를 통해 선두 연구소들이 지능, 속도, 비용 모든 측면에서 압도적인 우위를 점할 것이라는 분석입니다.
LLM 코딩 에이전트의 제3자 기술(skills)을 이용한 소프트웨어 공급망 공격을 방어하기 위한 연구입니다. 기존 정적 스캐너를 우회하는 SkillCloak 프레임워크와 이를 탐지하기 위한 행동 중심의 런타임 감사 도구인 SkillDetonate를 제안합니다.
생성형 AI 코딩 어시스턴트가 개발자의 생산성뿐만 아니라 웰빙과 상호작용 경험에 미치는 영향을 실증적으로 연구했습니다. 연구 결과, 작업 유형에 따라 선호되는 상호작용 방식이 다르며, AI 도구가 인지 부하와 생산성에 미치는 복합적인 영향을 확인했습니다.
네트워크 트래픽에서 API 엔드포인트의 구조를 직접 모델링하는 비지도 이상 탐지 방식인 HRAL을 제안합니다. API 문서가 부족한 환경에서도 높은 재현율과 F1-score를 기록하며 기존 기술 대비 강력한 보안 탐지 성능을 입증했습니다.

OpenAI의 차세대 모델 GPT 5.6 Sol Ultra가 다음 주 출시될 예정입니다. 이 모델은 Anthropic의 Fable 5보다 높은 벤치마크 성능을 보이며, 더 낮은 가격과 완화된 가드레일, 넉넉한 사용 제한을 제공할 것으로 기대됩니다.
PBE(Programming-by-example) 시스템에서 적대적 예제 오염이 프로그램 합성 성능에 미치는 영향을 연구한 논문입니다. 고정 집합 최악의 경우 오염을 공식화하고, 이를 방어하기 위한 VPA 기법의 한계와 적대적 공격의 위험성을 분석했습니다.
Wan2.1 모델을 기반으로 동작 제어가 가능한 상호작용형 월드 모델인 Micro-World를 소개합니다. 이미지 및 텍스트를 통해 고품질 오픈 도메인 장면을 생성하며, 모델 가중치와 데이터셋을 모두 공개합니다.
AgenticSTS 논문은 에이전트의 메모리를 단순히 컨텍스트 윈도우를 확장하는 방식이 아닌, 구조화된 인터페이스로 다루어야 한다고 제안합니다. 모든 기록을 프롬프트에 쏟아붓는 대신, 결정에 필요한 정보를 계층적으로 구성하여 관리하는 전략을 제시합니다.
영지식 머신러닝(zkML)은 데이터 프라이버시를 유지하면서 동시에 AI 모델의 추론 결과가 올바른지 검증할 수 있는 기술입니다. EZKL, Modulus Labs, Giza 등 주요 프로젝트들이 모델 변환, 검증 가능한 AI 레이어, DeFi 특화 솔루션 등 다양한 방식으로 이 문제를 해결하고 있습니다.

Qwen3.5-9B 기반 추론 모델인 Qwythos-9B의 GGUF 양자화 버전(Q4_K_M, Q8_0) 성능을 GSM8K, IFEval, HumanEval 벤치마크로 비교 분석했습니다. 수학 및 지시 이행 능력에서는 양자화에 따른 성능 차이가 존재하나, 코딩 능력은 두 버전 모두 매우 낮음을 확인했습니다.

Surface Evolver라는 물리 시뮬레이션 도구를 활용하여 LLM의 커스텀 데이터 형식 작성 능력을 평가하는 새로운 벤치마크를 소개합니다. 모델이 문서를 참조하고 시뮬레이션을 디버깅하는 에이전틱 루프 능력을 측정합니다.
Hugging Face에서 주목받은 최신 AI 논문 10편을 분석하여 에이전트 메모리, 비디오 서빙, Program-as-Weights 등 다양한 연구 동향을 소개합니다. 특히 자연어 명세를 효율적인 뉴럴 아티팩트로 변환하는 새로운 패러다임과 장기 에이전트의 메모리 문제를 다룹니다.
OpenAI가 출시한 GPT-5.6 모델 제품군(Sol, Terra, Luna)에 대한 심층 리뷰입니다. 각 티어별 추론 모드, 벤치마크 성능, 네이티브 에이전트 기능 및 안전성 아키텍처를 다룹니다.
AI 모델이 생성한 합성 데이터로 차세대 모델을 학습시킬 때 발생하는 '모델 붕괴(Model Collapse)' 현상을 분석합니다. 데이터의 다양성 감소와 품질 저하가 모델의 성능과 창의성에 미치는 위험성을 경고합니다.
데이터가 극도로 부족한 도심 항공 모빌리티(UAM) 환경에서 신뢰할 수 있는 경로 설정을 위해 설명 가능한 인과 강화학습(XCRL)을 제안합니다. 단순 상관관계가 아닌 인과적 메커니즘을 학습하여 데이터 희소성 문제를 해결하고 의사결정의 근거를 제공합니다.
Dockerless는 코딩 에이전트가 생성한 코드 패치를 검증할 때 Docker 컨테이너를 통한 테스트 실행 없이 추론만으로 정답 여부를 판단하는 새로운 연구 방법론입니다. 기존의 실행 기반 검증 방식이 가진 높은 비용과 느린 속도 문제를 해결하여 SFT 및 RL 학습에 효율적인 신호를 제공합니다.
이번 주 AI 및 기술 분야의 주요 소식을 요약합니다. Claude의 접근성 확대, NotebookLM의 비디오 요약 기능 추가, OpenAI의 비용 절감 및 GPT-5.6의 생물학 테스트 성공 등 다양한 기술적 진보가 발표되었습니다.

함수를 신경 프로그램(neural program)으로 컴파일하여 실행하는 'Program-as-Weights' 기술을 소개합니다. 0.6B 규모의 인터프리터를 통해 메모리 사용량을 1/50로 줄이면서도 Qwen3-32B와 대등한 성능을 구현했습니다.
Temperature를 0으로 설정하고 seed를 고정하더라도 LLM의 출력이 매번 달라질 수 있음을 실험을 통해 증명합니다. 5개 모델을 대상으로 100회씩 테스트한 결과, 로컬 모델과 API 모델 모두에서 출력 불일치 현상이 관찰되었습니다.
Anthropic의 Claude Fable 5 재출시 이후 제기된 성능 저하 논란을 2가지 벤치마크 데이터를 통해 분석합니다. 강화된 안전 분류기(Safety Classifier) 도입이 벤치마크 결과에 미치는 영향과 모델 작동 메커니즘을 설명합니다.