Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.

LLM이 시스템 프롬프트와 사용자 프롬프트를 동일한 우선순위로 취급하여 발생하는 프롬프트 인젝션 문제를 다룬 OpenAI의 연구를 요약합니다. 모델 내부에 명령 계층(Instruction Hierarchy)을 구축하여 보안성을 높이는 방안을 제시합니다.

LLM 에이전트의 실용성과 보안성 사이의 트레이드오프를 측정하기 위한 벤치마크인 AgentDojo를 소개합니다. 외부 데이터를 통한 간접 프롬프트 인젝션 공격에 대한 에이전트의 내성과 태스크 수행 능력을 정량적으로 평가하는 환경을 다룹니다.

Qwen 3.5 35B 모델을 대상으로 7가지 실무 태스크를 통해 GPT-4와 성능을 비교 분석했습니다. 로컬 LLM이 GPT-4와 대등하게 경쟁할 수 있는 영역과 한계점을 실무 쿼리 기반으로 검증했습니다.

피지컬 AI와 생성 AI의 차이점을 세계 모델(World Model) 개념을 통해 설명합니다. 생성 AI가 결과물의 그럴듯함에 집중한다면, 피지컬 AI는 물리 법칙을 준수하며 현실 세계에서 행동하는 것을 목표로 합니다.

Model Soup은 여러 파인튜닝된 모델의 예측값이 아닌 가중치를 평균하여 단일 모델의 성능을 높이는 기법입니다. 앙상블과 달리 추론 비용 증가 없이 정확도와 강건성을 개선하며, 동일 사전 학습 모델에서 파인튜닝된 모델들이 공통의 저손실 영역에 존재한다는 원리를 이용합니다.

AI 에이전트에게 예산을 수명으로 부여하여 현실 세계에서 자율적으로 생존하게 하는 'OpenLife' 논문을 소개합니다. 6체의 에이전트가 12주간 예산을 관리하며 책을 판매하는 등 생존을 위해 행동하는 과정을 실험적으로 관찰했습니다.

Kimi K3 모델에 채택된 Attention Residuals 기술을 분석합니다. 기존 잔차 연결의 정보 병목 현상을 해결하기 위해 학습 가능한 파라미터와 어텐션 메커니즘을 깊이 방향으로 적용한 구조를 설명합니다.

Moonshot AI가 2.8T 파라미터 규모의 오픈 웨이트 모델인 Kimi K3를 공개했습니다. 이 모델의 공개는 상용 API의 통제권(계정 삭제, 로그 추적, 안전 장치)을 무력화하여 AI 주도 사이버 공격의 위험성을 극대화할 수 있음을 시사합니다.

NVIDIA DGX Spark 환경에서 Gemma 4 31B와 26B 모델의 소프트웨어 개발 성능을 비교 검증한 연구 결과입니다. HumanEval과 GSM8K 벤치마크를 통해 코딩 능력과 논리적 추론 능력을 정량적으로 평가했습니다.

수평 사고 퀴즈(바다거북의 스프)를 활용해 5개 LLM 모델의 추론 전략을 비교 분석했습니다. 실험 결과 Claude Opus 5가 96%의 정답률로 가장 뛰어난 성능을 보였으며, 모델별로 가설 주도형, 분할 정복 등 각기 다른 추론 패턴을 나타냈습니다.

TurboQuant 논문을 통해 KV 캐시 양자화 기술의 핵심 원리를 분석합니다. 랜덤 직교 회전을 통해 이상치(outlier)를 분산시킨 후 최적의 스칼라 양자화를 적용하여 정밀도 손실을 최소화하는 방법을 다룹니다.

Anthropic이 새로운 모델 Claude Opus 5를 공개했습니다. 이전 세대와 동일한 가격을 유지하면서도 성능은 대폭 향상되었으며, 지능과 비용을 조절할 수 있는 5단계 effort 설정이 도입되었습니다.

LLM의 성능을 결정하는 스케일링 법칙(Scaling Laws)의 원리와 자원 간의 관계를 설명합니다. 파라미터, 데이터량, 계산량의 균형이 중요하며, 향후 데이터 고갈과 물리적 인프라 한계라는 두 가지 주요 벽에 직면해 있음을 분석합니다.

Sakana AI의 음성 대화 모델 KAME를 오픈 모델로 구동할 수 있도록 개조하고, MT-Bench를 통해 벤치마크 성능을 평가한 연구 결과입니다. STS 모델의 저지연성과 LLM의 고지능을 결합한 하이브리드 구조를 분석하고, 툴 콜(Tool Call)을 통한 실시간 정보 처리 가능성을 시험했습니다.

Moonshot AI가 2.8조 파라미터 규모의 차세대 오픈 웨이트 모델인 Kimi K3를 발표했습니다. 초희소 MoE 구조와 독자적인 KDA 어텐션 메커니즘을 통해 대규모 컨텍스트 처리 효율을 극대화한 것이 특징입니다.

SDGs 에세이 수상작 30편을 벡터 임베딩 기술을 활용해 분석하여 일관된 이야기 구조를 도출했습니다. AI의 벡터 검색을 통해 키워드 일치 여부와 상관없이 의미적 유사성을 파악하고, 수상작의 패턴과 모범 답안의 차이를 규명했습니다.

AI 에이전트 설계 패턴을 인지 기능(Cognitive Function)과 실행 토폴로지(Execution Topology)라는 두 축으로 분류하는 새로운 이축 프레임워크를 제안하는 논문을 소개합니다. 기존의 단일 축 중심 가이드들을 보완하여 에이전트의 동작 원리와 구조를 체계적으로 분석합니다.

AI 에이전트의 코딩 능력을 평가할 때 최종 결과물뿐만 아니라 대화 과정에서의 수정 횟수를 측정하는 새로운 벤치마크 SWE-Together를 소개합니다. 사용자의 개입 정도를 수치화한 'User Correction' 지표를 통해 에이전트의 실질적인 효율성을 평가합니다.

Anthropic이 출시한 Claude Opus 5의 성능과 비용 효율성을 기존 벤치마크 데이터(Mifos 유적)를 통해 검증합니다. Fable 5 대비 절반 가격임에도 디버깅과 근본 원인 분석 능력이 향상되었음을 실측합니다.

Microsoft Research의 논문을 통해 GitHub Copilot CLI와 Claude Code의 실제 도입 사례를 분석합니다. AI 도구의 확산은 교육보다 동료 간의 사회적 네트워크를 통해 이루어지며, 업무 활동량이 높은 사용자일수록 정착률이 높다는 점을 밝혀냈습니다.