Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
ALIBI 연구는 LLM 기반 취약점 탐지기를 속이기 위해 소스 코드 내에 적대적 자연어 주석을 삽입하는 공격 프레임워크를 소개합니다. 이 공격은 프로그램 동작에는 영향을 주지 않으면서 모델의 추론을 유도하거나 가짜 도구 출력을 모방하여 탐지 성공률을 90% 이상으로 높입니다.
AI 에이전트가 긴 정책 문서를 얼마나 정확히 준수하는지 측정하는 새로운 벤치마크 HANDBOOK.md가 발표되었습니다. 테스트 결과, 가장 우수한 에이전트 설정조차 복잡한 SOP를 완벽히 따르는 데 큰 어려움을 겪는 것으로 나타났습니다.
LLM의 암호 해독 능력을 체계적으로 측정하기 위한 새로운 벤치마크인 CryptanalysisBench를 소개합니다. 이 프레임워크는 3단계 계층 구조를 통해 모델이 암호 체계의 취약점을 식별하고 보안 속성을 추론하는 능력을 평가합니다.

인공 신경망이 확률적 언어 모델로서 작동하는 원리와 그로 인해 발생하는 환각 현상을 설명합니다. 모델은 사실 관계를 검증하는 대신 문맥상 가장 확률이 높은 텍스트를 생성하므로, 정보가 누락된 경우에도 확신에 찬 오류를 출력할 수 있습니다.
PRISM-AH는 비디오 내 얼굴, 음성, 언어 간의 불일치를 통해 양가감정과 망설임을 인식하는 멀티모달 추론 프레임워크입니다. 경량 스트리밍 모델과 LLM의 지식 유도 추론을 결합하여 기존 제로샷 모델 대비 성능을 크게 향상시켰습니다.
코드의 실행 속도를 최적화하기 위해 강화학습(RL)을 적용하는 연구를 소개합니다. 측정 노이즈와 보상 희소성 문제를 해결하기 위해 DMC-Optim 프레임워크를 구축하여 Qwen 및 CWM 모델의 성능을 크게 향상시켰습니다.
MemLens는 LLM 에이전트의 효율적인 메모리 관리를 위해 가치 인식(value-aware) 방식을 제안하는 시스템입니다. Shapley 가치 평가를 통해 메모리 기록의 중요도를 판단하며, 대화형 대시보드를 통해 메모리 수명 주기를 시각화하고 분석할 수 있습니다.
LLM을 이용한 Kubernetes 보안 패치 생성 시, 실제 런타임 토폴로지 컨텍스트를 제공하는 KuTIE 엔진의 효과를 연구했습니다. 실험 결과, 서비스 호출 그래프와 의존성을 반영한 컨텍스트가 패치 정확도를 최대 78%까지 크게 향상시킴을 입증했습니다.
표 형식 파운데이션 모델(TFM)의 분포 외(OOD) 성능을 실증적으로 평가한 연구입니다. 다양한 사전 학습 전략과 아키텍처를 가진 9가지 모델을 대상으로 분포 변화가 성능에 미치는 영향을 분석했습니다.
컴퓨터 사용 에이전트(CUA)의 GUI 전환 이해 능력을 측정하기 위한 새로운 벤치마크인 Desktop-Delta Bench(DDB)를 소개합니다. 기존 벤치마크가 놓치기 쉬운 상태 확인, 소스 추적, 문맥 인식 제어 능력을 단계별로 평가합니다.
Pictura는 시점 기반 셀프 플레이를 통해 자율 주행 정책을 학습하는 새로운 프레임워크를 제안합니다. GPU 가속 시뮬레이터를 활용해 1인칭 시야와 특권 관측치 사이의 표현 격차를 완화하며, 대규모 데이터로 훈련된 고성능 주행 모델을 구현합니다.
기존 액션 청킹 흐름 정책의 지연 시간 문제를 해결하기 위해 반응형 실시간 흐름 정책인 $\pi \text{R}^2$를 제안합니다. 빠른 채널과 느린 채널의 비동기적 업데이트 및 지연 시간 적응형 스케줄링을 통해 실시간 폐루프 제어를 가능하게 합니다.
온폴리시 증류(OPD) 과정에서 발생하는 접두사 실패 문제를 해결하기 위해 Relay-OPD 방식을 제안합니다. 교사가 학생의 오류를 감지하여 궤적을 재설정하는 '핸드오프' 메커니즘을 통해 효율적이고 정확한 학습을 유도합니다.
CHARM은 멀티모달 그래프 환경에서 제로샷 전이를 가능하게 하는 새로운 그래프 파운데이션 모델입니다. 계층적 문맥 모델링을 통해 도메인 특화 정보를 공유된 고수준 개념으로 매핑하여 미학습 도메인에서도 높은 성능을 발휘합니다.
엣지 컴퓨팅의 자원 제한 및 불안정한 환경을 고려하여, 시스템 단위가 아닌 개별 기능 단위의 안정성을 정의하는 새로운 프레임워크를 제안합니다. 연속적인 품질 함수와 정량적 지표를 통해 기존의 이진적 신뢰성 모델이 포착하지 못하는 서비스 품질 요구사항을 정밀하게 분석합니다.
HLS 설계를 위해 계약 정렬형 멀티 에이전트 워크플로우인 ContractHIL-HLS를 제안합니다. 자연어 요구사항을 구조화된 계약으로 변환하고, 하드웨어 피드백 루프를 통해 설계의 정확도와 성능을 최적화합니다.
LLM 추론 성능을 최적화하기 위해 연산자 스케줄링과 가중치 레이아웃을 공동 최적화하는 DOPS 프레임워크를 제안합니다. NPU와 PIM 등 이기종 하드웨어 환경에서 Prefill-Decode 분리 방식보다 뛰어난 속도 향상을 입증했습니다.
VPR-Evolve는 LLM 멀티 에이전트를 활용하여 FPGA 배치 및 라우팅 엔진인 VPR의 소스 코드를 설계별로 최적화하는 프레임워크입니다. 하이퍼파라미터 튜닝을 넘어 코드 수준의 진화를 통해 회로 성능과 도구 실행 시간을 획기적으로 개선합니다.
Tao Zhe Xuan의 ICM 2026 강연으로, AI 시대에 직면한 수학적 가치와 실천의 기초 위기를 다룹니다. 과거의 논리적 기초 위기와 달리, 현재는 AI의 수학적 능력에 대응하여 수학의 목적과 역할을 재정의해야 하는 메타수학적 과제를 제시합니다.
Anthropic이 공개한 Mythos Preview 연구 모델은 소프트웨어의 제로데이 취약점을 자율적으로 식별하고 익스플로잇을 생성할 수 있음을 보여줍니다. 브라우저, 커널, 암호화 라이브러리 등 다양한 환경에서 실질적인 보안 연구 능력을 입증하며 AI 보안의 새로운 국면을 제시합니다.