Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
의사결정 나무(Decision Trees)의 작동 원리를 경사 하강법 기반의 최적화가 아닌 국소적 분할을 통한 '성장'의 관점에서 설명합니다. 데이터에 대한 가정이 적어 유연하지만, 높은 분산으로 인해 데이터 변화에 민감하고 불안정할 수 있다는 특성을 다룹니다.

LLM 추론 과정의 복잡한 교차 계층 문제를 해결하기 위한 비침습적 근본 원인 분석(RCA) 프레임워크인 TELLER를 제안합니다. NVTX/CUPTI 트레이스와 로그를 결합하여 요청별 호출 체인을 재구성하고, TPE 토크나이저를 통해 효율적인 분석을 수행합니다.
코딩 LLM 평가의 신뢰성을 높이기 위해 테스트 스위트의 결함을 찾아내는 코딩 에이전트 연구를 소개합니다. 에이전트가 적대적 테스트 케이스를 생성하고 인증 체인을 통해 버그를 검증함으로써, 기존 공식 스위트가 놓치는 '정답이지만 버그가 있는' 제출물을 효과적으로 식별합니다.
LLM이 소프트웨어 취약점을 추론할 때 도메인 지식을 위반하는 문제를 해결하기 위해 EntailLLM을 제안합니다. 논리 프로그래밍과 함수 호출 그래프를 활용하여 LLM의 분석 경로를 검증함으로써 신뢰성을 높입니다.
사무 업무 기반의 장기적 사후 학습(Post-Training)이 소프트웨어 엔지니어링 능력을 향상시킨다는 연구 결과입니다. Qwen3.5 모델을 사무 워크플로우로 학습시킨 결과, 소프트웨어 관련 과업이 아님에도 SWE-Bench Pro 점수가 향상되었습니다.
본 논문은 요구사항 도출 인터뷰를 돕기 위해 스크립트 생성, 실시간 주제 추적, 후속 질문 생성을 결합한 AI 지원 워크플로우를 제안합니다. 실험 결과, AI 지원 인터뷰는 교육만 받은 경우보다 더 정교한 목표 모델을 생성하며 높은 품질의 스크립트를 제공함을 입증했습니다.
코딩 에이전트의 저장소 수준 취약점 탐지 능력을 평가하기 위한 새로운 벤치마크인 VulnGym을 제안합니다. GitHub 어드바이저리를 기반으로 세밀한 취약점 추적 주석을 제공하여 에이전트의 코드 로컬라이제이션 및 증거 구축 능력을 진단합니다.
LLM의 저장소 수준 코드 생성을 위해 부분 의존 그래프를 활용한 DyRetriever를 제안합니다. 기존 RAG의 한계를 극복하기 위해 LLM의 의미론적 이해를 바탕으로 다중 홉 추론을 수행하며, 효율적인 컨텍스트 검색을 가능하게 합니다.
AArch64 기계어에서 소스 코드 없이 취약점을 탐지하기 위해 설명 가능한 디지털 트윈 기술을 제안합니다. 디지털 트윈을 통해 프로그램 실행 상태를 재현하고, 클레이니 대수 기반의 심볼릭 규칙을 유한 오토마타로 컴파일하여 취약점을 탐지합니다.
Brevis는 무손실 텐서 압축을 프로그램 합성 문제로 공식화하여 모델 체크포인트의 저장 공간을 효율적으로 줄이는 연구입니다. 타입 지정 DSL과 A* 탐색을 통해 텐서 구조를 포착하는 최적의 프로그램을 합성하며, 기존 범용 및 텐서 특화 압축기보다 뛰어난 압축률을 보여줍니다.
자동화 창고의 로봇 레이아웃 최적화를 위해 시뮬레이션 없이 다항 시간 내에 결과를 도출하는 SRA 알고리즘을 제안합니다. 기존 진화적 최적화 방식보다 훨씬 적은 연산 자원과 시간으로 더 높은 처리량과 확장성을 달성했습니다.
무선 센서 네트워크 내 VLA 로봇을 대상으로 물리적 적대적 공격을 평가하고 완화하는 프레임워크 VLAGuard를 제안합니다. 시각-언어-행동 모델의 어텐션 메커니즘을 교란하는 공격을 분석하고, 이를 방어하기 위한 미세 조정 기법을 제시합니다.
WAM-Diff2는 자율 주행을 위한 VLA 모델의 계산 지연 시간과 노출 편향 문제를 해결하기 위해 제안된 계층적 증류 프레임워크입니다. 자기회귀(AR) 모델의 추론 능력을 유지하면서 병렬 실행이 가능한 확산(Diffusion) 모델로 변환하여 효율성을 극대화합니다.
시각-언어 모델(VLM)에 인코딩된 탈옥 공격을 시도할 때, 관련 없는 미끼 이미지를 함께 입력하면 방어 효과가 크게 증폭됨을 발견했습니다. 실험 결과, 미끼 이미지는 캡션 매개 방어 기제의 공격 성공률(ASR)을 최대 73%까지 낮추는 효과를 보였습니다.
온디바이스 모델의 전화 비서 능력을 평가하기 위한 새로운 벤치마크인 CallScreenBench를 제안합니다. 기존 에이전트 평가와 달리 협력적 사용자가 없는 환경에서 모델의 대응 품질을 다섯 가지 차원으로 분석합니다.
도구 사용 에이전트의 제어 컨텍스트(ACC) 압축 시 발생하는 신뢰성 문제를 다루는 연구입니다. 새로운 벤치마크인 CompressAgent를 통해 압축률에 따른 에이전트의 실행 성공률과 신뢰성 경계를 분석했습니다.
DeBERTa-v3의 분리된 어텐션을 활용하여 AI 생성 텍스트를 투명하게 탐지하는 DeBERTa-Sentinel 프레임워크를 소개합니다. 토큰 수준의 설명을 제공하여 탐지 결과의 해석 가능성을 높였으며, 다양한 LLM 생성물에 대해 높은 정확도와 재현율을 기록했습니다.
MLLM의 구조화된 시각적 인지 능력을 향상시키기 위해 박스 수준의 기여도를 할당하는 MCR-GRPO 프레임워크를 제안합니다. 기존 GRPO의 응답 수준 감독 문제를 해결하여 개별 객체 예측의 정확도를 높이는 것이 핵심입니다.
Transformer의 잔차 구조에서 어텐션 매칭(Query-Key)과 콘텐츠 검색(Value)의 역할을 분리하는 RD-AttnRes 구조를 제안합니다. 실험 결과, 매칭과 검색이 서로 다른 깊이의 표현을 참조할 때 모델의 성능이 향상됨을 입증했습니다.
Google DeepMind가 시각과 언어 지시를 통해 로봇 동작을 생성하는 Gemini Robotics 2 모델군을 발표했습니다. VLA, ER 2, On-Device 2 모델로 구성되며, 적은 데이터로도 다양한 양팔 로봇 기체에 빠르게 적응하는 성능을 보여줍니다.