Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
LLM 지원 코딩 도입으로 발생하는 기술 부채의 유형과 완화 전략을 다성적 문헌 고찰을 통해 분석한 연구입니다. 기존의 코드 및 설계 부채 외에도 프롬프트, 윤리, 데이터 등 LLM 특유의 새로운 부채 유형을 식별했습니다.
멀티 에이전트 LLM 시스템의 디버깅 비용을 줄이기 위해 지식 그래프를 활용한 '제로-리플레이' 예측 방식을 제안합니다. 리플레이를 직접 수행하지 않고도 어떤 이벤트가 시스템에 큰 영향을 미치는지 예측하여 디버깅 효율성을 극대화합니다.
코드 LLM의 아키텍처 추론 능력을 높이기 위해 에이전트적 판단(Agentic Judgment) 파이프라인을 제안합니다. ACJ와 AQJ라는 두 가지 판단기를 통해 아키텍처 복잡도와 품질을 평가하며, 이를 통해 미세 조정된 Qwen 모델이 SWE-bench Verified에서 높은 성능 향상을 보였습니다.
LLM을 활용한 프로그램 버그 분석 시 발생하는 근거의 불확실성을 해결하기 위해, LLM의 추론과 형식 분석을 분리한 시스템 'Evident'를 제안합니다. Evident는 LLM이 분석 하네스를 구축하면 백엔드 분석기가 도달 가능성을 검증하는 방식으로 작동하여 오탐을 효과적으로 제거합니다.
Modelica를 다양한 현대적 엔지니어링 워크플로우에 맞게 변환하는 Rust 기반 네이티브 컴파일러 Rumoca를 소개합니다. 파싱부터 DAE 구축, 코드 생성까지의 파이프라인을 통해 JAX, Julia 등과의 호환성을 높였습니다.
Assurance Case에 정량적 신뢰도 평가를 적용할 때 발생하는 의사결정 복잡도와 노력의 확장성을 분석하는 모델을 제안합니다. BBN, DST, Certus 등 기존 방법론을 비교하여 논거 크기에 따른 효율성을 검증했습니다.
본 논문은 대화형 데이터 시각화 언어인 Vega의 모호한 의미론을 해결하기 위해 그래프 기반의 운영 의미론과 타입 시스템을 제안합니다. 이를 통해 Vega의 스트리밍 데이터플로우 아키텍처를 정밀하게 모델링하고, 정적 분석을 통해 데이터 변환 과정의 오류를 사전에 방지할 수 있는 체커를 구현했습니다.
SDVDiag는 소프트웨어 정의 차량(SDV)의 장애 원인을 분석하기 위한 멀티모달 인과 관계 발견 파이프라인을 제안합니다. 로그와 메트릭 데이터를 공유 임베딩 공간으로 융합하여 온라인 환경에서 실시간으로 근본 원인을 추적합니다.
Scratch 프로그램의 행동 동등성을 판별하기 위한 새로운 프레임워크 SPECTRA를 제안합니다. 렌즈-파라미터적 관찰 관계를 통해 구문론적으로 다르더라도 동작이 동일한 프로그램을 정밀하게 검증합니다.
본 논문은 절차적 연산 대신 상태 공간과 술어를 활용한 선언적 연산 모델을 제안합니다. 문제 명세와 구현 전략을 분리하여 다양한 알고리즘과 양자 오라클을 동일한 의미론적 틀 안에서 다룰 수 있는 추상화 체계를 구축했습니다.
Snyk VulnBench JS 1.0을 통해 에이전트형 LLM의 보안 취약점 탐지 반복 가능성을 실험했습니다. 연구 결과, LLM의 추가 탐지 결과는 불균일한 반면, Claude와 같은 모델이 기존 SAST 도구와 일치하는 결과는 높은 안정성을 보였습니다.
확률적 프로그램 검증의 확장성 문제를 해결하기 위해 타입화된 확장 결정 다이어그램(TEDDs)을 제안합니다. TEDDs를 통해 최약 전제 기대치(WP)를 효율적으로 계산하고 SMT 기반 가지치기를 적용하여 검증 성능을 획기적으로 향상시켰습니다.
본 연구는 Octagons 추상 도메인에서 가짜 제약 조건을 제거하기 위한 새로운 알고리즘을 제안합니다. 6,930개의 불변량을 비교 분석하여 Octagons의 표현력이 불변량 정밀도에 미치는 영향을 평가하고, 최소 비교를 통해 도메인 간의 관계를 재정립했습니다.
Anthropic의 Claude Fable-5 모델을 증류하여 개발한 오픈 웨이트 모델 Qwable-v1이 공개되었습니다. Qwen3.6-35B를 기반으로 하며, Fable-5의 에이전트 코딩 흔적을 학습하여 도구 호출 능력을 갖추고 있습니다.
LLM의 정렬(Alignment)을 위한 네 가지 주요 방법론인 RLHF, DPO, IPO, KTO를 비교 분석합니다. 각 방법의 수학적 원리, 데이터 요구 사항, 컴퓨팅 예산 및 안정성 측면의 트레이드오프를 다룹니다.
Microsoft와 중국 대학 연구진이 발표한 SkillOpt 방법론은 단순한 Markdown 파일 하나로 AI 에이전트의 성능을 획기적으로 높일 수 있음을 보여줍니다. 이 방식은 기존의 다양한 학습 방법론보다 뛰어난 성능 향상을 기록했습니다.
PropRAG는 LLM의 멀티홉 추론 능력을 강화하기 위해 설계된 새로운 RAG 프레임워크입니다. 문맥적 명제를 기본 단위로 활용하고 LLM-free 온라인 빔 서치 알고리즘을 통해 지연 시간과 비용을 줄이면서 복잡한 질의에 대한 성능을 극대화했습니다.
RAG 시스템의 성능을 평가하기 위한 새로운 중국어 벤치마크인 CRUD-RAG를 소개합니다. 이 벤치마크는 데이터셋, 실험 튜토리얼, 평가 코드를 포함하며 RAG 시스템의 역량을 종합적으로 측정합니다.
LLM의 아첨(Sycophancy)과 환각(Hallucination)을 측정하기 위한 오픈 벤치마크인 HalBench v2.3을 소개합니다. 33개의 모델을 대상으로 테스트한 결과, Sonnet 4.6이 가장 높은 반박률을 기록했으며 Qwen 모델이 오픈 소스 모델 중 가장 우수한 성능을 보였습니다.

LLM의 출력을 최적화하기 위해 작업별로 적합한 모델 하네스(model harnesses)를 자동으로 탐색하는 기술을 다룹니다. 이를 통해 모델의 성능을 극대화할 수 있는 최적의 설정을 효율적으로 찾을 수 있습니다.