Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
SWE-MeM은 장기적 소프트웨어 엔지니어링 작업을 수행하는 에이전트를 위한 적응형 메모리 관리 학습 프레임워크입니다. 에이전트가 컨텍스트 예산에 맞춰 메모리 압축 시점과 방식을 스스로 결정하도록 학습시켜 성능과 효율성을 동시에 높였습니다.
AI가 생성한 코드가 다시 학습 데이터로 사용되는 재귀적 자기 학습 과정에서 발생하는 모델 성능 저하(Collapse) 현상을 연구합니다. 리뷰 체계에 따른 붕괴 양상을 분석하며, AI 자체 리뷰보다는 외부 검증의 중요성을 강조합니다.
소프트웨어 엔지니어링이 결정론적 코드 작성에서 자율적 에이전트 시스템을 감독하는 패러다임으로 전환되고 있음을 논합니다. 에이전트 엔지니어의 등장과 함께 작업 단위, 정확성 평가, 책임 소재의 변화를 세 가지 핵심 축으로 정의합니다.
터미널 기반 범용 컴퓨터 사용 에이전트(TUA)를 평가하기 위한 새로운 벤치마크인 TUA-Bench를 소개합니다. 일상적인 디지털 활동부터 전문적인 과학·공학 워크플로우까지 120개의 실제 작업을 포함하며, 실행 기반 점수 산정 방식을 사용합니다.
LLM이 명시적인 지침 없이 Java 코드 스니펫을 새로운 문맥에 맞게 적응시키는 능력을 평가하는 연구입니다. 변이 주입 프레임워크를 통해 적응 유형, 복잡도, 문맥 의존성을 체계적으로 분석합니다.
펌웨어 내 제3자 라이브러리(TPL)의 취약점을 탐지하기 위한 바이너리 코드 유사성 탐지(BCSD)의 대규모 실증 연구를 다룹니다. 함수 버전, 탐색 공간, 함수 크기, 컴파일 툴체인이 성능에 미치는 영향을 분석하고 성능을 개선하는 전략을 제안합니다.
LLM의 코드 생성 성능 향상을 위한 정렬(Alignment) 기술의 효과를 분석한 연구입니다. DPO와 BoNBoN 기법을 활용하여 사전 학습 모델과 미세 조정 모델 간의 정렬 경로에 따른 기능적·비기능적 요구사항의 트레이드오프를 실증적으로 규명했습니다.
LLM의 버그 수정 능력을 정밀하게 평가하기 위해 개발된 대규모 벤치마크 MegaBugFix를 소개합니다. LLM을 활용해 Diff 방식으로 12,629개의 Python 버그 프로그램을 합성하여 기존 벤치마크의 한계를 극복했습니다.
Symbolon은 코드 변환 학습을 통해 심볼릭 실행의 확장성 문제를 해결하는 새로운 프레임워크입니다. 다양한 코드 변환을 에이전트 기술로 증류하여 적용함으로써, 기존 방식보다 효율적으로 경로 폭발 문제를 극복하고 버그 탐지 성능을 높였습니다.
마이크로서비스 장애 진단 시 LLM 에이전트의 추론 과정을 체계적으로 평가하기 위한 새로운 벤치마크와 데이터셋을 제안합니다. 기존의 결과 중심 평가를 넘어 국소화, 식별, 추론의 세 가지 차원에서 에이전트의 능력을 검증합니다.
난독화된 어셈블리 코드 이해를 위해 LLM의 성능을 개선하는 OASIF 프레임워크를 제안합니다. 토큰 효율적인 인코더와 3단계 학습 과정을 통해 상용 난독화 도구에 대한 대응력을 높였습니다.

여러 언어 모델을 결합하는 앙상블 전략이 모든 모델이 동시에 틀리는 '공동 실패(co-failure)' 비율인 β에 의해 성능 한계가 결정된다는 연구를 소개합니다. 기존의 쌍별 오류 상관관계 방식으로는 이 공동 실패율을 정확히 측정할 수 없음을 지적합니다.
HKUDS가 개발한 ViMax는 멀티 에이전트 오케스트레이션을 통해 기존 AI 비디오 생성의 한계인 짧은 길이와 일관성 문제를 해결합니다. 시나리오 작가, 감독, 프로듀서, 비디오 생성기라는 네 가지 에이전트 역할을 통해 구조화된 서사와 일관된 캐릭터를 유지하는 영화적 비디오 생성을 구현합니다.

Ante는 참조 카운팅의 유연성과 빌림 검사의 안전성을 결합한 새로운 시스템 프로그래밍 언어 설계입니다. shape-stability와 temporary uniq conversion을 통해 Rust의 런타임 패닉이나 Swift의 독점 접근 검사 오버헤드 없이 안전한 가변 빌림을 구현하는 것을 목표로 합니다.
Ornith-1.0은 에이전트 기반 코딩을 위해 설계된 자기 개선형 오픈 소스 모델 시리즈입니다. 강화학습을 통해 솔루션과 스캐폴드를 동시에 최적화하며, 다양한 코딩 벤치마크에서 동급 규모 모델 대비 최첨단 성능을 보여줍니다.

3D-RE-GEN은 단 한 장의 사진을 기반으로 완전하고 편집 가능한 3D 실내 장면을 생성하는 기술입니다. 단일 이미지만으로 정교한 3D 공간을 구축할 수 있는 혁신적인 연구 결과를 보여줍니다.
직접 라벨링한 900개의 의료 스캔 문서를 활용하여 의료 VQA 성능을 테스트한 결과입니다. 기존 코딩 벤치마크와는 다른 양상이 나타났으며, 모델별 추론 속도와 사고 과정의 차이를 분석했습니다.

GPT-4, Claude 3 등 주요 LLM의 창의성을 인간과 비교한 연구 결과입니다. AI는 평균적인 인간보다 높은 창의적 점수를 기록했으나, 상위 10%의 탁월한 인간은 여전히 AI를 압도하는 것으로 나타났습니다.
LLM의 핵심 아키텍처인 Attention, Transformer, MoE, KV Cache, Speculative Decoding의 탄생 배경과 트레이드오프를 비유로 설명합니다. 각 기술이 해결하고자 했던 문제와 모델 선정 및 비용 최적화 시 고려해야 할 실무적 관점을 다룹니다.
OpenAI가 새로운 AI 모델군인 GPT-5.6(Sol, Terra, Luna)을 발표했습니다. 각 모델의 차이점과 API 가격, ultra 모드에 대한 정보와 함께 미국 정부의 요청으로 인한 한정적 공개 상황을 다룹니다.