Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
QASP는 쿼리별 재현율(Recall)을 예측하여 검색 정책을 동적으로 조정하는 쿼리 적응형 벡터 검색 기술입니다. 단 한 번의 회귀를 통해 목표 재현율에 최적화된 검색 깊이를 결정하며, 데이터 액세스를 80% 절감하면서도 높은 성능을 유지합니다.
다면체에 정점을 추가할 때 피라미드 너비(pyramidal width)가 증가할 수 없다는 기존의 추측을 반박하는 연구입니다. 6개의 정수 점을 이용한 구체적인 반례를 제시하여 정점 삽입이 피라미드 너비를 증가시킴을 증명했습니다.
TerraNova는 물리적 지구 시스템과 인간 사회의 데이터를 결합하여 모델링하는 새로운 파운데이션 모델입니다. 격자형 지구 데이터와 국가 지표를 교차 모달 트랜스포머로 융합하여 시공간적 상태를 통합적으로 표현합니다.
확산 환경(Diffusion Environment) 내 다중 팔 밴딧 문제에 대한 정책 경사 업데이트를 연구합니다. 확률적 정책의 로짓 매개변수화를 통해 최적의 팔로의 수렴성을 증명하고, 비점근적 후회 상한을 도출했습니다.
2.4조 파라미터 규모의 MoE 구조를 가진 Qwen 3.8 플래그십 모델이 출시되었습니다. 이 모델은 자율적인 코딩 능력을 갖추어 10일 이상의 장기 프로젝트를 수행할 수 있는 성능을 보여줍니다.

Qwen 3.8의 클라우드 프리뷰 출시와 오픈 웨이트(Open Weights) 계획 사이의 간극을 분석합니다. 모델 발표가 곧 로컬 배포 가능성을 의미하지 않으므로, 도입 전 모델 식별자, 실제 성능 테스트, 라이선스 및 아티팩트 확인이 필수적임을 강조합니다.
MOT-SR은 LLM과 외부 분석 도구를 결합하여 과학적 방정식을 발견하는 새로운 프레임워크입니다. 정확도, 복잡성, 일반화를 동시에 최적화하는 다중 목적 평가를 통해 기존 기호 회귀 모델의 한계를 극복했습니다.
LLM의 수학적 문제 해결 신뢰성을 높이기 위해 에이전트 기반의 수학적 도구 흐름 검증 방식인 AMTFV를 제안합니다. 검증 모델링과 실행을 분리하여 정확한 계산을 지원하며, DeepSeek, GPT, Gemini 등 다양한 모델에서 기존 베이스라인보다 높은 성능을 입증했습니다.
멀티모달 거대 언어 모델(MLLM)이 대화 클립을 통해 두 사람의 친밀도를 추론하는 능력을 평가하는 새로운 벤치마크 FriendBench를 소개합니다. 26개 모델을 대상으로 텍스트, 오디오, 비디오 모달리티를 분석하여 인간과 모델의 추론 방식 차이를 규명했습니다.
Dungeons & Dragons 전투를 활용하여 규칙 중심의 전술적 추론 능력을 평가하는 새로운 벤치마크인 DungeonBench를 소개합니다. 이 벤치마크는 단순한 전투를 넘어 자원 관리와 장기적인 생존 전략을 포함한 복잡한 의사결정 능력을 테스트합니다.
LLM 에이전트의 순차적 하이퍼파라미터 최적화(HPO) 능력을 평가하기 위한 새로운 벤치마크인 AgentHPOBench를 소개합니다. 30개의 머신러닝 태스크를 통해 에이전트가 실험 로그를 해석하고 후속 설정을 제안하는 능력을 측정합니다.
딥러닝 모델의 설명 충실도를 객관적으로 평가하기 위해 설명 가능성-성능 계수(EPC)를 제안합니다. EPC는 특징 선택 희소성과 모델 성능 간의 트레이드오프를 정량화하며, 다양한 모달리티에서 인간의 판단과 높은 일치성을 보임을 입증했습니다.
TraceViT는 ARC 벤치마크를 위해 제안된 루프형 시각적 추론 모델로, 중간 단계의 변환 과정을 단계별로 감독하는 '추적 감독(Trace Supervision)' 방식을 사용합니다. 의미론적으로 단조로운 변환 체인을 통해 모델이 논리적인 추론 단계를 밟도록 유도하며, ARC-AGI-1에서 높은 성능을 입증했습니다.
본 연구는 가치 기반 모방 학습(Value-Based Imitation Learning)에서 전문가와의 온폴리(On-Policy) 상호작용이 미치는 영향을 분석합니다. 상호작용을 통해 학습자의 표현력 요구 사항을 완화하고 전문가의 가치 함수를 효율적으로 실현할 수 있음을 입증합니다.
CENDRe는 CNN 기반 시계열 데이터의 개념 추출(Concept Extraction)을 위한 새로운 방법론을 제안합니다. 기존 방식의 한계인 주파수 특징 간과, 개념 수 정의 문제, 국소화 불일치를 해결하여 시간 및 주파수 도메인 모두에서 정확한 패턴을 식별합니다.
AgenticRepair는 에이전트 기반의 다각적 프로그램 컨텍스트 엔지니어링을 통해 자동화된 보안 취약점 수정을 수행하는 프레임워크입니다. 코드 구조, 런타임 실행, 커밋 히스토리라는 세 가지 핵심 컨텍스트를 활용하여 기존 방식보다 높은 패치 성공률을 달성했습니다.
에이전틱 AI 시스템의 복잡한 다단계 동작을 검증하기 위한 새로운 방법론을 제시하는 조사 논문입니다. 257편의 논문을 분석하여 행동, 안전, 시간적, 규제, 다중 에이전트라는 5차원 분류 체계를 구축하고 현재 기술의 격차를 규명합니다.
AuditCoder는 코드 생성 시 프로그램과 함께 감사 가능한 생성 추적을 출력하여 생성 결정과 수정 이력을 보존하는 프레임워크를 제안합니다. 작업 그래프를 통해 책임 식별자를 할당하고, 검증 실패 시 특정 영역만 국소적으로 수정할 수 있는 기능을 제공합니다.
AI 코딩 에이전트의 대규모 코드 생성을 효과적으로 검토하기 위한 새로운 시스템 ARCTIC을 제안합니다. 의도 예측, 드리프트 탐지, 코드 스포트라이트 기능을 통해 정확성, 보안, 성능 중심의 고도화된 코드 비평을 수행합니다.
NLP 모델 업데이트 시 발생하는 행동 회귀를 탐지하기 위한 도구인 Alteron을 소개합니다. 변형 테스트(Metamorphic Testing)를 활용하여 기존 벤치마크가 놓치기 쉬운 모델 버전 간의 미세한 동작 변화를 식별합니다.