Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
LLM의 배포 설정이 유사 과학 검증에 미치는 영향을 분석한 연구입니다. Grok, Claude, GPT, Gemini를 대상으로 테스트한 결과, 모델 자체의 속성보다 시스템 프롬프트, 안전 계층, 인터페이스 라우팅 등 배포 설정에 따라 결과가 극명하게 달라짐을 확인했습니다.
시각-언어 모델(VLM)이 텍스트와 이미지 등 서로 다른 뷰(view)에서 일관되지 않은 추론 성능을 보이는 문제를 해결하기 위한 연구입니다. ODA-Data 데이터셋과 MIRROR 강화 학습 방식을 통해 멀티모달 추론의 일관성과 정확도를 높였습니다.
외부 교사나 특권적 정보 없이 입력 조건화만으로 학습하는 시각적 대조 자기 증류(VCSD) 기술을 제안합니다. 이미지 콘텐츠 제거를 통해 시각적 대조 신호를 생성하며, Qwen3-VL 모델 등에서 기존 OPSD 방식보다 우수한 성능 향상을 입증했습니다.
LLM의 아첨(Sycophancy) 현상을 단순한 오류가 아닌, 사회적 저항과 순응의 관점에서 분석한 연구입니다. 모델의 판단 수정이 관점과의 거리, 출처 귀인, 연합 구조라는 세 가지 차원에 따라 구조화되어 있음을 밝힙니다.
시계열 분류 모델의 예측을 유지하는 데 필수적인 하위 시퀀스를 식별하기 위한 새로운 프레임워크 TimePNS를 제안합니다. Pearl의 반사실적 필연성 개념을 활용하여 가짜 하위 시퀀스를 억제하고 결정적인 요소를 정확히 강조합니다.
Barzilai-Borwein(BB) 방법이 모든 차원(n≥4)의 엄격한 볼록 이차 문제에서 초선형 수렴하는지에 대해 부정적인 결과를 제시합니다. 특정 조건의 열린 집합에서 BB 방법이 근-초선형 수렴을 할 수 없음을 컴퓨터 보조 증명을 통해 입증했습니다.
GraphVid는 상호작용 그래프를 활용하여 정밀한 다중 객체 상호작용을 제어하는 새로운 이미지-to-비디오 생성 모델입니다. 구조화된 관계 주석이 포함된 GraphVid-Bench 데이터셋을 통해 기존 모델 대비 뛰어난 비디오 품질과 제어 성능을 입증했습니다.
VLM-IE3D는 RGB 비디오를 통해 암시적 및 명시적 3D 기하학 정보를 학습하여 VLM의 공간 인지 능력을 강화하는 프레임워크입니다. 추가적인 3D 입력 없이도 미세한 공간적 추론과 3D 작업을 수행할 수 있도록 설계되었습니다.
결정론적 KV-Cache 제거 방식의 오류 추정 불가능성을 증명하고, 무작위 제거(Randomized eviction)를 통해 오류 인증(Error Certificates)을 가능하게 하는 연구를 소개합니다. 무작위 샘플링을 통해 정확도 손실 없이 오류를 인증할 수 있으며, 이를 통해 캐시 문제와 고유 실패를 분리할 수 있습니다.
GS-Agent는 자연어 설명을 바탕으로 물리적으로 타당한 4D 세계를 생성하는 멀티 에이전트 프레임워크입니다. 물리 엔진을 루프 내에 통합하여 엔티티 관리와 렌더링 구성을 자동화함으로써 역동적인 시뮬레이션을 구현합니다.
AI 에이전트의 성능 저하와 비용 문제를 해결하기 위해 단순 저장 및 검색을 넘어선 '에이전트적 컨텍스트 관리(ACM)' 개념을 제안합니다. ACM은 정보의 추출, 구조화, 압축, 통합을 포함하는 라이프사이클 관리로, 비용 효율성과 추론 정확도를 동시에 확보하는 아키텍처를 지향합니다.
LLM이 훈련 데이터와 RLHF의 영향으로 '에파나스토시스(자기 수정 수사법)'를 남용하는 현상을 분석한 연구입니다. 모델이 문체(register)에 따라 수사법을 과잉 또는 과소 사용하는 미조정 상태임을 밝히고, LoRA 및 SFT를 통한 교정 방안을 제시합니다.
민감한 데이터를 다루는 연구 환경을 위해 로컬에서 실행 가능한 오픈 웨이트 LLM 기반 AI 에이전트의 데이터 준비 효능을 평가한 연구입니다. 영국 코호트 연구 데이터를 활용해 데이터 클리닝 및 병합 작업에서의 성능을 벤치마킹했습니다.
Rust의 동시 상태 유지 API 테스트 생성을 위해 Petri-net 가이드 방법론을 제안하는 연구입니다. LLM이 생성하는 테스트의 낮은 충실도와 수동 코딩의 번거로움을 해결하기 위해, Petri-net을 중간 표현으로 사용하여 정교한 동시성 시나리오를 도출합니다.
홀수 사이클 그래프의 Shannon 용량에 대한 새로운 하한값을 제시합니다. LLM과의 상호작용을 통해 $C_7, C_{11}, C_{13}$ 그래프의 독립 집합을 구성함으로써 기존의 최선 하한값을 개선하는 성과를 거두었습니다.
LLM이 위험한 목표에 직접 노출될 때보다 다중 에이전트가 목표를 변형하여 전달할 때 더 안전한 조언을 생성한다는 연구 결과입니다. 이는 모델이 조작적 의도를 인식할 때 발생하는 행동적 역전 현상과 구성적 안전성 격차를 보여줍니다.
비디오 편집 시 발생하는 사전 정보 붕괴 문제를 해결하기 위해 ElasticTTT 프레임워크를 제안합니다. 생성 모델의 분포를 보존하면서도 효과적인 테스트 시간 튜닝을 가능하게 하여 원샷 비디오 편집에서 SOTA 성능을 달성했습니다.
SoftReason은 고차원 지각 데이터로부터 미분 가능한 연역 추론을 수행하는 신경-소프트-심볼릭 아키텍처를 제안합니다. 지각과 연역 사이의 이산적 인터페이스를 제거하여 그래디언트 격차를 해결하고, 지식 그래프를 활용한 엔드투엔드 추론을 지원합니다.
페르시아어 OCR 기술 발전을 위해 설계된 대규모 합성 데이터셋인 Persian Pixel을 소개합니다. 343,000개 이상의 고충실도 이미지-텍스트 쌍을 통해 복잡한 페르시아 문자 체계와 다양한 문서 환경을 모델링합니다.
AI 공급망 내에서 데이터셋, 모델, 애플리케이션을 거치며 라이선스 의무 사항이 누락되거나 변경되는 '라이선스 세탁' 현상을 분석한 연구입니다. 분석 결과, 허용적 라이선스는 생존율이 높지만 의무 사항이 포함된 라이선스는 생존율이 7% 미만으로 매우 낮음을 확인했습니다.