Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
AutoSci는 과학 연구의 전 과정을 자동화하기 위해 설계된 메모리 중심 에이전트 시스템입니다. 장기 지식과 활성 연구 메모리를 분리하여 관리하며, 피드백을 통해 연구 절차를 스스로 개선하는 구조를 갖추고 있습니다.
헝가리어 대화형 ASR 성능 향상을 위해 기존 85시간 규모의 BEA-Dialogue 코퍼스를 200시간으로 확장한 BEA-Dialogue+를 제안합니다. 화자 분리 기준을 완화하여 데이터 양을 늘렸으며, Whisper 및 FastConformer 모델을 통해 SOT 기반 미세 조정의 효과를 검증했습니다.
LLM의 추론 능력을 높이기 위해 탐색 이력을 명시적인 트리 구조로 표현하는 LinTree 방법론을 제안합니다. 기존의 선형화된 추적 방식이 가진 한계를 극복하여 백트래킹과 분기 전환 시 탐색 효율성을 크게 향상시켰습니다.
GNN의 메모리 병목 현상을 해결하기 위해 I/O 및 연산 강도 중심의 새로운 GPU 커널을 제안합니다. SpMM, 리덕션, 어텐션 기반 레이어를 최적화하여 데이터 이동을 줄이고 그래프 확장성을 크게 개선했습니다.
에이전트 강화학습(Agentic RL)에서 성공적인 궤적을 추상적 패턴으로 압축하여 일반화 성능을 높이는 ReuseRL 방법론을 제안합니다. MDL 원칙을 기반으로 기술 사전을 추출하고 특이 행동에 페널티를 부여하여 성능을 개선합니다.
LLM의 의인화된 속성이 모델 고유의 특성이 아닐 수 있음을 Age of Empires II 환경의 신경망 실험을 통해 지적합니다. 특정 속성은 기질(substrate)에 따라 달라질 수 있으므로, 실험 시 의인화된 속성을 가정하는 대신 비유일성을 가정하는 '귀무 가설'을 제안합니다.
3D 장면 재구성 시 계산 자원을 효율적으로 배분하기 위한 적응형 특징 최적화 프런트엔드 기술을 제안합니다. 질감, 재현성, 판별력 등을 기준으로 특징 점수를 매겨 뷰별로 예산을 할당함으로써 재구성 품질을 높입니다.
RayDer는 카메라 추정, 장면 재구성, 렌더링을 하나의 백본으로 통합한 피드포워드 트랜스포머 모델입니다. 실제 비디오의 동적 요소를 학습 신호로 활용하여, 정적 장면의 신규 시점 합성(NVS) 성능을 데이터 규모에 따라 멱법칙으로 확장합니다.
Transformer 모델의 어텐션 헤드가 위치 기반 또는 기호 기반으로 학습되는 역학을 연구합니다. 숫자와 문자 작업의 구조적 차이에 따른 메커니즘을 분석하고, RoPE 기하학을 통해 긴 시퀀스에 대한 외삽 성능 차이를 규명합니다.
시각-언어 모델(VLMs)이 모호한 입력 상황에서 직업-성별 스테레오타입을 어떻게 출력하는지 분석한 연구입니다. 모델이 내부적으로는 여성 연관성을 인코딩하더라도, 출력 단계에서 남성 신호가 증폭되고 여성 신호가 억제되는 현상을 발견했습니다.
SPECTRA는 합성 텍스트 코퍼스와 검색 테스트 컬렉션을 생성하는 재현 가능한 프레임워크입니다. 인간의 평가를 보완하는 진단 도구로서, 대규모 데이터셋 구축 비용을 절감하고 검색 시스템의 확장성과 실패 모드를 효과적으로 테스트할 수 있습니다.
LLM이 희귀한 Paired-Focus 구문의 구성 의미론을 학습하는지 분석한 연구입니다. 새로운 데이터셋을 통해 모델 규모와 학습 역학을 테스트한 결과, 특정 규모의 오픈 소스 모델은 구문론보다 의미론을 나중에 습득하며 세상 지식과 상관관계가 있음을 발견했습니다.
Lumos-Nexus는 비디오 통합 모델의 훈련 효율성과 시각적 품질을 동시에 개선하는 새로운 프레임워크입니다. 2단계 설계를 통해 경량 생성기로 의미론적 제어를 학습한 뒤, 추론 시 UPFB 기술로 고용량 생성기의 성능을 점진적으로 활용합니다.
그래프-텍스트 생성(Graph-to-Text)을 위한 마스크 확산 언어 모델(MDLM)의 생성 궤적을 분석한 연구입니다. MDLM이 엔티티를 우선 생성하는 특성을 발견하고, SFT의 실패 모드를 해결하기 위한 람다 스케일 구조적 디코딩 기법을 제안합니다.
분산된 에이전트 공격을 탐지하기 위한 상태 유지형 온라인 모니터링 기술을 제안합니다. 기존 모니터가 놓치는 계정 간 분산된 유해 행위를 실시간 클러스터링으로 식별하여, 낮은 지연 시간으로 공격을 조기에 포착합니다.
LongTraceRL은 장문 맥락 추론 능력을 향상시키기 위해 루브릭 보상(Rubric Rewards)을 활용한 새로운 강화학습 방법론을 제안합니다. 계층적 방해 요소를 포함한 도전적인 데이터셋과 엔티티 수준의 과정 감독을 통해 모델의 증거 기반 추론 성능을 극대화합니다.
TunerDiT는 추가 훈련 없이 Diffusion Transformer를 활용해 다중 이벤트 비디오를 생성하는 기술입니다. 이벤트 분할 마스킹과 프롬프트 융합을 통해 비디오 일관성과 이벤트 분리 사이의 조절 가능한 성능을 제공합니다.
문맥에 따라 논증의 성패가 결정되는 CDAFs(Context-Dependent Argumentation Frameworks) 프레임워크를 제안합니다. 에이전트가 전략적 레버를 활용해 관점을 활성화함으로써 논증의 결과를 조절할 수 있음을 이론적으로 증명합니다.
금융 QA 분야에서 LLM의 수치적 환각 문제를 해결하기 위해 데이터 중심 추론 컴파일러(DCRC) 프레임워크를 제안합니다. 적대적 데이터 구축과 다단계 학습을 통해 검증 가능한 추론 프로그램을 생성하여 신뢰성을 높입니다.
점진적 시계열 데이터의 해석 가능한 표현을 학습하기 위한 새로운 방법론인 STEP을 제안합니다. 자기지도 대조 학습을 통해 저차원 잠재 공간을 구축하며, 잠재 컴퍼스(θ, r)를 통해 상태 진행과 활성 모드를 명확히 구분합니다.