Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
Liquid AI가 추론 모델의 실패 모드인 '둠 루프(doom loop)'를 제거하는 오픈 소스 기술인 Antidoom을 출시했습니다. 이 기술을 적용하면 LFM2.5 및 Qwen3.5 모델에서 둠 루프 발생률을 획기적으로 낮출 수 있습니다.
Google Research의 'Prompt Repetition Improves Non-Reasoning LLMs' 논문을 바탕으로 프롬프트 반복 효과를 소규모 재현 실험했습니다. 실험 결과, 논문이 주장한 급격한 성능 향상 대신 2%의 미미한 차이만을 확인하며 트랜스포머 어텐션 메커니즘에 대한 통찰을 얻었습니다.
자연 모방 최적화 알고리즘인 군집 지능(Swarm Intelligence)을 활용한 블랙박스 적대적 공격 기법을 분석합니다. 그래디언트 정보가 없는 환경에서도 PSO, DE, ABC 등의 알고리즘이 어떻게 신경망의 취약점을 찾아내는지 설명합니다.
CGGS는 1인칭 시점(ego-centric) 3D 장면 생성 시 발생하는 시점 불일치와 기하학적 왜곡을 해결하기 위한 새로운 텍스트-to-3D 프레임워크입니다. 다중 시점 확산 모델과 기하학적 최적화 기법을 결합하여 일관성 있고 정확한 3D 콘텐츠 생성을 가능하게 합니다.
Wan-Streamer v0.2는 낮은 지연 시간을 유지하면서 출력 해상도를 640x368로 높인 엔드투엔드 시청각 상호작용 모델입니다. 단일 GPU 저지연 경로와 멀티 GPU 컨텍스트 병렬 구조를 통해 실시간 대화에 적합한 고해상도 비주얼 스트림을 지원합니다.
범용 로봇 조작 정책을 체계적으로 평가하기 위한 통합 벤치마크인 RoboDojo를 소개합니다. 시뮬레이션과 실세계 환경을 결합하여 일반화, 정밀도, 장기 실행 능력 등을 종합적으로 검증할 수 있는 프레임워크를 제공합니다.
SceneFrom3D는 실외 3D 장면 생성 시 발생하는 뷰 스케줄링 병목 현상을 해결하기 위해 자동 뷰 스케줄링 프레임워크를 제안합니다. 유향 생성 그래프를 통해 뷰를 자동으로 정의하며, 객체 수준의 제어를 통해 고품질의 기하학적 일관성을 유지합니다.
본 논문은 미분 가능한 빛 전달 기술을 활용하여 눈부심 지수(UGR)를 최적화하는 새로운 프레임워크를 제안합니다. 기존의 이산적인 UGR 공식을 미분 가능한 시그모이드 경계로 대체하여, 경사 기반 역렌더링을 통해 시각적 불편함을 최소화하는 물리적 설계를 가능하게 합니다.
Omnitrees의 세분화 기능을 확장하여 코스닝(coarsening)을 포함한 완전 적응형 압축을 가능하게 하는 새로운 연산을 제안합니다. 웨이브렛(wavelets)을 통합하여 모멘트를 보존하며, 3D 형상 및 밀도 데이터에서 OpenVDB 대비 압축 효율을 획기적으로 높였습니다.
백테스팅 및 에이전트 기반 트레이딩 시스템에서 발생하는 Look-ahead bias를 '시간적 비간섭'이라는 형식적 속성으로 정의하고 분석한 연구입니다. 데이터 가용성과 참조 시간을 분리하는 파이프라인 계산법을 통해 유출 여부를 선형 시간 내에 검증할 수 있는 이론적 프레임워크를 제시합니다.
MV-Forcing은 4D 기하학적 브리지를 활용하여 긴 다중 시점 비디오를 생성하는 새로운 프레임워크를 제안합니다. 3D 재구성 모델을 통해 시점 간 기하학적 일관성을 유지하며, 공동 디노이징 방식을 통해 시간적 제약 없이 비디오를 확장할 수 있습니다.
LLM을 이용한 HPC(고성능 컴퓨팅) 코드 번역의 정확성을 검증하기 위한 새로운 프레임워크 Kaizen을 제안합니다. 변형 퍼징과 차분 테스트를 결합하여 컴파일 성공 여부만으로는 잡아낼 수 없는 의미론적 오류를 탐지합니다.
모바일 로봇의 실시간 포인트 스트림 처리를 위한 새로운 공간 데이터 구조인 ECO(Ego-Centric Octree)를 제안합니다. 3D 슬라이딩 윈도우 방식을 통해 계산 및 메모리 효율성을 높이고, KITTI 벤치마크에서 기존 방식 대비 업데이트 시간을 대폭 단축함을 입증했습니다.
TiCodec은 시불변 표현 추출(TIRE) 모듈을 통해 음성 콘텐츠에서 화자 및 환경 정보를 분리하는 신경망 음성 코덱 연구입니다. 중간 레이어의 상호 보완성을 활용한 Dual-TIRE 구조를 제안하며, 스트리밍 환경에서도 성능 저하 없이 저지연 음성 처리가 가능함을 입증했습니다.
LLM이 생성할 남은 출력 길이를 내부적으로 추정하고 있다는 연구 결과입니다. 은닉 상태를 통한 선형 프로빙 결과, 모델은 응답의 전체 길이를 예측할 수 있는 내부 표현을 가지고 있음이 확인되었습니다.
실제 운영 환경의 Race Condition 버그를 대상으로 6개 LLM 모델의 디버깅 능력을 비교한 벤치마크 결과입니다. DeepSeek V4 Flash는 비용 효율성과 고유 버그 발견 능력을, MiMo V2.5 Pro는 가장 높은 버그 발견 성능을 보여주었습니다.
Qwythos-9B-Claude-Mythos-5 모델의 1M 컨텍스트 성능을 실제 코드베이스를 통해 테스트한 결과입니다. 9B 규모의 모델임에도 불구하고 긴 컨텍스트 내에서 복잡한 논리적 결함을 찾아내는 뛰어난 추론 능력을 보여주었습니다.
최상위 AI 모델들이 학습 데이터 차단 시점(training cutoff) 이후에 철회된 실제 논문을 유효한 정보로 인용하는 구조적 한계를 분석합니다. 모델의 규모를 키워도 해결되지 않는 문제이기에, 외부 레지스트리와 대조하는 검증 계층의 필요성을 강조합니다.
클래식 판타지 RP 에이전트의 성능을 측정하기 위해 세분화된 카테고리와 히트맵 방식을 도입한 벤치마크 업데이트 결과입니다. LLM 판사를 활용해 창의성보다는 기계적 준수 사항(상태 추적, 구조화된 출력 등)을 정밀하게 평가합니다.
Google DeepMind가 발표한 Gemma 4 기술 보고서는 단순한 벤치마크 성능을 넘어, 로컬 하드웨어 최적화와 멀티모달 기능에 집중합니다. 특히 12B 모델은 별도의 인코더 없이 이미지와 오디오를 직접 처리하여 메모리 효율성을 극대화했습니다.