Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
AdviSD는 결과 기반 강화학습과 자가 증류를 결합한 새로운 방법론입니다. 이 방법은 피드백을 통해 어드바이저의 조언을 개선하며, 특히 어떤 수정(correction)이 다른 수정보다 더 유용한지 선택적으로 학습하여 모델 성능을 향상시킵니다. Gemini와 Claude 환경에서 Qwen3-8B를 사용한 실험 결과, 기존 방식 대비 높은 성능 향상을 입증했습니다.
Speech-to-Text API의 429 Rate Limit 처리 전략에 대해 논하며, 단순 재시도보다 내구성 있는 큐(durable queue)를 사용하는 것이 중요하다고 강조합니다. 특히 429 응답은 `Retry-After` 헤더 준수 및 제한적 지수 백오프를 사용해야 하며, 다른 4xx 오류는 재시도 대신 기능/구성 검토가 필요합니다.
본 논문은 비전 기반 신경 피드백 시스템 검증을 위해 확률적 세계 모델(stochastic world models)을 제안합니다. 이 모델은 물리적으로 근거 있는 잠재 변수를 가지며, 기존 GAN 대리물보다 더 풍부하고 충실한 장면 재현이 가능합니다. 연구진은 새로운 검증 절차를 개발하여 상태 공간 해결 능력을 크게 향상시켰습니다.
판단 특화 AI 모델 'Jev'를 활용하여 가상 자금으로 미국 주식 자동 매매를 시도했으나, 2일간의 테스트 결과 -0.63%의 손실을 기록했습니다. 이 글은 Jev의 작동 방식과 다양한 매매 전략(5분봉 지표, 패턴 등)을 적용한 과정을 상세히 설명하며, AI가 시장에서 우위를 점하기 어려움을 입증합니다.
생성 AI로 인해 결과물의 품질을 추측하던 대리 지표(proxy metrics)가 파괴되었으며, 이 현상을 'Meat Proxy'라 명명했습니다. 기존의 대책들이 망가진 대리 지표를 복구하려 하거나 근거 없는 취향 강요에 그치는 한계를 분석합니다.
Frostline은 사용자의 기기에서 구동되는 정원 계획 도구입니다. 이 도구는 서리일 정보를 바탕으로 파종, 육묘, 이식 등의 기간을 계산하고, 로컬 오픈 웨이트 모델인 Gemma 3과 Ollama를 활용하여 코치 노트를 생성합니다. 최종적으로 종이 체크리스트로 출력하여 사용자가 실제로 정원에 나가 활동하도록 유도하는 것이 핵심입니다.
본 논문은 테스트 시간 AI-for-AI 접근 방식을 연구하며, Builder가 Target을 위해 최적의 실행 환경을 구성하는 방법을 학습하는 Meta-Skill 개념을 제안합니다. 이 Meta-Skill은 필요한 지원과 제공할 리소스를 원칙으로 명시하여, Builder가 개발 세트에서 피드백을 통해 이를 학습하고 고정된 스킬 뱅크로 하네스를 구축합니다.
내부 재고 관리 도구(pcview)의 검색 기능을 개선하여 협력자 번호 정규식을 3~6자리 숫자로 제한하고, PcDevice 모델에 인보이스 및 구매 주문서 필드를 통합했습니다. 이 변경은 Prisma 스키마와 글로벌 검색 로직을 업데이트하여 데이터 무결성과 사용자 경험을 향상시킵니다.
본 논문은 기존의 토큰별 MoE가 비디오 데이터의 복잡한 특성(공간적/시간적 중복성, 롱테일 의미론)을 처리하는 데 한계가 있음을 지적합니다. 이를 해결하기 위해 전문가 풀을 '의미론적'과 '일반'으로 분리하고, 프로토타입 기반 라우팅 및 풀-푸시 정규화를 적용한 SplitMoE 아키텍처를 제안했습니다.
본 기사는 AI 시스템에서 데이터 처리의 보안 취약점을 다루며, 단순히 입력값 검증(Input Validation)이나 기능 실행 권한 확인(Authorization)을 넘어선 '접근 제어(Access Control)'의 중요성을 강조합니다. AI가 데이터를 다룰 수 있는지 여부는 반드시 애플리케이션 레벨에서 별도로 판단해야 합니다.
본 글은 에이전트가 복잡한 문제를 해결할 때 실행 과정을 체계적으로 제어하는 '에이전트적 메타 추론(agentic meta-reasoning)'을 소개합니다. 이 방법은 컨트롤러가 전체 기록 대신 간결한 계정으로 다음 옵션을 평가하고 선택하여, 기존 에이전트 대비 높은 성능 향상을 입증했습니다.
본 연구는 트랜스포머 언어 모델(LM)이 가진 정보 흐름 병목 현상을 해결하기 위해 LIFT(Latent Information Feedback Transformer) 아키텍처를 제안합니다. LIFT는 사전 학습 과정에서 깊은 레이어의 상태 정보를 얕은 레이어로 피드백하여, LM이 생성 전반에 걸쳐 상태를 효과적으로 전파할 수 있도록 합니다. 실험 결과, LIFT는 다양한 언어 모델링 및 다운스트림 작업에서 기존 트랜스포머 대비 우수한 성능을 입증했습니다.
본 논문은 장기 비디오 메모리에서 동일한 물리적 개체를 추적하는 어려움을 해결하기 위해 Grounded Entity Biographies (GEB) 프레임워크를 제안합니다. GEB는 클립 전반의 시각적으로 근거된 관찰들을 검색 가능한 '전기(biography)'로 그룹화하여, 질문 답변 과정에서 모델이 개체의 정체성 링크를 활용해 이벤트를 추적하도록 돕습니다.
본 논문은 Sentinel-2 다중 스펙트럴 SITS 데이터 기반의 작물 분할을 위한 PAtteRNS라는 하이브리드 트랜스포머-컨볼루션 모델을 제안합니다. 이 모델은 시간적, 스펙트럴, 공간적 측면에 개별 셀프 어텐션을 적용하며, 병렬 트랜스포머 아키텍처를 통해 계산 복잡도를 줄였습니다. 테스트 결과, 기존 모델 대비 우수한 성능과 특히 필지 경계 묘사 품질에서 뛰어남을 입증했습니다.
본 논문은 기존 감정 TTS 모델이 요청된 감정을 신뢰성 있게 표현하는 데 어려움이 있음을 지적하며, 트레이닝-프리 접근 방식인 벡터 조향을 연구합니다. 제안된 EmoRES는 감정 벡터를 공유 구성 요소와 잔차 구성 요소로 분해하여 백본 재학습 없이 두 요소를 제어함으로써 TTS의 감성 표현력을 크게 향상시켰습니다.
LeapQuant는 LLM의 선형 어텐션 구조에서 발생하는 순환 상태 양자화 문제를 해결하는 새로운 기법입니다. 훈련 없이도 높은 정확도를 유지하며, '윈도우별 양자화'와 보상 토큰을 활용하여 오차 누적 및 이상치 문제를 완화합니다. 이를 통해 메모리/컴퓨팅 비용을 크게 줄이고 추론 속도를 향상시킵니다.
본 논문은 선형 어텐션의 순환 상태 양자화 시 발생하는 오류 문제를 다룹니다. STEPQuant라는 새로운 프레임워크를 제안하여, 시간적/공간적 관점에서 오류가 미치는 영향을 분석하고 정밀도를 할당합니다. 이를 통해 메모리 효율성을 높이면서도 높은 정확도를 유지할 수 있음을 입증했습니다.
본 논문은 인간형 로봇의 로코-매니퓰레이션 기술 학습을 위해 PRISM이라는 프레임워크를 제안합니다. 이 프레임워크는 소수의 실제 비디오로부터 V2V 생성을 통해 대규모의 '반사실적' 상호작용 데이터를 생성하고, 이를 물리적으로 그럴듯하게 리타겟팅하여 로봇 훈련에 활용합니다.
본 연구는 MLLMs가 여러 시점 이미지로부터 일관된 3D 장면을 추론하는 데 어려움이 있다는 점에 착안하여 Imagine3D-LLM을 제안합니다. 이 모델은 학습 가능한 요약 토큰을 추가하고, 이를 간결한 3D Gaussian Splatting 표현으로 디코딩하며 답변 생성과 공동 학습시킵니다. 그 결과, 기존 방식보다 우수한 3D 추론 성능을 보여줍니다.
본 논문은 생성 모델의 역동성을 분석하며, '종 분화(speciation)'와 '비국소성(nonlocality)'이라는 두 가지 시간적 현상을 조사합니다. 연구진은 이 둘이 의미론적 정보 공간 분포를 통해 연결되어 있음을 증명하고, 시스템 크기 증가에 따른 두 창의 수축 조건을 제시했습니다.