Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.

상태 공간 모델(SSM)인 Mamba에 Mixture of Experts(MoE) 구조를 결합한 MoE-Mamba를 제안합니다. 이 모델은 Transformer-MoE와 Mamba를 모두 능가하는 성능을 보이며, Transformer 대비 효율적인 학습 속도를 자랑합니다.
LLM이 Pokémon FireRed를 자율적으로 플레이할 수 있도록 설계된 오픈 소스 에이전트 프로젝트입니다. 에뮬레이터 제어, 게임 메모리 기반의 경험 관리, 경로 탐색 및 OCR을 활용한 텍스트 파싱 기술을 결합하여 구현되었습니다.
YC W25 출신 스타트업 Enhanced Radar가 항공 교통 관제(ATC)의 인적 오류를 방지하기 위한 AI 안전망 솔루션을 발표했습니다. 자체 개발한 Yeager 모델을 통해 ATC 오디오를 실시간 분석하여 충돌 위험을 사전에 감지합니다.
Finetuning Hub는 YAML 설정 파일 하나로 LLM 미세 조정 실험의 전 과정을 제어할 수 있는 CLI 도구입니다. 프롬프트, 오픈 소스 모델, 최적화 전략 및 테스트를 통합적으로 관리하여 효율적인 실험 파이프라인을 구축할 수 있습니다.

LLM의 컨텍스트 윈도우가 확장됨에 따라 성능이 유지될 것이라는 일반적인 가정과 달리, 입력 토큰 증가가 모델 성능에 미치는 부정적 영향을 분석합니다. 기존 NIAH 벤치마크의 한계를 지적하며, 의미적 매칭과 복잡한 작업 환경에서의 성능 저하 현상을 입증합니다.
Pipecat에서 공개한 오픈 소스 네이티브 오디오 발화 탐지(Turn Detection) 모델 Smart Turn v3.2를 소개합니다. VAD의 한계를 넘어 음성의 운율과 의미론적 단서를 직접 분석하여 음성 에이전트의 응답 시점을 정교하게 결정합니다.
ControlFlow는 에이전트 기반의 AI 워크플로우를 구축하기 위한 Python 프레임워크입니다. 작업 중심 아키텍처를 통해 복잡한 AI 프로세스를 관리 가능한 단계로 분해하며, 구조화된 결과와 멀티 에이전트 오케스트레이션을 지원하여 예측 가능한 AI 애플리케이션 개발을 돕습니다.
Pipecat은 실시간 음성 및 멀티모달 대화형 AI 에이전트를 구축하기 위한 오픈 소스 Python 프레임워크입니다. 오디오, 비디오, AI 서비스 및 다양한 전송 방식을 손쉽게 오케스트레이션하여 초저지연 상호작용이 가능한 복잡한 대화 시스템을 구현할 수 있습니다.
Bloop은 자연어로 코드베이스에 질문하고 검색할 수 있는 LLM 기반의 코드 탐색 도구입니다. 사용자의 코드를 컨텍스트로 활용하여 코드 설명, 기능 작성, 오류 탐색 등을 지원하며, Rust 생태계를 기반으로 구축되었습니다.
Agent Browser Protocol(ABP)은 웹 브라우징 과정을 에이전트 친화적인 이산적(discrete) 멀티모달 채팅 형식으로 재구성한 오픈 소스 프로토콜입니다. 이는 Chromium 포크에 MCP + REST가 직접 내장되어 있으며, 하나의 요청마다 확정된 상태(스크린샷 및 이벤트 로그 포함)를 제공합니다. ABP는 기존 방식 대비 토큰 사용량과 자동화 실행 속도를 개선하고, 특히 LLM이 브라우저보다 앞서 나가는 경합 상태(race condition) 문제를 해결하여 안정적인 에이전트 웹 탐색을 가능하게 합니다.
이 프로젝트는 ROS의 클래식 시뮬레이터인 turtlesim을 AI 에이전트가 구동하는 창의적인 캔버스로 변환합니다. LangChain 기반의 `turtlesim_agent`는 사용자의 자연어 지침(예: '무지개 그리기')을 해석하여, 이를 ROS 동작 명령으로 추론하고 실행함으로써 시뮬레이션되는 거북이를 디지털 아티스트처럼 움직이게 합니다. 사용자는 평범한 영어로 원하는 그림이나 모양의 의도를 설명할 수 있으며, AI 에이전트는 이 지침에 따라 복잡한 궤적을 계산하여 구현합니다. 이 프로젝트는 LLM이 외부 환경과 상호작용하며 창의적인 행동을 보여줄 수 있는 가능성을 탐구하는 데 중점을 두고 있습니다.

Spine Swarm은 단순한 텍스트 응답을 넘어, 여러 AI 에이전트가 병렬적으로 연구, 합성, 문서 작성을 수행하여 완성도 높은 결과물을 반환하는 차세대 협업형 AI 시스템입니다. 이 시스템은 Google DeepMind의 DeepSearchQA 등 최첨단 멀티스텝 연구 벤치마크에서 최고 성능을 입증했습니다. 사용자는 투자 분석(TAM/SAM/SOM 모델 구축, 실적 발표 분석), 컨설팅 보고서 작성(시장 규모 산정, 상업적 실사), 법률 조사(판례 및 규제 추적), 의료 문헌 검토 등 전문 분야별로 즉시 활용 가능한 포맷의 결과물을 얻을 수 있습니다. 또한, 예약 기능과 API/웹훅 통합을 통해 기존 업무 흐름에 자동화된 워크플로우를 구축할 수 있어 기업 수준의 생산성 향상을 지원합니다.
OpenAI의 Whisper ASR 모델을 C/C++ 기반으로 포팅하여 고성능, 저지연 추론이 가능한 라이브러리를 공개했습니다. 이 구현은 의존성이 없고 다양한 아키텍처(Apple Silicon, x86, POWER 등)와 하드웨어 가속기(Metal, Vulkan, OpenVINO, NPU 등)를 지원하며, 정수 양자화 및 메모리 할당 최적화를 통해 온디바이스 환경에 최적화되었습니다. 이를 통해 개발자는 다양한 플랫폼에서 오프라인 음성 비서나 전사 애플리케이션을 쉽게 구축할 수 있습니다.

rStar-Math는 지식 증류(distillation) 없이도 OpenAI o1에 필적하거나 능가하는 수준의 수학 추론 능력을 작은 언어 모델(SLM)에 부여하는 새로운 프레임워크입니다. 이 방법은 Monte Carlo Tree Search (MCTS)를 활용한 '심층 사고' 과정을 통해 테스트 시뮬레이션 기반으로 작동하며, 세 가지 혁신적인 요소를 도입했습니다. 특히, 합성된 추론 궤적 생성, 프로세스 보상 모델(PPM)을 통한 개선된 학습 방법, 그리고 정책 SLM과 PPM을 반복적으로 진화시키는 자기진화 레시피를 통해 수학 문제 해결 능력을 크게 향상시켰습니다.
AutoThink는 쿼리의 복잡도를 분석하여 계산 자원을 적응적으로 할당함으로써 로컬 LLM의 추론 효율성과 성능을 향상시키는 기법입니다. 이 방법은 쿼리를 복잡도에 따라 분류하고, 이에 맞춰 '생각 토큰(thinking tokens)'을 차등적으로 할당하는 것이 핵심입니다. 또한, Microsoft Phi-4 논문의 Pivotal Token Search에서 영감을 받은 스티어링 벡터를 활용하여 모델의 추론 패턴을 안내함으로써 높은 정확도를 달성합니다.
본 논문은 대형 언어 모델(LLM)의 다단계 추론 능력을 오프라인 강화학습(RL)으로 개선하는 새로운 방법인 OREO(Offline Reasoning Optimization)를 제안합니다. 기존의 DPO와 같은 방식은 선호도 데이터 의존성 및 희소 보상 환경에서의 신용 할당 문제로 인해 복잡한 다단계 추론 작업에 적용하기 어렵습니다. OREO는 소프트 벨만 방정식을 최적화하여 정책 모델과 가치 함수를 공동으로 학습함으로써, 쌍별 데이터 수집의 필요성을 줄이고 효과적인 신용 할당을 가능하게 합니다.
Sketch-of-Thought (SoT)는 LLM의 단계별 문제 해결 능력을 강화한 CoT 프롬프팅의 과도한 계산 오버헤드 문제를 해결하기 위해 제안된 새로운 추론 프레임워크입니다. SoT는 인지적 영감을 받은 패러다임을 통합하여, 토큰 사용량을 획기적으로 줄이면서도 높은 추론 정확도를 유지하는 것을 목표로 합니다. 이 프레임워크는 Conceptual Chaining, Chunked Symbolism, Expert Lexicons 세 가지 모듈식 접근 방식을 포함하며, 경량 라우팅 모델을 통해 테스트 시점에 동적으로 최적의 방법을 선택합니다.
R-Zero는 방대한 인간의 레이블링 데이터에 의존하는 기존 LLM 학습 방식의 한계를 극복하기 위해 제안된 자율적인 프레임워크입니다. 이 시스템은 단일 기본 LLM을 기반으로 Challenger와 Solver라는 두 개의 독립적 모델을 초기화하고, 이들이 상호작용하며 공진화(co-evolve)합니다. Challenger는 난이도가 높은 작업을 제시하고, Solver는 이를 해결하는 과정을 통해 기존 데이터 없이도 목표 지향적인 자체 개선 커리큘럼을 생성하여 LLM의 추론 능력을 크게 향상시킵니다.
본 논문은 LLM의 추론 능력 한계를 극복하기 위해 순수 강화학습(RL)을 적용하는 새로운 프레임워크를 제안합니다. 기존 모델들이 인간 주석에 크게 의존했던 것과 달리, 이 RL 접근 방식은 자기 성찰, 검증, 동적 전략 적응 같은 고급 추론 패턴의 발생적 발전을 촉진합니다. 그 결과, 훈련된 모델은 수학이나 코딩 대회와 같은 검증 가능한 작업에서 기존 지도 학습 기반 모델보다 뛰어난 성능을 보여줍니다.
본 기사는 기존의 유사도 기반(벡터) RAG가 전문적이고 다단계 추론이 필요한 문서에서 한계를 보이는 문제를 지적하며, '관련성' 확보를 위해 추론 중심적인 새로운 접근법인 추론 기반 RAG(Reasoning-based RAG)를 제안합니다. 이 방법은 AlphaGo의 트리 검색 개념을 차용하여 LLM이 스스로 사고하고 가장 관련성 높은 문서 섹션으로 도달하도록 돕습니다. 핵심 구성 요소로, 긴 문서를 계층적 트리 구조로 조직화하는 오픈 소스 인덱싱 시스템인 PageIndex를 공개하며, 이를 통해 재무 문서 분석 등에서 기존 벡터 기반 시스템 대비 검색 정확도의 상당한 개선을 입증했습니다.