Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
본 기사는 RL 학습 환경에서 발생하는 비효율적인 토큰 처리 방식을 지적하며, 특히 긴 프롬프트와 짧은 응답을 사용하는 워크로드에서 심각한 연산 낭비가 발생함을 설명합니다. 해결책으로 프롬프트를 한 번만 계산하고 이후의 모든 응답을 순차적으로 계산하는 '프롬프트 캐싱' 기법을 제안하며, 이를 학습 과정에 적용하기 위해 인과적 어텐션(causal attention) 문제를 해결할 수 있는 복잡한 구현 방법을 제시합니다. 실제 테스트 결과, 이 기법은 특정 워크로드에서 최대 7.5배의 속도 향상을 보여줍니다.
Hugging Face가 이론 물리학 연구 문제를 다루기 위해 'physics-intern'이라는 에이전트 기반 하네스를 출시했습니다. 이 프레임워크는 복잡한 연구 과정을 모방하여 계산, 주장 검토, 연구 전략 도전 등 여러 전문 서브에이전트에 작업을 분해하여 할당하는 멀티 에이전트 구조를 가지고 있습니다. 이를 통해 Gemini 모델의 CritPt 벤치마크 성능을 향상시키고 새로운 SOTA(State-of-the-Art) 기록을 달성했습니다.
작성자는 다양한 채팅 UI를 테스트한 경험을 바탕으로 llama.cpp의 웹 UI에 대해 높은 만족도를 표현하며, 특히 사용된 컨텍스트 양을 정확히 계산해 주는 기능을 최고의 장점으로 꼽았습니다. 다만, 도구 호출(tool call) 실패 시 전체 대화가 중단되는 문제점과 이로 인한 불편함을 주요 개선 사항으로 지적했습니다.
WebWorld는 웹 에이전트 훈련 및 평가를 위해 설계된 대규모 오픈웹 월드 모델 시리즈입니다. 이 모델은 100만 개 이상의 실제 웹 상호작용 궤적을 학습했으며, 장기 시뮬레이션, 다양한 상태 표현(HTML, XML 등), 그리고 CoT 활성화 추론 기능을 지원합니다. WebWorld로 학습된 에이전트는 MiniWob++ 및 WebArena와 같은 벤치마크에서 높은 성능 향상을 보이며, 월드 모델로서 GPT-5를 능가하는 잠재력을 보여줍니다.
본 기사는 Token AI가 발표한 새로운 최적화 알고리즘인 'Stable Training with Adaptive Momentum (STAM)'을 소개합니다. STAM은 기존의 Adam, AdamW 등 고정된 모멘텀 값으로 인해 발생하는 훈련 불안정성 문제를 해결하며, 그래디언트와 이전 모멘텀 간의 차이를 측정하여 적응형 beta1을 적용함으로써 안정적인 학습을 유도합니다. 특히 경량 버전인 STAMLite는 기존 최적화기 대비 메모리 효율성을 크게 개선하면서도 뛰어난 성능을 보여주어, LLM 훈련에 새로운 표준이 될 잠재력을 제시합니다.
본 기사는 2026년 5월 현재 로컬 환경에서 수행 가능한 심층 연구(Deep Research) 도구들의 현황을 분석하고 비교합니다. 주요 논의 대상은 'Local Deep Research'와 'GPT Researcher' 두 프로젝트입니다. 이 글은 각 프로젝트의 활성도, 기여 빈도, 사용 기술 스택 등을 상세히 관찰하여 사용자들에게 가장 건강하고 로컬 친화적인 옵션을 제시하는 것을 목표로 합니다.
본 기술 기사는 실제 기업 환경의 복잡성을 반영하여 RAG(Retrieval-Augmented Generation) 시스템을 테스트하기 위한 새로운 오픈 벤치마크인 'EnterpriseRAG-Bench'를 소개합니다. 이 벤치마크는 Slack, Gmail, GitHub 등 다양한 내부 소스에서 추출된 약 50만 개의 문서로 구성되어 있으며, 단순한 공개 데이터셋의 한계를 극복했습니다. 개발팀은 단순히 많은 문서를 생성하는 것보다, 문서들이 실제 회사에 속한다는 '현실적인 맥락'과 의존성을 부여하는 데 중점을 두었으며, 랜덤 노이즈와 오류를 추가하여 현실성을 높였습니다. 평가 과정에서는 BM25가 벡터 검색을 능가하고, 관련 증거의 제공이 답변 품질에 결정적임을 발견했습니다.
LLMSearchIndex는 로컬 LLM 및 RAG 시스템을 위한 오픈 소스 웹 검색 라이브러리입니다. 이 라이브러리는 FineWeb과 Wikipedia의 방대한 양의 웹 페이지를 포함하는 커스텀 압축 인덱스를 사용하여, 유료 API나 외부 크롤러에 의존하지 않고도 인터넷 규모의 로컬 검색 기능을 제공합니다. 약 2GB 크기의 이 인덱스는 대부분의 하드웨어에서 빠른 속도로 실행되며, RAG 컨텍스트로 결과를 쉽게 가져올 수 있도록 파이썬 인터페이스를 제공합니다.
미국에서 논의되는 GUARD Act는 AI 채팅봇에 연령 확인 시스템을 의무화하고 특정 공개를 요구하는 법안입니다. 이 법안은 어린이 안전을 명분으로 내세우고 있지만, 필자는 이 정책이 지나치게 침습적이며 개인 정보 보호와 AI 모델 개발의 자유를 제한할 수 있다고 우려합니다. 이러한 정부 규제 강화 추세 속에서 로컬 및 오픈 웨이트 AI 모델의 중요성이 더욱 부각될 것으로 예상됩니다.
이 가이드는 LLM(대규모 언어 모델)을 파인튜닝하는 과정을 처음부터 끝까지 포괄적으로 다루는 종합적인 튜토리얼입니다. Full Supervised Fine-Tuning (Full-SFT), LoRA, QLoRA 등 다양한 기법들을 설명하며, 올바른 환경 설정부터 데이터셋 준비, 실제 모델 훈련 및 최종 GGUF 파일 생성에 이르는 모든 단계를 안내합니다.
호러스(Horus) 프로젝트는 이집트에서 처음부터 개발된 오픈소스 대규모 언어 모델(LLM)입니다. TokenAI와 Assem Sabry가 개발한 이 모델은 소스 코드 공개를 통해 커뮤니티의 활용을 독려하고 있습니다. 다음 버전인 Horus 1.5 Instruct는 기존보다 성능이 크게 향상될 것으로 예상되며, 특히 64K 컨텍스트 길이(기존 대비 8배 증가)와 아키텍처 개선을 통해 새로운 수준의 능력을 제공할 예정입니다. 또한 TokenAI는 사이버 보안 분야에 특화된 대규모 모델도 개발하며 이집트 및 아랍 지역 AI 생태계 발전에 기여하고 있습니다.
이 글은 15년 이상 공공 기관의 사회적 연구 경험을 가진 필자가, Hermes Agent와 Qwen3.6-35b-a3b 모델을 활용하여 McKinsey 스타일의 심층 연구 보고서를 작성하는 과정을 공유합니다. 비록 기술적인 한계가 존재하지만, 반복적인 작업과 정교한 프롬프팅을 통해 21페이지 분량의 복잡한 문서를 거의 자동으로 초안부터 수정, 차트 삽입까지 완성할 수 있음을 보여줍니다. 필자는 이 경험이 공공 연구 분야에 흥미로운 첫 단계가 될 것이라 기대하며 관련 기술 스택과 산출물을 공유합니다.