Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
브라우저 환경에서 Gemma 4와 같은 소형 모델을 실행하고 테스트할 수 있는 웹 사이트와 오픈 소스 SDK를 공개했습니다. 텍스트, 멀티모달, 음성 등 다양한 기능을 브라우저 내에서 직접 처리할 수 있는 환경을 제공합니다.
ICML 포지션 트랙을 통해 머신러닝 컨퍼런스의 리뷰 프로세스 개선을 위한 크레딧 시스템 도입을 제안합니다. 리뷰어와 저자에게 인센티브를 제공하여 책임감을 높이고 연구 생태계의 질을 향상시키고자 합니다.
Kokoro, Supertonic, Inflect-Nano, Pocket TTS 등 소형 TTS 모델들을 대상으로 CPU 환경에서의 성능과 UTMOS 점수를 비교 분석한 벤치마크 결과입니다. 모델별 아키텍처에 따른 RTF 스케일링 특성과 UTMOS 지표의 한계점을 심도 있게 다룹니다.
LLM 에이전트의 대화 기록을 토픽 트리 형태로 구성하는 오픈 소스 계층적 메모리 시스템 TRACE를 소개합니다. MemoryAgentBench의 EventQA 태스크에서 기존 Mem0나 MemGPT보다 높은 검색 정확도를 기록했습니다.
LingBot-Vision은 자기지도 사전학습을 위해 교사 모델이 예측한 조밀한 경계 필드를 활용하여 마스킹 전략을 개선한 모델입니다. DINOv3 대비 적은 데이터로도 우수한 NYUv2 선형 프로브 성능을 보이며, 특히 인코더 초기화 측면에서 강력한 성능을 입증했습니다.
PD-분리형 MoE 서빙 시 전문가 지역성을 고려하여 지연 시간을 줄이는 ELDR 라우팅 기법을 제안합니다. Prefill 단계의 전문가 활성화를 바탕으로 생성 단계의 전문가를 예측하여 최적의 워커에 요청을 할당합니다.
개인정보 보호를 위해 100% 로컬 환경에서 실행되는 음성 대 음성(Voice-to-Voice) AI 어시스턴트 'Athena'가 공개되었습니다. C++로 구현되어 효율적이며, 감정 표현과 장기 기억, 대화 가로채기 기능을 지원합니다.
튀니지 다리자(Arabizi)를 위한 오픈 소스 기계 번역(MT) 파이프라인과 병렬 코퍼스 베이스라인을 구축한 프로젝트입니다. 데이터 부족 문제를 해결하기 위해 SentencePiece 토크나이저와 Transformer 모델을 바닥부터 구축하여 초기 성능을 확보했습니다.
컨텍스트 윈도우의 한계를 극복하기 위해 디퓨전 모델의 점진적 렌더링 개념을 차용한 시맨틱 압축 방식을 제안합니다. 압축된 개요에서 세부 사항으로 나아가는 coarse-to-fine 접근법을 통해 비지역적 정보(Non-local information)를 보존하고자 합니다.
작은 규모의 로컬 모델이 복잡한 작업을 수행할 수 있도록 에이전트에게 전용 애플리케이션(워크플로우) 환경을 제공하는 아키텍처를 소개합니다. 에이전트가 특정 앱 내에서 제한된 도구와 컨텍스트를 사용하게 함으로써 모델의 성능 한계를 극복하고 정확도를 높이는 방법론을 다룹니다.
Claude Code 사용 시 정확성을 높이기 위해 '항상 증거(receipts)를 제시할 것'이라는 새로운 글로벌 지침을 설정하는 방법을 다룹니다. 모든 작업 결과에 대해 명령어 출력, 종료 코드, 온디스크 검증 등 기계적으로 검증 가능한 증거를 포함하도록 요구합니다.
가중치나 활성화 값에 접근할 필요 없이 로짓(logits)만을 활용해 파인튜닝된 LLM의 원문 데이터를 복구하는 CDD 기법을 제안합니다. 기존의 화이트박스 방식보다 효율적이며, 다양한 모델 규모에서 높은 원문 복구 성능을 입증했습니다.
PyTorch를 사용하여 249M 파라미터 규모의 MoE Transformer를 밑바닥부터 직접 구현한 연구 프로젝트입니다. GQA, SwiGLU, RoPE 등 현대적 LLM의 핵심 구성 요소를 직접 구현하여 모델 구조에 대한 깊은 이해를 목표로 합니다.
Sora의 서비스 중단 이후, 사용자가 대안으로 활용 중인 AI 영상 생성 도구 조합을 소개합니다. PixVerse, Runway, Kling을 활용하여 물리 법칙과 분위기를 구현하는 워크플로우를 공유합니다.
AI 모델을 단순한 엔진으로 보고, 이를 제어할 수 있는 구조(steering)와 설계 철학의 중요성을 강조합니다. 모델의 확률적 특성을 이해하고, 환각을 줄이며 일관성을 유지하기 위한 시스템 구축 원칙 5가지를 제시합니다.
Discord, Steam, Telegram 등 하드웨어 가속을 사용하는 앱들이 VRAM을 상당 부분 점유하여 LLM 구동에 방해가 될 수 있습니다. VRAM 부족 시 하드웨어 가속을 끄거나 앱을 종료하여 자원을 확보하는 방법을 제안합니다.
포르투갈에서 자체 개발한 9B 파라미터 규모의 LLM인 Amalia를 출시했습니다. Hugging Face를 통해 SFT 및 DPO 모델이 공개되었으며, Apache 2.0 라이선스를 따릅니다.
에이전트 워크플로우를 단순한 DAG 구조를 넘어 신경망(Neural networks)의 작동 원리와 유사하게 설계해야 한다는 제안입니다. 각 워크플로우 노드를 최소 학습 단위로 정의하고, 손실 함수와 파라미터 업데이트 개념을 도입하여 제어 가능한 에이전트 시스템을 구축하는 방법을 다룹니다.
AI 코딩 어시스턴트의 컨텍스트 유지 및 프로세스 관리 문제를 해결하기 위한 마크다운 기반 워크플로우 생성기 'ai-flow-anything'을 소개합니다. 디자인 우선 원칙을 적용하여 설계 승인 후 구현이 진행되도록 강제하며, 프로젝트 지식 베이스를 구축하여 도구 전환 시에도 컨텍스트를 유지합니다.
Mistral이 형식 검증 분야에 특화된 오픈 소스 모델 Leanstral 1.5를 출시했습니다. 6B의 활성 파라미터를 사용하여 수학적 증명 및 코드 검증에서 최첨단 성능을 보여줍니다.