Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.

LFM2.5-8B-A1B 모델의 토크나이저를 처음부터 다시 학습하지 않고 인플레이스 방식으로 업그레이드하는 기술을 소개합니다. 어휘 사전 크기를 65K에서 128K로 확장하여 기존의 과도한 언어 분할 문제를 해결했습니다.
대형 AI 기업들이 벤치마크 수치를 부풀리고 실제 배포 시 성능을 저하시키는 행위가 FTC 정의상 사기에 해당할 수 있다고 비판합니다. 이를 방지하기 위해 규제 기관의 무작위 재벤치마킹과 오픈소스 모델의 투명성이 필요함을 강조합니다.
듀얼 GPU 환경에서 모델 추론 시 GPU 사용률이 낮게 나타나는 원인이 연산 능력이 아닌 메모리 대역폭 제한에 있음을 설명합니다. 토큰 생성 시마다 모델 가중치를 메모리에서 읽어와야 하는 병목 현상을 다룹니다.

7가지 조절 가능한 감정을 지원하는 125M 파라미터 규모의 오픈 소스 온디바이스 TTS 모델 NeuTTS-2E를 공개했습니다. 사용자의 명시적 지시에 따라 감정을 표현하며, 로컬 실행을 통해 프라이버시를 보호하고 효율적인 음성 생성이 가능합니다.

오스트리아 정부가 Mistral 오픈 웨이트 모델과 Open WebUI를 활용한 공공 AI 플랫폼 'GovGPT'를 출시했습니다. 약 18만 명의 공무원을 대상으로 문서 채팅, 지식 베이스 구축, 에이전틱 워크플로우 등의 기능을 제공할 예정입니다.

Poolside가 MoE 아키텍처를 활용한 Laguna S 2.1 모델을 출시했습니다. 총 118B 파라미터를 보유했으나 활성 파라미터는 8B에 불과하여, 효율적인 추론 비용으로 대규모 모델들을 능가하는 성능을 보여줍니다.

Felix Rieseberg가 개발한 'Language Model Builder'는 사용자가 직접 LLM을 구축할 수 있도록 돕는 무료 도구입니다. 기본 설정을 통해 단 하루 만에 문법적으로 올바른 텍스트를 생성하는 모델을 학습시킬 수 있습니다.
번역 작업 중 모델이 페이로드 내의 지시 사항을 실행하여 번역 대신 문제를 풀어버리는 현상을 다룹니다. 지시 사항(instruction)과 데이터(payload) 사이의 경계가 무너질 때 발생하는 프롬프트 인젝션 문제를 경고합니다.

P40 및 MI50과 같은 구형 GPU 하드웨어 환경에서 RPC를 활용하여 550B Nemotron Ultra 모델을 구동한 벤치마크 결과입니다. 100Gbe NIC와 다수의 GPU를 결합하여 대규모 모델의 처리량을 테스트했습니다.

새로 출시된 Laguna-S-2.1 모델을 RTX Pro 6000 환경에서 에이전트 성능 중심으로 테스트한 결과입니다. 도구 호출 및 다단계 체인 수행 능력은 매우 뛰어나지만, 특정 지식 영역과 압박 상황에서의 근거 제시(grounding) 능력에서는 한계를 보였습니다.
LLM의 고정된 레이어 구조를 넘어, 입력에 따라 레이어를 건너뛰거나 반복하여 실행하는 'PoLar(Program-of-Layers)' 기술을 제안합니다. 이를 통해 추론 시간 연산량과 모델의 추론 능력 사이의 유연한 트레이드오프를 달성할 수 있습니다.

Laguna S 2.1 모델이 출시되었습니다. 이 모델은 Deepseek v4 Flash보다 저렴하면서도 V4 Pro보다 뛰어난 성능을 보여주며, 다양한 코드 벤치마크에서 높은 성적을 기록했습니다.

GraphRAG의 높은 인덱싱 비용과 복잡성을 해결하기 위해 별도의 그래프 DB 없이 일반 DB와 검색 인덱스만으로 지식 그래프를 구축하는 실용적인 방법을 제안합니다. 엔티티와 엣지를 일반 레코드로 관리하여 비용을 획기적으로 낮추고 운영 효율성을 높이는 접근법을 다룹니다.

Poolside에서 새로운 120B 파라미터 규모의 언어 모델인 Laguna-S-2.1을 출시했습니다. Hugging Face를 통해 모델과 llama.cpp용 GGUF 파일을 공개하며 강력한 경쟁 모델의 등장을 알렸습니다.

Nanbeige4.2-3B는 Looped Transformer 아키텍처를 사용하여 파라미터 수를 늘리지 않고도 모델 용량을 확장한 컴팩트한 에이전트 모델입니다. 3B 규모임에도 불구하고 강력한 에이전트 동작, 추론 및 정렬 능력을 갖추어 일반 및 코드 에이전트 작업에서 뛰어난 성능을 보여줍니다.

SenseNova-U1-8b-MoT-Infographic-V3 모델이 출시되었습니다. 이 모델은 텍pick 텍스트 및 콘텐츠 편집, 글로벌 스타일 및 레이아웃 편집 기능을 제공하며, T2I와 편집 기능을 공동 학습하여 높은 품질을 유지합니다.
3.5조 개의 토큰만으로 학습된 20B Looping 모델에 관한 연구 내용입니다. 기존 모델 대비 적은 토큰과 비용으로도 효율적인 사전 학습이 가능함을 시사합니다.

pi 0.81.0 버전에서 llama.cpp(llama-server router)에 대한 통합 지원이 추가되었습니다. 이를 통해 기존의 huggingface/pi-llama 확장 기능이나 수동 모델 관리 작업을 대체할 수 있습니다.

Unsloth의 Qwen3.6-27B NVFP4 모델을 RTX 5090 환경에서 벤치마크한 결과입니다. MTP(Multi-Token Prediction) 설정 시 단일 사용자 환경에서는 속도가 크게 향상되지만, 배치 작업이나 긴 컨텍스트에서는 성능 저하가 발생할 수 있음을 확인했습니다.
LLM 배포를 탈중앙화하고 가속화하기 위해 토렌트 기술을 활용하는 llama.garden 프로젝트를 소개합니다. HTTP 웹 시드와 캐싱 API를 통해 다운로드 속도를 최적화하며, 모델의 무결성을 검증할 수 있는 구조를 제공합니다.