Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
Google이 Gemini Enterprise Agent Platform에 대형 모델의 추론을 활용해 소형 모델을 학습시키는 증류(Distillation) 기능을 추가했습니다. 수동 레이블링 없이 Gemini 3.1 Pro를 교사 모델로 사용하여 Gemini 2.5 Flash를 미세 조정할 수 있는 파이프라인을 제공합니다.

Mark Zuckerberg는 AI 기술이 소수 연구소나 정부에 독점되지 않고 기업, 개인, 오픈 생태계로 확산되어야 한다고 주장합니다. 그는 AI를 인류를 위협하는 힘이 아닌 개인의 주체성을 확장하는 도구로 보아야 하며, 기술 발전을 늦추기보다 구체적인 위해를 규제하는 방향을 강조합니다.
의료 NLP 스택인 OpenMed 2.0이 출시되었습니다. 279M 및 560M 파라미터의 경량 모델을 사용하여 클라우드 전송 없이 오프라인에서 개인 건강 정보(PHI)를 비식별화할 수 있습니다.

자율 에이전트에 의한 최초의 사이버 공격 사건을 분석하고, 이에 대응하기 위해 오픈 모델을 활용한 방어 과정을 기술적 타임라인과 함께 공개합니다.
Kimi-k3 모델을 llama.cpp 환경에서 실행한 벤치마크 결과입니다. 고사양 워크스테이션 환경에서 C++ 코딩 프롬프트를 처리하며, 향후 RPC 서버를 통한 클러스터 연결 계획을 포함하고 있습니다.

GPQA, MMLU-Pro, MMMU-Pro 벤치마크를 감사한 결과, 약 12%의 오류 질문을 발견하여 이를 정제한 버전을 공개했습니다. 오류 수정 후 최상위 모델들의 성능이 약 98%까지 상승함을 확인했습니다.

Mage-VL은 비디오 코덱 구조를 활용하여 시각적 토큰을 75% 이상 절감하고 추론 속도를 3.5배 향상시킨 멀티모달 파운데이션 모델입니다. 코덱 정렬 희소성(codec-aligned sparsity)과 System 1 & 2 이중 프로세스 설계를 통해 실시간 스트리밍 인지 효율성을 극대화했습니다.

LFM2.5-Encoder는 LFM2 아키텍처 기반의 다국어 양방향 인코더 제품군으로, CPU 및 온디바이스 환경에 최적화되어 있습니다. 8k 컨텍스트 길이를 지원하며, 경량 모델임에도 불구하고 유사 크기 모델 대비 뛰어난 성능을 제공합니다.

LLM 추론 시 발생하는 메모리 대역폭 문제를 해결하기 위해 RAM 내부에서 직접 연산을 수행하는 CaSA 기술을 소개합니다. 1-bit 및 ternary 모델을 활용하여 가중치가 메모리 버스를 통과하지 않고 DIMM 내부에서 연산되도록 설계되었습니다.
GGUF 기반 모델을 활용하여 90GiB VRAM 환경에서 DeepSeek-V4-Flash를 효율적으로 학습하는 기술적 업데이트를 소개합니다. Triton 커널 최적화를 통해 CPU 오프로딩 없이도 빠른 학습 속도를 구현했습니다.

AMD Ryzen AI MAX+ 395 하드웨어에서 DeepSeek V4 Flash 모델을 구동하여 최대 32 tok/s의 디코드 속도를 달성했습니다. ROCmFPX 기술을 활용한 혼합 정밀도 양자화 방식을 통해 128GB 통합 메모리 환경에서 효율적인 추론 성능을 구현했습니다.
llama.cpp의 최신 업데이트를 통해 Mamba-2 가속을 위한 ggml-cuda의 chunked SSD matmul 추가 및 Metal 백엔드용 FWHT 커널이 도입되었습니다. 또한 GPT-OSS 모델을 위한 Eagle3-v3 지원과 다양한 버그 수정이 포함되었습니다.

OS나 커널 없이 Rust로 작성된 UEFI 앱만으로 USB 스틱에서 로컬 LLM을 직접 부팅하는 기술을 소개합니다. Llama 3.2, Qwen3 등 표준 GGUF 모델을 지원하며 Raspberry Pi 5에서도 구동 가능합니다.

DSpark를 활용한 추측적 디코딩(Speculative Decoding) 실험 및 관련 모델 사례를 소개합니다. DeepSeek-V4 및 Bonsai 모델 등에 적용된 DSpark의 성능 개선 효과를 확인하고 공유할 것을 권장합니다.

SupraLabs에서 LLM이 자신의 정체성을 정확히 인지할 수 있도록 돕는 'LLM-Self-Identification' 데이터셋을 출시했습니다. 모델 이름, 아키텍처, 파라미터 수 등 모델의 주요 정보를 학습시키는 데 최적화되어 있습니다.
소형 LLM에서 추론과 실행을 분리하여 정확도를 높이는 동적 재실행(Dynamic Re-Execution) 기술을 제안합니다. 검증된 프로그램을 12B 모델이 토큰 오버헤드 없이 재실행함으로써 비트 단위의 결정론적 결과를 산출합니다.

Ami는 사용자의 작업 스타일과 커뮤니케이션 방식을 학습하는 로컬 우선 오픈 소스 에이전트입니다. 그래프 메모리를 활용해 앱, 데이터, 도구 간의 복잡한 업무를 자율적으로 수행하며 개인화된 코파일럿 역할을 합니다.
LLM 에이전트가 bash 명령어를 안전하게 실행할 수 있도록 돕는 로컬 Python 샌드박스 도구인 Vivarium을 소개합니다. E2B의 대안으로 설계되었으며, 단일 사용자 환경에서 에이전트의 코드 실행을 격리하여 안전하게 관리할 수 있습니다.
Qwen3.6-27B를 기반으로 의료 추론에 특화된 Reasoning-Medical-27B 모델이 공개되었습니다. 37만 개의 고품질 데이터셋과 Chain-of-Thought 추론 방식을 결합하여 전문적인 의학 지식 대응 능력을 높였습니다.
llama.cpp 사용 시 특정 GGUF 파일의 채팅 템플릿 동작 오류로 인해 코딩 에이전트의 성능이 저하되는 문제가 발생했습니다. 이를 해결하기 위해 DeepSeek-V4용 jinja 템플릿 파일을 직접 지정하는 방법이 권장됩니다.