Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
Kimi-k3 모델을 llama.cpp 환경에서 실행한 벤치마크 결과입니다. 고사양 워크스테이션 환경에서 C++ 코딩 프롬프트를 처리하며, 향후 RPC 서버를 통한 클러스터 연결 계획을 포함하고 있습니다.

GPQA, MMLU-Pro, MMMU-Pro 벤치마크를 감사한 결과, 약 12%의 오류 질문을 발견하여 이를 정제한 버전을 공개했습니다. 오류 수정 후 최상위 모델들의 성능이 약 98%까지 상승함을 확인했습니다.

Mage-VL은 비디오 코덱 구조를 활용하여 시각적 토큰을 75% 이상 절감하고 추론 속도를 3.5배 향상시킨 멀티모달 파운데이션 모델입니다. 코덱 정렬 희소성(codec-aligned sparsity)과 System 1 & 2 이중 프로세스 설계를 통해 실시간 스트리밍 인지 효율성을 극대화했습니다.

LFM2.5-Encoder는 LFM2 아키텍처 기반의 다국어 양방향 인코더 제품군으로, CPU 및 온디바이스 환경에 최적화되어 있습니다. 8k 컨텍스트 길이를 지원하며, 경량 모델임에도 불구하고 유사 크기 모델 대비 뛰어난 성능을 제공합니다.

SupraLabs에서 LLM이 자신의 정체성을 정확히 인지할 수 있도록 돕는 'LLM-Self-Identification' 데이터셋을 출시했습니다. 모델 이름, 아키텍처, 파라미터 수 등 모델의 주요 정보를 학습시키는 데 최적화되어 있습니다.
소형 LLM에서 추론과 실행을 분리하여 정확도를 높이는 동적 재실행(Dynamic Re-Execution) 기술을 제안합니다. 검증된 프로그램을 12B 모델이 토큰 오버헤드 없이 재실행함으로써 비트 단위의 결정론적 결과를 산출합니다.
Qwen3.6-27B를 기반으로 의료 추론에 특화된 Reasoning-Medical-27B 모델이 공개되었습니다. 37만 개의 고품질 데이터셋과 Chain-of-Thought 추론 방식을 결합하여 전문적인 의학 지식 대응 능력을 높였습니다.
다양한 LLM을 대상으로 정치 성향 테스트를 실시한 결과, Grok을 포함한 대부분의 모델이 자유지상주의 좌파 성향을 보였습니다. 모델의 자기 인식과 실제 측정값 사이의 차이를 분석하며, 모델 간의 상대적인 정치적 편향성을 비교했습니다.
실제 계량기 및 영수증 사진 32장을 활용하여 6개 비전 모델의 필드 수준 정확도를 벤치마크한 결과입니다. 실험 결과, 비용이 높은 모델이 반드시 더 높은 정확도를 보장하지는 않으며, 특정 모델들은 어려운 환경에서 높은 성능을 유지했습니다.
35B 규모의 코딩 에이전트 모델 4종(Stock, Ornith, KAT-Coder 등)을 대상으로 120회 실행 비교 테스트를 진행한 결과입니다. KAT-Coder-V2.5-Dev가 가장 적은 토큰을 사용하면서도 가장 높은 통과율과 안정적인 도구 호출 성능을 보여주었습니다.
특허 문서의 복잡한 구조와 수식을 정확히 인식하기 위해 5,000만 개의 샘플로 학습된 0.3B 규모의 MOSS-OCR 모델을 공개했습니다. 이 모델은 레이아웃 탐지를 제외한 블록 레벨 인식에 집중하여 매우 작고 빠른 성능을 제공합니다.
Moonshot의 Kimi K3 모델 가중치가 공개되었으며, 2.8T 파라미터 규모의 MoE 구조를 가집니다. A100, H200, B300 등 다양한 GPU 환경에서의 배포 및 성능 벤치마크가 진행될 예정입니다.
XYZ AI Lab에서 개발한 오픈 웨이트 딥 서치 에이전트 제품군인 XYZ-Aquila-mini를 소개합니다. Qwen3.6-35B-A3B를 기반으로 사후 학습되었으며, 에이전트 기반 검색과 장기 계획 수립에 최적화된 사고 모델입니다.

Qwen3.6-27B 모델을 대상으로 다양한 양자화 수준에 따른 추측적 디코딩(Speculative Decoding) 성능을 벤치마킹한 결과입니다. 양자화가 무거울수록 추측적 디코딩을 통한 속도 향상 이득이 더 커지는 경향을 확인했습니다.

Qwen 3.6-35B GGUF 모델의 4가지 변체에 대한 코딩 능력 테스트 결과입니다. 알고리즘, 리팩토링, 시스템 디자인 등 세 가지 프롬프트를 통해 각 모델의 성능을 비교 분석했습니다.
Kimi K3 모델의 효율성을 뒷받침하는 MoE, MLA, KDA 기술 스택을 비전공자도 이해하기 쉽게 설명합니다. 거대 파라미터 모델임에도 불구하고 낮은 실행 비용을 유지할 수 있는 핵심 원리를 다룹니다.
HuggingFace의 23개 Gemma 4 E4B 모델을 대상으로 Abliterlitics 테스트를 진행하여 모델의 탈제한(abliteration) 성능을 비교 분석했습니다. 분석 결과, 다운로드 수가 많은 일부 모델이 실제로는 성능이 심각하게 저하된 상태임을 밝혀냈습니다.

RecGPT-V3는 Taobao의 추천 시스템을 위해 설계된 상태 유지형 하이브리드 모달 모델입니다. Memory Hub, 하이브리드 모달 파운데이션 모델, 잠재 의도 추론 기술을 통해 계산 효율성을 높이고 추천 성능을 극대화했습니다.

GigaChat 3.1 Lightning을 기반으로 구축된 오디오 네이티브 LLM인 GigaChat Audio 10B를 소개합니다. Conformer 음성 인코더와 MoE 디코더를 결합하여 텍스트 품질을 유지하면서도 뛰어난 음성 이해 능력을 갖추었습니다.

GTX 1080 Ti와 P102-100 GPU 3개를 결합한 시스템에서 Gemma4 및 Qwen3.6 등 다양한 LLM의 성능을 비교한 벤치마크 결과입니다. llama.cpp Vulkan 빌드를 사용하여 모델별 추론 속도(tg128, pp512)를 측정했습니다.