Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
이탈리아 스타트업 Domyn이 400B 규모의 새로운 EU 모델 개발 계획을 발표했습니다. 이들은 이미 260B 규모의 기업용 폐쇄형 모델과 10B 규모의 오픈 소스 모델을 출시한 바 있습니다.
llama.cpp의 최신 업데이트를 통해 granite-speech-4.1-2b 및 LFM2.5 임베딩 모델 지원이 추가되었습니다. 또한 Vulkan 백엔드의 성능 개선과 다양한 연산 지원 및 UI/UX 개선이 포함되었습니다.
ModelScope에 출시된 Unlimited-OCR은 단일 이미지부터 다중 페이지 PDF까지 지원하는 3.3B 파라미터 규모의 다국어 모델입니다. 전체 문서 파싱과 32K의 긴 출력 길이를 지원하며, OpenAI 호환 스트리밍 요청이 가능합니다.
Qwen이 에이전트 환경 시뮬레이션을 위해 학습된 언어 세계 모델인 Qwen-AgentWorld-35B-A3B를 출시했습니다. 이 모델은 MoE 구조를 사용하여 MCP, 터미널, Android, 웹 등 7가지 도메인에서의 환경 변화를 예측합니다.
OpenLumara는 로컬 LLM 실행을 위해 설계된 로컬 우선 인터페이스로, 단순한 API 노출을 넘어 캘린더, 웹 검색 등 다양한 모듈을 통합 제공합니다. Python 스크립트를 통한 쉬운 확장성과 보안 강화를 위한 커뮤니티 기반의 취약점 테스트가 특징입니다.
대규모 컨텍스트 작업에서 Mimo 2.5와 Step 3.7 Flash 모델이 슬라이딩 윈도우 어텐션 기술을 통해 높은 속도를 유지함을 분석합니다. RTX PRO 6000 환경에서 로컬 모델의 성능과 최신 GPU 커널 최적화 이슈를 다룹니다.
단일 8x A100 노드에서 Llama 3.1 405B 모델과 7개의 LoRA 어댑터를 vLLM을 통해 실시간(Hot)으로 서빙하는 최적화 사례를 소개합니다. AWQ-int4 양자화와 Marlin 커널을 활용하여 어댑터 전환 시간을 최소화하고 처리량을 극대화했습니다.
불안정한 네트워크 환경에서도 HuggingFace 모델 및 데이터셋을 안정적으로 다운로드할 수 있는 오픈 소스 앱인 HF Downloader를 소개합니다. 연결 문제를 자동으로 감지하여 다운로드를 일시 중지하고 재개하는 스마트 자동 재시작 기능을 제공합니다.
Mac Studio의 대용량 메모리를 활용하여 GLM 5.2 모델의 실행 속도를 대폭 향상시키는 PR이 공개되었습니다. 100k 이상의 긴 컨텍스트에서도 100 t/s 이상의 프리필 속도를 유지하며 효율적인 모델 실행이 가능합니다.
OpenMed가 macOS 및 iOS 기기에서 실행 가능한 650개 이상의 Apache-2.0 라이선스 생물 의학 NER 및 비식별화 모델을 공개했습니다. MLX 프레임워크를 활용하여 Apple Silicon 환경에서 기존 CPU 대비 최대 40배 빠른 온디바이스 추론 성능을 제공합니다.
Qwen2.5-35B-A3B 및 Gemma2-9B 모델의 KV 캐시 양자화 성능을 KLD 매핑을 통해 분석한 연구 결과입니다. 양자화 비트 수에 따른 모델별 민감도 차이와 압축 효율성을 다룹니다.
중국 내 AI 가속기 시장의 급격한 성장과 주요 기업들의 동향을 분석합니다. Huawei를 포함한 빅테크와 최근 IPO를 마친 전문 기업들이 H100/H200급 칩을 출하하며 NVIDIA의 점유율을 빠르게 대체하고 있습니다.
의료 기록 작성을 위한 8개 LLM의 성능을 벤치마크한 결과, 환각보다 임상적 세부 사항을 누락하는 현상이 더 빈번하게 발생함을 확인했습니다. 모델 크기와 성능이 반드시 비례하지 않으며, 비용과 품질 사이의 트레이드오프가 존재함을 보여줍니다.
16GB VRAM 환경에서 Qwen-27B 모델을 효율적으로 구동하기 위한 새로운 GGUF 양자화 모델들을 소개합니다. 논리력 향상에 초점을 맞춘 IQ4_KS 방식과 실험적인 Trellis 알고리즘을 적용한 IQ4_KS_KT 모델의 성능을 비교 분석했습니다.
Qwen3.6-27b 기반의 터미널 에이전트 Tmax-27B를 소비자용 GPU에서 실행할 수 있도록 최적화된 GGUF 양자화 모델을 소개합니다. 중요도 행렬(imatrix) 보정을 통해 양자화 시 발생할 수 있는 에이전트의 도구 호출 및 추론 성능 저하를 최소화했습니다.
사이버 보안 특화 소형 모델인 OpenMythos의 벤치마크 결과가 공개되었습니다. SWE-bench, CyberGym, cybench 테스트를 수행했으며, 향후 성능 향상을 위한 추가 학습을 계획 중입니다.
사이버 보안에 특화된 소형 모델인 OpenMythos의 벤치마크 결과가 공개되었습니다. SWE-bench Pro, CyberGym, cybench 등 다양한 테스트를 통해 모델의 성능을 검증하였으며, 향후 추가 학습을 통해 성능을 개선할 계획입니다.
CPU 환경에서 세 가지 오픈 웨이트 TTS 모델(Kokoro 82M, Supertonic 3, Inflect-Nano-v1)의 성능을 RTF와 MOS 지표로 비교 분석했습니다. 모델별 속도와 음질 사이의 트레이드오프를 상세히 다루며, 특히 Kokoro ONNX의 효율성을 강조합니다.
EU AI Act 시행에 따라 AI 생성 콘텐츠에 대한 워터마크 및 메타데이터 삽입 의무가 강화됩니다. 시스템적 위험이 있는 GPAI 모델 제공자는 텍let 및 오디오 등에 대해 이중 계층의 기술적 솔루션을 적용해야 하며, 위반 시 막대한 벌금이 부과됩니다.
Boogu-Image-0.1은 텍스트 생성, 고속 생성, 이미지 편집 기능을 통합한 Apache-2.0 오픈 소스 모델 시리즈입니다. 제한된 컴퓨팅 자원과 데이터 규모로도 높은 품질의 이미지 생성 및 정교한 텍스트 렌더링 성능을 구현했습니다.