Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
의료 기록 작성을 위한 8개 LLM의 성능을 벤치마크한 결과, 환각보다 임상적 세부 사항을 누락하는 현상이 더 빈번하게 발생함을 확인했습니다. 모델 크기와 성능이 반드시 비례하지 않으며, 비용과 품질 사이의 트레이드오프가 존재함을 보여줍니다.
사이버 보안 특화 소형 모델인 OpenMythos의 벤치마크 결과가 공개되었습니다. SWE-bench, CyberGym, cybench 테스트를 수행했으며, 향후 성능 향상을 위한 추가 학습을 계획 중입니다.
사이버 보안에 특화된 소형 모델인 OpenMythos의 벤치마크 결과가 공개되었습니다. SWE-bench Pro, CyberGym, cybench 등 다양한 테스트를 통해 모델의 성능을 검증하였으며, 향후 추가 학습을 통해 성능을 개선할 계획입니다.
CPU 환경에서 세 가지 오픈 웨이트 TTS 모델(Kokoro 82M, Supertonic 3, Inflect-Nano-v1)의 성능을 RTF와 MOS 지표로 비교 분석했습니다. 모델별 속도와 음질 사이의 트레이드오프를 상세히 다루며, 특히 Kokoro ONNX의 효율성을 강조합니다.
Boogu-Image-0.1은 텍스트 생성, 고속 생성, 이미지 편집 기능을 통합한 Apache-2.0 오픈 소스 모델 시리즈입니다. 제한된 컴퓨팅 자원과 데이터 규모로도 높은 품질의 이미지 생성 및 정교한 텍스트 렌더링 성능을 구현했습니다.
Apostate의 새로운 대조적 공벡터 편집(contrastive co-vector edit) 연산자를 소개합니다. 이 방식은 무해한 동작을 보존하면서 거부 방향만을 정밀하게 제거하여, Granite-3.3-8b 모델에서 거부율을 96%에서 5%로 대폭 낮추는 성과를 보였습니다.
TMax는 터미널 에이전트 성능 향상을 위한 강력한 오픈 강화학습(RL) 레시피를 제안합니다. 14,600개의 고품질 RL 데이터셋인 TMax-15k와 결과 중심 RL 학습법을 통해 소규모 오픈 모델로도 대규모 폐쇄형 모델에 근접하는 성능을 달성했습니다.
NEX-N2-mini는 매우 적은 추론 토큰을 사용하면서도 3.5/3.6 수준의 뛰어난 추론 능력을 보여주는 새로운 MoE 모델입니다. 효율적인 추론 성능을 바탕으로 기존 모델들의 파레토 프런티어를 뛰어넘는 성능을 입증했습니다.
Gemma4-12B-QAT Uncensored Balanced 모델이 MTP(Multi-Token Prediction) 기술을 적용하여 출시되었습니다. 이 모델은 비검열화된 답변을 제공하며, MTP를 통해 품질 저하 없이 생성 속도를 약 60% 향상시킨 것이 특징입니다.
Ling and Ring 2.6 기술 보고서를 통해 조 단위 파라미터 규모에서도 효율적이고 즉각적인 에이전트 지능을 구현하는 기술을 소개합니다. Ling-2.6-flash(100B) 모델 출시와 함께 Ling-mini-2.0의 압도적인 추론 속도를 강조합니다.
Gemma 4 31B 모델에서 QAT(양자화 인식 학습)를 적용한 KV 캐시 양자화가 표준 양자화 방식보다 압도적인 성능을 보임을 입증했습니다. KL 발산 지표를 통해 QAT가 모델의 정보 손실과 이상치를 획기적으로 줄여줌을 확인했습니다.
192개의 프롬프트를 사용하여 다양한 로컬 텍스트-이미지(text-to-image) 모델의 성능을 비교 분석한 테스트 결과입니다. 텍스트 생성, 인체 해부학, 공간 구성 등 여러 측면을 평가하였으며 VLM을 활용한 정량적 분석을 포함합니다.
Apostate 프로젝트를 통해 Qwen 3.6 27B 모델의 안전 정렬을 제거한 모델을 Hugging Face에 출시했습니다. 모델의 성능 저하를 최소화하면서 거절률을 92%에서 7.6%로 대폭 낮추는 데 성공했습니다.
VLM(Vision Language Model)의 성능을 측정하기 위한 2차 벤치마크 업데이트 결과입니다. 하드웨어 VRAM 용량별 최적 모델을 제안하며, 사고(Thinking) 모드가 시각 지능에는 오히려 부정적인 영향을 미칠 수 있음을 밝힙니다.
사이드 프로젝트 HobbyLM을 통해 500M 파라미터 LLM과 330M 파라미터 이미지 생성기를 처음부터 사전 학습 및 사후 학습한 과정을 공유합니다. Claude SDK 기반의 에이전트 하네스를 활용해 최적의 아키텍처를 탐색하고 옴니 모델을 구축했습니다.
Gemma 4의 QAT(Quantization-Aware Training) 모델이 KV 캐시 양자화에 대해 높은 성능을 유지함을 보여줍니다. KL 발산(KLD) 지표를 통해 양자화 시에도 모델의 어텐션 성능이 잘 보존됨을 확인했습니다.
GLM-5.2 오픈 웨이트 모델이 DeepSWE 벤치마크에서 GPT-5.4와 Gemini를 능가하는 코딩 성능을 기록했습니다. 하지만 과도한 출력 토큰 사용으로 인해 작업당 비용 효율성은 GPT-5.5나 Claude Opus 4.8보다 현저히 낮습니다.
AllenAI가 자연어 지침을 바탕으로 3D 포인트 궤적을 예측하는 MolmoMotion 비전-언어 모델을 출시했습니다. 짧은 RGB 관측 이력을 통해 미래의 3D 공간 내 객체 이동을 예측하는 것이 특징입니다.
SupraLabs가 텍스트, 이미지, 비디오를 단일 토큰 스트림으로 처리하는 ~30M 파라미터 규모의 Any-to-Any 멀티모달 Transformer 모델인 Supra-A2A-Nano-Exp를 공개했습니다. 별도의 비전 인코더나 확산 모델 없이 공유된 어휘집을 통해 모든 모달리티를 언어 모델링 방식으로 통합한 실험적 프로토타입입니다.
llama.cpp B70 빌드에서 SYCL 백엔드를 사용한 Gemma 4 및 Qwen 모델의 성능 벤치마크 결과입니다. 다양한 모델 크기와 양자화 설정에 따른 토큰 생성 속도(t/s)를 측정하였습니다.