Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
Apple Silicon Mac에서 EXL3 양자화 모델을 실행, 추론 및 변환할 수 있게 되었습니다. 기존 CUDA 환경의 고가 GPU가 필요했던 작업이 64GB 이상의 메모리를 갖춘 Mac에서도 가능해져 로컬 LLM 접근성이 높아졌습니다.
이미지를 실시간 플레이 가능한 게임으로 변환하는 소규모 트랜스포머 기반 신경망 모델을 소개합니다. 소비자용 하드웨어에서 실행 가능하도록 설계되었으며, 키보드 입력에 따라 자기회귀적으로 프레임을 생성합니다.
SupraLabs가 기존 기록을 경신하는 세계 최대 규모의 채팅 제목 데이터셋을 공개했습니다. 지시어 튜닝, 분류 스타일 제목 생성, 소형 모델 벤치마킹 등에 활용할 수 있는 필터링 및 비필터링 버전을 모두 제공합니다.
Reddit의 r/LocalLLaMA 커뮤니티 데이터를 분석하여 현재 로컬 AI 생태계의 트렌드와 현황을 파악한 연구 결과입니다. 약 4만 9천 개의 게시물과 80만 개의 댓글을 바탕으로 로컬 LLM 활용 양상을 정리했습니다.
AMD Radeon 7900XTX GPU를 활용하여 Qwen 3.6 27B 모델을 131k 컨텍스트로 구동하는 최적화 방법을 소개합니다. iGPU를 통한 VRAM 확보와 KV 캐시 양자화 기술을 통해 성능과 메모리 효율을 극대화하는 가이드를 제공합니다.
GLM 5.2 모델은 추론 토큰 사용량을 대폭 줄이면서도 코딩 작업에서 최대 지능의 약 98%를 유지하는 효율성을 보여줍니다. 기술 보고서에 따르면 high level 설정을 통해 로컬 및 API 사용자 모두 효율적인 모델 활용이 가능합니다.
Dual RTX 3090 환경에서 vLLM Prefix Caching과 OpenCode 병렬 에이전트를 활용해 개발 속도를 2.4배 향상시킨 최적화 사례를 다룹니다. 대규모 컨텍스트 사용 시 발생하는 KV 캐시 부족 문제를 비대칭 컨텍스트 프로필로 해결하는 기술적 방법을 제시합니다.
SupraLabs가 115K의 정제된 데이터셋으로 학습된 채팅 타이틀 생성 모델인 supra-title-FFT-preview를 출시했습니다. 이전 모델 대비 데이터 규모가 대폭 확장되어 니치한 주제에 대한 커버리지가 크게 개선되었습니다.
유료 API 없이 로컬 에이전트에 웹 접속 기능을 부여하기 위해 SearXNG와 Scrapling을 결합한 구현 방법을 소개합니다. SearXNG로 검색을 수행하고 Scrapling과 Trafilatura를 통해 웹 페이지를 마크다운 형식으로 추출하는 워크플로우를 다룹니다.
자연어를 수학적 스케줄과 스펙트로그램으로 변환하여 언어의 내부 구조를 시각화하는 Attention Algebra 연구를 소개합니다. 이는 모델의 추론 체인을 진단하고, 메타 언어를 통해 모델의 추론 효율성을 극대화하는 것을 목표로 합니다.
M&A 합병 계약서에서 복잡한 데이터를 JSON 형식으로 추출하는 MAUD 데이터셋과 그 성능 평가에 관한 글입니다. 단순한 스키마 강제를 넘어 데이터의 의미론적 정확도와 환각률을 측정하는 실험적 접근을 다룹니다.
중고 GPU 4개를 P2P로 연결하여 약 1,800달러의 저렴한 비용으로 Qwen/Qwen3.6-27b-FP8 모델을 구동하는 방법을 소개합니다. vLLM을 활용해 262K의 긴 컨텍스트와 BF16 KV 캐시를 적용한 추론 최적화 설정 및 벤치마크 결과를 공유합니다.
Qwen2.5-32B 모델이 엄격한 JSON 스키마를 준수하더라도 복잡한 M&A 계약서 데이터 추출 시 높은 환각률을 보인다는 연구 결과를 소개합니다. 스키마 제약 디코딩이 구조적 정확성은 보장하지만, 내용의 의미론적 정확성과 환각 문제는 별도로 해결해야 함을 강조합니다.
유럽 위원회가 24개 EU 공식 언어를 지원하는 오픈소스 프런티어 AI 모델 개발 프로젝트인 'Frontier AI Grand Challenge'의 승자로 EUROPA 컨소시엄을 선정했습니다. 이 프로젝트는 유럽의 기술 주권과 언어적 다양성을 확보하기 위해 4,000억 개 이상의 파라미터를 가진 모델을 구축하는 것을 목표로 합니다.
Qwen 모델을 위한 Eagle(3) 투기적 디코딩(Speculative Decoding) 기능이 새롭게 출시되었습니다. 사용자는 드래프트 모델을 지정하여 초당 토큰 수(TPS)를 향상시킬 수 있으나, 현재 텐서 병렬화 미지원 및 VRAM 점유 등의 제약 사항이 존재합니다.
단 하나의 JSON 설정으로 LLM의 사전 학습(Pretrain)부터 SFT, 평가까지 엔드 투 엔드로 처리할 수 있는 오픈 소스 프레임워크 'librarian-press'를 소개합니다. 스팟 인스턴스 환경에서도 중단된 샤드부터 재개할 수 있는 안정적인 파이프라인을 제공합니다.
Ohio State University 연구진이 32개의 H100 GPU와 8K개의 합성 데이터를 활용해 학습시킨 오픈 소스 Deep Research 에이전트 QUEST-35B를 공개했습니다. 학습 레시피, 코드, 가중치 및 데이터셋을 모두 오픈 소스로 제공하며 프런티어 모델에 필적하는 성능을 보여줍니다.
AMD Strix Halo(gfx1151) 환경에서 hipBLASLt의 NT 및 TT 레이아웃 GEMM 커널 성능을 최적화하기 위해 진화 알고리즘 기반의 EvoTensile을 개발했습니다. 이를 통해 100개의 입력 형태에 대해 성능을 20 TFLOPS에서 40 TFLOPS 수준으로 대폭 향상시켰습니다.
GLM-5.2 모델을 llama.cpp 및 Unsloth Studio를 통해 로컬 환경에서 실행할 수 있게 되었습니다. 2-bit 양자화를 통해 모델 크기를 대폭 줄이면서도 높은 정확도를 유지하며, 고사양 Mac 환경에서 구동이 가능합니다.
SupraLabs가 VLM의 작동 원리를 투명하게 이해할 수 있도록 설계된 초경량 Vision-Language Model인 SupraVL-Nano-900k를 출시했습니다. 약 90만 개의 파라미터로 구성된 이 모델은 Flickr8k 데이터셋을 통해 처음부터 학습되었으며, 전체 아키텍처를 단일 Jupyter notebook 수준으로 가볍게 구현했습니다.