Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
Triple Nvidia GTX-1070 GPU 환경에서 Gemma 4 모델의 추론 성능을 벤치마크한 결과입니다. 다양한 모델 크기와 양자화 방식에 따른 토큰 생성 속도 및 효율성을 측정하였습니다.
Gemma 및 Qwen 모델의 다양한 양자화(Quantization) 방식에 따른 정확도를 산술, 역사 지식, 주의력 테스트를 통해 비교 분석한 결과입니다. 모델 크기와 양자화 기법(QAT, UD 등)이 성능에 미치는 영향을 실험적으로 보여줍니다.
InfiniteKV는 긴 컨텍스트 처리를 위해 KV 캐시를 압축하여 RAM이나 디스크에 저장하는 오픈 소스 기술입니다. 기존의 슬라이딩 윈도우 방식처럼 토큰을 삭제하는 대신, 104바이트의 검색 가능한 레코드로 압축하여 모델이 과거 정보를 정확히 참조할 수 있게 합니다.
Apodex 1.0 컬렉션의 소형 모델(4B, 35B mini)에 대한 로컬 구동 테스트 후기입니다. 이 모델들은 검색 에이전트로서 쿼리 계획 및 도구 호출 능력을 갖추도록 설계되었으며, 특히 4B 모델은 체급 대비 낮은 환각률과 뛰어난 다단계 질문 해결 능력을 보여줍니다.
AI의 논리적 추론 능력 향상과 아첨 문제 해결을 위해 제안된 '계층적 학습 패러다임(HTP)'에 관한 아이디어입니다. 학습 데이터를 언어, 논리/추론, 실제 세상 정보 순으로 단계별로 제공하여 인간의 학습 방식을 모방하는 새로운 접근법을 다룹니다.
Huawei가 HarmonyOS와 Ascend 컴퓨팅에 최적화된 오픈 소스 대규모 언어 모델인 openPangu 2.0을 출시했습니다. 512K 컨텍스트 처리 능력을 갖추었으며, 높은 희소성 비율을 통해 효율적인 파라미터 활용을 구현했습니다.
Qwopus3.6-27B-Coder-MTP 모델의 성능을 벤치마킹한 결과입니다. MTP Speculative Decoding 기술을 적용했을 때 토큰 생성 속도가 약 2.07배 향상됨을 확인했습니다.
사용자가 'Apostate'라는 abliteration engine을 개발하고 있음을 공유했습니다. 기존의 직교 투영 방식의 경직성을 극복하기 위해 사각 투영(oblique projection)을 구현했으며, 다음 단계로는 KL 다이버전스를 보존하는 전단 매핑(shear mapping) 도입을 계획 중입니다.
새로운 Diffusion Gemma 모델을 기존 자율 회귀(autoregressive) Gemma4와 비교한 벤치마크 결과입니다. DiffusionGemma는 속도는 빠르지만, 사실 확인 과정에서 오류가 훨씬 많이 발견되었습니다. 반면, 일반 Gemma4는 느리지만 정확도가 높아 중요한 정보 전달에 더 적합함을 보여줍니다.
리우데자네이루 시 정부 연구원이 개발한 새로운 오픈 소스 모델을 Hugging Face에 공개했습니다. 이 모델은 기존의 qwen 3.7 플러스와 비교해도 성능이 우수해 보이며, 연구 커뮤니티에서 활용될 수 있도록 공유되었습니다.
Fable 5 데이터셋을 공개하며, 이 데이터에는 CoT(Chain-of-Thought) 정보가 포함되어 있습니다. 해당 데이터를 활용하여 곧 파인튜닝된 모델들이 출시될 것으로 예상됩니다.
2026년 중반에는 로컬 환경에서 구동 가능한 오픈 웨이트 모델이 현실화될 전망입니다. 이는 더 많은 RAM을 요구하는 것이 아니라, sparse attention, MoE, latent KV compression 등 기술적 개선 덕분입니다.
작성자는 Qwen 27B 모델을 사용하여 WASM 바이트코드를 생성하는 과정에서, 모델이 지속적으로 잘못된 결과를 내놓고 이를 확신하며 반복적인 디버깅 문제를 겪고 있음을 공유했습니다. 특히 Qwen3.6-Plus와 같은 최신 버전에서도 오류가 발견되었으나, 웹 검색 기능을 활용한 Qwen3.7-Plus 및 웹 검색 없이도 정확한 답변을 제공하는 Qwen3.7-Max의 성능 차이가 주목됩니다.
Cohere Labs가 코드 생성 및 에이전트 엔지니어링에 최적화된 30B 파라미터의 오픈 웨이트 모델 'North Mini Code'를 출시했습니다. 이 모델은 특히 터미널 작업과 소프트웨어 엔지니어링 분야에서 강력한 성능을 보여줍니다.
InclusionAI가 Qwen3.5 9B 백본을 기반으로 GUI-grounding 비전-언어 모델인 VISTA-9B와 VISTA-4B를 공개했습니다. 이 모델은 스크린샷과 자연어 지침을 정규화된 좌표로 매핑하는 것이 목표입니다. 특히, '뷰 일관성 GRPO 학습'과 '자체 검증 교차 뷰 앵커링' 기법을 통해 정확한 위치 지정 능력을 강화했습니다.
Anthropic이 미국 수출 규정 준수를 위해 Fable 5를 전 세계적으로 폐기한 사례는 AI 모델의 통제권 문제를 제기합니다. 클라우드 API 사용은 지능을 임대하는 것이며, 로컬 가중치(weights)만이 진정한 디지털 독립성을 보장한다는 경고입니다.
미국 정부가 Anthropic의 Fable 5와 Mythos 5 서비스에 대해 긴급 수출 통제 지침을 내리면서, 해당 모델들이 전 세계적으로 강제 중단되었습니다. 이는 사소한 Jailbreak 문제로 인해 투명한 과정 없이 API 접근이 완전히 폐쇄된 사례입니다.
Apostate 엔진 개발 현황을 공유하며, 강력한 거부 방향 목표를 위해 단순 직교 투영 대신 사각 투영 방식을 구현했다고 설명합니다. 향후 의도된 행동 변화와 KL 보존을 위해 전단 매핑 추가를 고려 중이며, 정식 출시 시 더 발전할 것이라고 예고했습니다.
본 글은 초장문 컨텍스트 처리를 위한 MiniMax Sparse Attention (MSA)을 제안합니다. MSA는 GQA 기반의 블록별 희소 어텐션을 사용하여, 기존 softmax 어텐션의 2차 비용 문제를 해결했습니다. 이 기술은 토큰당 연산량을 대폭 줄이고 GPU 실행 경로를 최적화하여 높은 효율성을 달성했습니다.
ex-Huggingface 사전 학습 팀이 로보틱스 데이터 정제(refinement)를 위한 새로운 라이브러리를 공개했습니다. 이 라이브러리는 Parquet, HDF5, MCAP 등 다양한 로보틱스 포맷의 수집을 지원하며, 핸드 트래킹 및 서브태스크 주석 처리 같은 일반적인 데이터 처리 흐름도 제공합니다.