Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
DeepSeek의 파격적인 저가 정책이 기존 미국 AI 기업들의 가격 결정력에 의문을 제기하며 시장의 거품론을 촉발했습니다. DeepSeek V4 Pro는 OpenAI와 Anthropic의 모델 대비 압도적으로 낮은 토큰 비용을 제시하며 마진 압박을 예고합니다.
에이전트 기반 코딩 시 컨텍스트 최적화를 위한 대화 기록 수정 과정에서 발생하는 전체 프롬프트 재처리 문제를 해결하기 위한 PR입니다. llama.cpp가 변경된 부분만 효율적으로 처리하도록 개선하여 에이전트의 반응성을 높였습니다.
Huawei Ascend NPU 환경에서 1.58비트 삼진 양자화 인식 학습(QAT)을 구현한 BitCPM-CANN 연구를 소개합니다. 기존 GPU 기반 파이프라인을 CANN 및 Megatron-LM으로 포팅하여, 전정밀도 모델 성능의 최대 97.2%를 유지하면서도 메모리 사용량을 획기적으로 줄였습니다.
사용자가 OpenAI의 지속적인 서비스 장애와 기능 결함을 보고했음에도 불구하고, 적절한 조치 없이 결제가 지속되고 보안 사고(계정 탈취)까지 발생한 사례를 다룹니다. 사용자는 기술적 분석을 제공하며 해결을 시도했으나 OpenAI의 미흡한 고객 지원과 인프라 문제를 비판합니다.
이미지가 포함된 긴 PDF 문서를 대상으로 시각 기능 LLM과 OCR 기반 파이프라인의 성능을 비교 벤치마킹한 연구입니다. Claude Sonnet 4.5를 활용해 정확도와 비용을 분석한 결과, 차트와 표가 많은 문서에서는 레이아웃 추출 기능이 포함된 OCR이 더 우수함을 확인했습니다.
llama.cpp 서버에 파일 읽기, 쓰기, 쉘 명령 실행 등 다양한 네이티브 도구가 포함된 실험적 플래그가 추가되었습니다. 이를 통해 별도의 복잡한 래퍼 없이도 llama-server를 미니 에이전트 하네스로 활용할 수 있습니다.
이번 주 급성장한 10개의 AI 관련 오픈소스 리포지토리를 소개합니다. AI 코딩 에이전트, 개인용 AI, 브라우저 자동화 및 로컬 개발 도구 등 최신 기술 트렌드를 반영한 프로젝트들이 포함되어 있습니다.
Llama.cpp가 Nvidia Blackwell GPU의 새로운 기능인 PDL(Programmatic Dependent Launch) 지원을 도입했습니다. 이를 통해 토큰 생성 단계에서 약 5~6%의 성능 향상을 기대할 수 있으며, 특정 빌드 플래그를 통해 활성화가 가능합니다.
llama.cpp에서 비대칭 KV 캐시 양자화 사용 시 CUDA 환경에서 성능이 저하되는 문제를 다룹니다. 컴파일 과정에서 다양한 양자화 조합을 포함하는 해결책이 제안되었으며, 메모리 절약과 정밀도 유지 효과가 확인되었습니다.
Cohere Transcribe 모델에 화자 분리(Diarization) 및 타임스탬프 기능을 추가하기 위한 파인튜닝 결과물을 소개합니다. 표준 타임스탬프 형식을 지원하며, 매우 높은 시간 정확도와 최대 32명의 화자 식별 능력을 갖추고 있습니다.
8GB VRAM을 가진 RTX 3070 Ti 환경에서 Qwen3.6-35B-A3B MoE 모델을 활용해 262k 컨텍스트를 구현하고 30tps 이상의 속도를 달성하는 최적화 방법을 소개합니다. 양자화 기법과 KV 캐시 관리, Ubuntu 환경 설정을 통해 저사양 GPU에서도 대규모 컨텍스트 추론이 가능함을 보여줍니다.
6GB VRAM 환경에서 Qwen3.6-35B-A3B 모델을 구동하기 위한 ByteShape 양자화 성능을 테스트했습니다. 실험 결과, ByteShape 양자화는 Unsloth 방식 대비 토큰 생성(TG) 속도가 30% 더 빠르며 효율적인 CPU 오프로딩 성능을 보여주었습니다.
BeeLlama v0.2.0이 출시되어 DFlash 구현 최적화와 Gemma 4 31B 지원을 포함한 대규모 업데이트를 선보였습니다. RTX 3090 환경에서 Qwen 3.6 27B 모델을 사용 시 최대 164 tps의 압도적인 추론 속도를 달성했습니다.
OpenAI의 최근 성과는 단순한 수학 계산을 넘어, 인간의 직관과 다른 새로운 수학적 탐색 공간을 발견하는 데 의의가 있습니다. AI가 대안적 증명 전략과 추측 후보를 생성하며 인간과 협업하는 새로운 연구 패러다임을 제시합니다.
GPT-5.2가 Nature 피어 리뷰 연구에서 최상위권 인간 리뷰어와 대등한 성능을 기록했습니다. 45명의 과학자가 참여한 실험 결과, AI 리뷰어는 일부 약점에도 불구하고 높은 수준의 논문 검토 능력을 입증했습니다.
RTX 4070 Super 12GB 환경에서 ik_llama.cpp를 사용하여 Qwen3.6 35B 모델의 추론 속도를 110 tok/s까지 끌어올린 사례를 소개합니다. 기존 llama.cpp의 MTP 성능 저하 문제를 ik_llama.cpp의 CPU 오프로딩 최적화를 통해 해결했습니다.
1Password가 OpenAI와 협력하여 AI 코딩 에이전트 사용 시 발생할 수 있는 자격 증명 유출 문제를 해결하기 위한 새로운 보안 통합 기능을 출시했습니다. 이 솔루션은 비밀 정보를 프롬프트나 저장소로부터 격리하고, 사용자의 승인을 거쳐 런타임 시점에만 자격 증명을 주입함으로써 보안을 강화합니다.
OpenAI와 몰타 정부가 협력하여 '모두를 위한 AI' 이니셔티브를 추진합니다. 몰타 시민들이 University of Malta의 AI 리터러시 과정을 이수하면 1년 동안 ChatGPT Plus를 무료로 이용할 수 있는 혜택을 제공합니다.
작성자는 Codex CLI, Claude Code, Gemini CLI 등 다양한 에이전틱 코딩 도구를 사용해 본 결과, 가볍고 효율적인 'Pi'를 가장 선호한다고 밝혔습니다. Pi는 최소한의 도구로 구성되어 로컬 모델 활용에 최적화되어 있으며, 필요에 따라 패키지를 추가하여 기능을 확장할 수 있는 유연성을 갖추고 있습니다.
Arena의 최신 리더보드 데이터에 따르면, GLM과 Mimo 모델이 Gemini 3.5 Flash보다 코딩 성능 측면에서 더 우수한 평가를 받았습니다. 현재 Gemini 3.5 Flash가 큰 관심을 받고 있으나, 특정 벤치마크에서는 오픈 웨이트 모델들이 더 높은 순위를 기록했습니다.