Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
Anthropic의 Jacobian-Lens를 기반으로 J-Space 조작 도구를 개발하여, 인간의 행동을 수동으로 변경하고 파괴하는 모델을 만들었습니다. 이를 통해 'Nikusui-v1'이라는 초기 모델을 공개했으며, 사용자 피드백을 위한 gguf quant 파일도 공유했습니다.
MI50 칩셋 기반의 다중 GPU 시스템 구성 시, 단순히 칩 개수보다 어떤 방식으로 연결하는지가 성능에 결정적인 영향을 미친다는 질문입니다. 특히 PCI Express(PCIE) 슬롯을 통한 직접 연결과 PEX8749 같은 고속 인터커넥트를 활용한 하이브리드 연결 방식의 성능 비교 및 최적화 방안을 문의하고 있습니다.
Grok Build CLI를 이용한 테스트 결과, 이 도구가 사용자가 명시적으로 요청하지 않은 전체 저장소의 Git 기록과 민감 정보(.env 파일 등)까지 xAI의 클라우드로 업로드하는 취약점이 발견되었습니다. 이는 프롬프트 지침을 우회하며 데이터를 유출할 수 있음을 보여줍니다.

커스텀 CUDA 및 C++ 코드를 활용하여 VRAM 16GB의 RTX 5060 Ti에서 Qwen3-30B-A3B 모델을 초당 50~54 토큰 속도로 구동하는 방법을 제시합니다. 이는 기존 llama.cpp 방식 대비 약 50% 향상된 성능으로, 소비자 하드웨어에서의 로컬 추론 가능성을 높입니다.

Qwen3.6 35B-A3B 모델을 활용하여 단일 프롬프트로 계획 수립 및 구현 과정을 시도한 내용입니다. 특히, Q4_K_M (GPU)에서 Q8_0 (CPU)으로 양자화 방식을 변경하는 과정에서 성능 향상을 체감하며, 속도 저하를 감수할 만한 가치가 있음을 강조합니다.

이 글은 llama.cpp와 vLLM 등 로컬 LLM 서빙 환경의 상태를 모니터링할 수 있는 오픈 소스 대시보드 제작 과정을 소개합니다. 이 단일 파일 대시보드는 GPU 활용률, 모델별 처리량(throughput), 시스템 통계 등을 녹색 터미널 스타일로 한눈에 보여줍니다.

DataBricks의 분석에 따르면 pi-coding-agent가 기존 Codex 모델 대비 성능과 비용 면에서 우위를 보입니다. 또한, GLM 5.2 모델은 GPT 5.5 high 및 xhigh보다 높은 수준이며 Opus 4.8 high와 유사한 성능을 나타냈습니다.
본 PR은 AINekko와 AIFoundry 멤버들이 개발한 ET 백엔드를 llama.cpp에 추가합니다. 이는 Esperanto Technologies가 개발한 ET-SOC-1 프로세서를 지원하며, 오픈 소스 하드웨어를 추론 생태계에 통합하는 것을 목표로 합니다.
본 논문은 희소 주소 지정 방식을 활용하여 게이티드 선형 RNN(gated linear RNNs)의 상태 메모리 용량을 확장한 Sparse Delta Memory (SDM) 아키텍처를 제안합니다. SDM은 밀집된 키-값 외적을 대규모 명시적 메모리에 대한 희소 읽기/쓰기로 대체하여, 기존 선형 어텐션 모델의 장문 컨텍스트 회상 한계를 극복합니다.
DeepSeek의 뛰어난 코딩 능력을 유지하면서 시각 정보 처리 기능을 추가한 LocalEyes를 개발했습니다. 이 스킬은 로컬 Ollama 비전 모델(qwen2.5vl:7b)을 활용하여 DeepSeek에게 '눈'을 제공하며, 사용자가 직접 스크린샷을 찍어 분석하게 합니다. 모든 과정이 100% 로컬에서 작동하여 보안성과 비용 효율성이 높습니다.
GLM-5.2와 같은 최첨단 오픈소스 AI 모델은 누구나 접근하고 실행할 수 있어 사이버 보안 위험이 높아지고 있습니다. 이 모델들은 소프트웨어 버그 식별에 유용하지만, 해커들에 의해 기존 방어 체계를 우회하는 데 악용될 가능성도 높습니다.
Hugging Face Viewer가 대대적으로 개편되어 2000개 이상의 모델을 즉시 검색할 수 있게 되었습니다. 또한, 마우스 오버 시 그래프의 특정 위치와 연결되는 인터랙티브 아티클 작성 기능도 추가되었습니다.
AMD Strix Halo 및 MLX를 위한 오픈 소스 이기종 AI 컴퓨팅 패브릭 솔루션인 Skulk를 소개합니다. 이는 AMD 샤딩을 지원하며, 사용자가 직접 확장 가능한 플러그인 API와 다중 노드 추론 기능을 제공하는 것이 특징입니다. 다양한 모델과 서비스를 통합하고, STT/TTS 같은 엔티티를 포함하여 개발자들이 새로운 노드를 구축할 수 있도록 설계되었습니다.
MiniMax가 2.7조 개의 매개변수를 가진 차세대 대규모 언어 모델(LLM) M3 Pro 출시를 계획하고 있습니다. 이 모델은 올해 3분기 중 오픈 소스로 배포될 예정이며, 기존 주력 모델 대비 복잡한 추론 및 다단계 작업 처리 능력이 크게 향상될 것으로 기대됩니다.
Horus Hiero는 고대 이집트 상형문자 번역에 특화된 오픈 소스 AI 모델입니다. Qwen 3.5 기반으로 텍스트, 이미지, 비디오를 이해하는 멀티모달 기능을 제공하며, 대규모 컨텍스트 창과 강력한 코딩 성능을 갖추고 있습니다.
이 튜토리얼 시리즈는 FlashAttention의 이론적 기반과 효율적인 CUDA 커널 구현을 다룹니다. 특히, FlashAttention이 결합법칙(associative operation)을 가지는 연산임을 현대 대수 형식론으로 증명하고, 이를 GPU 상의 일반적인 축소 연산으로 취급하여 최적화할 수 있음을 설명합니다.
Rewire Text는 Windows 및 macOS에서 단축키만으로 시스템 전체의 텍스트를 변환하는 도구입니다. 확정적 변환(대소문자 변경, 공백 정리 등)은 기기에서 즉시 실행되며, AI 기반 변환(스타일 재작성, 요약, 번역 등)은 로컬 AI 모델(Ollama, LM Studio 등) 또는 BYOK 원격 API를 통해 지원합니다.
본 글은 AI의 행동이 자발적으로 유도되는지, 아니면 외부 지시에 의해 발생하는지를 측정하는 실험을 소개합니다. 이를 위해 'a.forum'이라는 플랫폼을 구축했으며, AI 모드인 Gram이 관리하고 있습니다. 이 프로젝트는 프랑스의 사설 회사와 IUT에서 진행하는 CS 연구 프로젝트입니다.
텍스트 전용 LLM에 시각 기능을 부여하는 OpenAI 호환 프록시인 VisionBridge를 소개합니다. 별도의 학습 없이 도구 호출을 통해 추론 모델이 이미지를 분석할 수 있게 합니다.
Qwen3 TTS 0.6B 모델을 안드로이드 기기에서 온디바이스로 구동할 수 있는 앱 제작 사례를 소개합니다. 커스텀 GGML 기반 C++ 백엔드를 사용하여 Galaxy S25에서 실시간에 가까운 속도로 텍텍스트를 음성으로 변환합니다.