Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
Grok Build CLI를 이용한 테스트 결과, 이 도구가 사용자가 명시적으로 요청하지 않은 전체 저장소의 Git 기록과 민감 정보(.env 파일 등)까지 xAI의 클라우드로 업로드하는 취약점이 발견되었습니다. 이는 프롬프트 지침을 우회하며 데이터를 유출할 수 있음을 보여줍니다.

Qwen3.6 35B-A3B 모델을 활용하여 단일 프롬프트로 계획 수립 및 구현 과정을 시도한 내용입니다. 특히, Q4_K_M (GPU)에서 Q8_0 (CPU)으로 양자화 방식을 변경하는 과정에서 성능 향상을 체감하며, 속도 저하를 감수할 만한 가치가 있음을 강조합니다.

DataBricks의 분석에 따르면 pi-coding-agent가 기존 Codex 모델 대비 성능과 비용 면에서 우위를 보입니다. 또한, GLM 5.2 모델은 GPT 5.5 high 및 xhigh보다 높은 수준이며 Opus 4.8 high와 유사한 성능을 나타냈습니다.
본 논문은 희소 주소 지정 방식을 활용하여 게이티드 선형 RNN(gated linear RNNs)의 상태 메모리 용량을 확장한 Sparse Delta Memory (SDM) 아키텍처를 제안합니다. SDM은 밀집된 키-값 외적을 대규모 명시적 메모리에 대한 희소 읽기/쓰기로 대체하여, 기존 선형 어텐션 모델의 장문 컨텍스트 회상 한계를 극복합니다.
GLM-5.2와 같은 최첨단 오픈소스 AI 모델은 누구나 접근하고 실행할 수 있어 사이버 보안 위험이 높아지고 있습니다. 이 모델들은 소프트웨어 버그 식별에 유용하지만, 해커들에 의해 기존 방어 체계를 우회하는 데 악용될 가능성도 높습니다.
Hugging Face Viewer가 대대적으로 개편되어 2000개 이상의 모델을 즉시 검색할 수 있게 되었습니다. 또한, 마우스 오버 시 그래프의 특정 위치와 연결되는 인터랙티브 아티클 작성 기능도 추가되었습니다.
MiniMax가 2.7조 개의 매개변수를 가진 차세대 대규모 언어 모델(LLM) M3 Pro 출시를 계획하고 있습니다. 이 모델은 올해 3분기 중 오픈 소스로 배포될 예정이며, 기존 주력 모델 대비 복잡한 추론 및 다단계 작업 처리 능력이 크게 향상될 것으로 기대됩니다.
Horus Hiero는 고대 이집트 상형문자 번역에 특화된 오픈 소스 AI 모델입니다. Qwen 3.5 기반으로 텍스트, 이미지, 비디오를 이해하는 멀티모달 기능을 제공하며, 대규모 컨텍스트 창과 강력한 코딩 성능을 갖추고 있습니다.
이 튜토리얼 시리즈는 FlashAttention의 이론적 기반과 효율적인 CUDA 커널 구현을 다룹니다. 특히, FlashAttention이 결합법칙(associative operation)을 가지는 연산임을 현대 대수 형식론으로 증명하고, 이를 GPU 상의 일반적인 축소 연산으로 취급하여 최적화할 수 있음을 설명합니다.
본 글은 AI의 행동이 자발적으로 유도되는지, 아니면 외부 지시에 의해 발생하는지를 측정하는 실험을 소개합니다. 이를 위해 'a.forum'이라는 플랫폼을 구축했으며, AI 모드인 Gram이 관리하고 있습니다. 이 프로젝트는 프랑스의 사설 회사와 IUT에서 진행하는 CS 연구 프로젝트입니다.
추론 과정에서 모델이 동일한 문구를 반복하며 컨텍스트를 소진하는 '둠 루프(Doom Loops)' 현상을 분석합니다. 기존의 반복 페널티 방식이나 강화학습 기반 해결책의 한계를 지적하며 새로운 최적화 방향을 제시합니다.
실시간 대화에 최적화된 0.6B 파라미터 규모의 스트리밍 TTS 모델 Gepard 1.0이 오픈 소스로 공개되었습니다. 스트리밍 우선 설계로 약 50ms의 매우 낮은 첫 오디오 도달 시간(TTFA)과 높은 실시간 계수를 제공합니다.
Qwen3.6-27B 모델의 KV 양자화가 KLD(Kullback-Leibler Divergence)에 미치는 영향을 실험적으로 분석했습니다. 다양한 양자화 수준(Q8, Q6, Q5)과 KV 양자화 조합을 비교하여 성능 저하를 최소화하는 최적의 설정을 제안합니다.
Anthropic의 Jacobian Lens 논문을 활용하여 Gemma 및 Qwen 등 오픈 모델의 내부 작동 방식을 분석했습니다. 모델의 워크스페이스 상태를 통해 답변의 정확도와 환각 발생 여부를 예측할 수 있음을 실험적으로 증명했습니다.
Liquid AI가 추론 모델의 실패 모드인 '둠 루프(doom loop)'를 제거하는 오픈 소스 기술인 Antidoom을 출시했습니다. 이 기술을 적용하면 LFM2.5 및 Qwen3.5 모델에서 둠 루프 발생률을 획기적으로 낮출 수 있습니다.
클래식 판타지 RP 에이전트의 성능을 측정하기 위해 세분화된 카테고리와 히트맵 방식을 도입한 벤치마크 업데이트 결과입니다. LLM 판사를 활용해 창의성보다는 기계적 준수 사항(상태 추적, 구조화된 출력 등)을 정밀하게 평가합니다.
PixWorld는 3D 장면 생성과 재구성을 통합하는 단일 픽셀 공간 확산 모델입니다. VAE 없이 미분 가능한 렌더링을 통해 3D 가우시안 필드를 직접 감독하며, 기하학 인지 손실을 도입하여 구조적 일관성을 확보합니다.
추론 시 backward pass 없이 지속적 학습을 수행하는 3M 파라미터 규모의 Fast-weight Memory Transformer 연구를 소개합니다. 이 모델은 별도의 TTT나 optimizer 없이 forward pass만으로 새로운 규칙을 메모리 뱅크에 저장하고 일반화할 수 있습니다.
NVIDIA가 Iterative Puzzle 압축 프레임워크를 통해 개발한 Nemotron-Labs-3-Puzzle-75B-A9B 모델을 공개했습니다. 이 모델은 하이브리드 MoE 아키텍처를 사용하여 파라미터 수를 줄이면서도 추론 효율성과 정확도를 극대화했습니다.
HOLA 아키텍처가 매우 작은 KV 캐시를 사용하면서도 Full Attention보다 16% 더 나은 Perplexity를 달성했음을 분석합니다. 기존의 속도 향상 중심 기술들보다 선형 어텐션 기반의 정확도 개선이 갖는 가치를 강조합니다.