Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.

Cohere가 North Mini Code를 공식 출시하며, 사용자 피드백을 반영한 세부 정보를 제공했습니다. 가중치는 Hugging Face에서 다운로드 가능하며, vLLM 배포 시에는 `cohere_melody` 라이브러리 설치와 특정 명령어를 사용해야 합니다. 또한 GGUF 및 MLX 지원 등 다양한 최적화 방안에 대한 논의도 진행 중입니다.
본문은 '바이브 코딩'이라는 개념을 두 가지 방식으로 정의하고, 이 용어의 사용이 커뮤니케이션에 혼란을 줄 수 있음을 지적합니다. 특히 AI 지원을 받는 코드 작성 방식과 무분별하게 AI에게 모든 것을 맡기는 방식을 구분할 필요가 있습니다.

AI 연구자들이 여러 출처(arXiv, Hugging Face 등)의 논문을 한곳에서 모아볼 수 있는 웹사이트 'Paper Deck'을 개발했습니다. 이 도구는 논문 열람, 북마크, 기기 간 동기화 기능을 제공하며 무료 오픈 소스로 공개되었습니다.

Cohere에서 North Mini Code라는 오픈소스 에이전트 코딩 모델을 공개했습니다. 이 모델은 300억 개의 파라미터 중 30억 개만 활성화하여 높은 효율성을 보여줍니다. Apache 2.0 라이선스로 배포되어 접근성이 높습니다.
OpenAI가 새로운 AI 모델 개발과 상장(IPO) 계획을 동시에 추진하고 있습니다. Altman은 급격한 기술 발전, 특히 재귀적 자기 개선(RSI)이 IPO를 지연시킬 수 있다고 언급했습니다. 또한, OpenAI는 GPT-5.5보다 의미 있는 개선이라 설명되는 코드명 5.6 모델도 준비 중입니다.
Sam Altman의 최근 24개월간 인터뷰를 분석한 결과, 답변의 73%가 12개의 정해진 스크립트로 구성되어 있음이 밝혀졌습니다. 이는 창업자의 진솔한 페르소나가 치밀하게 관리되는 PR 전략의 결과임을 시사합니다.
Q-Judger는 텍text-to-image 생성 이미지의 품질을 자동 평가하기 위해 미세 조정된 시각-언어 모델입니다. Qwen3.6-27B를 기반으로 하며, 사고 사슬(CoT) 추론을 통해 품질, 미학, 정렬 등 5가지 차원에서 구조화된 JSON 점수를 출력합니다.
Zai가 GLM-5.1 추론을 위해 자체 개발한 ZCube 네트워크 아키텍처를 도입하여 성능을 대폭 개선했습니다. 기존 ROFT 방식의 트래픽 불균형 문제를 해결하여 비용은 줄이고 처리량과 지연 시간 성능은 높였습니다.
5090, 6000 PRO MaxQ, 6000 PRO WS/SE 등 다양한 GPU 모델의 Diffusion 연산 성능을 비교 분석한 테스트 결과입니다. 각 그래픽 카드의 전력 제한 범위와 언더볼팅/오버클러킹 적용 여부에 따른 성능 차이를 다룹니다.
18년 된 RTOS와 90년대 CPU 에뮬레이터 환경에서 260K 파라미터 규모의 초소형 LLM을 실행하는 데 성공한 프로젝트입니다. FPU가 없는 환경을 극복하기 위해 INT8 양자화와 정수 연산 최적화 기법을 적용했습니다.
NVIDIA가 공개한 SOL-ExecBench 벤치마크를 통해 AI가 생성한 CUDA 커널의 성능 문제를 분석합니다. 실제 운영 환경에서 AI 생성 커널이 학습과 추론 성능을 저하시킬 수 있음을 보여줍니다.
CUDA 없이 Triton만으로 구현한 Fused MoE dispatch kernel을 소개합니다. Megablocks 대비 89-131%의 성능을 달성했으며, 메모리 트래픽을 35% 절감하고 AMD MI300X에서도 코드 변경 없이 동작합니다.
SWE-rebench 리더보드가 110개의 새로운 Python 작업을 포함하여 업데이트되었습니다. 모델이 실제 GitHub PR 이슈를 해결하고 테스트를 통과하는 능력을 평가하며, 향후 소형 모델 추가 및 다국어 작업 지원을 계획하고 있습니다.
MOSS-TTS-v1.5는 제로샷 음성 복제와 다국어 합성을 지원하는 최신 음성 합성 모델입니다. 1.0 버전 대비 음성 복제의 안정성과 언어 태그를 통한 다국어 성능, 문장 부호 기반 운율 제어 능력이 크게 개선되었습니다.
ChatGPT의 프로젝트 폴더 기능 사용 시 컨텍스트 격리가 완벽하지 않아 정보가 유출되는 현상이 발견되었습니다. 프로젝트 폴더 내 정보가 이후 생성되는 모든 스레드에 영향을 미치는 메모리 유출(memory bleed) 문제가 확인되었습니다.
로컬 LLM 채팅 로그를 분석하여 스스로 성능을 개선하는 자기 최적화(Self-optimizing) 에이전트 파이프라인을 소개합니다. 성찰 및 재작성 단계를 통해 추출된 교훈을 시스템 프롬프트에 자동으로 반영하여 에이전트의 능력을 지속적으로 향상시킵니다.
에이전트의 마크다운 스킬 파일을 학습 가능한 파라미터로 취급하여 최적화하는 SkillOpt 방법론을 소개합니다. 엄격한 검증 게이트를 통해 성능이 개선된 편집 사항만을 수용함으로써 효율적인 스킬 최적화를 달성합니다.
OSCAR는 2비트 KV 캐시 양자화를 위해 오프라인 스펙트럴 공분산 인식을 활용한 회전 행렬을 제안합니다. 이를 통해 모델의 성능 저하를 최소화하면서 KV 캐시 메모리 사용량을 약 7배 압축할 수 있습니다.
16GB VRAM 환경에서 Qwen3.6:27B 모델을 최적화하여 실행하는 방법과 성능을 분석합니다. MTP 양자화 및 레이어 오프로딩 설정을 통해 음성 비서 서비스에 적합한 추론 속도를 확보하는 과정을 다룹니다.
llama.cpp의 최신 b9274 버전에서 MTP(Multi-Token Prediction) 모델 사용 시 발생하는 VRAM 누수 문제가 해결되었습니다. 서버가 sleep 상태로 진입할 때 해제되지 않던 draft 리소스들을 명시적으로 정리하여 메모리 부족 오류를 방지합니다.