Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
스마트폰과 같은 모바일 엣지 디바이스에서 1B~7B 규모의 LLM 성능을 벤치마킹한 연구를 분석합니다. 다양한 SoC 환경에서 지연 시간, 메모리 점유율, 양자화 방식 및 최적의 스레드 설정 등 실질적인 배포 지표를 다룹니다.
커스텀 Silia 아키텍처를 기반으로 한 117M 파라미터 규모의 소형 모델 학습 결과와 연구 내용을 소개합니다. H100 GPU를 사용하여 5시간 만에 81M 토큰을 학습 완료하였으며, 모델 구조와 추론 방법 및 논문을 공유합니다.
RISC-V 아키텍처 기반의 CSB1-N10SPK3 서버 에지 클러스터 제품 사양을 소개합니다. 10개 노드로 구성된 클러스터는 총 320GB RAM과 600TOPS의 높은 연산 성능을 제공합니다.
Anthropic이 모델의 내부 사고 과정을 분석하는 연구를 발표하며 J-Space 렌즈 코드를 공개했습니다. Qwen 3.6 27B 모델을 활용한 J-Space 데모가 함께 소개되었습니다.
선형 어텐션 모델의 메모리 손실 문제를 해결하기 위해 해마(Hippocampus) 구조를 도입한 HOLA를 제안합니다. 고정된 순환 상태와 함께 정확한 KV 캐시를 병행 사용하여 긴 문맥에서도 높은 니들 리콜 성능을 유지합니다.
Claude Code 세션을 로컬 모델 미세 조정을 위한 학습 데이터로 변환하는 도구인 Claude-Converter v1.5.0이 출시되었습니다. 이번 업데이트를 통해 Claude Code뿐만 아니라 Codex와 Pi 세션 변환 기능 및 통합 API를 지원합니다.
Ascent GX10 하드웨어에서 REAP-pruned NVFP4 기술을 적용한 DeepSeek-V4-Flash 모델의 성능을 테스트했습니다. 긴 컨텍스트 환경에서 처리량(throughput)의 안정성과 일관성을 검증하기 위해 VLLM과 Grafana를 활용한 모니터링을 수행했습니다.
Ornith 397B 모델의 추론 능력을 테스트한 결과, Claude Opus 수준의 고난도 수학 문제 해결 능력을 보여주었습니다. 특히 동적 계획법과 역방향 귀납법이 필요한 복잡한 확률 문제를 완벽하게 풀어내며 강력한 성능을 입증했습니다.
Open Computer는 에이전트가 UI를 조작하고 앱을 설치할 수 있도록 설계된 오픈 소스 에이전트 전용 컴퓨터 환경입니다. 격리된 VM 내에서 작동하며, 인간이 관찰 가능한 인터페이스를 제공하면서도 에이전트의 효율적인 작업을 지원합니다.
Ant Group이 경계 기반 마스킹(boundary-driven masking) 기술을 적용한 DINO 계열 비전 백본인 LingBot-Vision을 공개했습니다. 이 모델은 자기지도 학습을 통해 객체의 경계를 효과적으로 학습하며, 특히 NYUv2 데이터셋에서 뛰어난 성능을 보여줍니다.
ThinkingCap-Qwen3.6-27B 모델은 추론 과정을 기존 Qwen3.6 대비 약 50% 단축하면서도 동일한 정확도를 유지합니다. 수학, 코드, 에이전트 활용 등 다양한 벤치마크를 통해 엄격한 통계적 검증을 거쳤습니다.
Kyutai의 Pocket TTS는 5초의 오디오만으로 목소리를 복제할 수 있는 100M 파라미터 규모의 스트리밍 언어 모델입니다. CPU 환경에서도 구동 가능하며, Mimi 신경 코덱을 기반으로 일정한 지연 시간과 스트리밍 기능을 제공합니다.
ggml-cpu 프로젝트에서 ARM 프로세서의 NVFP4 내적 연산 성능을 높이기 위해 UE4M3 룩업 테이블(LUT) 최적화를 적용했습니다. 이를 통해 ARM 구현을 x86과 일치시키고 CPU 기반 추론 속도를 크게 향상시켰습니다.
대규모 트랜스포머 모델을 다룰 때 발생하는 메모리 부족 문제를 해결하기 위한 tftf 프로젝트를 소개합니다. 모든 연산을 텐서 단위로 수행하여 VRAM과 RAM 용량을 초과하는 모델도 효율적으로 처리할 수 있도록 설계되었습니다.
Sberbank에서 새로운 GigaChat3.5-432B-A28B 모델을 출시했습니다. 베이스 버전과 함께 GGUF 포맷 버전도 제공되어 llama.cpp를 통한 활용이 가능할 전망입니다.
Tencent가 새로운 오픈 모델 Hy3를 공개했습니다. 총 295B 파라미터 중 21B가 활성화되는 구조를 가지며, 라이선스가 Apache 2.0으로 변경되어 커뮤니티 활용도가 높아졌습니다.
ggml-hip 빌드 시 -ffast-math 옵션을 활성화하여 AMD GPU(RDNA3.5)에서의 추론 성능을 개선한 벤치마크 결과입니다. Qwen 모델 시리즈를 대상으로 테스트한 결과, 다양한 컨텍스트 길이에 걸쳐 약 0.6%에서 최대 7.0%의 성능 향상을 확인했습니다.
멀티모달 모델의 반복적인 비디오 전송 비용을 줄이기 위해 로컬 우선(local-first) 비디오 인덱싱 파이프라인인 Watch Skill을 구축했습니다. 비디오에서 전사, OCR, 장면 경계 등을 추출하여 로컬 인덱스를 생성하고, LLM이 이를 검색하여 활용하도록 설계되었습니다.
로컬 모델의 신뢰성을 검증하기 위해 숨겨진 테스트 스위트를 활용하는 'eval gym' 파이프라인을 구축했습니다. gpt-oss:20b 모델이 이 테스트를 통과하여 에이전트 기반 앱 빌드 신뢰 등급을 획득했으며, 실제 업무 적용을 통해 모델의 한계와 버그를 식별하는 과정을 다룹니다.
Llama-Server의 KV 캐시 저장/복구 기능이 프로세스 재시작 시 메타데이터 유실로 인해 무용지물이 되는 문제를 분석하고 해결책을 제시합니다. 체크포인트 메타데이터를 사이드카 파일로 영속화하여 재시작 후에도 효율적인 롤백과 프리필 비용 절감이 가능하도록 개선했습니다.