Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.

생성형 AI(GenAI) 열풍과 하이퍼스케일러들의 막대한 자본 지출 배경 속에서 Cerebras Systems가 성공적으로 IPO를 마쳤습니다. 이번 IPO를 통해 55억 5,000만 달러를 조달하며 회사의 시가총액은 약 950억 달러에 달하는 거대한 규모로 자리매김했습니다. Cerebras는 자체 개발한 컴퓨팅 시스템을 활용하여 OpenAI, AWS 등 주요 고객사들의 AI 인프라 구축 수요를 충족시키며 시장의 주목을 받고 있습니다.
이 글은 여러 AI 모델 제공업체의 복잡성을 해결하기 위해 개발된 오픈 소스 멀티 모델 API 게이트웨이를 소개합니다. 이 게이트웨이는 OpenAI와 호환되는 단일 엔드포인트를 통해 13개 제공업체로부터 43개의 다양한 모델을 지원하며, 사용자는 비용 추적 및 스마트 라우팅 기능을 활용하여 최적의 선택을 할 수 있습니다.
Anthropic의 Mythos가 연구원들이 알려지지 않은 두 개의 macOS 커널 버그를 발견하고 이를 5일 만에 작동하는 권한 상승 익스플로잇으로 전환하는 데 도움을 주었습니다. 이 취약점은 Apple 데스크톱 운영체제의 가장 깊은 계층인 macOS 커널에서 메모리와 프로세스를 제어하는 핵심 영역을 대상으로 했습니다.

이 글은 wgpu를 중심으로 GPU 컴퓨팅의 원리와 AI/CG 파이프라인 간의 유사성을 설명합니다. CG와 LLM 모두 데이터 처리 과정(파이프라인)을 거치며, 특히 GPU의 핵심 기능인 통합 셰이더 유닛(compute shader)이 이 과정을 담당함을 강조합니다. 과거 전용 회로였던 것들이 통합되면서 범용적인 컴퓨팅 능력이 향상되었으며, 이를 통해 AI 모델 구동에 GPU가 활용되는 방식과 그 기술적 구조를 깊이 있게 다룹니다.
InternLM은 35B 파라미터의 과학 멀티모달 파운데이션 모델인 Intern-S2-Preview를 공개했습니다. 이 모델은 기존의 파라미터 스케일링을 넘어, 전문 과학 과업의 난이도와 범위를 확장하는 '태스크 스케일링' 방식을 채택하여 개발되었습니다. 그 결과, 35B라는 비교적 작은 크기에도 불구하고 여러 핵심 전문 과학 과업에서 조 단위 규모 모델에 필적하는 성능과 강력한 일반 추론 및 에이전트 역량을 갖추게 되었습니다.

Cerebras Systems가 대규모 IPO를 성공적으로 마쳤음에도 불구하고 주가가 10% 하락하며 시장의 변동성을 보였습니다. 이 반도체 기업은 AI 모델 학습 및 실행을 위한 초거대 컴퓨터 칩과 시스템을 판매하는 회사입니다. 주력 제품인 Wafer Scale Engine 3는 실리콘 웨이퍼 전체를 활용한 거대한 프로세서로, Nvidia GPU보다 빠르다고 주장하며 시장의 주목을 받고 있습니다.
GitHub의 e2b-dev/desktop은 AI 에이전트가 안전하게 작동할 수 있도록 설계된 격리된 가상 데스크톱 환경을 제공합니다. 이 도구는 AI 에이전트에게 독립적이고 통제된 실행 공간을 제공하여, 실제 시스템에 미치는 잠재적인 위험 없이 복잡한 작업을 수행하도록 돕습니다.
본 자료는 센서 데이터로부터 실시간 3D Scene Graphs를 구축하는 방법에 대한 정보를 제공하며, 관련 GitHub 저장소(MIT-SPARK/Hydra) 링크를 포함하고 있습니다. 또한, 데이터 분석, 플러그인 및 웹 브라우징 기능을 갖춘 AI 에이전트 개발에 대한 추가적인 참고 자료(xlang-ai/OpenAgents)도 함께 소개합니다.
많은 사람들이 AI를 로컬에서 실행하려면 고가의 장비(예: $3,000 MacBook Pro, RTX 4090 등)나 지속적인 클라우드 구독 비용이 필요하다고 생각하지만, NVIDIA가 저렴한 가격($249)의 새로운 컴퓨터를 출시하여 이러한 인식을 바꿀 수 있게 했습니다. 이 기기에 탑재된 장치는 라우터보다 작고 AirPods와 비슷한 크기이며, 67 TOPS 성능으로 llama 3.1-8B 같은 모델을 인터넷 연결이나 API 없이 영구적으로 로컬에서 실행할 수 있습니다.
도널드 Trump 전 대통령은 중국이 자국 기업들의 Nvidia H200 AI 칩 구매를 허용하지 않고 있다고 언급하며, 이는 미국 상무부가 여러 중국 기업에 대한 구매 승인을 내렸음에도 불구하고 실제 출하가 이루어지지 않은 상황을 반영합니다. 현재 수출 라이선스 프레임워크는 마련되었으나, 최종적인 판매 여부는 베이징의 결정에 달려 있는 교착 상태입니다. 전문가들은 만약 제대로 작동하는 수출 프레임워크가 구축된다면, Nvidia가 중국 시장으로부터 연간 35억~40억 달러의 매출을 회복할 수 있을 것으로 추정하고 있습니다. 또한 양국은 AI 가드레일 및 미국의 프런티어 모델 보호를 위한 논의도 진행했습니다.
serve-sim은 iOS 시뮬레이터를 위한 npx serve 도구입니다. 이 도구를 사용하면 단 하나의 명령어로 시뮬레이터가 브라우저에서 실행되며, 60 FPS의 MJPEG 스트리밍, 터치 제어, 실시간 로그 기능을 제공합니다. 이는 Cursor나 Claude Desktop과 같은 다양한 개발 서버 환경에서도 호환됩니다.
DeepSeek V4가 출시되었으며, 이 모델은 58페이지 분량의 상세한 연구 논문을 통해 공개되었습니다. 본문은 Anthropic의 Claude와 같은 폐쇄형 프런티어 모델 대비 DeepSeek-V4가 압도적인 성능과 효율성을 보여주며, 특히 비용 측면에서 큰 우위를 점하고 있음을 강조합니다. DeepSeek는 하이브리드 어텐션 아키텍처를 통해 100만 토큰 컨텍스트 창을 오픈 웨이트로 무료 제공하며, 이는 기존 모델의 병목 현상을 해결하는 세대적 도약으로 평가됩니다.



Apple Silicon 환경에서 MLX 생태계를 활용하여 Gemma 4 31B MTP 모델 제품군을 구동할 수 있는 오픈 소스 로컬 API 게이트웨이 프로젝트가 개발되었습니다. 이 프로젝트는 특히 Gemma4-31B-it 모델의 경우 기존 대비 1.42배의 속도 향상을 달성했습니다. 이는 Google의 Gemma 4 제품군과 연계되어 사용될 수 있습니다.
OrcaSlicer가 Bambu Lab 프린터에 대한 네트워크 지원 기능을 복구했습니다. 이를 통해 사용자는 로컬 네트워크(LAN)의 제약 없이 인터넷을 통해 원격으로 3D 프린팅 작업을 출력할 수 있게 되었습니다. 이 브랜치는 공식 버전에서 제한되었던 Bambu Network 지원을 완전히 복원하여, 기존과 동일하게 인터넷 기반의 원격 출력이 가능합니다.
Burn은 유연성, 효율성, 이식성을 모두 갖춘 차세대 텐서 라이브러리이자 딥러닝 프레임워크입니다. Rust를 기반으로 설계되어 정적 그래프 최적화의 장점을 유지하면서도 높은 유연성을 제공합니다. Burn은 CUDA, ROCm, Metal, Vulkan 등 다양한 하드웨어 백엔드를 지원하며, Autodiff, Fusion, Router, Remote와 같은 데코레이터 패턴을 통해 기능을 확장하고 분산 컴퓨팅까지 지원할 수 있습니다.
huggingface/tokenizers는 성능과 다재다능함에 초점을 맞춘 토크나이저 구현 라이브러리입니다. Rust로 구현되어 학습 및 토큰화 과정 모두 매우 빠르며, 1GB의 텍스트를 20초 미만으로 처리할 수 있습니다. 이 라이브러리는 BPE, WordPiece, Unigram 등 다양한 모델을 지원하며, 정규화 추적, 전처리(pre-processing), 특수 토큰 추가 등 연구 및 프로덕션 환경에 필요한 모든 기능을 제공합니다.
삼성전자가 직원들의 보너스 문제로 인한 18일간의 계획된 파업을 6일 앞두고 이미 웨이퍼 투입 축소 및 생산 라인 조정 등 '비상 경영 모드'에 돌입했습니다. 이는 노조의 파업 시작보다 먼저 생산 감소가 진행되고 있음을 의미하며, 총 생산 중단 기간은 예상보다 길어질 수 있습니다. 또한, 이번 사태는 삼성전자의 글로벌 반도체 공급망과 시장 점유율에 상당한 리스크를 제기하고 있습니다.
AI 에이전트의 발전으로 인해 작업 흐름의 병목 현상이 'AI의 능력'에서 '사용자가 PC 앞에 상주하는 여부'로 이동하고 있으며, 이에 따라 사용자는 언제 어디서든 AI와 연결되어 지시 및 승인(Approval)을 내릴 수 있는 환경을 필요로 한다. 본 글은 Rokid Glasses를 활용하여 Claude Code 세션에 대한 원격 제어 및 알림 기능을 구현한 사례를 제시하며, 스마트폰과 연동된 플러그인형 SDK (CXR-L)를 통해 AI 에이전트의 상태와 응답을 안경(HUD)으로 받아보는 방법을 설명한다.
본 기사는 AI 에이전트에 외부 전문 지식이나 기능을 안전하고 효율적으로 통합하는 방법을 다루며, 이를 위한 표준 프로토콜인 Model Context Protocol (MCP)과 그 구현체 FastMCP를 소개합니다. FastMCP는 Python의 타입 힌트와 데코레이터를 활용하여 개발자가 복잡한 프로토콜 정의 없이도 자작 도구를 쉽게 만들 수 있게 합니다. 핵심은 함수의 docstring이나 명명 규칙 등 코드의 가독성이 LLM의 추론 정밀도로 직결된다는 'AI 퍼스트' 설계 원칙을 따르는 것입니다.
AI 컴패니언의 구현은 단순 LLM 활용을 넘어, 인격 설계, 단기/장기 기억 관리, 안전성 규칙 등이 통합된 시스템적 접근이 필수적입니다. 캐릭터 일관성을 유지하면서도 대화가 템플릿화되는 것을 방지하기 위해 프로필과 이력을 분리하여 다루는 것이 중요합니다. 또한, 안전성은 모델의 답변 필터링에만 의존할 것이 아니라 온보딩 과정, UI 설계, 로그 관리 등 제품 전반에 걸쳐 고려되어야 합니다.