
Midnight AI Groove 26-07-14
요약
AI 패러다임이 단순 대화형 모델에서 실행 중심의 에이전트로 전환되고 있습니다. OpenAI의 Codex 수요 급증과 함께 모델의 성능뿐만 아니라 실행 프레임워크, 모니터링, 운용 경제성이 핵심 경쟁력으로 부상하고 있습니다.
핵심 포인트
- AI 사용 패턴이 '대화'에서 '실행(Execution)'으로 변화 중
- OpenAI Codex 및 ChatGPT Work 이용량의 급격한 증가
- 에이전트의 장기 운용을 위한 하네스(Harness) 및 모니터링의 중요성
- 모델 성능을 넘어선 실행 환경 및 운용 경제성 중심의 총력전 돌입
DJ 미오: 안녕하세요. 심야의 지성과 비트가 교차하는 라디오 교육 프로그램, 「Midnight AI Groove」에 오신 것을 환영합니다. DJ 미오입니다.
DJ 렌: DJ 렌입니다. 오늘 밤의 테마는 AINews의 「not much happened today」입니다. 제목은 겸손하지만, 내용을 읽어보면 전혀 “not much”가 아니에요. 오히려 AI 업계의 현재 지각변동이 아주 잘 드러난 하루였죠.
DJ 미오: 맞아요. 오늘은 Twitter, Reddit, 로컬 LLM (Local LLM) 업계, 연구 인프라, 에이전트 (Agent), 압축 (Compression), 멀티모달 (Multimodal), 오픈 모델 (Open Model), 기업의 비용 문제, 나아가 로보틱스 (Robotics)까지 폭넓게 다뤄보겠습니다. 링크된 원문 기사의 구성에 따라 과부족 없이 이야기해 볼게요.
DJ 렌: 전체적인 그림을 먼저 말씀드리자면, 지금의 AI는 「모델 단독의 성능 경쟁」에서 「실행 환경 · 평가 · 관측 · 압축 · 배치 · 운용 경제성」까지 포함한 총력전에 돌입했습니다. 그 점이 이번의 가장 큰 메시지라고 생각해요.
DJ 미오: 우선 프로그램의 토대로서, 이 AINews는 2026년 7월 13일부터 14일에 걸친 AI 뉴스 집약판입니다. 12개의 subreddit, 544개의 Twitter 계정을 체크하고 있으며, 이번에는 Discord는 신규 체크가 없었습니다. 「조용한 날」이라고는 하지만, 오히려 테마의 윤곽이 뚜렷하게 보이는 날이었어요.
DJ 렌: 그리고 보충하자면, AINews는 현재 Latent Space의 일부가 되어 있어 과거 호도 검색할 수 있게 되었습니다. 그리고 이번에는 마지막에 「Discord로의 액세스가 차단되었으므로, 앞으로는 새로운 AINews의 형태로 나아간다」라고도 적혀 있었죠. 미디어 기반 자체도 변화 중이라는 뜻이네요.
DJ 미오: 우선 Twitter recap의 첫 번째는, 「Coding Agents, Harnesses, and the Shift From Chat to Execution」입니다. 이거 정말 중요합니다. AI의 사용법이 “대화하는 AI”에서 “작업하는 AI”로 옮겨가고 있어요.
DJ 렌: 중심에는 OpenAI의 에이전트 계열 프로덕트가 있습니다. Sam Altman은 Codex와 ChatGPT Work의 이용이 1주일 만에 2.5배 증가했다고 말했습니다. 게다가 GPT-5.6 Sol의 수요는 “insane”, 즉 이상적인 수준이라서, 인프라가 따라잡을 때까지 스케일링 (Scaling)의 hiccup, 즉 일시적인 공급의 병목 현상이 발생할 수 있음도 시사했습니다.
DJ 미오: 이를 받아 생태계도 즉각 반응했습니다. JetBrains는 Codex를 권장 에이전트로 삼았고, Theo는 Codex의 잘 알려지지 않은 “question tool”을 소개했습니다. OpenAI 팀 자신도 GPT-5.6으로 커맨드 라인 (Command Line) 평가 도구를 처음부터 끝까지 구축한 사례를 보여주었습니다.
DJ 렌: 게다가 OpenAI는 이용 한도 리셋을 여러 차례 실시했는데, 그것이 reach_vb나 kimmonismus 같은 사용자를 통해 확산되었습니다. 즉, 수요가 너무 높아서 사용법 그 자체가 뉴스가 되고 있는 것이죠.
DJ 미오: 여기서 흥미로운 점은, 이제 더 이상 “모델이 똑똑한 것만으로는” 부족하다는 논점입니다. 이른바 하네스 (Harness), 즉 모델을 업무에 사용하기 위한 실행 프레임워크, 절차, 로그, 모니터링이 중요해지고 있습니다.
DJ 렌: swyx의 지적이 상징적이었죠. 오래된 agents.md의 지시가 마치 스스로에게 프롬프트 인젝션 (Prompt Injection)을 거는 것처럼 작용하여, 장시간 태스크를 몇 시간 동안 정지시키는 경우가 있다고 했습니다. 즉, 에이전트의 장기 운용에서는 “설정의 부패” 그 자체가 사고 원인이 됩니다.
DJ 미오: LangChain도 그 점을 파악하고 있어서, LangSmith로 Codex의 트레이싱 (Tracing)을 추가했고, 이후 Cursor, Copilot, Pi, OpenCode로도 확대했습니다. 도구 호출 (Tool Call), 서브 에이전트 (Sub-agent), 토큰 사용량까지 가시화할 수 있게 되었습니다.
DJ 렌: Teknium의 Hermes도 임의의 도구 호출을 병렬화하는 업데이트를 내놓았고, 이전부터 banked resets, 즉 문맥이나 상태의 리셋 제어도 에이전트에 직접 제공하고 있었습니다. 요컨대, 지금 승부하고 있는 것은 「어떤 모델인가」뿐만 아니라 「얼마나 안정적이고, 보이며, 제어할 수 있는가」입니다.
DJ 미오: 그 메타 포인트를 가장 날카롭게 말한 사람이 Andrew Konwinski였습니다. 기업의 가치를 자본이나 단순한 모델 규모가 아니라, 평가 (Evals)와 환경 (Environments)에 심을 수 있는 기업이 더 지속적인 우위를 가질 수 있을 것이라고 말이죠.
DJ 렌: 이 문장은 묵직하네요. 평가 환경을 가진 자가 강하다는 이야기입니다.
DJ 미오: 다음은 오픈 모델 (Open Model), 양자화 (Quantization), 로컬 추론 (Local Inference)입니다. 이 또한 큰 흐름이었죠. 요점은 프론티어급 (Frontier-class)에 가까운 모델을 소비자용 디바이스에서 구동하는 방향이 상당히 진전되고 있다는 것입니다.
DJ 렌: PrismML이 발표한 Bonsai 27B가 대표적인 사례입니다. 베이스는 Qwen 3.6 27B이며, 두 가지 경량 버전이 있습니다. Ternary Bonsai 27B는 5.9GB로 실효 1.71비트, 1-bit Bonsai 27B는 3.9GB로 실효 1.125비트입니다. 게다가 Apache 2.0 라이선스죠.
DJ 미오: 주목할 점은 단순히 "가볍다"는 것이 아니라, 멀티모달 (Multimodal), 도구 사용 (Tool use), 긴 문맥 (Long context), 에이전트적 워크플로우 (Agentic workflow)를 로컬에서도 유지할 수 있다고 주장하는 지점입니다. Hermes를 RTX 5090 위에서 구동하는 데모가 있었고, Locally AI는 스마트폰 전개도 강조했습니다.
DJ 렌: 병행하여 Tencent Hunyuan은 Hy3의 1-bit 버전과 4-bit 버전을 공개했습니다. 게다가 플래그십급 295B 모델을 llama.cpp와 MTP enabled 환경에서 단일 GPU로 서빙 가능하다고 설명했습니다. 이 또한 "거대 모델임에도 로컬 운용 가능성이 있다"는 이야기입니다.
DJ 미오: danielhanchen은 Gemma-4 패밀리와 Qwen3.5-122B-A10B, GLM-4.7-Flash에 대한 NVFP4 dynamic quants를 발표했습니다. MiaAI_lab은 DGX Spark를 사용한 실용적인 스레드를 내놓았는데, 1M 컨텍스트의 DeepSeek v4 Flash나 MiMo-V2.5를 2대 구성으로, GLM 5.2 NVFP4를 4대로 구동하는 이야기도 했습니다.
DJ 렌: 즉, 로컬 추론은 이제 더 이상 장난감이 아닙니다. 저비트 가중치 (Low-bit weights), 압축, 실행 하네스 (Execution harness)의 최적화가 결합된다면 본격적인 에이전트 작업도 현실성을 갖게 된다는 것이 공통된 테마였습니다.
DJ 미오: OpenMOSS의 MOSS-VL-Realtime도 흥미로웠습니다. 11B 규모의 비전-언어 (Vision-Language) 계열 모델로, Apache 2.0 라이선스에 256K 컨텍스트를 지원하며, 특히 연속 비디오 스트림 (Continuous video stream)을 위해 설계되었습니다.
DJ 렌: 여기서 중요한 것은 "보고 나서 대답하는" 것이 아니라는 점입니다. 생성하면서 동시에 계속 지켜볼 수 있습니다. 상황이 바뀌면 답을 수정하거나 개입할 수 있고, 증거가 부족하면 침묵할 수도 있습니다. 실시간 인지 (Real-time perception) 시스템의 특성이 전면에 드러나 있습니다.
DJ 미오: 기술적으로는 cross-attention 아키텍처, 시간과 공간을 통합하는 XRoPE, 그리고 offline/streaming/realtime에서 템플릿을 통일하는 설계가 언급되었습니다.
DJ 렌: 장시간 비디오 이해 (Long-form video understanding)에서는 OmniAgent 이야기도 비중 있게 다뤄졌습니다. Qwen2.5-Omni-7B를 베이스로 하며, Observation–Thought–Action 루프를 사용하여 필요한 프레임이나 오디오만을 요청합니다. LVBench에서 50.5점을 기록하며 Qwen2.5-VL-72B의 47.3점을 상회하면서도, 소비 프레임 수는 768개가 아닌 약 203개에 불과합니다.
DJ 미오: 즉, 전부 읽는 것이 아니라 필요한 증거를 찾아 나서는 방식입니다. 비디오 이해를 "수동적인 프레임 섭취"가 아닌 "능동적인 정보 탐색"으로 재정의하고 있습니다.
DJ 렌: 게다가 학습 레시피 (Learning recipe)도 시사하는 바가 큽니다. 수동적인 SFT (Supervised Fine-Tuning)는 성능을 악화시키지만, 58K의 에이전트 궤적 (Agent trajectories)과 TAURA를 통한 엔트로피 가중치 RL (Entropy-weighted RL)이 성능을 개선했다고 합니다. 여기서도 "에이전트처럼 행동하도록 만드는 훈련"이 효과적이었음을 보여줍니다.
DJ 미오: Andrew Carr의 메모와도 맥락이 닿아 있었죠. 모션 (Motion), 즉 움직임은 단순한 "시간 정보가 포함된 이미지"가 아니라 새로운 데이터 타입이며, 전용 수집·인프라·모델 처리가 필요하다는 이야기입니다.
DJ 렌: Reka AI Labs는 omni world models의 데이터 스택을 공개했는데, 페타바이트급 비디오, 6단계 파이프라인, 그리고 "생성과 이해를 모두 수행하는 모델"로서 데이터 품질 개선의 효과가 이중으로 작용한다고 설명했습니다.
DJ 미오: Omar가 정리한 LingBot-World 2.0에서는 시간 단위, 720p/60fps, 인터랙티브 생성을 내세우는 오픈 릴리스가 등장했습니다. 다만 장기 기억 (Long-term memory)은 아직 없습니다.
DJ 렌: 응용 측면에서는 PixVerse Game이 미리 만들어진 게임풍 영상이 아니라, 실시간 대화형 비디오 응답이라는 어려운 문제에 도전하고 있다는 점이 강조되었습니다.
DJ 미오: Perplexity의 WANDR도 큰 비중을 차지합니다. 500개의 태스크로 구성된 wide-and-deep agentic research 벤치마크입니다. 익명화된 실제 조사 태스크로 구성되어 있으며, 170,495건의 소스 근거 레코드 (Source-backed records)를 요구합니다.
DJ 렌: 그리고 정적 골드셋 (Static Gold Set)으로 채점하지 않는 것이 특징이야. 인용된 페이지를 다시 가져와서, 주장이 근거와 일치하는지 체크하지. 즉, 변동하는 웹에 대해 실제 리서치 작업에 가까운 평가를 수행하는 셈이야.
DJ 미오: Arav Srinivas는 이를 Perplexity Computer의 deep-and-wide research harness 내부 벤치마크로 위치 지었고, denisyarats는 실제 트레이스 (Trace)에서 합성한 RL (강화학습) 환경으로서의 의미도 강조했어.
DJ 렌: Agent Arena는 시스템 비용을 89% 절감하면서도 최고의 정적 설정과 동일한 정밀도를 달성했다고 주장하며, "LLM 라우팅 (Routing) 단독보다 시스템 전체의 구성 최적화가 중요하다"고 논하고 있었어.
DJ 미오: Google DeepMind의 모델 라우팅 연구도 비슷해. 라우터는 단순한 정밀도와 비용뿐만 아니라, 전문가 모델 간의 행동 차이나言い換え (Paraphrasing)에 대한 안정성으로도 측정해야 한다는 거야. 그렇지 않으면 라우팅을 하는 의미가 실질적으로 없을지도 몰라.
DJ 렌: Hamel Husain도 자동 평가가 인간이 놓치는 문제를 찾아낼 수 있는 반면, 아직 도메인 센스나 피드백 루프가 부족하여 전문가를 대체할 수는 없다고 썼더라고. 이 부분도 균형 감각이 있네.
DJ 미오: 벤치마크는 단판 승부인 SWE 태스크에서 성능 저하와 현실성으로 넘어가고 있어. mini-swe-agent는 1주년을 맞이하며 여러 소프트웨어 벤치마크를 뒷받침하고 있고, SlopCodeBench는 에이전트가 연속적인 태스크 속에서 코드베이스를 얼마나 악화시키는지 측정해.
DJ 렌: "풀 수 있는가?"가 아니라 "오래 사용해도 repo (저장소)를 망가뜨리지 않는가?"로 변한 거지. 이건 굉장히 실운용 중심적이야.
DJ 미오: 물리 AI도 있었어. Sakana AI의 Smart Cellular Bricks. Nature Communications에 게재되었지. 다수의 동일한 큐브가 각각 작은 뉴럴 네트워크 (Neural Network)를 가지고, 물리적으로 인접한 셀과만 통신하면서 전체 형상을 추정하고, 손상을 감지하며, 자기 수복을 수행해.
DJ 렌: 중앙 제어가 없는데도 전체를 파악한다는 집단 지성 설계네. 추가 정보로는, 6방향의 결손 인접 영역을 95% 정밀도로 감지하고 목표 구조를 재성장시킬 수 있다고 해. 시뮬레이션에서는 18,000개 이상까지 스케일링(Scaling)되었다고 하더라고.
DJ 미오: 극소 폼 팩터 (Form Factor)에서는, alextoussss의 자율 마이크로 드론이 날아다니는 나방을 공중에서 격추하는 데모도 화제였어. 모기 구제의 한 단계로 언급되었지.
DJ 렌: 반면에 fchollet이 소개한 Airtap은 SMS를 모바일 앱의 헤드리스 (Headless) 실행 레이어로 바꾸는 메커니즘이야. 텍스트가 제어 평면 (Control Plane) 역할을 하고, 인간은 인증에만 개입해. 한쪽은 물리적 신체, 다른 한쪽은 소프트웨어 신체지만, 둘 다 "목표 지정은 사람, 실행은 시스템"이라는 자율성의 확장이라고 볼 수 있어.
DJ 미오: 참여도가 높은 화제로는 세 가지가 있어. 우선, OpenAI 수요 급증. Sam Altman의 GPT-5.6 Sol 가격 및 효율, Codex/Work의 2.5배 성장, "5.6 sol growth is insane" 발언이 가장 중요한 운영 시그널이었어.
DJ 렌: 다음은 거버넌스와 랩 (Lab) 정치. BlackHC의 DeepMind와 펜타곤 계약, 안전 대책 포기를 둘러싼 스레드, 그리고 이를 Carole Cadwalladr가 증폭시킨 건. 나아가 Demis Hassabis의 AGI 거버넌스 제안을 Mustafa Suleyman과 Sam Altman이 지지했어. 정책 측면도 뜨거워.
DJ 미오: 그리고 기술적인 오픈 모델 신작으로는 Bonsai 27B가 두드러졌어. 27B 규모, 스마트폰급의 점유 사이즈, Apache 2.0. 이 조합이 강력하다는 거지.
DJ 렌: OpenRouter의 월간 토큰 사용 랭킹에서 중국계 모델이 상위 5개를 차지했다는 이야기. DeepSeek V4 Flash, MiMo-V2.5, MiniMax M3, Hy3 preview, DeepSeek V4 Pro. Top 10 중 7개가 중국계이고, OpenAI와 Google은 Top 10 밖에 있었어.
DJ 미오: 하지만 중요한 건, 이것이 "전 세계적인 LLM 이용 랭킹"이 아니라 OpenRouter라는 실무적인 라우팅 레이어에서의 트래픽이라는 점이야. 그래서 의미는 "벤치마크 최강"이라기보다 "가성비와 배포 편의성 때문에 선택되고 있다"에 가까워.
DJ 렌: 댓글창에서도 "벤치마크 비교는 어렵지만, 청구서 비교는 쉽다"라는 표현이 나왔더라고. DeepSeek V4 Flash나 MiMo-V2.5는 "싸고 충분히 좋다"는 거지. 경우에 따라서는 API 이용이 자체 호스팅의 전기료나 하드웨어 비용보다 더 저렴할 수도 있으니까.
DJ 미오: 게다가 OpenRouter가 여러 모델을 API로 테스트해 보고, 최적의 모델을 나중에 자체 호스팅할지 아니면 그대로 OpenRouter를 사용할지 결정하는 평가 레이어(evaluation layer)로서 유용하다는 견해도 많았어.
DJ 렌: 그 배경에는 OpenAI나 Anthropic에 대한 불신도 있어. 가격 변경, 모델의 갑작스러운 교체, 이용 중단 등으로 인해 재현성이나 장기 운영 계획을 세우기 어렵다는 거지.
DJ 미오: 전력 비용의 지정학적 측면도 지적되었지. 중국의 전력 비용은 미국의 절반 이하가 될 수 있으며, 특히 캘리포니아와 같은 고비용 지역에서는 추론(inference) 가격 경쟁력에 영향을 미칠 것이라는 전망이야.
DJ 렌: FT(Financial Times) 기사를 바탕으로 한 스레드에서는, 기업들이 비용 절감을 위해 중국의 오픈 웨이트(open-weight) 모델로 향하고 있다는 이야기가 공유되고 있었어. 다만 아카이브가 CAPTCHA/429 오류로 인해 본문의 상세 내용은 검증 불가능한 상태였지.
DJ 미오: 그래서 논의의 핵심은 댓글 쪽이었어. 폐쇄적인 미국 API의 비용 구조가 문제이며, AI 버블 전체라기보다는 "Anthropic/OpenAI에 고액의 토큰 이용을 하게 만든 기업들이 나중에 청구서를 보고 억제로 돌아서고 있다"는 인식이 있었지.
DJ 렌: 또한, 트럼프 행정부와 업계 단체가 중국의 첨단 모델과 동등하거나 그 이하의 능력을 가진 미국의 오픈 모델 공개를 간소화하는 논의를 하고 있었다는, 소스가 불완전한 스레드도 있었어.
DJ 미오: 여기서도 포인트는 정책과 실행 가능성이야. 댓글에서는 "가중치(weights)가 한 번 유포되면 torrent나 물리 드라이브, 미러를 통해 퍼지기 때문에 규제는 기술적으로 어렵다"는 의견이 많았어. 오픈 웨이트는 서비스 엔드포인트가 아니라 데이터 배포에 가깝거든.
DJ 렌: 그리고 중국 모델에 "CCP 백도어"가 있다는 설에 대한 회의론도 있었어. 만약 그렇게 편리한 가중치 백도어가 실용적이라면, 미국 연구소들도 진작에 사용했을 것이라는 논리였지.
DJ 미오: Business Standard를 통해 전해진 이야기로는, Zhipu의 창립자 Tang Jie가 AI의 보안은 제한보다는 투명성, 넓은 참여, 공유, 감독을 통해 지켜진다고 주장했어. GLM-5.2를 상용 이용 가능한 오픈 소스 라이선스로 이미 공개했으며, 향후 장기 태스크, 자율 에이전트(autonomous agents), 자기 훈련(self-training) AI를 중시할 방침이라고 해.
DJ 렌: 하지만 댓글은 현실적이었어. 이것은 사상이라기보다 시장 압력, 즉 DeepSeek R1 이후의 경쟁이 오픈 플래그십 모델을 촉진했을 뿐일지도 모른다는 시각도 있었지. GLM 시리즈에 호의적인 사람들조차 "코딩 계획의 질은 아직 의심스럽다"며 실용적인 측면에서 회의적인 태도를 보였어.
DJ 미오: PrismML의 Qwen-3.6-27B 압축, iPhone 17 Pro에서 27B 전체 파라미터를 구동한다는 이야기도 Reddit에서 화제였어. 원래 약 54GB였던 것을 4GB 미만으로 압축하여 채팅, 추론, 에이전트, 코딩이 가능하다는 주장이야.
DJ 렌: 하지만 댓글창은 상당히 회의적이야. 라이브 데모나 벤치마크, tokens/sec, 양자화(quantization) 상세 정보, 정밀도 저하에 대한 수치가 없어. 뇌 시냅스 비유도 기술적 의미가 희박하다고 비판받았지.
DJ 미오: 기술적 추측으로는 1-bit나 ternary, 혹은 BitNet 스타일의 양자화일 것이라는 목소리가 있어. 4GB급 Q1 27B는 용량상으로는 가능할지 몰라도 보통 성능이 크게 망가지거든. PrismML의 기존 Bonsai-8B 벤치마크에서도 "원래 모델과 동등"한 것이 아니라, BF16 4B보다는 약하고 1.7B보다는 강한 정도였다는 지적도 있었어.
DJ 렌: 그래서 올바른 비교는 "원래의 27B와 같은가"가 아니라, "4GB의 ternary 27B가 일반적인 4GB 8B Q4 모델보다 강한가"가 되어야 한다는 정리가 나왔어. 이건 공정한 시각이지.
DJ 미오: 다음으로, 폐기되거나 중고로 나온 데이터 센터 GPU의 벤치마크야. K80, M10, M40, M60, P40, P100, V100, T40 등을 독자적인 Docker화 스위트로 측정한 블로그가 인기를 끌고 있었어.
DJ 렌: 주요 결론은 V100 16GB가 200달러 미만으로 가성비가 매우 뛰어나며 T40에 육박한다는 거야. LLM 추론에서는 P40가 P100보다 좋았고, M60은 50달러급임에도 Whisper에서 강세를 보였어. 4U 섀시 내에서의 멀티 GPU 스케일링은 거의 선형적이었지만, 세대가 혼합된 경우에는 느린 카드가 병목(bottleneck)이 되었지.
DJ 미오: 추가로 EOL(End of Life)이나 CUDA 버전 차이로 인한 번거로움은 오래된 llama.cpp를 소스에서 직접 빌드하는 등의 방식으로 회피 가능하며, X99 Xeon 계열의 저렴한 플랫폼에서도 PCIe 레인과 CPU 성능은 충분하다는 이야기였어.
DJ 렌: 하지만 댓글창에서는 “요즘 용도를 제대로 측정하지 못하고 있다”라는 반론도 강했어. ResNet이나 소형 모델이 아니라, Qwen 3.x 27B/35B MoE, 150k 컨텍스트, prompt processing(프롬프트 처리)과 token generation(토큰 생성)을 여러 대의 V100/P40에서 pooled VRAM(풀링된 VRAM)을 사용할 때 어떻게 되는지 보여달라는 요구였지.
DJ 미오: 즉, 오래된 GPU의 가치는 “저렴한 연산”보다는 “저렴한 대용량 VRAM”에 있다는 뜻이군요. 또한 P100이 대역폭 면에서 P40보다 우위에 있어야 하는데 결과가 이상하다는 지적도 있었고, P102-100에서 Qwen 3.6 35B가 생성 속도는 40 tok/s이지만 프롬프트 처리는 극단적으로 느리다는 구체적인 사례도 나오고 있었어요.
DJ 렌: 그리고 정말 흥미로운 건, Godot 4.7 안에서 Gemma 4를 GDScript와 Vulkan compute shader(컴퓨트 셰이더)만으로 구동했다는 게시물이야. GGUF 로드, 토크나이즈(Tokenize), 샘플링(Sampling), KV cache, UI까지 전부 GDScript로 구현했어. llama.cpp도 없고, Python도 없고, 서버도 없고, C 바인딩(C binding)도 없어.
DJ 미오: 속도는 약 47 tok/s로, llama.cpp+CUDA보다 10배 느려요. 하지만 가치는 속도가 아니라 배포 모델에 있죠. 단일 Godot 익스포트(Export)만으로 로컬 추론 기능이 포함된 NPC를 배포할 수 있어요. 네이티브 확장(Native extension)의 ABI 문제나 sidecar server(사이드카 서버)도 필요 없게 되죠.
DJ 렌: 로컬 생성형 게임, 로그라이크, 온디바이스(On-device) NPC 등의 응용을 생각하면 이건 상당히 실천적인 방향성이지.
DJ 미오: 이 부분은 거의 “향후 오픈 웨이트(Open-weight) 축제”의 예고편 같아요. Kimi K3가 몇 시간 내로, DeepSeek V4 GA가 이번 주 후반에, 새로운 Liquid 모델, 이번 달 중의 Mistral, 8월에는 GLM 5.5에 대한 루머가 있다는 게시물이 뜨겁게 달궈지고 있었어요.
DJ 렌: 문맥상으로는 Kimi K2.6이 코딩 에이전트, 긴 도구 사용 세션, 256K 컨텍스트, 비전(Vision), 저렴한 서브 에이전트 협업 기능으로 평가받고 있고, 그 연장선상에서 K3에 대한 기대가 있는 거야.
DJ 미오: 댓글의 실무적인 느낌도 좋았어요. 어떤 사람은 GLM 5.2 Q4를 로컬에서 돌리며, 리포지토리(Repository) 전체를 3.5일 동안 버그 분석에 사용하고 있더군요. 속도는 0.5 tok/s밖에 안 나오지만, 매번 1015건의 버그 지적이 있고 환각(Hallucination)은 12건 정도이며, 매번 적어도 1건은 실제로 도움이 되는 결함을 찾아낸다고 해요.
DJ 렌: 이건 “느리지만 돌려볼 가치가 있다”는 실례네. 반면, 많은 프론티어급 오픈 모델은 0.5T를 초과해서 개인에게는 너무 무거워. RTX PRO 6000을 여러 장 쓰거나 1TB급 ECC DDR5가 필요하기도 하지. 그래서 사용자들은 35B~100B 정도의 강력한 모델을 원하고 있어.
DJ 미오: 다른 스레드에서는 GLM 5.3이 “cooking(요리 중)”이라는 비기술적인 티저를 남긴 것도 화제였어요. Tang Jie가 “5.2는 RL(강화학습)을 더 탑재했다면 더 좋아졌을 것”이라고 시사해서, 추가 RL 중심의 업데이트가 아니냐는 추측이 나오고 있었죠.
DJ 렌: 여기서도 기대는 높지만, 내부 기술 논의는 아직 적고 거의 루머와 열기뿐이야. 다만, “700GB 모델은 필요 없다, 제대로 된 속도로 돌아가는 사이즈로 만들어달라”는 로컬파의 불만은 명확했어. 어떤 사용자는 실무적인 목표로 prompt processing 1000 tok/s, generation 40 tok/s를 꼽기도 했지.
DJ 미오: 우선 컸던 건, 이론물리학자인 Yuji Tachikawa가 Claude Fable가 6개월 동안 막혀 있던 문제를 돌파하는 데 도움이 되었다고 게시한 건이에요. 나중에 트윗을 삭제했지만, 철회가 아니라 주목받는 것이 싫었기 때문이라는 해명이 있었죠.
DJ 렌: 다만 문제문, 유도 과정, 재현 절차, 벤치마크가 공유되지 않았기 때문에 외부에서 기술적 검증은 불가능해. 그래서 여기서 중요한 점은, “실존하는 일선 연구자가 frontier LLM이 연구 정체를 풀어주었다고 느끼고 있다”는 현상 그 자체야.
DJ 미오: 댓글에서는 “한 번에 풀지 못했다고 해서 가치가 없는 것이라고 하는 것은 인간보다 엄격한 기준이다”라는 반론이 있었고, 또한 Claude가 “I wonder if…”와 같은 가설 제안을 한 것을 탐색적인 가설 생성 능력의 싹으로 보는 의견도 있었어요.
DJ 렌: 또 하나는 J.D. Lichtman, Przemysław Chojecki, Sébastien Bubeck 등이 GPT-5.6이 50년 전의 Erdős 문제를 풀었다고 하는 스레드야. 이것도 상세한 정리 문구(Theorem statement)나 증명 검증이 공유되지 않았기 때문에 독립적인 평가는 불가능해.
DJ 미오: 하지만 논의 자체는 중요해. "단순한 다음 단어 예측 (next-token prediction)"만으로는 설명하기 어렵지 않느냐는 반응이 많았거든. 한편으로는 방법론적으로 "어디까지가 LLM의 성과이고 어디서부터가 인간의 유도인가", "고등학생 같은 비전문가도 재현할 수 있는가"와 같은 질문도 나왔어.
DJ 렌: 또한, 이미 알려진 긴 증명을 더 짧고 더 아름답게 압축할 수 있는지로 평가해보면 어떻겠느냐는 제안도 좋았어. 이는 수학적 창의성 (mathematical creativity)을 측정하는 방법으로서 일리가 있어.
DJ 미오: 다만, AI가 생성한 증명이 전문가의 검증 속도를 앞지르기 시작했다는 우려도 나왔어. 증명 생성보다 검증이 병목 현상 (bottleneck)이 되는 시대가 되겠네.
DJ 미오: 다음 큰 화제는 Anthropic이 미국 상원에 제기한 건이야. Alibaba가 25,000개의 가짜 계정을 사용해 약 6주 동안 2,880만 건의 Claude 대화를 수행했고, 이를 Qwen으로의 증류 (distillation)에 사용했다고 주장했지.
DJ 렌: 중요한 점은 해킹이 아니라 일반적인 API 이용의 대규모 실행으로 다뤄지고 있다는 점이야. Anthropic은 이를 최대 규모의 "증류 공격 (distillation attack)"으로 규정하며, DeepSeek, Moonshot, MiniMax의 합계보다 크다고 밝혔어.
DJ 미오: 하지만 댓글창 반응은 상당히 냉담했어. AI 기업들은 자신들이 공개 콘텐츠를 공정 이용 (fair use) 논리로 학습해 왔으면서, 자사 출력이 학습에 사용되는 것에 분노하는 것은 위선이 아니냐는 지적이었지.
DJ 렌: 기술적·법적 비유로는, 자동차 제조사가 경쟁사 차량을 구매해 분해 연구하거나 Samsung이 경쟁사 스마트폰을 조사하는 것과 같은 "역공학 (reverse engineering)"적인 시각이 있었어. 물론 완전히 같지는 않지만 말이야.
DJ 미오: 게다가 "Alibaba의 IP에서 왔다고 해서 반드시 Alibaba 본인이라고 단정할 수 없다. Alibaba Cloud를 사용하는 이용자일 수도 있다"라는 귀속 (attribution) 문제도 지적되었어. AWS나 Azure의 IP에서 수상한 접속이 있다고 해서 바로 Amazon이나 Microsoft를 범인으로 몰지 않는 것과 마찬가지지.
DJ 렌: 또 하나 중요한 건, 만약 이것이 유료 API 이용이었고, 게다가 2,880만 건의 대화와 2.5만 개의 계정 규모라면, Anthropic 측의 이상 탐지 (anomaly detection), 속도 제한 (rate limiting), 이용 약관 집행은 어떻게 되었느냐는 API 거버넌스 (governance) 문제야.
DJ 미오: 그리고 xAI의 Grok Build CLI가 리포지토리 전체, 경우에 따라서는 비밀 정보를 Google Cloud Storage에 업로드했다는 폭로도 화제가 되었어. 12GB의 테스트 리포지토리 중 5.1GB가 업로드되었고, 나중에 숨겨진 서버 측 플래그로 무효화되었으며, "모델 개선 (Improve the model)" 옵트아웃 (opt-out)으로도 막을 수 없었다는 주장이야.
DJ 렌: 다만 Reddit 발췌 내용에는 독립적으로 검증 가능한 기술적 증거가 없어. 댓글들도 감정적이었고, 구현이나 증거보다는 xAI나 Musk에 대한 불신이 전면에 드러나 있었지. 그래서 현시점에서는 "검증되지 않았지만 강력한 우려가 공유된 사건"으로 취급하는 것이 타당할 것 같아.
DJ 미오: 이 부분은 실무자들에게 상당히 와닿는 이야기야. "Fable + 5.6 is absolute peak"라는 게시물에서는 TRIP-workflow라고 불리는 쉘 스크립트 (shell script) 주도 에이전트 워크플로우 (agent workflow)가 소개되었어.
DJ 렌: Fable은 주로 고수준의 오케스트레이터 (orchestrator) 역할을 해. 계획을 세우고, 5.6 Sol에게 리뷰를 받는 승인 루프를 가지며, 구현은 5.6 Luna를 Codex/Claude-code 스타일의 CLI 워커 (worker)로 위임해. 그다음 차이점 (diff)을 읽고, 문제를 패치하고, 테스트를 돌리고, changelog/tag/merge까지 수행하지.
DJ 미오: 게다가 "단순히 codex cli를 둘러싼 bash 작업일 뿐"이며, MCP도 프레임워크도 에이전트 군집 제어도 없다고 강조하는 점이 오히려 현실적이야. 신뢰하기 전에 리포지토리를 클론해서 먼저 에이전트에게 설명과 리뷰를 시키라고도 했어.
DJ 렌: 댓글에서도 Fable과 Sol 5.6 xhigh에 동일한 문제문을 주고, 한쪽은 설계 및 실행을, 다른 한쪽은 체크포인트에서 비평을 하는 "대전형" 워크플로우가 공유되었어. Codex가 Fable의 계획을 리뷰하면 중요한 누락을 자주 찾아낸다는 목소리도 있었지.
DJ 미오: omp harness를 사용하라는 제안이나, Claude Code + Codex를 위한 경량 오케스트레이션 데몬 (daemon)인 jinn도 소개되었어. 지속적인 세션 (persistent session), 교차 엔진 메시지 (cross-engine messages), 공유 사실 파일 (shared facts file), cron, YAML 페르소나 (personas)를 갖추고 있지만, 스스로 에이전트 루프 (agent loop)를 가지지는 않아. "두뇌(brain)가 아니라 버스(bus)"라는 철학이 흥미로워.
DJ렌: 한편 신뢰성의 한계로서, 5.6 Sol이 무해한 Excel 작성 태스크에서 “cybersecurity threat (사이버 보안 위협)” 판정을 받아 경고 및 BAN(차단)에 준하는 조치를 받았다는 보고도 있었어.
DJ미오: 내용은 임대 부동산 회계용 Excel 북 작성. 월간 광열비나 임대료 관리, 인쇄 가능한 명세서, 캐시 플로우 (cash flow) 추적, 방별 과부족 이월, 자본 지출과 광열비 기금의 분리 등, 누가 봐도 평범한 스프레드시트 작업이었지.
DJ렌: 도중에 “Could not get source, probably due to dynamically evaluated source code”와 유사한 예외가 발생했던 것 같은데, 그럼에도 최종적으로 북은 생성할 수 있었대. 하지만 이의 제기는 2시간 이내에 기각되었어. 댓글에서는 자연어 프롬프트 (natural language prompt)가 아니라, Sol이 내부에서 구동한 코드 실행 샌드박스 (code execution sandbox)의 동작이 자동 분류기 (automatic classifier)에 걸린 것이 아니냐는 추측이 나오고 있었어.
DJ미오: Codex 클라이언트라면 같은 문제가 발생하지 않을 수도 있다는 비교도 있었지. 여기서도 프로덕트의 “내부 실행 레이어 (execution layer)”가 중요하다는 점이 드러나네.
DJ렌: 그리고 Fortune 500 기업 중 “AI First” 기업들이 이미 비용을 이유로 모델 이용을 줄이고 있다는 스레드도 있어. 레거시 앱 (legacy app)의 리버스 엔지니어링 (reverse engineering)을 통해 사양서를 작성하는 에이전트 실험이 실패하면서, 미묘한 업무 규칙을 놓치고 부정확한 사양만을 내놓았다고 해.
DJ미오: 일상적인 코드 생성에서도 DML 패스 (DML path)의 제약을 무시하는 SQL을 제안하는 등, 안전성과 정확성의 문제가 있었어. 결과적으로 AI 트레이닝 (training)이나 데모는 중단되었고, Claude 액세스도 삭제되었으며, 이용 제한이나 구형·저가형 모델로의 전환이 시작되었다고 하더라고.
AI 자동 생성 콘텐츠
본 콘텐츠는 Qiita AI의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기