ChatGPT Live Mode: AI를 실시간 동반자로 활용하는 방법
요약
OpenAI의 ChatGPT Live Mode와 Anthropic의 Claude Code 업데이트를 통해 AI가 실시간 화면 인식 및 에이전트 기반 워크플로우로 진화하는 과정을 다룹니다. Claude Code의 시스템 프롬프트 최적화와 웹 검색 제한 해결 방법 등 실무적인 팁을 제공합니다.
핵심 포인트
- ChatGPT Live Mode는 실시간 화면 인식과 딥 에이전트를 통해 대화형 코파일럿 역할을 수행함
- Claude는 화면 녹화를 통해 반복 가능한 기술(Skill)을 구축하고 워크플로우를 자동화할 수 있음
- Anthropic은 Claude Code의 시스템 프롬프트를 대폭 축소하여 문맥 중심의 동적 관리로 전환함
- Claude Code의 세션당 웹 검색 제한(200회)은 설정을 통해 1500회 등으로 상향 가능함
OpenAI의 새로운 보조 기능인 ChatGPT Live Mode는 실시간으로 사용자의 화면을 읽으며 작업 과정을 함께합니다. Leonard Schmedding은 Codex, Claude 그리고 브라우저를 사용하며 ChatGPT Live Mode를 실시간으로 활용해 봅니다. 이를 통해 AI는 단순한 도구에서 대화형 코파일럿 (Co-Pilot)으로 진화합니다.
ChatGPT Live Mode: 음성 비서가 업무 방식을 바꾸는 방법
ChatGPT Live Mode는 모든 앱 위에 이동 가능한 배너 형태로 자리 잡습니다. 사용자가 말하는 동안 경청하며, 호출 시 스크린샷을 찍어 보이는 내용을 설명합니다. 영상에서는 브라우저 탭을 읽고 내용을 정확하게 요약하는 모습을 보여줍니다.
이 어시스턴트는 병렬로 작동합니다. 사용자에게 작업을 지시하면 백그라운드에서 **딥 에이전트 (Deep Agent)**가 시작됩니다. Codex 내에서는 GitHub 리포지토리(Repository) 검색과 같은 작업을 수행하는 서브 에이전트 (Subagent)들이 실행됩니다. 사용자는 모든 단계를 화면에서 직접 확인할 수 있습니다.
특히 절제된 동작 방식이 매우 편리합니다. Live Mode는 더 이상 끊임없이 사용자의 흐름을 방해하지 않습니다. 대화 전체를 전사 (Transcription)하지만, 마지막의 명확한 지시사항에만 반응합니다. 일상적인 자동화를 위한 이 도약은 엄청난 수준입니다. AI 어시스턴트를 실무에 어떻게 통합하는지는 AI-Automations-Manager에서 확인할 수 있습니다.
한 가지 한계는 당분간 유지됩니다. ChatGPT가 아직 사용자의 화면을 직접 제어하지는 못합니다. 반면 받아쓰기 기능은 이미 작동합니다. 영상에서는 Voicely.de를 병렬로 실행하여 음성 프롬프트 (Prompt)를 Claude로 직접 전송하는 모습을 보여줍니다.
Teach Claude a Skill과 동적인 Claude Code 시스템 프롬프트
Teach Claude a Skill을 사용하면 화면을 녹화할 수 있습니다. Claude는 과정을 촬영하며 이를 바탕으로 반복 가능한 기술 (Skill)을 구축합니다. 이렇게 하면 워크플로우 (Workflow)를 한 번만 문서화한 뒤 이후에는 자동화할 수 있습니다.
동시에 Anthropic은 Claude Code의 배후 기술을 변경하고 있습니다. 팀은 시스템 프롬프트 (System Prompt)의 약 80퍼센트를 제거했습니다. 기존 프롬프트는 약 150,000자에 달했습니다. 더 강력한 모델일수록 더 적은 예시와 적은 금지 사항을 필요로 합니다.
대신 모델은 경직된 규칙 대신 문맥 (Context)을 전달받습니다. 오늘날의 시스템 프롬프트 (System Prompt)는 동적입니다. 워크스페이스 (Workspace)에 따라 Claude는 개별 구성 요소들을 정밀하게 주입합니다. 이는 귀하의 문맥 관리 (Context Management)를 직접적으로 개선합니다.
Claude Code: 200회 호출의 숨겨진 웹 검색 제한
이번 주부터 새로운 설정이 귀하의 리서치를 방해하고 있습니다. Claude Code는 이제 **세션당 200회의 웹 검색 (Web-Searches)**만 허용합니다. 이 변경 사항은 예고 없이 도입되었습니다. 인터넷에서 많은 검색을 수행하는 사용자라면 즉시 차이를 느낄 것입니다.
해결 방법은 간단합니다. 귀하의 전역 Claude Code 설정을 엽니다. 세션당 최대 웹 검색 횟수 값을 찾으세요. 이 값을 200에서 1500과 같은 값으로 높이십시오. 그러면 귀하의 심층 리서치가 다시 제약 없이 실행됩니다.
Anthropic Economic Index: 어떤 직업이 AI를 가장 강력하게 활용하는가
Anthropic Economic Index는 누가 Claude를 가장 집중적으로 사용하는지 보여줍니다. 귀하는 데이터를 커넥터 (Connector)로서 Claude 웹 앱에 연결합니다. 그 후 모델에 노동 시장에 관한 질문을 직접 던질 수 있습니다.
분석 결과는 부분적으로만 놀랍습니다. IT와 수학이 23.8 퍼센트로 선두를 달리고 있습니다. 그 뒤를 예술, 디자인, 미디어가 잇고 있습니다. 3위는 교육, 4위는 영업입니다.
이 수치들은 오래된 편견을 반박합니다. 창의적인 직업과 영업 관련 직업은 AI를 피하는 것이 아니라, 강력하게 활용하고 있습니다. 특히 마케팅 팀은 에이전틱 코딩 (Agentic Coding)을 통해 많은 성과를 거두고 있습니다.
Claude Opus 5 대 Fable 5: 벤치마크 및 실전 테스트
새로운 Claude Opus 5는 Anthropic의 '5' 시리즈 중 하나로 Fable 5와 함께 나란히 이름을 올립니다. 벤치마크 (Benchmarks)에서 이는 앞서 나갑니다. 조작이 거의 불가능한 ARC-AGI-3 벤치마크에서 가장 큰 도약이 나타났습니다.
실전 테스트는 당사의 AI 개발자 Marcel이 진행했습니다. 두 모델 모두 PDF 추출 앱을 구축했습니다. Opus 5는 5분 38초 만에 완료되었으며 비용은 22센트가 들었습니다. Fable 5는 30분 59초가 소요되었으며 비용은 약 40센트였습니다.
세부적인 정확도(Detail-Genauigkeit) 측면에서는 Opus 5가 확실히 앞섰습니다. Opus 5는 포맷팅을 깔끔하게 수행했으며 출력(Output)에 대해 더 많은 제어권을 제공했습니다. 반면 Fable 5는 모든 제품을 완벽하게 인식했습니다. 순수한 에이전틱 코딩 (Agentic Coding) 용도로는 GPT-5.6이 강력하고 저렴한 대안으로 남습니다.
새로운 AI 모델들과 Y Combinator의 13가지 비즈니스 모델
Google은 Gemini 3.6 Flash와 Gemini 3.5 Flash Light를 출시했습니다. 에이전틱 코딩 (Agentic Coding) 측면에서 두 모델은 거의 큰 역할을 하지 않습니다. 반면 보이스 에이전트 (Voice-Agents) 및 대화형 AI (Conversational AI) 분야에서 Gemini는 강력합니다. 새로 학습된 모델인 Gemini 4가 이미 준비되어 있습니다.
이미지 모델 분야에서는 Qwen Image 3가 현재 Nano Banana에 도전장을 내밀었습니다. Black Forest Labs 또한 Omni 모델인 Flux 3를 통해 추격하고 있습니다. Flux 3는 이미지, 비디오, 오디오 및 액션 예측 (Action Prediction)을 아우르며, 이를 통해 피지컬 AI (Physical AI)를 목표로 합니다.
마지막으로 Y Combinator는 13가지 비즈니스 모델을 언급했습니다. 핵심 관통 주제는 'AI가 물리적 세계로 침투하고 있다'는 것입니다. 여기에는 AI 튜터, 멀티플레이어 AI (Multiplayer AI), 그리고 자가 유지형 API (self-maintaining APIs) 등이 포함됩니다. 저희는 바로 이러한 AI와의 팀 협업을 위해 RelationFlow를 구축했습니다.
결론: ChatGPT Live Mode가 보여주는 업무의 미래
ChatGPT Live Mode는 진정한 미래의 모습을 보여줍니다. AI는 단순한 도구에서 상시 동반자로 진화하고 있습니다. 아직 기능이 완벽하지는 않습니다. 환각 (Hallucination) 현상이 발생하기도 하고, 스크린샷을 때때로 잘못 해석하기도 합니다. 그럼에도 불구하고 테스트해 볼 가치는 충분합니다.
독일 기업들에게는 한 가지 걸림돌이 남아 있습니다. 모든 가시적인 콘텐츠가 미국으로 직접 전송된다는 점입니다. 이는 민감한 기업 데이터에 있어 매우 민감한 문제입니다. GDPR(DSGVO)을 준수하는 대안은 CorporateLLM-Workshop에서 소개해 드립니다. 더 깊이 있게 배우고 싶은 분들은 kilernen.de에서 라이브 워크숍을 확인하실 수 있습니다.
자주 묻는 질문 (FAQ)
ChatGPT Live Mode란 무엇인가요?
ChatGPT Live Mode는 OpenAI의 보조 기능입니다. 이 기능은 사용자의 화면을 실시간으로 읽으며 음성으로 반응합니다. 어시스턴트는 호출 시 스크린샷을 찍고, 콘텐츠를 설명하며, 병렬적인 Deep Agents (딥 에이전트)를 실행합니다. Codex (코덱스) 내에서는 GitHub 리포지토리 검색 등을 위한 서브 에이전트 (Subagents)가 작동합니다. 이를 통해 AI가 컴퓨터 작업 중에 사용자를 직접 보조합니다.
Claude Code에서 웹 검색 제한을 어떻게 높이나요?
Claude Code는 최근 세션당 웹 검색 횟수를 200회로 제한하기 시작했습니다. 이 제한은 새로운 설정을 통해 예고 없이 도입되었습니다. 전역 Claude Code 설정을 열고 세션당 최대 웹 검색 (Web-Searches) 값을 찾으세요. 해당 값을 200에서 1500과 같은 더 높은 값으로 설정하십시오. 그러면 Claude가 세션당 훨씬 더 많은 조사를 수행할 수 있습니다.
Claude Opus 5가 Fable 5보다 나은가요?
벤치마크 결과에 따르면, 특히 조작하기 어려운 ARC-AGI-3 벤치마크에서 Claude Opus 5가 앞서고 있습니다. PDF 테스트에서 Opus 5는 5분 38초를 기록하여, 30분 59초가 소요된 Fable 5보다 빨랐으며 비용 또한 40센트 대신 22센트가 들었습니다. 세부 정확도와 포맷팅 측면에서는 Opus 5가 우세했습니다. 반면 Fable 5는 모든 제품을 완전히 인식했습니다. Agentic Coding (에이전틱 코딩) 용도로는 GPT-5.6이 저렴한 대안으로 남아 있습니다.
Anthropic Economic Index에 따르면 어떤 직업군이 AI를 가장 많이 사용하나요?
Anthropic Economic Index (앤스로픽 경제 지수)는 누가 Claude를 가장 집중적으로 사용하는지 측정합니다. IT와 수학 분야가 23.8%로 앞서고 있습니다. 그 뒤를 예술, 디자인, 미디어가 잇고 있습니다. 3위는 교육, 4위는 영업 분야입니다. 이 데이터는 창의적인 직업과 영업 관련 직업에서도 AI에 대한 의존도가 높음을 보여줍니다.
ChatGPT Live Mode는 기업용으로 안전한가요?
독일 기업들의 실무 적용 측면에서 ChatGPT Live Mode는 여전히 민감한 문제입니다. 모든 가시적인 콘텐츠는 미국으로 직접 전송되어 처리됩니다. 이는 민감한 기업 데이터(Firmendaten)에 있어 실질적인 리스크입니다. 또한, 해당 기능은 여전히 환각 (Hallucination) 현상을 보이며, 스크린샷을 때때로 잘못 해석하기도 합니다. 테스트 용도로는 적합하지만, 민감한 실제 데이터 (Echtdaten)를 사용하기에는 아직 시기상조입니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기