에이전트에게 필요한 것은 대화창이 아니라 책상입니다
요약
기존의 대화 기반 에이전트 데모는 실제 복잡한 작업 환경에서 한계를 보입니다. 진정한 협업을 위해서는 단순히 로그를 기록하는 것보다, 인간과 에이전트가 공유하고 상호작용할 수 있는 '공간적 작업 영역(spatial workspace)' 설계가 필수적입니다. 이 공간은 커서와 레이아웃 기반의 중단 가능성 및 지속적인 상태 유지를 핵심으로 합니다.
핵심 포인트
- 에이전트는 대화창(로그)보다 책상(주소 공간)에서 작동해야 한다.
- 진정한 협업을 위해 에이전트에게 자체 커서를 부여하고 레이아웃 기반의 상호작용이 필요하다.
- 단순한 자율성 대신, 사용자가 언제든 개입할 수 있는 '중단 가능성'이 핵심 기능이다.
- 협업 세션에서는 공유 화면보다 모든 요소가 유지되는 '저장된 캔버스/레이아웃' 인프라가 중요하다.
대부분의 에이전트 데모는 여전히 똑같아 보입니다. 사용자가 상자에 타이핑합니다. 어딘가에서 무언가가 일어납니다. 도구 호출(tool calls)의 벽이 스크롤됩니다. 그런 다음 요약본이 나타나고, 사용자는 그것을 신뢰해야 합니다.
그 모델은 좁은 작업(narrow tasks)에는 작동하지만, 에이전트가 사용자가 사용하는 것과 같은 컴퓨터를 사용해야 하는 순간 무너집니다. 즉, 브라우저, 스프레드시트, 티켓 등 자동화에 맞춰 설계되지 않은 지저분한 사용자 인터페이스(UI)들입니다. 포인터를 볼 수 없다면 협업하는 것이 아닙니다. 기다리는 것입니다.
저는 무한 캔버스 OS를 위한 제품과 엔지니어링을 구축하고 있습니다. 우리가 계속 돌아가는 디자인의 핵심은 간단합니다. 에이전트와 인간은 공간적 작업 영역(spatial workspace)을 공유해야 한다는 것입니다. 같은 보드에, 분리된 커서로, 중단 가능한 작업 흐름이어야 합니다.
실제로 이것을 구현하려고 할 때 어떤 의미를 가지는지 살펴보겠습니다.
대화는 로그입니다. 책상은 주소 공간(address space)입니다.
대화는 의도 파악에는 훌륭합니다.
그러니 에이전트에게 자체 커서를 부여하세요. 레이블을 지정하고, 색상을 입히고, 자신만의 것을 유지하게 하세요. 이제 옆에 있는 예약 페이지에서 에이전트가 작업하는 동안 시트(sheet)에 계속 타이핑할 수 있습니다. 충돌은 신뢰 문제가 아니라 레이아웃 문제로 변합니다.
저희는 결국 각 에이전트 좌석을 컴포지터(compositor) 내부의 마우스와 키보드로 취급하게 되었습니다. 에이전트를 추가하고, 새로운 창에 새 커서를 떨어뜨립니다. 저희 사례에서는 한 캔버스에 최대 열여섯 개까지 가능합니다. 도우미(helpers)들은 리드(lead)에 연결되어 하나의 작업당 하나의 창을 사용하므로, 보드가 익명의 활동 더미로 변하지 않습니다.
중단 가능성(Interruptibility)이 사람들이 실제로 원하는 기능입니다
누군가 에이전트가 잘못된 목록을 클릭하는 것을 보는 첫 순간에, 그들은 더 나은 모델을 요구하지 않습니다. 그들은 클릭 중간에 작동하는 정지 버튼을 요구합니다.
일시정지(Pause)하세요. 창을 되찾으세요. 전체 실행을 다시 시작하지 않고 수정을 타이핑하세요.
이러한 제어 기능들은 작게 들립니다. 하지만 이것은 '자율성(autonomy)'과 '감독(supervision)'의 차이를 만듭니다. 중단할 수 없는 자율성은 단지 더 나은 산문으로 쓰인 장기 실행 스크립트에 불과합니다.
유용한 패턴이 있습니다: 리드 에이전트가 진행하기 전에 편집 가능한 계획을 작성하고, 도우미들이 보이는 부분에서 조각들을 실행하며, 별도의 검사(check)가 무언가가 완료되었다고 표시되기 전에 새로운 스크린샷을 읽습니다. '완료'는 더 이상 '모델이 끝났다고 말했다'는 의미를 갖지 않습니다.
만약 에이전트 OS나 에이전틱 OS 레이어를 설계하고 있다면, 중단 가능성을 초기에 내장하세요. 나중에 추가하는 것은 화염방사기식(fire-and-forget) 러너에 붙이는 것이 고통스럽습니다.
멀티플레이어 작업에는 공유 화면보다 공유 캔버스가 우수합니다
개발자들은 이미 원격 디버깅 의식을 싫어합니다. 한 사람이 공유하고, 나머지 모두가 설명합니다.
마지막 부분이 들리는 것보다 더 중요합니다. 대부분의 협업 세션은 Zoom이 끝나면 끝납니다. 보드도 사라집니다. 다음 날 당신은 기억과 반쯤 업데이트된 문서를 통해 맥락을 재구축해야 합니다.
저장된 레이아웃은 과소평가된 인프라입니다. 앱, 위치, 탭들이 아침에도 그대로 있습니다. 지루하지만 극도로 유용합니다.
'인간 + 에이전트 작업 공간'이라 부르기 위해 제가 요구하는 것
마케팅 용어는 건너뛰세요. 다음 구체적인 속성들을 요청하세요:
- 단순히 기록(transcript)만이 아니라, 보이는 에이전트 입력 (커서, 링, 타이핑)
- 당신의 창을 가리는 대신 옆에 위치하는 에이전트 창
- 작업을 재시작하지 않고 일시 중지/방향 전환/재점유(reclaim)할 수 있는 기능
- 작업을 수행한 과정과 동일하지 않은 검증 절차
- 에이전트가 실행되는 동안 당신 자신의 메모와 앱이 보이는 곳
- 모두를 하나의 포인터로 직렬화(serialize)하지 않는 다중 사용자 환경
기존 도구들로도 이 중 일부는 만들 수 있습니다. 브라우저 자동화에 화면 공유, 채팅 사이드바를 더하면 어느 정도는 가능합니다. 실패 모드는 항상 같습니다. 인간이 공간적 그림을 잃고, 에이전트는 다시 블랙박스가 됩니다.
우리는 정반대의 가정 — 즉 컴퓨터 자체가 사람, 앱, 에이전트가 눈에 보이게 머무르는 캔버스가 되어야 한다는 가정을 바탕으로 Novastart를 구축했습니다. Windows 또는 Intel Mac의 앱으로 설치하여 사용하거나, 전체 속도를 원한다면 전용 PC에서 OS로 설치할 수 있습니다.
에이전트 제품을 출시하는 사람들을 위한 마무리 조언
사용자들이 AI를 '신뢰'하는지 묻는 것을 멈추세요. 대신 그들이 그것이 무엇을 하고 있는지 보고, 멈추고, 같은 공간에서 계속 작업할 수 있는지 물으세요.
만약 당신의 에이전트가 패널 안에만 존재한다면, 당신은 영리한 비서(assistant)를 만든 것입니다. 만약 그것이 자체 손을 가지고 책상 위에 앉아 있다면, 당신은 사람들이 실제로 협업할 수 있는 소프트웨어를 만들기 시작한 것입니다.
그것이 제가 중요하게 생각하는 기준입니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기