Launch HN: Cyberdesk (YC S25) – Windows 레거시 데스크톱 앱 자동화
요약
Cyberdesk는 Windows 레거시 데스크톱 애플리케이션의 반복적인 작업을 자동화하기 위해 설계된 결정론적 컴퓨터 사용 에이전트입니다. 기존 RPA의 취약성을 극복하기 위해 화면 상태를 실시간으로 인식하며, 이상 징후 발생 시에만 추론을 사용하여 안정적인 워크플로를 제공합니다.
핵심 포인트
- Windows 레거시 소프트웨어 내 클릭 및 키스트로크 자동화 지원
- RPA의 한계인 UI 변경 및 예상치 못한 팝업에 대한 자가 수정 능력 보유
- 결정론적(Deterministic) 실행 방식을 채택하여 운영 환경에서의 신뢰성 확보
- 자연어 지침을 통해 워크플로를 학습하고 동적인 작업 처리 가능
안녕하세요 HN, 저희는 Mahmoud와 Alan이며, Windows 데스크톱 애플리케이션을 자동화하기 위한 결정론적 컴퓨터 사용 에이전트 (deterministic computer use agent)인 Cyberdesk (https://www.cyberdesk.io/)를 만들고 있습니다. 개발자들은 데스크톱에 직접 클릭과 키스트로크 (keystrokes)를 실행함으로써 의료, 회계, 건설 등 다양한 분야의 레거시 소프트웨어 내 반복적인 작업을 자동화하기 위해 저희를 사용합니다.
다음은 Cyberdesk의 컴퓨터 사용 에이전트 데모 몇 가지입니다:
레거시 데스크톱 앱으로의 빠른 파일 가져오기 자동화:
OpenDental이라는 거대한 Windows 모놀리스 (monolith) 소프트웨어 작업 (에이전트의 학습 과정도 보여줍니다):
W-2 세금 양식 작성:
많은 산업이 레거시 Windows 데스크톱 애플리케이션에 묶여 있으며, 직원들은 엄청난 시간이 소요되는 반복적인 작업으로 고통받고 있습니다. 이러한 환경에 자동화를 제공하는 업체들은 결국 깨지기 쉬운 로봇 프로세스 자동화 (RPA, Robotic Process Automation) 스크립트를 작성하거나, 수동 작업 실행을 위해 해외 팀을 고용하게 됩니다. RPA는 불가피한 UI 변경이나 Windows 업데이트 또는 무작위 앱 내 알림과 같은 예상치 못한 팝업으로 인해 자주 중단됩니다. 해외 팀은 종종 신뢰할 수 없고 소프트웨어보다 비용이 많이 들며, 규제가 엄격한 산업에서는 항상 선택 가능한 옵션도 아닙니다.
저는 이전에 Fortune 100 기업에서 2만 명 이상의 직원에게 영향을 미치는 RPA 스크립트를 구축한 적이 있으며, 그곳에서 RPA의 취약함과 유연하지 못한 점을 직접 경험했습니다. 이것이 해결되지 않은 문제에 대한 임시방편 (bandaid solution)이라는 것이 저에게는 명백했습니다. Alan은 이전 스타트업에서 컴퓨터 사용 에이전트를 구축하고 있었고, 이것이 많은 산업에 걸쳐 수많은 수동 컴퓨터 작업을 자동화할 수 있는 엄청난 잠재력이 있다는 것을 깨달았기에, 저희는 Cyberdesk 작업을 시작했습니다.
컴퓨터 사용 모델 (Computer use models)은 추상적이고 장기적인 목표를 가진 작업 (long-horizon tasks)에는 어려움을 겪을 수 있지만, 화면 단위로 문맥을 인식하는 결정 (context-aware decisions)을 내리는 데는 탁월하므로, 이러한 데스크톱 앱을 자동화하는 데 적합합니다.
신뢰성의 핵심은 매우 구체적이고 잘 설계된 프롬프트 (prompts)를 작성하는 것입니다. ChatGPT와 마찬가지로, 모호하거나 불분명한 프롬프트는 원하는 결과를 얻을 수 없습니다. 이는 컴퓨터 사용 (computer use) 분야에서 특히 중요한데, 모델이 데스크톱 화면 전체에 가까운 방대한 시각적 정보 (visual information)를 처리하기 때문입니다. 정밀한 지침이 없다면 모델은 어떤 세부 사항에 집중해야 할지, 혹은 어떻게 행동해야 할지 알 수 없습니다.
RPA와 달리, Cyberdesk의 에이전트 (agents)는 클릭을 맹목적으로 재생하지 않습니다. 이들은 모든 동작 전에 화면 상태 (screen state)를 읽으며, 흐름이 어긋날 때(팝업, 지연 시간, UI 변경 등) 스스로 수정합니다. 기성 컴퓨터 사용 AI와 달리, Cyberdesk는 운영 환경에서 결정론적 (deterministically)으로 실행됩니다. 즉, 에이전트는 기본적으로 학습된 단계를 따르며, 이상 징후가 발생할 때만 추론 (reasoning) 단계로 전환합니다. Cyberdesk는 자연어 지침 (natural-language instructions)으로부터 워크플로 (workflows)를 학습하여 미묘한 차이를 포착하고 동적인 작업을 처리하며, 이는 단순히 몇 번의 실행을 화면 녹화하여 인코딩하는 수준을 훨씬 뛰어넘습니다.
이러한 접근 방식은 신뢰성과 비용 측면 모두에서 유리합니다. 예상치 못한 상황에서 컴퓨터 사용 모델로 전환하기 때문에 신뢰성이 높고, 컴퓨터 사용 모델은 비용이 많이 들기 때문에 꼭 필요할 때만 사용하므로 비용 효율적입니다. 그 외의 경우에는 결정론적 실행 (deterministic runs) 동안 단계별로 화면 상태를 확인하기 위해 더 빠르고 저렴한 시각적 LLM (visual LLMs)을 활용합니다. 또한 우리의 에이전트는 동적이고 민감한 상황을 처리할 수 있도록 페일세이프 (failsafes), 데이터 추출 (data extraction), 화면 평가 (screen evaluation)와 같은 도구들을 갖추고 있습니다.
작동 방식: 모든 Windows 머신에 당사의 오픈 소스 드라이버(https://github.com/cyberdesk-hq/cyberdriver)를 설치하면 됩니다. 이 드라이버는 당사의 백엔드(backend)와 통신하여 명령(클릭 (click), 타이핑 (type), 스크롤 (scroll), 스크린샷 (screenshot))을 수신하고 데이터(스크린샷 (screenshots), API 응답 (API responses) 등)를 다시 보냅니다. 사용자는 특정 작업에 대한 프로세스를 마치 신입 사원이 새로운 업무를 배울 때 사용하는 표준 운영 절차 (SOP)처럼, 컴퓨터 사용 에이전트 (computer use agent)에게 상세한 자연어 설명 (natural language description)으로 제공합니다. 그러면 에이전트는 컴퓨터 사용 AI 모델 (computer use AI models)을 활용하여 단계를 학습하고, 각 스크린샷을 해당 동작(이 좌표를 클릭, XYZ 입력, 페이지 로드 대기 등)과 함께 저장함으로써 이를 기억합니다.
에이전트는 빠르고 예측 가능하게 실행하기 위해 이러한 단계들을 결정론적 (deterministically)으로 수행합니다. 팝업 (popups) 및 UI 변경 사항을 고려하기 위해, 당사의 에이전트는 기억된 상태 (memorized state)와 현재의 실시간 화면 상태 (live screen state)를 대조하여 기억된 단계를 진행해도 안전한지 판단합니다. 기억된 단계의 안전한 실행을 방해하는 주요 변경 사항이 없다면 진행하며, 그렇지 않은 경우 이전 동작과 남은 작업에 대한 컨텍스트 (context)를 가진 컴퓨터 사용 모델 (computer use model)로 폴백 (fallback)합니다.
현재 고객들은 레거시 데스크톱 애플리케이션 (legacy desktop applications)에서 파일을 가져오거나 내보내는 작업, 데스크톱 PMS에서 환자 예약하기, EMR에서 환자 프로필과 같은 양식을 채우기 위한 데이터 입력 (data entry) 등 수동 작업에 당사를 활용하고 있습니다.
아직 셀프 서비스 (self-serve) 옵션은 제공되지 않지만, 수동으로 온보딩 (onboard)을 도와드리고 싶습니다. 더 자세히 알아보려면 여기서 데모를 예약하세요! (https://www.cyberdesk.io/)
나중에 출시될 셀프 서비스 옵션을 기다리고 싶으시다면, 준비되는 즉시 알림을 받으실 수 있도록 여기에 이메일을 제출해 주세요 (https://forms.gle/HfQLxMXKcv9Eh8Gs8).
당사의 문서 (docs)는 여기에서 확인하실 수 있습니다: https://docs.cyberdesk.io/.
당사의 접근 방식과 레거시 산업을 위한 데스크톱 자동화 (desktop automation)에 대한 여러분의 의견을 꼭 듣고 싶습니다!
AI 자동 생성 콘텐츠
본 콘텐츠는 HN Claude Code Search의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기