내 목소리로 제작한 블로그의 새로운 기능
요약
본 글은 ChatGPT 데스크톱 앱의 Codex 음성 모드를 활용하여 로컬 개발 환경에 연결하고, 요리하는 등 멀티태스킹 상황에서도 코딩 작업을 진행한 경험을 공유합니다. GPT-6 Astra와 같은 모델이 음성 대화만으로 Django 기능 구현, 데이터베이스 통합, GitHub PR 생성까지 놀라운 수준의 결과물을 만들어냈습니다.
핵심 포인트
- Codex 음성 모드를 활용하여 로컬 개발 환경에 연결 가능
- GPT-6 Astra 등 최신 모델은 음성 피드백 기반 코딩 작업 수행
- 음성 대화로 초기 구현 후, PR 검토 및 타이핑으로 디테일 수정 완료
- 멀티태스킹 상황에서 AI를 통한 개발 효율성을 입증
내 목소리로 제작한 블로그의 새로운 기능
2026년 10월 9일
Codex 음성 모드
저는 이 작업을 위해 ChatGPT 데스크톱 앱을 사용했고, Codex 탭에서 음성 대화 모드를 사용하여 로컬 개발 환경에 연결했습니다. 실제 모습은 다음과 같습니다:
제가 다음 명령어를 입력하며 세션을 시작했습니다:
Start dev server and open in browser
이것은 사이트가 작업할 미리보기를 제공했으며, 나중에 이 기능을 통해 새로운 페이지를 보여달라고 요청하여 진행 상황을 시각적으로 추적할 수 있게 해주었습니다.
그런 다음 ‘새 음성 채팅 시작(Start new voice chat)’ 버튼을 클릭했습니다. (마이크 버튼이 아닙니다. 그 오른쪽의 버튼입니다.) 그리고 주방에 노트북을 세팅하여 요리하는 동안 대화할 수 있도록 했습니다.
컴퓨터와 대화하기
저는 무엇을 만들고 싶은지 꽤 명확하게 알고 있었고, 이는 Django 기능 중 비교적 간단한 것이어서 모델(이 경우 GPT-6 Astra High)이 처리할 수 있을 것이라고 확신했습니다. 새로운 모델, 마이그레이션, 일부 뷰 코드, 템플릿, 그리고 외부 소스에서 데이터베이스를 채우기 위한 몇 가지 임포트 함수가 필요했습니다.
Codex가 기록한 제 음성 녹취록의 발췌본은 다음과 같습니다:
분명히 모델이 제가 무엇을 만들고 싶은지 알았다는 것이 분명해 보입니다! 전체 녹취록과 말더듬까지는 이 Gist에서 읽어볼 수 있습니다.
저희는 약 30분 동안(저녁 식사를 요리하는 데 걸린 시간) 이런 식으로 진행했습니다. 모델은 답변하고 때때로 명확히 하는 질문을 하다가 코드를 수정하는 작업을 시작했습니다.
우리가 만든 것
오직 음성만으로 놀라울 정도로 많은 것을 만들었습니다:
-
네 개의 작동하는 임포트 기능:
- RSS를 통한 가장 최근 Substack 항목들
- 그들의 비공개 API를 통한 격주 Substack 항목들. GPT-6 Astra는 이를 알고 있었거나 검색을 통해 찾아냈습니다.
-
사이트 검색 엔진과의 통합
거의 출시할 준비가 되었습니다. 문제는 가져오기(imports)였습니다. Astra는 로컬 사본에서 데이터를 내보내서 제가 프로덕션에 가져올 수 있도록 제안했지만, 저는 다른 가져오기 스크립트처럼 작동하기를 원했습니다. 일부 데이터가 비공개 GitHub 저장소에 있었기 때문에, 이는 새로운 API 키를 생성하는 것을 포함할 것이었고, 이를 위해서는 제가 한동안 키보드 앞에 앉아 있어야 한다는 것을 알았습니다.
검토를 통한 완성
요리를 마치고 대부분의 기능이 갖춰졌다고 판단한 후, 저는 Codex에게 브랜치를 만들고 풀 리퀘스트(pull request)를 열도록 했습니다.
저는 GitHub PR 인터페이스에서 코드를 검토했습니다. 제가 필요로 하는 것에 거의 근접했지만, 가져오기 스크립트 중 하나에 대해 서브프로세스(subprocess)에서 Git을 사용하기로 선택한 것이 문제였습니다. 저는 가져오기 중 하나가 비공개 Git 저장소에서 데이터를 가져와야 했기 때문에, API가 더 나은 선택이라고 생각했습니다. 저는 타이핑으로 전환하여 Codex에게 이를 API 기반 가져오기로 교체하도록 했습니다.
검토 과정에서 제가 수정한 변경 사항들은 PR의 추가 커밋(commits)에서 볼 수 있습니다. 저는 가져오기 메커니즘을 수정하고 공개 페이지 표시 방식에 몇 가지 조정을 했습니다. PR을 병합하여 프로덕션에 배포할 준비가 될 때까지 타이핑 기반 프롬프팅(prompting)으로 추가 반 시간이 걸렸습니다.
최종 결과물
GPT-6 Astra가 페이지를 디자인했고, 그 후 저는 주방에서 로컬 미리보기를 보면서 내린 음성 피드백을 바탕으로 해당 디자인을 수정했습니다.
일상적인 작업용보다는 멀티태스킹에 더 적합함
OpenAI는 DevDay 같은 자리에서 이와 같은 음성 기반 데모를 사용하는 것을 매우 좋아하며, 실제로 그런 환경에서는 잘 작동합니다. 하지만 이것이 저의 일상적인 작업용(daily driver)이 될 것이라고는 생각하지 않습니다.
저는 전에 개를 산책시키면서 휴대폰으로 ChatGPT 음성 모드를 사용해서 얼마나 많은 '작업'을 하는지에 대해 글을 쓴 적이 있습니다. 주로 연구와 브레인스토밍이었지만, 가끔은 ChatGPT가 코드 조각(snippets)을 작성하고 테스트하게 함으로써 실제 개발 작업도 했습니다.
이전과는 느낌이 달라요. 시각적 미리보기 기능에 더해, 목소리로 전달하기 어려운 내용을 키보드로 입력하거나 붙여넣을 수 있게 되면서 코딩 에이전트와 상호작용하는 방식이 훨씬 강력해졌어요.
하지만 세부 사항까지 들어가면 저는 여전히 타이핑으로 돌아가게 돼요. 예시나 오류 메시지를 붙여 넣거나, 변경해야 할 코드나 기능을 직접 하이라이트 하는 것이 말로 설명하려는 것보다 더 효율적이에요.
저는 주로 재택근무를 하는데, 이건 좋은 점이에요. 공유된 작업 공간에서 이렇게 컴퓨터와 대화하고 싶지 않거든요!
저에게 가장 혁신적인 기능은 멀티태스킹이 가능하다는 거예요. 보통 팟캐스트나 TikTok을 틀어놓고 요리를 하곤 했는데, 이제는 실제로 무언가를 만들 수 있게 됐어요.
AI 자동 생성 콘텐츠
본 콘텐츠는 Simon Willison Blog의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기