
【Day 20】 로컬 AI vs 클라우드 AI. 고양이 사진 한 장을 10종류의 동영상 AI로 움직여 보았다
요약
로컬 환경과 클라우드 환경에서 10종류의 동영상 생성 AI를 비교 테스트한 결과입니다. 생성 시간, 비용, 지시 이행 능력 측면에서 로컬과 클라우드의 장단점을 분석했습니다.
핵심 포인트
- 클라우드 AI가 로컬 대비 생성 속도와 복잡한 지시 이행 능력에서 우세함
- 로컬 환경은 전기세 외 추가 비용이 없어 경제적 측면에서 유리함
- LTX-2.3 모델의 경우 구동 환경에 따라 생성 속도가 최대 7.6배 차이 남
- 고해상도 작업 시 로컬 환경의 메모리 한계(Ceiling) 고려 필요
【Day 20】 로컬 AI vs 클라우드 AI. 고양이 사진 한 장을 10종류의 동영상 AI로 움직여 보았다
서론
【Day 20】입니다!
사진을 한 장 건네면 몇 초의 동영상으로 만들어 주는 AI를 10종류 준비했습니다. 절반은 로컬 (Local), 절반은 클라우드입니다 🐱
사용한 것: DGX Spark (LTX-2.3 / Wan 2.2) / fal.ai를 경유한 클라우드 AI 8종류 / ComfyUI / ffmpeg
진행 내용
| 항목 | 내용 |
|---|---|
| 입력 | 같은 사진 1장 (우리 집 고양이가 책상에 앉아 있는 사진) |
| 길이 | 6초 |
| 설정 | 모두 동일 |
| 변경 사항 | 주제만 변경 |
간단한 주제
이 사진 속 고양이가 카메라를 보고 한 번 울기. 입을 벌려 울고, 다시 다물기. 꼬리가 가볍게 흔들리고, 귀가 쫑긋 움직이기
어려운 주제
이 사진 속 고양이가 주방에서 뒷발로 서서, 작은 앞치마를 두르고, 앞발로 식칼을 들고, 도마 위에서 채소를 썰기. 뒤쪽 냄비에서는 김이 모락모락 나기
결과는... 꼭 영상을 확인해 주세요!
다리가 긴 고양이가 나오는 등 여러 가지 일이 있었지만,, 음..
전반부가 '간단한 주제', 후반부가 '어려운 주제'입니다.
간단한 주제는 로컬과 클라우드 모두 꽤 좋은 승부를 펼쳤습니다. 어려운 주제는... 클라우드인 것 같네요...!
이하, 3가지 관점에서 랭킹을 매겨보겠습니다.
랭킹 ① 시간
어려운 주제로, 한 편을 만드는 데 걸린 시간입니다.
| 순위 | AI | 환경 | 시간 |
|---|---|---|---|
| 🥇 | LTX-2.3 | 클라우드 | 41초 |
| ... | 315초 | ||
| 8 | Wan 2.2 | 로컬 | 651초 |
| 9 | daVinci-MagiHuman | 클라우드 | 710초 |
| 10 | HunyuanVideo 1.5 | 클라우드 | 796초 |
19배의 차이.
주목할 점은 1위와 7위입니다. 같은 LTX-2.3이며 해상도도 거의 같습니다. 다른 점은 구동하는 장소뿐인데, 7.6배의 차이가 났습니다.
로컬 측 설정
DGX Spark (GB10, 유니파이드 메모리 128GB, 대역폭 약 273GB/s). ComfyUI를 헤드리스 (Headless)로 구동하며, API를 통해 워크플로우를 던지고 있습니다.
LTX-2.3은 distilled fp8 · 8스텝. 1088×1920 해상도에서 피크 메모리 77.8GB (128GB의 약 6할). **이곳이 한계치(Ceiling)**였습니다. 해상도를 512×768로 낮추면 70초 만에 끝나지만, 화소 수는 클라우드의 5분의 1이 됩니다.
Wan 2.2는 I2V-A14B fp8 · 20스텝 · 480×640. 해상도를 높이면 현실적인 시간 내에 끝나지 않습니다.
랭킹 ② 비용
| 순위 | AI | 6초당 비용 |
|---|---|---|
| 🥇 | 로컬 | 전기세만 발생 |
| 🥈 | LTX-2.3 (클라우드) | $0.36 |
| 🥉 | Wan 2.7 | $0.90 |
| 4 | Kling 3 Pro | $1.01 |
| ... |
11배의 차이.
로컬의 전기세는 측정하지 않았습니다. 수치는 밝히지 않겠습니다.
랭킹 ③ 지시 이행 여부
"앞치마를 두르고 이족 보행하며, 식칼로 채소를 썬다"를 어디까지 수행했는가.
◎ 전부 수행 (5종류 · 모두 클라우드)
Wan 2.7 / Happy Horse 1.1 / Veo 3.1 / Kling 3 Pro / Seedance 2.0
앞치마를 입고, 뒷발로 서서, 앞발로 식칼을 쥐고 채소를 썰고 있습니다. Veo와 Happy Horse는 냄비의 김까지 표현했습니다.
△ 중간까지 수행 (3종류)
| AI | 환경 | 결과 |
|---|---|---|
| LTX-2.3 | 로컬 | 주방은 되었음. 서 있기도 함. 다만 고양이가 2마리로 늘어남 |
| LTX-2.3 | 클라우드 | 주방은 되었으나, 서지 않음 |
| daVinci-MagiHuman | 클라우드 | 세로 사진을 주었는데 가로형 동영상이 나옴 |
✕ 아무 일도 일어나지 않음 (2종류)
| AI | 환경 | 결과 |
|---|---|---|
| Wan 2.2 | 로컬 | 11분을 기다렸으나, 책상 위에 앉아 있는 상태 그대로 |
| HunyuanVideo 1.5 | 클라우드 | 13분을 들였으나, 마찬가지로 책상 위 |
오늘의 발견: 로컬 vs 클라우드
간단한 주제로는 차이가 없습니다. 사진을 몇 초간 움직이는 정도라면, 성능은 이미 충분합니다.
어려운 과제를 주면 차이가 나타납니다. 다만 "로컬이라서 안 된다"는 뜻은 아닙니다.
- 로컬의 3개 중,
1개는 주방까지 도달 - 클라우드의 8개 중,
1개는 13분을 들여 아무것도 하지 않음
적재적소네요.
| 이런 경우 | 어느 쪽이 적합한가 |
|---|---|
| 간단한 움직임을 많이 만든다 | 로컬 (개수에 상관없이 전기세만 발생) |
| 어려운 지시를 확실히 통과시킨다 | 클라우드 (선택할 수 있는 폭이 다름) |
| 남에게 보여줄 수 없는 것을 다룬다 | 로컬 (외부로 유출되지 않음) |
| 높은 해상도를 원한다 | 클라우드 (로컬은 1088×1920이 한계) |
보너스: 막혔던 부분
해상도를 선택하게 해주지 않는 AI가 있었다
HunyuanVideo 1.5 에 720p를 지정했더니 에러가 발생했습니다. 사양상 480p로 고정되어 있으며, 다른 값은 받아들이지 않습니다.
10종류나 나열하다 보니 "조건을 맞출 수 없는" 경우가 발생합니다. 맞추지 못한 상태로 실측하여 표에 주석을 달았습니다.
영상의 일본어가 '토푸(깨진 글자)'가 되었다
ffmpeg의 drawtext로 일본어를 입혔더니, 일부가 □로 표시되었습니다. "로컬", "초"는 나오는데 "표준"만 깨지는 식의 오류였습니다.
글자는 Pillow를 사용하여 이미지로 그린 뒤 겹치는 방식으로 변경하여 해결했습니다. 일본어라면 이 방식이 확실합니다.
다음 회차
【Day 21】은 제1막(Day 1~21)의 회고입니다.
읽어주셔서 감사합니다🐾
Discussion

AI 자동 생성 콘텐츠
본 콘텐츠는 Zenn AI의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기