DeepSeek V4.1 Flash, 이제 Enclave의 최고 해킹 모델
요약
DeepSeek V4.1 Flash가 이전 버전 대비 성능과 속도가 향상되었으며, 특히 에이전트 코딩 환경에서 높은 효율성을 보여주었습니다. 이 모델은 Gemini 3.7 Flash와 경쟁할 만한 위치에 있으며, Kimi K3나 Opus 5 같은 최고급 모델 대비 압도적인 비용 효율성을 제공합니다. 따라서 고비용의 복잡한 작업을 수행하는 데 매우 경제적입니다.
핵심 포인트
- DeepSeek V4.1 Flash는 성능과 속도가 향상되어 경쟁력이 높음.
- 에이전트 코딩 환경에서 높은 효율성과 안정성을 입증함.
- 최고급 모델 대비 압도적인 비용 절감 효과를 제공하여 경제성이 뛰어남.
- 복잡한 작업 수행 시, DeepSeek가 다른 최상위 모델들보다 우수한 성능을 보임.
v4.1 Flash를 자체 평가한 결과 V4 Flash보다 똑똑하고 빨라졌으며, 가격도 그에 맞게 올랐음. 추론을 많이 하는 모델이라 실제 비용은 표시된 가격만큼 저렴하지 않으며, 성능·비용의 파레토 최적선에서 Gemini 3.7 Flash 근처에 위치함. 에이전트 코딩에서는 더 낮은 비용으로 상위 오픈 웨이트 모델인 GLM 5.3, Kimi K3에 예상보다 가까운 성능을 냄.
중국 모델은 에이전트 실행 환경에서 반복적으로 시도할 때 늘 강했고, 이 모델도 단발성 풀이보다 실행 환경을 제공했을 때 평균 백분위 순위가 약 20% 높아짐. 다만 모델이 똑똑하다고 느끼게 하는 것은 한 번에 풀어내는 유동 지능이며, 이것이 높으면 보통 시도 횟수와 토큰도 줄어듦. 이 부분에서는 미국 최상위 모델들이 여전히 크게 앞서 있음.
새 아키텍처와 기존 Flash·Pro 사이의 가격대도 흥미로움. 추론량 때문에 그다지 빠르지 않았던 초저가 Flash와, 크기·비용에 비해 Flash보다 일관되게 낫지 못했던 Pro를 정리하고 Gemini Flash 계열과 경쟁할 중간급 모델에 집중하려는 것일 수도 있음. 평가 데이터는 https://gertlabs.com/rankings에서 확인 가능함.
DeepSeek는 벤치마크 성능과 가격이 훌륭하고 팀도 널리 인정받는 듯하지만, 정작 써보면 그다지 좋지 않았음. GLM은 적어도 5.2부터 훨씬 성과가 좋았음. 내가 잘못 쓰는 것일 수도 있지만, DS는 반복에 갇히거나 엉뚱한 소리를 하는 반면 GLM은 저렴한 Claude처럼 느껴짐.
내 경험은 정반대임. V4 Flash도 꽤 좋았지만 V4.1은 최첨단 수준에 매우 가까움. 몇 주 동안 Gemini 3.8, Kimi K3, Opus 5와 비교 평가했는데 DeepSeek가 확실히 이겼음.
우리는 고객에게 토큰 단위로 과금함. Kimi가 같은 품질에서 Opus 5 가격의 약 30%였다면, DeepSeek는 Kimi K3 가격의 10분의 1 수준임. 가격 차이가 너무 커서 다른 모델들이 가격을 내리기 전에는 추천하기 어려움.
초기 Opus 시절부터 에이전트 78개를 병렬로 돌려 Rust, 설계, GEPA, 평가, 분석 등의 작업을 맡겨왔음. 이 용도로는 오랫동안 Kimi K3가 최고였고 그전에는 GPT 5.5였는데, DeepSeek가 너무 잘해서 일부러 허점을 찾으려 해도 맡긴 작업을 모두 끝냄. 작업당 비용은 보통 1530센트, 1달러 미만임.
같은 작업이 Kimi에서는 3~15달러, 때로는 100달러 가까이 들었고, GPT 5.5로 며칠씩 모델을 평가할 때는 800달러짜리 작업도 드물지 않았음. 이제는 1달러도 안 듦. 다른 업체들이 몇 주 안에 가격을 대폭 내리지 않으면 쓸 이유가 없으며, 월 200달러 구독보다 DeepSeek 토큰 종량제가 더 경제적임. 사용하는 실행 도구는 https://omp.sh/임.
DeepSeek의 API를 직접 쓰고 있는지? 그렇지 않으면 성능이 크게 떨어질 수 있음. OpenRouter라면 제공자를 DeepSeek로 고정해야 하며, OpenCode Go는 어느 제공자를 쓰는지 알기 어려움.
여러 요인에 따라 달라짐. 내가 알기로 Claude Code의 TUI 실행 환경은 DeepSeek와 잘 맞지 않지만, Opencode에서는 놀랄 만큼 잘 작동함.
oh-my-pi에서는 GLM 5.3 Flash보다 DS 4.1 Flash가 훨씬 잘 작동했음. GLM은 도구 호출을 시도하기 전에 계속 같은 추론을 맴도는 듯함.
이 결과, 혹은 제목이 조금 의외임. 구조를 잘 파악하고 있고 주석도 완전히 달아둔 Nintendo 3DS 커널 디컴파일 코드에서 GLM 5.3과 DSv4.1-F에 취약점과 버그를 찾도록 시켰음. 둘 다 Max 모드와 하위 에이전트를 사용함. GLM 5.3은 30분·22달러로 거의 모든 취약점을 찾았지만, DS는 40분·2달러로 하나만 찾았음. DS는 쉽게 빠르게 찾을 수 있는 취약점이 많은 대상에서 더 잘 작동하는 것일까?
어떤 GLM 5.3을 쓰는지도 영향을 줌. OpenRouter에서 성능이 좋다가 형편없어지기도 했는데, 연결된 제공자 중 일부는 fp8, 일부는 fp4를 사용하고 있었음. fp4는 복잡한 작업만 주면 오작동했으며, 차이가 너무 커서 이제 허용 목록에 fp8 제공자만 넣음.
다른 분야에서도 같은 결과를 얻었으며, GLM 5.1·5.2·5.3이 DS v4.1보다 훨씬 나음. 다만 DS는 빠르고 저렴하면서도 알아서 작업하게 둘 정도의 지능은 갖춰서 그런 용도로 이상적임. 글에서 빠진 부분이 하나 더 있는데, 작업에 맞는 맞춤형 도구를 제공하면 DS는 아주 좋아지지만 단독으로는 평범함.
그 예시라면 DS 작업을 더 병렬화할 수 있지 않을까? 같은 가격에 에이전트를 11배나 돌릴 수 있음.
공개된 취약점이라면 이미 학습 데이터에 들어 있을 테니 평가 의미가 약함. 미공개 취약점이라면 추론 제공자와 중간 업체의 학습 데이터에 넘겨버린 셈이므로, 앞으로의 벤치마크가 무의미해짐.
조금 다른 질문인데, 이런 역공학 작업에 GLM이나 DS를 쓰려면 어디서 이용해야 하는지? 공식 플랫폼에서는 이런 작업을 거부하는 모델이 많다고 읽은 것 같음.
다른 모델과의 비교가 전혀 없는데 DeepSeek를 최고의 해킹 모델이라고 부르는 것은 꽤 대담해 보임.
‘우리의’라는 한정에 주목해야 함. 자신들이 접근할 수 있는 모델 중 최고라는 뜻임.
증류 모델을 별도 범주로 나누면 어떨까?
DeepSeek가 내 소스 코드를 ‘해킹’하게 하려면 어떻게 해야 하는지? 코드 디렉터리에서 코딩 에이전트를 실행하고 취약점을 찾아달라고 하면 되는지, 아니면 더 전문적인 소프트웨어가 있는지?
최근 VRAM 192GB에서 구동하는 데 성공했으며, Klaudia 실행 환경과 함께 쓰니 예전에는 Opus와 Fable을 써야 했던 작업을 놀라울 만큼 잘 처리함.
DeepSeek는 저평가되어 있음. 이제 중국 모델은 사실상 모두 일상적인 코딩에 충분함. 이런 상황에서 Anthropic 하나에만 걸린 2조 달러의 투자 수익을 실현할 수 있을지 회의적임.
일상적인 코딩만으로 가치 있는 무언가를 만들 수 있을지 의문임. 미래 경제에서 경쟁하려면 기술의 최전선에서 경쟁해야 하며, 쉽게 얻을 수 있는 성과에는 가치가 없어질 것임. 오픈 웨이트 모델로 당신의 SaaS를 훨씬 적은 비용에 재현할 수 있다면 그 SaaS에는 가치가 없음.
무엇과 비교해서 최고라는 것인지? enclave.ai는 GPT Cyber나 Glasswing을 이용할 수 있는지?
결과는 흥미롭지만 글의 완성도는 매우 낮음.
댓글을 보고 수정한 것인지? 이제는 채택된 실행 비용이 4.65달러, 실패한 시도와 대체 실행까지 포함한 총비용이 5.14달러라고 적혀 있음.
AI 자동 생성 콘텐츠
본 콘텐츠는 GeekNews의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기