DeepSeek V4.1 Flash를 연구 서브 에이전트 및 타이틀 모델로 Haiku 5.5와 비교 평가한 결과
요약
본 기사는 Haiku 5.5와 DeepSeek V4.1 Flash를 연구 서브 에이전트 및 채팅 제목 생성 작업에 대해 비교 평가한 결과를 담고 있습니다. 비용 효율성 면에서 Haiku가 우세했으나, 특정 전문 지식(HEX/Pantone 색상 등)을 요구하는 작업에서는 DeepSeek이 더 정확하고 신뢰할 만한 성능을 보여주었습니다.
핵심 포인트
- DeepSeek은 전문적인 색상 코드 식별 등 높은 정확도가 필요한 작업에서 강점을 보였습니다.
- Haiku는 비용 효율적이지만, 맥락 파악이나 세부 정보 추출에 한계가 있었습니다.
- 연구 서브 에이전트의 경우, 모델 선택 시 성능과 비용을 종합적으로 고려해야 합니다.
제 앱에서 두 가지 작은 작업에 대해 Haiku 5.5가 DeepSeek V4.1 Flash를 대체할 수 있는지 확인해 보았습니다. 그렇지 못했습니다. 소규모 평가는이지만 누군가에게는 유용할 수도 있습니다. 저는 GPU 사양이 좋지 않습니다 (M2 Max, 32GB). 그래서 DeepSeek은 OpenRouter를 통해 최소한 8-bit 정밀도로 실행되었고 처리량(throughput) 순으로 정렬되었습니다. 대부분의 실행은 Baidu에서 이루어졌고, 하나는 Parasail에서 이루어졌습니다.
작업 1: 연구 서브 에이전트 (research sub-agent)
이 작업은 브리프를 받고 웹을 검색하고 페이지를 읽은 다음 출처와 함께 보고서를 작성합니다. 두 모델 모두 동일한 도구를 사용했습니다: 검색용 Exa 및 Brave, 페이지 가져오기(page fetcher), 그리고 이미지 검색 및 이미지 분석 기능입니다. 저는 4개의 실제 브리프(브랜드 비주얼, 포럼의 소비자 인용구, 회사 배경 정보, 특정 카테고리의 광고 예시)를 사용했습니다. Haiku는 낮은(low), 중간(medium), 높은(high) 노력 수준으로 실행되었습니다. DeepSeek (현재 상업적 주력 모델)은 낮은 노력 수준으로 실행되었습니다.
| Haiku 노력 | W/T/L | vs DeepSeek 시간 비용 |
|---|---|---|
| low | 1/0/3 | 480s $0.09 |
| medium | 1/1/2 | 555s $0.12 |
| high | 0/1/3 | 992s $0.31 |
| DeepSeek low | - | 721s $0.35 |
Haiku가 더 빠르고 4배 저렴했지만, 매번 동일한 두 브리프에서 실패했습니다. 한 경우에 DeepSeek은 브랜드 자체의 가이드라인 페이지를 정확한 HEX 및 Pantone 색상과 함께 찾아냈습니다. Haiku는 아무리 높은 노력 수준으로도 이 페이지를 찾지 못했으며, 60개의 도구 호출을 사용했음에도 마찬가지였습니다. 대신 스크린샷에서 색상을 추측했습니다. 더 높은 노력을 주자 검색은 더 많이 했지만, 여전히 더 많은 것을 찾아내지는 못했습니다. Haiku가 성공한 브리프는 포럼의 실제 인용구를 찾는 것이었습니다. 이 경우 Haiku는 페이지를 열지 않고 Exa가 반환하는 발췌문만 사용했습니다. 비용 효율적인 승리였지만, 발췌문만으로는 누가 작성했는지 또는 어떤 맥락이었는지 알 수 없습니다.
작업 2: 채팅 제목 (chat titles)
52개의 메시지에 대해 두 모델 모두 추론을 수행했습니다. DeepSeek이 28개를, Haiku가 8개를 가져갔고, 나머지 9개는 분할되었으며 7개는 동일했습니다. 속도는 같았고(1.1초), Haiku가 약간 더 저렴했습니다. 문제는 Haiku가 제목을 지정하기보다는 메시지에 답하는 경우가 많다는 것입니다. 특정 주제에 대해 질문하면 그 답변의 첫 줄이 제목이 됩니다. 그리고 하나의 프롬프트 주입 테스트 메시지가 제목이 되기도 했습니다.
판단 기준: Opus가 A/B 순서로 블라인드하게 판단했습니다. 동점은 두 순서가 의견을 달리한다는 의미입니다. 네, Claude는 Claude를 평가했고 (동일한 연구소 편향), 여전히 DeepSeek을 선택했습니다.
설정당 한 번의 실행이므로, 이를 대규모 실험실 벤치마크로 간주하지 마십시오. 단지 제가 제 작업들을 위해 에이전트를 테스트하는 방식일 뿐입니다. $1을 잘 쓰거나 (아니면?) /u/dergachoff가 제출했습니다 [링크] [댓글들]
AI 자동 생성 콘텐츠
본 콘텐츠는 Reddit AI Engineering의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기