코딩 테스트: Strata에서 성능 검증
요약
본 글은 LLM의 코딩 테스트 성능을 Strata와 llama.cpp를 사용하여 심층적으로 검증한 내용을 다룹니다. 다양한 샘플링 매개변수 설정과 12시간에 걸친 자동화된 코딩 세션을 통해 모델이 생성한 추론 과정과 코드의 일관성을 분석했습니다. 주요 발견으로는, 모델이 자신이 실제로 수행한 작업(예: 보고서 작성)을 혼란스러워하거나, 도구 출력 읽기 과정에서 환각 현상을 보이는 사례가 보고되었습니다.
핵심 포인트
- Strata와 llama.cpp를 활용하여 LLM의 코딩 성능을 심층 검증함.
- 다양한 샘플링 매개변수(temperature, top_p 등) 설정에 따른 모델 동작 분석.
- 모델이 자신이 수행한 작업이나 도구 출력을 혼동하는 환각 현상 발견.
이 게시물은 다소 인기가 없을 수도 있지만, 사실에 기반한 내용이니 바로 시작하겠습니다. 혹시 제 이전 'Tested in Coding' 시리즈를 알고 계신가요? https://www.reddit.com/r/LocalLLaMA/comments/1vvsokm/tested_in_coding_q8_k_xl_qwen38_27b_vs_bf16/와 https://www.reddit.com/r/LocalLLaMA/comments/1vldngi/tested_in_coding_bf16_muse_glimmer_vs_bf16_qwen36/를 참고해 주세요.
명확히 하자면, 저는 높은 토큰 생성 속도를 쫓고 있는 것은 아닙니다. 저는 llama.cpp를 사용하여 Qwen3.8-Flash-Next-UD-IQ3_XXS 모델을 Q8_0 KV-cache로 실행하며 평균 30~40t/s의 생성 속도를 얻습니다. 프리필(Prefill)은 530t/s로 느린 편이지만 (이 서브레딧에서 읽은 바에 따르면 정상인 것 같습니다). VRAM 제한 때문에 Flash Next는 llama.cpp에서 220,000 컨텍스트로 실행됩니다.
우선 저는 새로운 것을 시도하기 전에 연구와 독서를 합니다. 여기에는 Strata의 샘플링 매개변수를 올바르게 설정하지 않았을 때 발생할 수 있는 우려 사항들을 이해하는 것이 포함됩니다. 이번 리뷰를 위해 저는 온도(temperature)가 0.7부터 1.0까지인 다양한 샘플링 설정, top_p, 심지어 presence_penalty와 frequency_penalty도 Strata에서 테스트했습니다.
업데이트 참고: 완전성을 기하기 위해, Strata는 Qwen3.8-Flash-Next-UD-IQ4_XS 모델을 호스팅했습니다. 추론(Reasoning)은 llama.cpp와 Strata 모두에서 xhigh로 설정되었습니다.
둘째, 제가 만든 커스텀 하네스는 자동화되어 있습니다 (24시간 코딩 비정지). 그리고 튜닝되었으며 (압축이 60초 이내에 완료됨), 근무 시간이 아닐 때는 감독을 받습니다. 저는 Flash Next가 수행한 모든 추론 흔적과 코드를 읽어봅니다.
주요 사건: 12시간의 코딩 세션 후, 제가 발견한 내용은 다음과 같습니다:
주요 사건 1 배포에 대한 실행 보고서를 작성한 직후, 모델이 자신이 실제로 그 보고서를 만들었는지 혼란스러워했습니다:
후처리 메시지들을 되돌아보며: 테이블/상세 정보를 생성하고 읽은 후, post npm 테스트를 실행했고, 분류기(먼저 검토 필요, 격리된 e2e는 녹색, 그리고 post2는 깨끗함)를 실행했으며, fitness도 모두 녹색이었습니다… 제가 실제로 이 모든 post/classifier/fitness 작업을 후처리 후에 수행했는지 확신할 수 없습니다? # 주요 사건 2 도구 출력 읽기 환각: “아까 glob 출력은 실제로는 XXXXXXXX...였는데, 읽기 도구가 파일이 없다고 보고했습니다... 두 번째 동일한 glob도 같은 경로를 반환했습니다. 그런데 첫 번째 읽기 시도는 ...XXXXXXXXXXXX에 실패했나요?? 잠깐, 제가 요청했던 Read는 XXXXXXX\ 경로였습니다 — '파일을 찾을 수 없음'이라고 했습니다. 하지만 glob은 저걸 반환합니다. 제가 오타를 냈을까요? 제가 보낸 것은 XXXXXXXXX...? 제가 보낸 것은 \20260\이 아니라 \202605\였어요!! 맞아요 — '5'를 빠뜨렸네요. 올바른 디렉터리로 다시 시도하겠습니다. 경로를 읽다가 숫자를 빠뜨렸습니다. 올바르게 재시도: 파일이 존재하지 않습니다 — glob 도구가 조작되거나 손상된 경로(harness 토큰 제한 아티팩트, 이전의 '160 토큰' 라인과 동일한 손상 클래스)를 반환하고 있습니다. 실제 파일 이름은 접두사가 다를 가능성이 높습니다. 디렉터리 목록에서 찾아보세요.” # 주요 사건 3 파일을 코딩하는 반복적인 실패: “지금 바로 명세를 작성하세요. 간결하게 유지하세요. [코드를 작성함] 마지막 쓰기는 잘못되었습니다 — 삭제하고 명세를 깨끗하게 다시 작성합니다: [다시 코드를 작성함] 또 그랬어요 — 이번에는 더 심각해요: 존재하지 않는 디렉터리 XXXXXXXX에 의미 없는 손상된 파일을 쓰고, 게다가 아무것도 삭제하지도 않았습니다. 이 명세 파일에 대한 제 생성 과정에 뭔가 심각하게 잘못된 것이 있습니다.” 요약 이러한 주요 사건들 외에도 여러 문제들이 있었기 때문에, 저는 신뢰성 문제로 인해 Strata 사용을 중단했습니다. 이것은 엔터프라이즈급 앱의 개발 환경에는 적합하지 않습니다. 제대로 구성되고 호스팅되는 AI 모델들은 환각을 일으키거나 이런 방식으로 오류를 범하지 않음을 확신합니다.
이 글까지 읽으셨다면, 저는 Strata에 대한 저의 생각을 공유하고 싶습니다: A. Strata는 특히 성능 측면에서 로컬 모델의 연구 및 개발을 진전시키고 있다는 점에서 가치가 있습니다. 토큰 생성량 증가는 (저에게는) 크지 않았지만, 프리필(prefill) 속도는 크게 증가했습니다. Strata는 100% 가치 있는 시도이며, 앞으로 더 발전하는 모습을 기대합니다. B. 분명히 속도의 증가는 샘플링에 영향을 미쳤거나, 아니면 다른 무언가(버그일 수도 있습니다) 때문에 오류나 환각을 유발하고 있습니다. 신뢰성(reliance)과 속도 사이의 적절한 균형이 맞춰졌는지 확신할 수 없지만, Strata가 발전함에 따라 이 부분이 개선되기를 바랍니다. C. 견고하고 철저한 자동 에이전트 테스트 및 (독립적인) 검토 프로세스는 Strata로 인해 발생하는 대부분의 (추가적인) 코딩 오류를 최소화할 수 있는 것으로 보입니다. 주요 추론(reasoning) 문제는 Strata 사용 시 명확하게 나타나지만, 이것이 실제 코딩 오류로 이어지는 측면에서는 완화될 수 있습니다. 완전한 자동 테스트 및 QA 프로세스 없이 Strata를 사용하는 것은 권장하지 않습니다. 제출자: /u/PathfinderTactician [링크] [댓글]
AI 자동 생성 콘텐츠
본 콘텐츠는 Reddit AI Engineering의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기