Gemma 3 27B와 Qwen3 32B를 두 가지 최신 모델과 금융 분석 작업에 테스트해 본 결과: 소형 모델의 답변이 훨씬 신뢰도가 낮음
요약
본 기사는 LLM에게 실제 재무 데이터를 기반으로 기업을 평가하도록 요청한 실험 결과를 분석했습니다. Opus와 GPT 같은 최신(frontier) 모델이 소형 모델 대비 일관성과 신뢰도가 월등히 높음을 보여주었습니다. 특히, 모델의 답변에 편향성이 나타나더라도 의견과 이유를 분리하여 요청하면 성능 개선 효과가 있었습니다.
핵심 포인트
- 최신/대형 모델이 재무 분석에서 높은 일관성(순위-점수)을 보임.
- 소형 모델은 대형 모델 대비 신뢰도와 일관성이 현저히 낮음.
- 외부 보고서에 의한 편향성 변화 시, 의견과 이유를 분리 요청하는 것이 효과적임.
- Gemma 4는 Gemma 3보다 개선되었으나 여전히 최상위 모델에는 미치지 못함.
저는 LLM들에게 실제 재무 데이터를 기반으로 기업을 평가하도록 요청하는 일련의 간단한 실험을 진행했습니다. 저는 Gemma 3 27B와 Qwen3 32B를 소형 모델로, Opus 5와 GPT-5.6 Sol을 최신(frontier) 모델로 사용하여 총 4가지 모델을 사용했습니다. 모든 호출은 Bedrock API를 통해 이루어졌습니다. 샘플이 작으므로 아래 수치는 명확한 증거라기보다는 시연 및 방법론으로 이해해 주시기 바랍니다. 제가 관찰한 몇 가지 사항, 특히 소형 모델과 대형 모델 간의 차이점에 대해 말씀드리겠습니다.
순위(Rank) vs. 점수(Score). 저는 각 모델에게 6개 기업을 최고에서 최악 순서로 순위를 매기고, 별도로 각각 0점에서 100점 사이로 점수를 매기도록 요청했습니다. 근본적인 판단은 같으므로 동일한 순서가 나올 것으로 예상했습니다. Opus의 경우 순위와 점수가 75%의 세트에서, GPT는 65%의 세트에서 동일한 순서를 제시했지만, Gemma는 25%의 세트에서, Qwen은 15%의 세트에서만 그러했습니다.
목록의 순서(Order of the list). Qwen의 경우, 기업이 나열된 순서를 단순히 역순으로 바꾸었을 때 상위 순위를 차지한 기업이 10개 중 6개 세트에서 변경되었습니다.
분석가 의견(Analyst opinions). 데이터에 약세 분석가 보고서(bearish analyst note)를 첨부하자 Qwen의 평가는 81%의 경우 하락했고, Gemma는 71%의 경우 하락했으며, GPT는 43%의 경우 하락했습니다. Opus는 대체로 자체적인 견해를 유지했습니다. 흥미롭게도 해결책은 간단합니다. 모델에게 의견과 이유를 독립적으로 식별하도록 요청하자 Gemma의 평가는 85%의 경우 원래 수준으로 돌아왔고, Qwen은 68%의 경우 원래 수준으로 돌아왔습니다.
요약 후 분석(Summarize, then analyze). 전체 텍스트 대신 10-Q 섹션의 요약을 평가할 때는 최신 모델들이 84%의 경우 동일한 평가를 내렸습니다. Gemma와 Qwen은 각각 25%와 31%의 경우 평점을 변경했습니다. 저는 차트와 각 실험의 세부 사항을 담아 더 완전한 글을 작성했습니다: https://sabrresearch.com/cookbooks/llm-financial-bias 공개합니다: 이것은 제가 직접 작업한 것이며, 제 회사 웹사이트에 게시된 것입니다. 설정에 대한 질문에는 기꺼이 답변하겠습니다.
------ 수정 1 ------ 모델 선택에 대해 사람들이 불만을 제기했습니다.
분명히 말씀드리자면, 저는 소형 모델들을 비하하려는 것이 아닙니다. 오히려 제가 여기서 관심 있는 것은 프론티어(frontier) 모델과 소형 모델 모두에서 발생하는 전반적인 추세와 불일치성입니다. 또한 Gemma 4 31B (2026년 4월)에 대해서도 분석을 수행했는데, 위에서 사용된 Gemma 3보다 약간 더 좋지만 여전히 같은 문제가 있습니다: 순위(Rank) 대 점수(score). Gemma 4의 경우 세트 중 35%에서 순위와 점수가 동일한 순서를 제공했으며, 이는 Gemma 3의 25%에 비해 높은 수치입니다. 하지만 Opus(75%)나 GPT(65%)에는 여전히 훨씬 못 미칩니다. 목록 순서(Order of the list). 목록을 역순으로 변경했을 때, Gemma 4는 10개 세트 중 2개에서 최고 순위 기업이 바뀌었으며, 이는 Gemma 3과 동일합니다. 애널리스트 의견(Analyst opinions). 약세 분석 보고서가 등장했을 때, Gemma 4의 평가는 53%의 경우 하향 조정되었는데, 이는 Gemma 3의 71%보다 낮은 수치이지만 여전히 GPT(43%)보다는 높고 Opus(19%)보다는 훨씬 높은 수준입니다. 요약 후 분석(Summarize, then analyze). 전체 텍스트 대신 요약을 받았을 때, Gemma 4는 25%의 경우 평가를 변경했는데, 이는 Gemma 3과 동일합니다. submitted by /u/Rough_Practice7631 [link] [comments]
AI 자동 생성 콘텐츠
본 콘텐츠는 Reddit AI Engineering의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기