LFM2.5 2.6b 대 MiniCPM5 2b 비교
요약
LFM2.5 2.6b와 MiniCPM5 2b 두 소형 모델을 에이전트 작업에 비교 분석했습니다. LFM2.5가 파라미터 수 대비 성능, 속도, RAM 사용량 면에서 우위를 보였으며, 특히 영어 대화 환경에 더 적합한 것으로 평가되었습니다.
핵심 포인트
- LFM2.5 2.6b는 MiniCPM5보다 빠르고 메모리 효율적입니다.
- 두 모델 모두 웹 검색 기반의 에이전트 작업 수행 능력이 뛰어납니다.
- MiniCPM5는 영어 프롬프팅에도 중국어로 응답하는 경향을 보였습니다.
- LFM2.5는 대화가 길어지면 환각(hallucination) 문제가 발생할 수 있습니다.
저는 이 두 모델을 몇 가지 작은 에이전트 작업(예: "오늘 날씨는 어때?" 등)에 사용해 보았습니다. 둘 다 크기가 작은 모델임에도 불구하고 웹 검색을 사용하여 답변을 찾는 데 상당히 능숙합니다.
요약:
LFM2.5 2.6b가 명확한 승자입니다. 파라미터 수는 더 많음에도 불구하고 MiniCPM보다 빠르고 RAM 사용량이 적습니다. 또한 영어 대화에 더 잘 맞춰진 것 같습니다.
MiniCPM5
M1 air에서: pp 162 t/s - tg 16 t/s
32k 컨텍스트(draft 모델 사용 시)에서 약 3.8gb의 RAM을 사용합니다.
영어로 프롬프팅했음에도 불구하고 종종 중국어로 응답합니다.
영어로 응답할 때는 매우 똑똑하며 에이전트 작업에 더 강력할 수 있습니다.
파라미터 수가 적다고 알려져 있음에도 LFM2.5보다 더 많은 메모리를 사용합니다.
상응하는 dspark 모델도 사용할 수 있습니다.
llama-server --model MiniCPM5-2B-Q8_0.gguf -md MiniCPM5-2B-DSpark-Q8_0.gguf --load-mode none --spec-type draft-dspark --spec-draft-n-max 2 -ngl all -ngld all -fa on -np 1 -t 4 -c 32000 --reasoning on -fit off --temp 1.0 --top-p 0.95 --cache-type-k q5_1 --cache-type-v q5_1 --spec-draft-type-k q8_0 --spec-draft-type-v q8_0
LFM2.5
M1 air에서: pp 200 t/s - tg 22 t/s
32k 컨텍스트에서 약 2.5gb의 RAM을 사용합니다.
단순한 원샷(one shot) 에이전트 작업에는 잘 작동하지만, 대화가 길어지면서 빠르게 환각(hallucinating)을 일으키는 경향이 있습니다.
llama-server -m LFM2.5-2.6B-QAD-Q4_0.gguf -ngl all -fa on --load-mode none --temp 0.1 --top-k 50 --top-p 0.9 -c 32000 --threads 4 --reasoning on -fit off --reasoning-preserve
submitted by /u/parepeg
[link] [comments]
AI 자동 생성 콘텐츠
본 콘텐츠는 Reddit AI Engineering의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기