Sapient Intelligence, HRM-Text 1B 출시: 40B 토큰, 약 $1,000의 사전 학습 비용으로 MATH 및
요약
Sapient Intelligence가 계층적 추론(HRM) 기술을 적용한 1B 파라미터 규모의 HRM-Text 1B 모델을 출시했습니다. 이 모델은 매우 적은 데이터량(40B 토큰)과 약 $1,000의 저렴한 비용으로 학습되었음에도 불구하고, MATH 및 DROP 벤치마크에서 기존 모델들을 상회하는 뛰어난 성능을 보여주었습니다.
핵심 포인트
- 16개의 GPU를 사용하여 1.9일 동안 처음부터 학습 완료
- 기존 모델 대비 약 1/1000 수준의 데이터(40B 토큰)만 사용
- MATH(56.2) 및 DROP(82.2) 벤치마크에서 Llama3.2 3B 및 GPT-3.5보다 높은 성능 기록
- MMLU 및 ARC-C 성능은 기존 소형 모델들과 대등하거나 다소 낮은 수준
Sapient Intelligence (HRM/계층적 추론(hierarchical reasoning) 연구팀)가 오늘 HRM-Text 1B를 출시했습니다. 마케팅에 회의적이더라도 벤치마크 차트가 살펴볼 가치가 있을 만큼 흥미롭기에 게시합니다.
학습 수치:
- 1B 파라미터(params), 16개의 GPU에서 1.9일 동안 처음부터(from scratch) 학습
- 40B 고유 토큰(unique tokens) (이들은 유사 모델 대비 약 1/1000 수준의 데이터라고 주장하며, 차트상으로는 Gemma3 4B / Llama3.2 3B / Qwen3.5 2B / Olmo3 7B보다 100배~900배 적은 양을 보여줍니다)
- 보고된 예산 약 $1,000
실제로 우세한 부분 (그들의 차트 기준):
- MATH: 56.2 vs Llama3.2 3B 48.0, Olmo3 7B 40.0, GPT-3.5 34.1
- DROP: 82.2 vs Olmo3 7B 71.5, Llama3.2 3B 45.2, GPT-3.5 64.1
비슷하거나 뒤처지는 부분:
- ARC-C: 81.9 — 기본적으로 Olmo3 7B (81.6) 및 Qwen3.5 2B (81.2)와 대등함
- MMLU: 60.7 — Qwen3.5 2B (64.7) 및 Olmo3 7B (65.8)에 뒤처짐
따라서 패턴은
AI 자동 생성 콘텐츠
본 콘텐츠는 Reddit AI Engineering의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기