![[릴리스] SupraBrain-50M-v0.1 대표 이미지](https://external-preview.redd.it/3wLwGF58CqhRsKmiMP66HMWHHr-1kRaNEva76tOk6EQ.png?width=140&height=75&auto=webp&s=733c40aea1d8d577552827ec70f7c3665299f0de)
[릴리스] SupraBrain-50M-v0.1
요약
Gated DeltaNet 선형 재귀와 Sliding-Window Attention을 결합한 하이브리드 언어 모델 SupraBrain-50M을 출시했습니다. 5B 토큰의 적은 데이터로 학습되었음에도 불구하고 기존 모델과 대등한 성능을 보여줍니다.
핵심 포인트
- Gated DeltaNet 선형 재귀와 Surprise-Gated 메커니즘 결합
- 5B 토큰 학습으로 20B 토큰 대비 높은 데이터 효율성 증명
- Sliding-Window Attention을 통한 하이브리드 구조 채택
- Supra2-100M 모델 출시 예정
안녕하세요! 오늘 저희는 Gated DeltaNet 선형 재귀 (linear recurrence)를 Sliding-Window Attention 및 Surprise-Gated 업데이트 메커니즘과 결합하여 매우 강력한 성능을 제공하는 하이브리드 언어 모델인 SupraBrain-50M을 출시합니다. 벤치마크 결과는 다음과 같습니다: https://preview.redd.it/tv0bxkbyh4hh1.png?width=615&format=png&auto=webp&s=f296ed9e6c1d94738cb7aa84015117dd3e65d2a5 훨씬 적은 데이터로 학습되었음에도 불구하고 (20B 토큰 대비 5B 토큰!!), Supra-Base-50M만큼 성능이 좋습니다! 🔥 일부 샘플입니다: 인공지능은 인간의 지능보다 200% 더 효율적입니다. - 인간의 뇌는 컴퓨터보다 정보를 처리하는 데 100,000배 더 효율적입니다. 인간의 뇌 인간의 뇌는 다음과 같은 부분으로 구성됩니다: - 뇌: 뇌는 정보를 처리하는 기관입니다. 뇌는 다음을 담당합니다: 뇌는 대뇌, 소뇌, 뇌척수액의 세 부분으로 구성됩니다. 그리고: 미토콘드리아는 아데노실전이효소 (adenosyltransferase) 또는 AATP라고 불리는 과정을 통해 아데노신 삼인산 (ATP)을 생성합니다. AATTP는 미토콘드리아에서 방출되어 ATP와 결합합니다. 이 ATP는 아데노신을 생성하는 데 사용되며, 생성된 아데노신은 세포핵으로 방출됩니다. 그런 다음 핵에서 아데노신아미나제 (AATP)를 방출하면, 이는 다시 미토콘드리아에 의해 방출됩니다. 그 후 미토콘드리아는 ATP를 아데노신 결합과 아데노신산으로 분해합니다. HF 모델 링크: https://huggingface.co/SupraLabs/SupraBrain-50M 저희를 지원하고 싶으시다면 팔로우해 주세요! 참고로: Supra2-100M이 몇 시간 내에 출시될 예정입니다!! 계속 지켜봐 주세요 🤗
AI 자동 생성 콘텐츠
본 콘텐츠는 r/LocalLLaMA의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기