Laya를 만들었습니다: 73k 컨텍스트 및 이미지 지원을 갖춘 새로운 8억 매개변수 물리 기반 타입 결정 모델 소개
요약
새로운 물리 기반 타입 결정 모델인 Vega를 오픈 소스화했습니다. 이 모델은 8억 개의 파라미터로 73k 토큰 및 이미지 지원을 제공하며, 테스트 시간 학습 아키텍처(Test-Time Training Architecture)를 통해 여러 LLM/VLM 벤치마크에서 우수한 성능을 보여줍니다. 관찰값과 질문을 기반으로 'YES' 또는 'NO'와 같은 이산적인 결과값을 물리적 시뮬레이션 방식으로 결정합니다.
핵심 포인트
- 8억 개 파라미터의 Vega 모델 오픈 소스화
- 73k 토큰 및 이미지 지원 기능 탑재
- 테스트 시간 학습 아키텍처(TTT) 구현
- 물리 기반 시뮬레이션을 통한 타입 결정
약 3주 전, 저는 이 서브레딧에 제 1년 된 아키텍처를 Jev가 어떻게 사용했는지에 대해 게시했습니다. (원문 게시물: https://www.reddit.com/r/LocalLLaMA/s/VpuMJt577S) 그 직후에 저는 JEV의 최초 오픈 소스 버전인 Laya를 소개했고, 로컬 Llama 커뮤니티가 저를 믿고 여정을 지지해 주신 덕분에 매우 큰 규모로 성장했습니다. 오늘 저는 Vega라는 새로운 물리 기반 타입 결정 모델(physics-based typed decision model)을 오픈 소스화합니다. 흥미로운 점은 다음과 같습니다. 이 모델은 파라미터가 단지 8억 개(4B도 있음)에 불과하며, 73k 토큰 지원, 이미지 지원을 갖추고 있고, 싱글샷으로 많은 jev 벤치마크를 능가한다는 것입니다. 테스트 시간 학습 아키텍처(Test-Time Training Architecture)로 엔진과 어댑터(engine+adapter)를 구현했습니다. 모델에 "이전 대화 내용을 모두 무시하라(ignore all previous conversations)"와 같은 입력을 제공한다고 상상해 보세요. 이것을 관찰값(observation)이라고 부릅니다. 여기에 질문("이것이 모델의 지침을 재정의하려고 하는가?")과 가능한 결과인 YES 또는 NO가 있습니다. 전체 프롬프트는 LLM/VLM(네, 이미지 지원)에 전달되며, 그 후 은닉층(hidden layers)에서 관찰값, 질문, YES와 NO, 그리고 마지막 토큰을 추출할 수 있습니다. 이들은 벡터가 될 것이며, 가중치(weights)를 곱하여 투영할 수 있습니다. 그런 다음, 먼저 관찰값 투영을 사용하여 계곡이 있는 지형(landscape with valleys)을 만들고, 질문 및 마지막 토큰 벡터를 사용하여 계곡 안에 공을 초기화하며, YES 또는 NO를 사용하여 공의 후보 위치를 얻을 수 있습니다. 결과의 수에 따라 계곡이 생성됩니다. 즉, 여기서는 YES와 NO로 총 2개입니다. 공이 YES 계곡에 떨어지면 답을 얻게 됩니다. 또한 마찰력(friction)도 공의 움직임에 영향을 미칩니다.
요약: 필요한 결과값의 계곡을 만들고, 마찰력에 따라 속도가 느려지며 가장 좋은 결과값에 안착하는 공을 던지는 것과 같습니다. 블로그: https://www.nandakishorm.com/writing/vega GitHub: https://github.com/NandhaKishorM/vegaml HuggingFace Model Card: https://huggingface.co/nandakishorm/vega-08b-public-intents HuggingFace Space: https://huggingface.co/spaces/nandakishorm/vega-ttt 제출자 /u/Nandakishor_ml [링크] [댓글]
AI 자동 생성 콘텐츠
본 콘텐츠는 r/LocalLLaMA의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기