
LLM의 개념 지도는 인간의 언어 영역과 닮아 있을까
요약
LLM의 Feature Map 시각화 결과와 인간의 뇌 활동(일본어 처리 영역) 사이의 구조적 유사성에 대한 고찰을 다룹니다. Feature 수의 증가가 지능 향상으로 이어지는지, 혹은 Feature 간의 관계성이 핵심인지에 대한 의문을 제기합니다.
핵심 포인트
- LLM의 Feature Map에서 특정 언어(일본어) 클러스터가 분산되어 나타나는 현상 관찰
- 인간의 뇌가 언어를 처리할 때 나타나는 비전형적 활성화 패턴과의 구조적 유사성 언급
- 지능의 본질이 Feature의 양적 팽창인지, Feature 간의 관계성인지에 대한 질문
최근 Transformer Circuits의 「Towards Monosemanticity」를 살펴보고 있었습니다.
페이지 마지막에는 16384개의 Feature를 2차원으로 시각화한 인터랙티브한 지도가 있습니다.
Feature 이름을 검색하면 해당 개념과 관련된 특징이 지도상에 표시됩니다.
무심코 **"Japanese"**라고 입력한 순간, 저는 저도 모르게 화면을 다시 보게 되었습니다.
일본어 관련 Feature는 한곳에 모여 있는 것이 아니었습니다.
중앙의 커다란 클러스터(Cluster)에도 존재하지만, 그 바깥쪽에도 독립적인 클러스터가 존재하며, 심지어 떨어진 곳에도 일본어 관련 Feature가 나타나고 있었습니다.
저는 이 구조를 본 순간, 예전에 보았던 인간의 일본어 처리와 관련된 뇌 활동 연구가 떠올랐습니다.
뇌과학에서는 일본어, 특히 한자 처리 시 고전적인 언어 영역(브로카 영역·베르니케 영역)뿐만 아니라, 그 주변이나 떨어진 영역도 강하게 활동한다는 것이 보고되어 있습니다.
저는 이전에 보았던 fMRI 이미지에서, 일본어 처리가 고전적인 언어 영역뿐만 아니라 떨어진 영역에서도 강하게 활성화되었던 것을 떠올렸습니다.
한편, Transformer Circuits의 Feature Map에서도 일본어 관련 Feature는 주요 클러스터뿐만 아니라, 떨어진 곳에도 독립적인 덩어리를 형성하고 있습니다.
물론, 이 두 가지는 전혀 다른 것입니다.
- 인간의 뇌는 실제 뇌 활동을 해부학적 위치로서 관측한 것
- LLM은 16384개의 Feature로 이루어진 특징 공간을 2차원으로 투영(Projection)한 것
즉, 위치를 직접 비교할 수는 없습니다.
그럼에도 저는,
"일본어만이 주 클러스터와는 조금 떨어진 곳에도 덩어리를 가진다"
라는 구조에서 강한 기시감을 느꼈습니다.
이것은 단순한 우연일까요.
현시점에서는,
일치한다는 증거는 없습니다.
제가 느낀 것은,
"일치한다"가 아니라,
"닮아 있는 것처럼 보인다"
라는 인상입니다.
또한, LLM의 지도는 차원 축소(Dimension Reduction)를 통해 시각화된 결과이며, 표시 방법이 바뀌면 보이는 모습도 변할 가능성이 있습니다.
따라서 이 유사성만을 근거로 인간과 LLM이 동일한 구조를 가진다고 결론 내릴 수는 없습니다.
하지만 향후 인간의 일본어 처리 네트워크와 LLM의 Feature Cluster를 비교하는 연구가 이루어진다면, 공통점 혹은 본질적인 차이가 보일지도 모릅니다.
현재의 AI 연구는 더 많은 Feature를 다루는 방향으로 나아가고 있습니다.
4096
↓
8192
...
목적은 더 세밀한 개념을 발견하고 모델 내부의 표현을 이해하는 것입니다.
하지만 여기서 한 가지 의문이 생깁니다.
제가 흥미를 느끼고 있는 것은 벤치마크 점수가 아닙니다.
개념 지도 그 자체입니다.
예를 들어 32768 Feature가 되었을 때, 일본어 클러스터는 어떻게 변화할까요.
Feature를 늘릴수록,
- 새로운 개념이 발견된다
- 일본어 클러스터도 더욱 세밀하게 나뉜다
- 추론 능력도 향상된다
이 경우, 현재의 AI 연구 방향은 옳은 것이 됩니다.
반면,
32768 Feature에서도,
65536 Feature에서도,
개념 지도가 거의 변하지 않는다면 어떨까요.
일본어의 격지(Enclave)도,
영어 클러스터도,
거의 같은 구조 그대로라고 가정해 봅시다.
그 경우,
지능은
Feature 수가 아니라,
Feature들 사이의 관계성에 의해 결정될 가능성이 있습니다.
저는 **"인간이 16384 Feature로 표현할 수 있다"**라고 말하고 싶은 것이 아닙니다.
인간의 개념 공간이 몇 차원인지는 현재의 뇌과학에서도 알지 못합니다.
하지만 만약 인간에게도 개념을 국소적으로 정리하는 메커니즘이 있다면, LLM과의 비교를 통해 지능 그 자체에 대한 새로운 관점을 얻을 수 있을지도 모릅니다.
이 글에는 결론이 없습니다.
하지만 이 지도를 본 이후로, 저는 하나의 의문을 갖게 되었습니다.
AI는 Feature를 계속 늘려나감으로써 정말로 지능을 획득할 수 있을까요.
만약 16384 Feature 시점에서 개념 구조가 거의 완성되어 있다면, AI의 미래는 "더 많은 Feature를 늘리는 것"이 아니라, "Feature들을 어떻게 결합할 것인가"에 있을지도 모릅니다.
저는 앞으로,
32768 Feature,
65536 Feature의 개념 지도 (Concept Map)가 어떻게 변화하는지에 주목하고 있습니다.
이 글은,
"인간의 뇌와 LLM은 동일한 구조이다"
라고 주장하는 것이 아닙니다.
제가 전달하고 싶었던 것은,
Transformer Circuits의 개념 지도 (Concept Map)를 보았을 때,
인간의 일본어 처리 네트워크를 떠올릴 정도로 유사한 구조로 보였다
라는 하나의 관찰입니다.
만약 향후 더 대규모의 Feature Map이나 인간의 뇌 활동과의 비교 연구가 진행된다면, 이 인상이 우연이었는지, 아니면 지능에 공통되는 어떤 구조를 나타내고 있는 것인지가 보일지도 모릅니다.
집필 협력: ChatGPT
자료 검색: Gemini
AI 자동 생성 콘텐츠
본 콘텐츠는 Qiita AI의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기