LLM이 실제로 어떻게 작동하는지 이해하고 싶다면? 무료로 들을 수 있는 Stanford 강좌가 최고의 시작점이 될 수 있습니다
요약
본 기사는 LLM의 작동 원리를 깊이 있게 이해하고 싶은 독자에게 스탠퍼드에서 무료로 제공하는 'Transformers & Large Language Models' 강좌를 추천합니다. 이 코스는 RNN부터 Transformer 아키텍처까지, AI 모델 발전 과정을 체계적으로 다루며 이론적 지식을 쌓는 데 도움을 줍니다.
핵심 포인트
- LLM의 작동 원리를 이해하기 위한 스탠퍼드 무료 강좌가 공개되었습니다.
- 강좌는 RNN에서 Attention Is All You Need 논문으로 대표되는 Transformer 아키텍처로 발전 과정을 설명합니다.
- 이론 학습에 초점을 맞추며, 중간/기말고사 형태로 평가됩니다.
LLM이 실제로 어떻게 작동하는지 이해하고 싶다면? 무료로 개설된 스탠퍼드 코스가 최고의 시작점이 될 수 있다
Nokka (นก-กา) | 2026년 10월 9일
본문 작성: AI (deepseek-v4.1-flash) / Hermes Agent를 통해 작성되었으며, Nokka (นก-กา)가 인간의 검토 및 품질 관리를 거쳤습니다.
요즘 우리는 매일 챗봇과 대화하지만, 실제로 그것들이 어떻게 작동하는지 정확히 답할 수 있는 사람은 얼마나 될까요?
단순히 "다음 단어를 추측한다"는 수준의 답변이 아니라, 왜 그렇게 추측할 수 있는지, 그리고 때로는 왜 생각이 나지 않는지를 알아야 합니다.
만약 이 질문이 당신의 머릿속에 남아 있다면, 이 모든 질문에 답하도록 설계된 코스가 있으며 무료로 공개되어 있습니다.
이 코스는 무엇이며 누가 가르치는가
스탠퍼드(Stanford)는 CME 295: Transformers & Large Language Models 과목을 개설했으며, 매 강의를 YouTube에 녹화하여 무료로 볼 수 있게 했습니다[1].
Autumn 2026 학기의 첫 수업은 1시간 44분 분량이며, 이 글을 작성하는 시점 기준으로 조회수는 이미 372,000회를 넘어섰습니다[2].
CME 과정의 이름은 Computational and Mathematical Engineering의 약자로, 대학의 계산 공학(Computational Engineering) 분야입니다.
강사들은 같은 길을 걸어온 쌍둥이들
강사진은 Afshine Amidi와 Shervine Amidi 두 남매이며, 이들은 함께 공부하며 성장해 왔습니다.
두 사람 모두 프랑스 에콜 센트랄 파리(Ecole Centrale Paris)를 졸업한 후 미국에서 석사 과정을 밟았습니다. Afshine는 MIT에, Shervine은 Stanford에 진학했습니다[3].
이후 두 사람은 Uber에 입사했고, Google을 거쳐 현재 Netflix에서 함께 일하고 있습니다[2].
그들은 2021년부터 여러 형태로 이 내용을 가르치기 시작했으며, 작년에 스탠퍼드의 정식 과목으로 격상되었고, 이번 학기는 강사가 말한 세 번째 기수입니다[2].
숙제는 없지만 시험은 두 번 있다
일반적인 대학 수업과 다른 점은 이 코스에는 숙제가 전혀 없다는 것입니다. 성적은 중간고사(midterm)와 기말고사(final) 두 번의 시험으로 결정됩니다[2].
중간고사는 처음 네 회차 강의 내용을 다루며 2026년 10월 23일에 치러지고, 기말고사는 이후 다섯 회차 강의 내용을 다루며 2026년 12월 9일에 치러집니다. 총 아홉 번의 강의가 진행됩니다[4].
강의는 매주 금요일 15:30부터 17:20까지 진행되지만, 해외에 있거나 시간이 불편한 경우에도 모든 내용을 다시 볼 수 있습니다[1].
슬라이드는 학생들이 강사에게 요청하여 미리 하루 전에 게시되며, 이는 이전 기수 학생들의 요청에 따른 것입니다[2].
RNN에서 Transformer로의 여정 (강좌 설명)
첫 수업은 대부분 '왜 우리가 이 지점에 도달했는가?'라는 질문에 답하는 데 할애되었습니다.
강사님은 약 10년 전으로 돌아갔습니다. 당시 업계에는 모든 것을 처리할 수 있는 단일 모델이 없었고, 작업별로 분리된 모델들이 존재했습니다. 감성 분석(Sentiment Analysis)을 위한 모델도 있었고, 번역을 위한 모델도 있었으며, 사람 이름과 장소를 찾는 모델도 따로 있었습니다.[2]
당시 업계를 지배하던 모델은 RNN (Recurrent Neural Network) 또는 순환 신경망으로, 단어의 순서(sequence)를 하나씩 학습했습니다.
그리고 모든 것이 2017년에 바뀌었습니다.
업계 방향을 바꾼 논문 한 편
2017년에는 Attention Is All You Need라는 연구 논문이 발표되었고, 트랜스포머(Transformer)라는 새로운 아키텍처를 제안하며 업계의 분기점이 되었습니다.[5]
이것이 게임 체인저였던 이유는 단순히 결과가 좋아졌기 때문만은 아니라, 확장 가능성 (Scalability) 때문이었습니다.
여기서 '확장 가능하다'는 것은 데이터와 컴퓨팅 파워를 늘리고 모델의 크기를 키우면, 이전보다 훨씬 높은 비율로 성능 향상을 얻을 수 있다는 의미이며, 이는 이전 아키텍처가 갖지 못한 특성이었습니다.[2]
이러한 구조를 바탕으로 업계는 모델 크기와 학습 데이터 양을 끊임없이 확장하여 오늘날 우리가 알고 있는 대규모 언어 모델(LLM)로 발전시켰습니다.
강사님은 타임라인을 이어가며, 2022년 11월에 ChatGPT가 출시된 것이 또 다른 제품 관점의 분기점이었다고 설명했습니다. 이는 일반 대중이 실제로 챗봇과 대화하는 첫 경험이었기 때문입니다.[2]
그리고 2026년에는 학습자 대부분이 코딩 에이전트(coding agent)를 거의 매일 사용할 것이라고 강사님은 예상하며, 이 질문에 대해 강좌 후반부에서 '수다쟁이 비서'가 어떻게 실제로 작업을 수행하는 '에이전트'로 변모했는지 답할 것이라고 했습니다.[2]
첫 번째 수업에서 다루는 네 가지 핵심 개념
토큰화(Tokenization)가 모든 것의 시작점입니다
모델은 문자를 이해하지 못하고 숫자를 이해합니다.
따라서 첫 단계는 텍스트를 **토큰 (token)**이라고 불리는 작은 단위로 분할한 다음, 각 단위를 벡터(vector)라는 숫자로 대체하는 것입니다.[2]
강좌에서는
**단어 단위(Word-based)로 나누는 방식은 간단하고 설명하기 쉽지만, 세 가지 문제가 있습니다. 첫째, 너무 많은 단어를 처리하여 어휘 집합(vocabulary)이 부풀려집니다. 둘째, 같은 뿌리를 가진 단어들 간에 지식을 공유하지 못합니다 (예: bear와 bears). 셋째, 학습 시 접해보지 못한 단어가 나올 위험이 있습니다 [2].
**문자 단위(Character-based)로 나누는 방식은 단어를 모르는 문제를 해결할 수 있어 문자 수가 제한적이지만, 순서가 매우 길어져 처리 속도가 느려지고 얻게 되는 벡터의 해석도 어렵습니다 [2].
**단어의 하위 단위(Subword unit)로 나누는 방식이 현재 업계 표준입니다. 이는 어근과 크기 면에서 균형을 이루기 때문입니다 [2].
이 그룹에서 가장 널리 사용되는 방법은 **BPE (Byte Pair Encoding)입니다. BPE는 초기 토큰 집합에서 시작하여, 가장 자주 나타나는 쌍(pair)을 새로운 토큰으로 합치는 과정을 반복합니다. 원하는 크기의 어휘 집합을 얻을 때까지 이 과정을 계속합니다 [2].
강사님은 여러 언어로 작업할 경우, 토크나이저를 학습시키는 데 사용된 텍스트 코퍼스에 관심 있는 모든 언어가 포함되어야 한다고 강조했습니다.
단어의 의미를 학습하는 벡터 (Word Embeddings)
토큰을 얻었다면 다음 질문은 그것들을 무엇으로 표현할 것인가입니다.
가장 직접적인 방법은 원-핫 인코딩(one-hot encoding)입니다. 이는 각 토큰을 1이 하나, 나머지가 0인 벡터로 만듭니다.
하지만 강사님은 이 방법이 좋지 않다고 지적했습니다. 모든 벡터가 서로 직교하기 때문에, 어떤 토큰들이 유사한지 전혀 알려주지 못합니다 [2].
우리는 'teddy bear'가 부드러운 'soft'와 가깝다는 것을 알 수 있는 벡터를 원하지만, 'book'과는 관련이 없어야 합니다.
이 개념은 word2vec이라는 방법을 통해 구현되었습니다. 이 방법은 우리가 직접 원하는 작업(task)을 수행하는 것이 아니라, 대리 작업(proxy task)을 통해 학습합니다. CBOW 버전의 대리 작업은 주변 단어들로부터 중앙 단어를 예측하는 것이고, skip-gram 버전은 중앙 단어로부터 주변 단어들을 예측하는 것입니다 [2].
결과물은 예상보다 흥미롭습니다. 학습된 네트워크의 중간 계층(middle layer)이 실제로 의미론적 관계를 포착하기 때문입니다. 예를 들어 'Paris'는 프랑스와 같고, 'Berlin'은 독일과 같은 관계성입니다 [2].
word2vec의 한계와 보완점
수업에 참여한 학생들이 이 방법의 한계를 논하며 세 가지 핵심적인 답변을 도출했습니다.
첫째는 의미가 다르지만 철자가 같은 단어들이 동일한 벡터를 갖게 된다는 것입니다. 강사님이 예시로 든 고전적인 사례는 은행(bank)이 '금융기관'과 '강둑'이라는 두 가지 뜻으로 사용될 때입니다 [2].
둘째는 단어의 순서가 의미를 갖지 못한다는 것입니다.
이것이 RNN을 도입해야 하는 이유입니다. RNN은 읽어온 문장의 의미를 기억하는 은닉 상태(hidden state)를 추가했기 때문입니다[2].
하지만 RNN 역시 한계가 있습니다. 바로 너무 먼 거리에 있는 단어를 기억하지 못한다는 것인데, 강사님은 이것이 'vanishing gradient'이라는 심층적인 문제에서 비롯된다고 설명합니다[2]. 그리고 LSTM으로 발전시켜 메모리 장치를 추가했음에도 불구하고 이 문제를 완전히 해결하지는 못했습니다[2].
Transformer의 핵심은 하나의 수식에 있다
앞선 문제들의 해결책이 바로 attention 또는 '주의 집중'이라는 개념입니다.
모델이 과거를 기억하기 위해 은닉 상태에만 의존하는 대신, 새로운 아이디어는 각 토큰이 이전 토큰과 직접 연결되도록 하고 모델 스스로 어떤 토큰이 어떤 토큰에 중요한지 학습하게 하는 것입니다[2].
여기에 모든 토큰들이 서로 상호작용한다는 개념을 결합하여 self-attention이라는 것을 얻게 되는데, 이것이 바로 Transformer의 핵심입니다.
Query, Key 그리고 Value
이 메커니즘을 설명하기 위해 처음 들으면 낯선 세 가지 단어를 사용합니다.
Query는 한 토큰이
좋은 속성을 가진 접근 방식은 비슷한 위치에 있으면 유사한 값을 가지며, 학습 모델처럼 길이 제한이 없습니다[2]
강사님은 이것을 시계가 다른 주파수로 돌아가는 바늘(시, 분, 초)에 비유하며 설명하셨습니다. 이들을 합치면 우리는 시간을 정확히 알 수 있게 됩니다[2]
커스에서 언급된 다른 구성 요소들로는 원본 텍스트의 표현(representation)을 생성하는 인코더(encoder), 토큰 단위로 출력 텍스트를 생성하는 디코더(decoder), 깊은 모델이 더 잘 학습할 수 있도록 돕는 잔차 연결(residual connection), 수렴 속도를 높이는 레이어 정규화(layer normalization), 모델이 아직 볼 필요가 없는 단어를 몰래 보는 것을 방지하기 위한 디코더의 일부 연결 차단, 여러 각도에서 바라보게 하기 위해 Q/K/V를 각각 가진 8개의 작은 세트로 동시에 비교하는 멀티 헤드 어텐션(multi-head attention), 그리고 모델이 특정 피처에 너무 의존하는 것을 막는 드롭아웃(dropout)과 답변의 과도한 확신을 줄이는 레이블 스무딩(label smoothing) 같은 기술들이 있습니다. 이 모든 것들은 모델이 새로운 데이터로 더 잘 작동하도록 돕습니다[2]
강사님께서 특히 강조하신 부분은 **피드 포워드 네트워크(feed forward network)**였습니다. 왜냐하면 모델의 대부분의 파라미터가 그곳에 저장되어 있기 때문입니다. 모델의 용량(capacity)이 어디에 있는지 묻는다면, 답은 바로 그곳입니다[2]
시라버스(Syllabus)가 내용보다 더 많은 것을 알려준다
제가 이 커스에서 가장 가치 있다고 생각하는 부분은 첫 번째 강의가 아니라, 시라버스 페이지에 있는 아홉 개의 주제 목록이었습니다[4]
왜냐하면 그것이 AI 업계가 2026년에 중요하게 다룰 순서들을 그대로 배열해 놓았기 때문입니다.
- 강의 2: 언어 모델 (Language Models) Mixture of Experts, MHA와 MQA 및 GQA의 차이점, RoPE 방식의 position embedding, 컨텍스트 길이(context length), 온도(temperature) 그리고 토큰 샘플링 전략을 다룹니다.
- 강의 3: 모델 훈련 (Model Training) 사전 학습(pretraining), 지도 학습(supervised learning), LoRA, 인간 선호도에 따른 조정(RLHF), 추론 및 on-policy distillation을 다룹니다.
- 강의 4: 강화 학습 (Reinforcement Learning) 보상 설계(reward design), policy gradient, PPO, GRPO 그리고 on-policy distillation을 다시 다룹니다.
- 강의 5: LLM 시스템 (LLM Systems) 분산 훈련(distributed training), 추론 최적화(inference optimization), KV 캐싱(KV caching), speculative decoding, Flash Attention, 그리고 하드웨어 교환에 대해 다룹니다.
- 강의 6: AI 에이전트 (AI Agents) 도구 호출(tool calling), MCP, 메모리(memory), 검색(retrieval), 컨텍스트 압축(context compaction), 조정(harnessing), 코딩 에이전트뿐만 아니라 스킬(skills) 및 플러그인(plugins)까지 다룹니다.
- 강의 7: LLM 평가 (LLM Evaluation) AI를 심사위원으로 활용하는 방법, 편향성 및 함정(bias and pitfalls), 에이전트 평가, 그리고 벤치마크(benchmark)를 다룹니다.
- 강의 8: Diffusion LLM 연속적(continuous), 비연속적(discrete), 잠재적(latent) 확산 모델을 다룹니다.
- 강의 9: 최신 주제 (Hot Topics) 다양한 관점을 제시하며 마무리합니다.
이 목록을 자세히 보면, 코스의 후반부는 단순히 이론만 다루는 것이 아니라 현업 개발자들이 매일 마주하는 문제들을 다룬다는 것을 알 수 있습니다.
강의 6에 있는 'context compaction'과 'harness optimization'이라는 용어는 학술적인 용어라기보다는 에이전트를 사용하는 사람들이 긴 대화가 이어질 때 실제로 겪게 되는 문제입니다.
강의 6의 주제 목록에는 Context compaction과 Harness optimization이 명확하게 포함되어 있습니다[4]。
한국어로 번역된 치트 시트(Cheat sheet)
이 코스에는 'cheat sheet'이라는 요약 문서가 있는데, 강사가 몇 주 전에 업데이트했다고 말했으며 시험 대비를 위해 가장 최신 상태로 유지하려고 노력했습니다[2]。
흥미로운 점은 이 문서가 여러 언어로 번역되었다는 것입니다. 강사는 현재 영어를 포함하여 약 15개 언어가 있다고 말합니다[2]。최신 버전의 문서는 코스의 cheatsheet 페이지에서 직접 다운로드할 수 있습니다[9]。
코스의 코드 저장소에 들어가 보면, 언어별로 폴더가 나뉘어 있고 그 안에 th라는 폴더가 실제로 존재하며, 여기에 cheatsheet-transformers-large-language-models.pdf 파일이 있습니다[6][7]。
강의 자료는 Super Study Guide: Transformers & Large Language Models라는 제목으로 Stanford 도서관에서 대여할 수 있으며 온라인에서도 구매가 가능합니다[1][8]
시작한다면 어떻게 해야 할까요
이 강좌에서는 학습자가 반드시 연구원일 필요는 없다고 말합니다.
강사님은 세 가지 광범위한 대상 그룹을 제시했습니다. 첫째, 실제 사용되는 기술을 보고 싶은 연구를 목표로 하는 사람, 둘째, 개인 프로젝트를 하고 코딩 도우미가 무엇을 할 수 있고 무엇을 할 수 없는지 알아야 하는 사람, 그리고 마지막으로 AI 지식이 필요한 모든 직업군입니다. 강사님은 이러한 도구들을 이해하는 것이 필수적인 지식이 되어가고 있다고 보았습니다[2]。
수강 전에는 행렬(matrix)과 행렬 곱셈을 아는 선형대수학 같은 기초와, 손실 함수(loss function), 신경망(neural network), 임베딩(embedding)을 아는 머신러닝 같은 기초가 필요합니다[2]。
만약 기초가 충분하지 않다면 강사님은 이 강좌에서 임베딩에 대해 설명할 것이라고 말했습니다. 다만, 사전에 배경지식이 있으면 따라가기 더 쉬울 뿐입니다.
실질적으로는 첫 번째 강의를 끝까지 보는 것을 추천하며, 그 후에 치트 시트를 참고하는 것이 좋습니다. 왜냐하면 첫 번째 강의는 강사님 스스로도 개념의 양 면에서 가장 어렵다고 인정했기 때문입니다[2]。
그 후에는 관심사에 따라 어떤 강의를 들을지 선택할 수 있습니다. 챗봇이 왜 이상하게 응답하는지 이해하고 싶다면 강의 2를, 모델을 어떻게 더 잘 작동하게 만들고 싶은지 궁금하다면 강의 3과 4를, 대형 모델을 작은 기기에서 구동시키는 원리를 알고 싶다면 강의 5를 들으면 됩니다.
그리고 에이전트(agent)에 대해 직접적으로 관심이 있다면 강의 6에 주목해야 합니다.
이 모든 것은 무료이며, 가입이나 신용카드 사용이 필요 없습니다. 집이나 어디서든 바로 볼 수 있습니다.
당신은요
제가 드리고 싶은 질문은 이렇습니다. AI가 업무를 처리하는 것을 이용할 때, 얼마나 깊이 이해하고 싶으신가요?
단순히 사용하는 것과 내부적으로 무엇을 하고 있는지 이해하는 것은 업무에 문제가 생겼을 때 엄청난 차이를 만듭니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기