1. 📌 LLM이란 무엇인가
✔ 정의
**LLM(Large Language Model)**은
👉 대량의 텍스트 데이터를 학습하여, 주어진 문맥(context)을 기반으로 다음 토큰을 예측하는 확률 모델이다.
✔ 핵심 개념
LLM의 본질은 단 하나:
👉 Next Token Prediction (다음 토큰 예측)
문장 생성, 번역, 요약, 코드 작성
👉 전부 결국 이 원리의 확장이다.
✔ 수식으로 표현
LLM은 다음 확률을 모델링한다:
P(w₁, w₂, ..., wₙ)
이를 체인 룰로 분해하면:
P(wₙ | w₁, w₂, ..., wₙ₋₁)
👉 즉,
“이전 문맥을 기반으로 다음 토큰의 확률을 계산”
2. 🔤 토큰(Token)과 텍스트 처리
✔ 토큰이란?
LLM은 단어가 아니라 토큰 단위로 입력을 처리
토큰은 문자열을 쪼갠 최소 단위
예시
"ChatGPT is awesome"
→ ["Chat", "GPT", " is", " awesome"]
✔ 왜 토큰 단위인가?
언어를 유연하게 처리 가능
미등록 단어(OOV) 문제 해결
다양한 언어 대응 가능
3. 🔢 임베딩 (Embedding)
✔ 개념
👉 텍스트(토큰)를 숫자 벡터로 변환하는 과정
"apple" → [0.12, -0.98, 0.44, ...]
✔ 특징
의미적으로 유사한 단어는 벡터도 유사
고차원 공간에서 의미를 표현
4. ⚙️ Transformer 구조
LLM의 핵심 엔진은 Transformer
✔ 기존 모델과 차이
| 모델 | 문제 |
|---|---|
| RNN | 순차 처리 → 느림 |
| LSTM | 장기 의존성 일부 해결 |
| Transformer | 병렬 처리 + long-range 이해 |
✔ 핵심 구성 요소
1) Self-Attention
👉 문장 내 모든 토큰 간 관계 계산
2) Multi-Head Attention
👉 다양한 관점에서 문맥 이해
3) Feed Forward Network
👉 비선형 변환 수행
4) Residual + LayerNorm
👉 학습 안정화
5. 🎯 Attention 메커니즘
✔ 개념
👉 문장에서 중요한 단어에 가중치를 부여
✔ Q, K, V 구조
각 토큰은 다음 3개 벡터로 변환됨:
Query (Q)
Key (K)
Value (V)
✔ 동작 과정
Query와 Key의 유사도 계산
Softmax로 가중치 생성
Value에 가중치 적용
✔ 수식
Attention(Q, K, V) = softmax(QKᵀ / √d) V
✔ 직관적 이해
문장:
"철수는 사과를 먹었다. 그는 배가 불렀다."
👉 "그는" → "철수"에 높은 attention
6. 🔄 학습 과정
1) Pretraining (사전 학습)
대규모 텍스트 데이터 사용
목적: 다음 토큰 예측
👉 비지도 학습 (Self-supervised)
2) Fine-tuning
특정 작업에 맞게 추가 학습
예: 번역, 코드, QA 등
3) Alignment (정렬)
모델을 “사람 기준에 맞게” 만드는 과정
✔ RLHF (Reinforcement Learning from Human Feedback)
사람이 좋은 답을 선택
보상 기반 학습
✔ Constitutional AI
규칙 기반 자기 평가
모델이 스스로 수정
7. 🧠 추론 과정 (Inference)
LLM이 실제로 답을 생성하는 과정
✔ 단계
입력 문장 → 토큰화
임베딩 변환
Transformer 통과
다음 토큰 확률 계산
토큰 선택 (샘플링)
반복 생성
✔ 토큰 선택 방식
Greedy
- 가장 높은 확률 선택
Sampling
- 확률 기반 랜덤 선택
Temperature
- 높을수록 다양성 ↑
Top-k / Top-p
- 후보 제한 후 선택
8. 📏 왜 “Large”인가
✔ 이유
파라미터 수 (수십억 ~ 수조)
데이터 규모 (인터넷 전체 수준)
연산량 (GPU/TPU 대규모 사용)
✔ 효과
일반화 성능 증가
문맥 이해 향상
emergent ability 발생
9. ⚠️ LLM의 한계
❌ 1) Hallucination
- 사실이 아닌 내용을 생성
❌ 2) 진짜 이해 X
- 의미 이해가 아니라 패턴 예측
❌ 3) 최신 정보 부족
- 학습 시점 이후 정보 없음
❌ 4) 계산 비용
- 매우 높은 리소스 요구
10. 🚀 확장 기술
LLM 단독으로는 부족하기 때문에 확장 기술 사용
✔ RAG (Retrieval-Augmented Generation)
- 외부 DB 검색 후 답변
✔ Tool Use / Function Calling
API 호출
코드 실행
✔ Agent 시스템
- 계획 + 실행 + 반복 구조
11. 🧠 LLM 정의
👉 “문맥을 기반으로 다음 토큰을 확률적으로 생성하는 Transformer 기반 모델”
12. 💡 핵심 정리
LLM은 확률 모델이다
“이해”가 아니라 패턴 예측
핵심 구조는 Transformer + Attention
실제 서비스는 반드시:
RAG
Tool
Prompt 설계 같이 붙는다
🔥 결론
LLM은 단순한 텍스트 생성기가 아니라,
👉 언어 패턴을 학습한 확률 기반 생성 엔진이다.
이 모델은 Transformer 구조를 기반으로
문맥(Context)을 이해하고 다음 토큰을 예측하며,
이를 반복함으로써 자연스러운 문장을 생성한다.