카테고리 없음

LLM이란? 대규모 언어 모델 동작 원리 정리

dev-emong 2026. 9. 8. 11:24

1. 📌 LLM이란 무엇인가

✔ 정의

**LLM(Large Language Model)**은

👉 대량의 텍스트 데이터를 학습하여, 주어진 문맥(context)을 기반으로 다음 토큰을 예측하는 확률 모델이다.


✔ 핵심 개념

LLM의 본질은 단 하나:

👉 Next Token Prediction (다음 토큰 예측)

문장 생성, 번역, 요약, 코드 작성

👉 전부 결국 이 원리의 확장이다.


✔ 수식으로 표현

LLM은 다음 확률을 모델링한다:

P(w₁, w₂, ..., wₙ)

이를 체인 룰로 분해하면:

P(wₙ | w₁, w₂, ..., wₙ₋₁)

👉 즉,

“이전 문맥을 기반으로 다음 토큰의 확률을 계산”


2. 🔤 토큰(Token)과 텍스트 처리

✔ 토큰이란?

  • LLM은 단어가 아니라 토큰 단위로 입력을 처리

  • 토큰은 문자열을 쪼갠 최소 단위

예시

"ChatGPT is awesome"
→ ["Chat", "GPT", " is", " awesome"]

✔ 왜 토큰 단위인가?

  • 언어를 유연하게 처리 가능

  • 미등록 단어(OOV) 문제 해결

  • 다양한 언어 대응 가능


3. 🔢 임베딩 (Embedding)

✔ 개념

👉 텍스트(토큰)를 숫자 벡터로 변환하는 과정

"apple" → [0.12, -0.98, 0.44, ...]

✔ 특징

  • 의미적으로 유사한 단어는 벡터도 유사

  • 고차원 공간에서 의미를 표현


4. ⚙️ Transformer 구조

LLM의 핵심 엔진은 Transformer


✔ 기존 모델과 차이

모델 문제
RNN 순차 처리 → 느림
LSTM 장기 의존성 일부 해결
Transformer 병렬 처리 + long-range 이해

✔ 핵심 구성 요소

1) Self-Attention

👉 문장 내 모든 토큰 간 관계 계산


2) Multi-Head Attention

👉 다양한 관점에서 문맥 이해


3) Feed Forward Network

👉 비선형 변환 수행


4) Residual + LayerNorm

👉 학습 안정화


5. 🎯 Attention 메커니즘

✔ 개념

👉 문장에서 중요한 단어에 가중치를 부여


✔ Q, K, V 구조

각 토큰은 다음 3개 벡터로 변환됨:

  • Query (Q)

  • Key (K)

  • Value (V)


✔ 동작 과정

  1. Query와 Key의 유사도 계산

  2. Softmax로 가중치 생성

  3. Value에 가중치 적용


✔ 수식

Attention(Q, K, V) = softmax(QKᵀ / √d) V

✔ 직관적 이해

문장:

"철수는 사과를 먹었다. 그는 배가 불렀다."

👉 "그는" → "철수"에 높은 attention


6. 🔄 학습 과정


1) Pretraining (사전 학습)

  • 대규모 텍스트 데이터 사용

  • 목적: 다음 토큰 예측

👉 비지도 학습 (Self-supervised)


2) Fine-tuning

  • 특정 작업에 맞게 추가 학습

  • 예: 번역, 코드, QA 등


3) Alignment (정렬)

모델을 “사람 기준에 맞게” 만드는 과정


✔ RLHF (Reinforcement Learning from Human Feedback)

  • 사람이 좋은 답을 선택

  • 보상 기반 학습


✔ Constitutional AI

  • 규칙 기반 자기 평가

  • 모델이 스스로 수정


7. 🧠 추론 과정 (Inference)

LLM이 실제로 답을 생성하는 과정


✔ 단계

  1. 입력 문장 → 토큰화

  2. 임베딩 변환

  3. Transformer 통과

  4. 다음 토큰 확률 계산

  5. 토큰 선택 (샘플링)

  6. 반복 생성


✔ 토큰 선택 방식

Greedy

  • 가장 높은 확률 선택

Sampling

  • 확률 기반 랜덤 선택

Temperature

  • 높을수록 다양성 ↑

Top-k / Top-p

  • 후보 제한 후 선택

8. 📏 왜 “Large”인가

✔ 이유

  • 파라미터 수 (수십억 ~ 수조)

  • 데이터 규모 (인터넷 전체 수준)

  • 연산량 (GPU/TPU 대규모 사용)


✔ 효과

  • 일반화 성능 증가

  • 문맥 이해 향상

  • emergent ability 발생


9. ⚠️ LLM의 한계


❌ 1) Hallucination

  • 사실이 아닌 내용을 생성

❌ 2) 진짜 이해 X

  • 의미 이해가 아니라 패턴 예측

❌ 3) 최신 정보 부족

  • 학습 시점 이후 정보 없음

❌ 4) 계산 비용

  • 매우 높은 리소스 요구

10. 🚀 확장 기술

LLM 단독으로는 부족하기 때문에 확장 기술 사용


✔ RAG (Retrieval-Augmented Generation)

  • 외부 DB 검색 후 답변

✔ Tool Use / Function Calling

  • API 호출

  • 코드 실행


✔ Agent 시스템

  • 계획 + 실행 + 반복 구조

11. 🧠 LLM 정의

👉 “문맥을 기반으로 다음 토큰을 확률적으로 생성하는 Transformer 기반 모델”


12. 💡 핵심 정리

  • LLM은 확률 모델이다

  • “이해”가 아니라 패턴 예측

  • 핵심 구조는 Transformer + Attention

  • 실제 서비스는 반드시:

  • RAG

  • Tool

  • Prompt 설계 같이 붙는다


🔥 결론

LLM은 단순한 텍스트 생성기가 아니라,

👉 언어 패턴을 학습한 확률 기반 생성 엔진이다.

이 모델은 Transformer 구조를 기반으로

문맥(Context)을 이해하고 다음 토큰을 예측하며,

이를 반복함으로써 자연스러운 문장을 생성한다.