기술 노트
Transformer: 한눈에 보는 딥러닝 혁신 구조
1. 들어가며최근 딥러닝 분야에서 가장 뜨거운 키워드는 단연 Transformer다. 기존에는 RNN, LSTM 같은 순환 신경망이 자연어 처리를 주도해 왔지만, Transformer가 등장한 이후 GPT, BERT, RAG 등 다양한 모델들이 놀라운 성능을 보이고 있다.이번 글에서는 Transformer의 전체적인 구조를 큰 그림으로 살펴본다. 세부 알고리즘(Attention, Multi-…

1. 들어가며
최근 딥러닝 분야에서 가장 뜨거운 키워드는 단연 Transformer다. 기존에는 RNN, LSTM 같은 순환 신경망이 자연어 처리를 주도해 왔지만, Transformer가 등장한 이후 GPT, BERT, RAG 등 다양한 모델들이 놀라운 성능을 보이고 있다. 이번 글에서는 Transformer의 전체적인 구조를 큰 그림으로 살펴본다. 세부 알고리즘(Attention, Multi-Head, Positional Encoding 등)은 다음 포스팅에서 자세히 다룰 예정이니, 이번 글로 개념을 한 번에 정리해두면 좋겠다.
2. Transformer가 등장한 배경
- 긴 시퀀스 처리 한계
- RNN이나 LSTM은 시퀀스 길이가 길어질수록 앞쪽 정보를 온전히 유지하기가 어려웠다
- Attention 메커니즘을 이용하면 문장의 모든 위치를 동시에 참조할 수 있어, 긴 문맥을 처리하기에 유리하다.
- 병렬화와 효율성
- RNN은 순차적으로 계산해야 하지만, Transformer는 Self-Attention을 통해 병렬 처리가 가능하다.
- 덕분에 학습과 추론 속도가 크게 빨라진다.
3. Transformer의 전체 구조
Transformer는 크게 인코더(Encoder)와 디코더(Decoder)로 나뉜다.
- 인코더: 입력 시퀀스(문장 등)를 받아 내부 표현을 만든다.
- 디코더: 인코더가 만든 표현을 활용해 출력을 생성한다(예: 번역 결과, 텍스트 생성 등).
아래는 Transformer 블록 다이어그램을 단순화한 예시다.
[입력] -> [인코더(여러 층)] -> [디코더(여러 층)] -> [출력]
3.1 인코더(Encoder)
- Self-Attention
- 동일 시퀀스 내에서 각 토큰이 서로 어떠한 연관도를 갖는지 계산한다.

- Feed-Forward Network(FFN)
- Attention 결과를 추가로 비선형 변환해 표현력을 높이는 역할을 수행한다.
- 잔차 연결(Skip Connection)과 Layer Normalization
- 학습을 안정화하고, Gradient 흐름을 개선해 깊은 네트워크도 학습할 수 있게 한다.
3.2 디코더(Decoder)
디코더 역시 비슷한 구조지만, 인코더-디코더 Attention 모듈이 추가된다는 점이 다르다.
- Self-Attention(디코더 내부): 디코더 시퀀스 내에서 이전 토큰들이 어떤 관련이 있는지 확인한다.
- 인코더-디코더 Attention: 인코더에서 나온 표현(값, 키)을 디코더의 쿼리와 매칭해 참고한다.
- Feed-Forward Network(FFN) 및 잔차 연결, Layer Normalization
- 인코더와 마찬가지로 FFN을 거치며, 잔차 연결로 안정성을 높인다.
4. Transformer의 핵심 포인트
- Attention 중심 설계
- 정보를 빠르고 효율적으로 ‘가중합’해 표현을 생성한다.
- 시퀀스 내 장기 의존성(Long-range dependency) 문제를 해결한다.
- 병렬 처리
- RNN과 달리 모든 위치의 토큰이 동시에 서로를 참고할 수 있어, 학습·추론 속도가 크게 향상된다.
- 확장성과 범용성
- NLP뿐 아니라 이미지, 음성, 시계열 등 다양한 분야에 적용할 수 있다 (예: Vision Transformer).
5. 마무리
이번 글에서는 Transformer가 왜 주목받는지, 그리고 어떤틀(인코더-디코더 구조)로 이루어져 있는지 살펴봤다. 다음 글에서는 Transformer의 내부 요소를 좀 더 깊이 파고들 예정이다. 특히
- Self-Attention의 세부 원리와 Multi-Head Attention
- Positional Encoding이 시퀀스 정보(토큰 위치)를 어떻게 학습하는지
- 인코더와 디코더의 층 구성 등을 구체적인 수식과 예시 코드로 다뤄볼 계획이다.
Transformer는 Attention 기법을 중심으로 RNN 기반 모델의 한계를 크게 뛰어넘은 혁신적인 구조다. 이미 다양한 변형 모델들이 등장했고, NLP는 물론 이미지나 음성 등 여러 분야에서 활약 중이다.
다음 포스팅에서는 세부 모듈을 하나씩 뜯어보며, “Transformer가 어떻게 이렇게 강력한 성능을 내는가?”를 자세히 알아볼 예정이다.