딥러닝 알고리즘의 발전 - Transformer 아키텍처
Deep Learning Algorithm Evolution: Transformer Architecture
목차 (16개 섹션)
딥러닝 알고리즘의 발전 — Transformer 아키텍처
2017년 구글 브레인 팀이 논문 한 편을 arXiv에 올렸을 때, 제목이 좀 뻔뻔하다는 반응이 있었다. "Attention Is All You Need." 그러나 그 뻔뻔함은 결국 정당화됐다. 이 논문이 제안한 Transformer 아키텍처는 이후 8년 동안 자연어처리를 넘어 컴퓨터 비전·음성·단백질 구조 예측까지 집어삼켰다.
RNN의 한계와 Attention의 등장
Transformer 이전, 시퀀스 데이터를 다루는 표준은 RNN(Recurrent Neural Network)과 그 변종인 LSTM이었다. 1997년 Hochreiter & Schmidhuber가 LSTM을 제안한 이후 거의 20년간 번역·음성인식·텍스트 생성의 최강자 자리를 지켰다.
문제는 구조적 한계였다. RNN은 토큰을 왼쪽에서 오른쪽으로 순차 처리한다. "나는 어제 서울에서 만든 친구를 오늘 다시 만났다"에서 '만났다'가 '나는'과 연결된다는 사실을 파악하려면, 그 사이의 모든 토큰을 거쳐야 한다. 거리가 멀어질수록 기울기가 소실되고(vanishing gradient), 문맥이 희석된다. 2014년 Bahdanau 등이 제안한 Attention 메커니즘은 이 문제를 우회했다 — 디코더가 인코더의 모든 위치를 동시에 참조해 가중합을 구하는 방식이었다. Transformer는 이 Attention만으로 순환 구조를 완전히 대체했다.
아키텍처 핵심: Self-Attention과 Multi-Head
Transformer의 핵심 연산은 Self-Attention이다. 입력 시퀀스의 각 토큰이 다른 모든 토큰과 얼마나 '관련 있는지'를 동시에 계산한다. 수식으로는 Query(Q), Key(K), Value(V) 세 행렬을 만들어 다음과 같이 처리한다.
``
Attention(Q, K, V) = softmax(QKᵀ / √dₖ) · V
``
√dₖ로 나누는 이유는 차원이 커질수록 내적값이 커져 softmax 기울기가 소실되는 것을 방지하기 위함이다. 여기에 Multi-Head Attention을 추가해 서로 다른 표현 공간에서 병렬로 Attention을 수행한다 — 2017년 원 논문은 8개 헤드를 사용했다.
순환 구조가 없으니 위치 정보가 사라진다. 이를 해결하기 위해 Positional Encoding을 입력 임베딩에 더한다. 원 논문은 사인·코사인 함수를 썼고, 이후 BERT·GPT 계열은 학습 가능한 위치 임베딩(learnable positional embedding)으로 교체했다.
BERT에서 GPT-4까지: 사전학습 패러다임의 전환
Transformer가 진짜 폭발한 것은 사전학습(pre-training) + 미세조정(fine-tuning) 패러다임과 결합하면서다.
2018년 OpenAI의 GPT-1은 언어 모델링(다음 토큰 예측)으로 대규모 텍스트를 사전학습했다. 같은 해 Google의 BERT는 반대로 마스킹된 토큰 예측(MLM) 과 다음 문장 예측(NSP) 을 결합, 양방향 문맥을 학습했다. BERT는 당시 11개 NLP 벤치마크에서 동시에 SOTA를 갱신했다.
이후 스케일링 법칙(scaling law)이 발견됐다. 2020년 Kaplan 등(OpenAI)의 연구에 따르면 모델 성능은 파라미터 수, 데이터량, 컴퓨팅 파워에 대해 멱함수(power law) 로 증가한다. GPT-3(2020, 1750억 파라미터) → GPT-4(2023, 추정 1조+ 파라미터)로 이어지는 경쟁은 이 법칙에 대한 산업계의 베팅이었다.
Transformer의 확장: 언어를 넘어
2020년 OpenAI의 iGPT가 이미지 픽셀을 시퀀스로 취급해 생성 모델을 학습한 이후, 2021년 Google의 Vision Transformer(ViT) 는 이미지를 16×16 패치로 나눠 Transformer 인코더에 직접 입력하는 방식으로 ImageNet에서 CNN 수준을 달성했다. AlphaFold 2(2020)는 Transformer 기반 Evoformer 블록으로 단백질 구조 예측 문제를 사실상 해결하며 2024년 노벨 화학상(Demis Hassabis·John Jumper)으로 이어졌다.
음악(MusicLM), 동영상(Sora), 코드(Codex·GitHub Copilot), 멀티모달(GPT-4V) 등 현재 생성 AI의 사실상 모든 기반이 Transformer 변형체다.
한계와 현재의 논쟁
Transformer가 만능은 아니다. Self-Attention의 계산복잡도는 시퀀스 길이 n에 대해 O(n²) 다 — 긴 문서, 고해상도 이미지, 긴 동영상을 처리할 때 메모리·연산 비용이 폭발한다. 이를 해결하려는 시도로 Sparse Attention(Longformer, 2020), Linear Attention, 그리고 2023년 이후 급부상한 Mamba(SSM 기반) 가 있다. Mamba는 State Space Model을 기반으로 O(n) 복잡도를 달성하며 일부 태스크에서 Transformer에 도전했다.
또한 거대 언어모델의 환각(hallucination) 문제, 학습 데이터의 편향 재생산, 에너지 소비(GPT-3 학습에 500톤 CO₂ 추정) 등은 현재 진행형 논쟁이다. "스케일만 키우면 된다"는 믿음에도 균열이 생기기 시작했다 — 2024~2025년에는 추론 시간 컴퓨팅(Test-Time Compute, OpenAI o1)으로 방향이 일부 선회하고 있다.
Transformer는 딥러닝 역사에서 드물게 등장하는 '패러다임 시프트'였다. 그리고 아직, 그 시프트는 끝나지 않았다.
세부 구성 요소의 동작 원리
위치 정보 부가와 임베딩 처리
Positional Encoding은 순환 구조를 사용하지 않는 신경망에서 입력 토큰의 순서 정보를 보존하는 기법이다. Positional Encoding은 시퀀스 데이터를 다루는 Transformer 기반 모델의 입력 임베딩 단계에 쓰인다. 입력 데이터의 토큰은 먼저 임베딩 벡터로 변환된다. 변환된 임베딩 벡터에 사인 및 코사인 함수 연산 결과나 학습 가능한 위치 임베딩(learnable positional embedding)을 더하는 처리가 이루어진다. 위치 정보가 결합된 임베딩 벡터는 Transformer 계층의 입력으로 전달된다.Self-Attention의 단계별 연산
Self-Attention은 입력 시퀀스 내의 각 토큰이 다른 모든 토큰과 맺는 연관성을 동시에 계산하는 연산 방식이다. Self-Attention은 시퀀스 내부의 전체 문맥 정보를 추출하여 토큰 표현을 갱신하는 데 쓰인다. 입력 시퀀스로부터 Query(Q), Key(K), Value(V)의 세 행렬이 생성된다. Query 행렬과 Key 행렬의 전치 행렬(Kᵀ) 간 내적을 계산하여 토큰 간 유사도 행렬을 구성한다. 유사도 행렬의 원소들을 차원의 제곱근(√dₖ)으로 나누는 스케일링 처리를 적용한다. √dₖ로 나누는 처리는 벡터 차원 증가 시 내적값이 과도하게 커져 softmax 함수의 기울기가 소실되는 현상을 방지한다. 스케일링된 행렬에 softmax 함수를 적용하여 정규화된 가중치 행렬을 도출한다. 가중치 행렬을 Value(V) 행렬과 행렬 곱 연산하여 최종 가중합 벡터를 출력한다.Multi-Head Attention의 병렬 구조
Multi-Head Attention은 Attention 연산을 독립된 복수의 헤드로 분할하여 병렬로 수행하는 구조이다. Multi-Head Attention은 서로 다른 표현 공간에서 다양한 관계 정보를 동시에 학습하는 데 쓰인다. 입력 벡터는 사전에 설정된 헤드 수에 맞추어 서로 다른 선형 변환 공간으로 투영된다. 2017년 논문에서는 8개의 헤드를 사용하여 병렬로 Attention 연산을 수행했다. 각 헤드에서 독립적으로 계산된 Attention 결과 벡터들은 하나로 결합된 뒤 다음 계층으로 전달된다.사전학습 패러다임과 응용 영역
언어 모델 사전학습 방식
사전학습(pre-training)과 미세조정(fine-tuning)은 대규모 데이터를 활용하여 범용 모델을 사전에 학습시킨 후 특정 작업에 맞추어 조정하는 훈련 방식이다. 이 방식은 자연어처리 및 텍스트 생성 시스템을 구축하는 데 쓰인다. OpenAI의 GPT-1은 대규모 텍스트에서 다음 토큰을 예측하는 단방향 언어 모델링 방식으로 사전학습을 수행한다. Google의 BERT는 입력 토큰의 일부를 가려 복원하는 마스킹된 토큰 예측(MLM)과 문장 간 순서를 판별하는 다음 문장 예측(NSP)을 결합하여 양방향 문맥을 학습한다. 사전학습된 모델은 작업별 데이터셋을 통해 가중치를 미세조정하는 단계를 거친다. BERT는 이러한 사전학습 방식을 통해 11개 NLP 벤치마크에서 SOTA를 동시에 갱신한 것으로 알려졌다. 또한 모델 파라미터 수, 데이터량, 컴퓨팅 파워를 확장할 때 모델 성능이 멱함수(power law) 형태로 향상된다는 스케일링 법칙(scaling law)이 연구를 통해 제시되었다.비언어 데이터 입력 변환 구조
Transformer의 시퀀스 처리 구조는 이미지 및 단백질 구조 데이터에도 확장 적용된다. 이 구조는 컴퓨터 비전, 생물학적 구조 예측, 멀티모달 생성 모델에 쓰인다. iGPT는 이미지 픽셀을 순차적 토큰 배열로 취급하여 생성 모델의 사전학습을 수행한다. Vision Transformer(ViT)는 이미지를 16×16 크기의 패치로 분할한 뒤 각 패치를 시퀀스 토큰 형태로 Transformer 인코더에 직접 입력한다. ViT는 이러한 입력 처리를 통해 ImageNet에서 CNN 수준의 분류 성능을 달성했다. AlphaFold 2는 단백질 서열 정보를 Transformer 기반의 Evoformer 블록을 통해 처리한다. 이 방식은 단백질 3차원 구조 예측 문제를 해결하는 데 기여하여 2024년 노벨 화학상 수상으로 이어진 것으로 평가받는다.계산 복잡도 분석 및 대안 구조
Self-Attention 연산량과 한계
Self-Attention 메커니즘의 연산 복잡도는 시퀀스 길이 n에 대해 O(n²)으로 산출된다. 이 특성은 시퀀스 내의 모든 토큰 쌍 간 내적을 동시에 계산하는 구조적 조건에서 발생한다. 입력 시퀀스의 길이가 증가하면 연산 및 메모리 요구량이 길이의 제곱에 비례하여 증가한다. 이에 따라 긴 문서, 고해상도 이미지, 긴 동영상을 처리할 때 연산 비용과 메모리 소모가 급격히 커지는 한계가 존재한다.효율화 구조 및 추론 방식의 변화
O(n²) 복잡도를 개선하기 위한 구조적 변형과 추론 방식이 제안되었다. 이들 기법은 시퀀스 처리 비용을 절감하고 모델의 확장성을 보완하는 데 쓰인다. Sparse Attention(Longformer)과 Linear Attention은 참조하는 토큰 범위를 제한하거나 수식을 변형하여 연산 효율을 높이는 방식을 사용한다. State Space Model(SSM) 기반의 Mamba는 O(n) 복잡도를 통해 선형 시간 연산을 달성하여 일부 태스크에서 Transformer의 대안으로 제시되었다. 거대 언어 모델에서는 환각(hallucination) 현상, 학습 데이터의 편향 재생산, 대규모 에너지 소비 문제가 주요 과제로 지적된다. 이에 따라 단순 파라미터 확장 외에 추론 시간 컴퓨팅(Test-Time Compute)을 활용하여 모델의 추론 성능을 강화하는 방향으로 연구가 일부 전환되는 양상을 보인다.관련 문서
문서 정보
- 최초 작성
- 최종 갱신
- 분류
- Science
HANGUL.WIKI가 정리·작성한 문서입니다. 정확성을 위해 노력하나 오류가 있을 수 있으므로, 중요한 내용은 공식 출처를 통해 확인하시기 바랍니다. 내용의 오류나 정정 요청은 오류·정정 신고로 알려주시면 검토 후 반영합니다.