아래의 내용은 클로드 코드로 작성한 내용입니다.정리 노트RNN의 순차 처리 한계(병렬화 불가, 장거리 의존성 소실)를 극복하기 위해 제안된 아키텍처.문장 전체를 한번에 보고 단어 간 관계를 직접 계산하는 Attention 메커니즘이 핵심이다.BERT, GPT, LLaMA 등 현대 LLM의 기반 구조이며, 지금까지 공부한 ReLU/GELU, Layer Norm,Residual Connection, Dropout, AdamW가 모두 Transformer 안에서 사용된다. --- 왜 Transformer가 필요했나 — RNN의 한계Transformer 이전엔 NLP에 RNN(순환 신경망)을 사용했다. ```"나는 어제 서울에서 밥을 먹었다"RNN: 나는 → 어제 → 서울에서 → 밥을 → 먹었다 순..