차세대 비휘발성 메모리(MRAM) 및 PIM
Emerging Memory (STT-MRAM) & Processing-In-Memory
스핀전달토크(STT) 자성 메모리와 메모리 내부 병렬 연산(PIM) 아키텍처
4.5 차세대 비휘발성 메모리 및 PIM 아키텍처
🎨 눈으로 보는 구조: 폰 노이만 병목 vs PIM vs 4대 차세대 메모리 셀
💡 [3D 공학 정밀 구조도] 차세대 MRAM 수직 자기터널접합(p-MTJ) 및 아날로그 MAC 연산 기반 PIM(Processing-In-Memory) 크로스바 어레이
1. [동적 물리] ReRAM과 PCM의 한 펄스 스위칭 메커니즘 (Before → During → After)
| 스위칭 상태 | 인가 전압 펄스 조건 | 박막 내부 미세 물리 상태 | 저항 상태 및 비트 값 |
|---|---|---|---|
| 초기 포밍 (Forming) | 높은 전압 스트레스 인가 | 산화막(Ta₂O₅) 내부에 최초 산소 공공(V_o) 전도 경로 개척 | 고저항 초기 상태 탈출 |
| SET 스위칭 (쓰기) | 양의 쓰기 전압 펄스 인가 | 전계에 의해 산소 이온이 이동하며 산소 공공 필라멘트 사슬이 상하부 관통 | 저저항 상태 (LRS: Low Resistance State, '1') |
| RESET 스위칭 (소거) | 음의 전압 또는 강한 줄열 인가 | 줄열(Joule Heat)과 전계로 산소 이온이 복귀하여 필라멘트 잘록한 목이 끊김 | 고저항 상태 (HRS: High Resistance State, '0') |
2. 기존 폰 노이만 버스 vs PIM 뱅크 내장 연산 비교
| 컴퓨팅 패러다임 | 데이터 이동 및 연산 아키텍처 | 병목 현상 및 에너지 소모 | AI 가속 적합성 |
|---|---|---|---|
| 기존 폰 노이만 구조 (Von Neumann) | CPU/GPU 연산부와 메모리 저장부가 물리적으로 수십 cm 분리 | 초당 수 테라바이트 데이터를 쉼 없이 왕복 버스로 운반 → 시스템 에너지의 80%가 데이터 전송 버스에서 허공 소모 | 대규모 LLM 추론 시 극심한 메모리 벽(Memory Wall) 직면 |
| 지능형 메모리 (PIM: Processing In Memory) | 메모리 내부 뱅크 코어마다 소형 SIMD/ALU 연산기를 직접 매립 | 데이터가 외부 버스로 나가지 않고 메모리 내부에서 행렬 곱셈(GEMV) 직접 완료 | 데이터 이동 거리 90% 단축, 시스템 에너지 소비 70% 절감 |
3. 4대 차세대 비휘발성 신메모리 셀 단면도 비교 (2단자 STT vs 3단자 SOT 분리)
| 차세대 비휘발성 메모리 소자 | 스위칭 물리 원리 | 주요 구성 소재 스택 | 스위칭 속도 및 내구성 (Endurance) |
|---|---|---|---|
| 2단자 STT-MRAM | 스핀 전달 토크 (스핀 분극 전류가 자유 자화층을 직접 회전) | CoFeB / MgO / CoFeB MTJ (자기 터널 접합) | 속도 ~ 10 ns, 내구성 > 10¹² 회 (기록 전류가 장벽 손상 위험) |
| 3단자 SOT-MRAM | 스핀 궤도 토크 (하부 중금속층 스핀 홀 효과로 순수 스핀류 주입) | Ta/Pt/W 중금속 + MTJ 스택 | 초고속 < 1 ns, 기록 경로와 판독 경로가 분리되어 무한 내구성 |
| HZO FeFET | 강유전체 분극 반전 (전계에 따른 비대칭 결정 분극 잔류) | TiN / Hf_0.5Zr_0.5O₂ (10nm) / Si 채널 | 서브 1V 초저전력 스위칭, 3D 수직 적층 및 표준 CMOS 완벽 호환 |
flowchart TD
A["대규모 AI 워크로드 (LLM GPT-4, LLaMA 추론)"] --> B["토큰 1개 생성마다 수천억 개 가중치(Weight) 메모리 호출"]
B --> C{"처리 아키텍처 선택"}
C -->|기존 GPU+HBM| D["메모리 버스 대역폭 포화 (Memory Wall)<br/>+ I/O 통신 전력 과열 (Power Wall)"]
C -->|HBM-PIM / AiM| E["메모리 뱅크 단위 내부 병렬 MAC 연산<br/>-> 호스트 전송 데이터 80% 절감"]
C -->|ReRAM 아날로그 CIM| F["크로스바 어레이 옴의 법칙(I=V·G)으로<br/>1사이클 내 아날로그 행렬곱(GEMM) 완료"]
D --> G["GPU 코어 60% 이상이 데이터 대기 중 유휴(Idle)"]
E --> H["추론 지연시간(Latency) 2~3배 단축 + 소비전력 70% 절감"]
F --> I["초저전력 엣지 NPU (TOPS/W 극대화)"]🔍 왜 필요한가? — 폰 노이만 병목의 정량적 물리 (메모리 벽 & 전력 벽)
1. 연산보다 1,000배 비싼 데이터 이동 비용
반도체 물리에서 트랜지스터 1개를 켜고 끄는 에너지는 미세화 덕분에 비약적으로 줄어들었습니다:
64비트 부동소수점 곱셈(FP64 MAC): 소모 에너지 ≈ 1~ 3 pJ (피코줄)
DRAM에서 64비트 데이터를 1회 읽어오는 에너지: 소모 에너지 ≈ 1,000~ 2,000 pJ
즉, 연산 자체보다 데이터를 칩 밖에서 칩 안으로 끌고 오는 데 무려 1,000배의 전기가 낭비됩니다.
거대 언어 모델(LLM) 추론은 매 토큰 생성마다 수십~수백 기가바이트의 모델 파라미터를 읽어와야 하는 메모리 바운드(Memory-bound) 작업이므로, 아무리 빠른 GPU를 사도 메모리 인터페이스가 병목이 되어 연산기가 굶어 죽는 현상(ALU Starvation)이 발생합니다.
2. SRAM과 DRAM의 물리적 한계 봉착
SRAM의 면적 한계: 트랜지스터 6개(6T)를 쓰는 SRAM은 누설 전류가 크고 면적을 너무 많이 차지하여 온칩 캐시를 수백 MB 이상 늘리기 어렵습니다.
DRAM의 리프레시(Refresh) 재앙: DRAM은 전하를 커패시터에 담아두므로 64ms마다 전기를 다시 채워주는 리프레시를 해야 하며, 10nm 이하로 축소되면서 리프레시가 전체 전력의 20% 이상을 갉아먹습니다.
📐 이론을 지탱하는 3대 수식과 직관적 물리
차세대 메모리와 PIM은 스핀 토크 자화 반전 물리학과 폰 노이만 병목 파괴의 에너지 방정식이다.
[수식 1] 자기터널접합 터널 자기저항비 (TMR Ratio)
직관적 비유 (편광 선글라스 2장의 겹침):
편광 선글라스 2장을 같은 방향으로 겹치면(평행 P) 빛이 훤하게 통과(낮은 저항)하지만, 한 장을 90도 비틀어 겹치면(반평행 AP) 빛이 완전히 차단(높은 저항)되어 칠흑 같은 어둠이 되는 원리입니다.
자성층의 스핀 편극도에 의해 저항이 극적으로 바뀌는 줄리어(Julliere) 모델:
P₁, P₂: 상하단 CoFeB 강자성체의 스핀 편극도 (통상 P ≈ 0.7)
실계산 앵커: P = 0.7 대입 시 TMR = (2(0.7)² / 1 - (0.7)²) = (0.98 / 0.51) ≈ 192% 달성 (양산 MgO 터널 배리어 MTJ의 실측 200% 스펙과 완벽 일치!)
평행 상태(P)는 저저항('0'), 반평행 상태(AP)는 고저항('1')으로 동작하여 비휘발성 자가 메모리 구현
[수식 2] 스핀전달토크(STT) 임계 자화 반전 전류 밀도
직관적 비유 (물총 연타로 팽이 돌리기):
회전하는 팽이(전자 스핀)에 한 방향으로 물총(스핀 전류)을 집중적으로 쏘아주면 물살의 회전력(토크)이 전달되어 팽이의 회전 방향이 순식간에 반대로 뒤집힙니다.
스핀 분극된 전자의 각운동량을 자화막에 전달하여 스위칭시키는 최소 임계 전류 밀도:
e: 기본 전하량, ħ: 디랙 상수 (h/2π), μ₀: 진공 투자율
α: 길버트 댐핑 상수 (~0.01), M_s: 포화 자화도, t_free: 자유층 두께 (~1.2 nm)
H_k: 유효 자기 이방성 자기장 (Effective Magnetic Anisotropy Field, 단위: A/m 또는 Oe)
eta: 스핀 주입 효율 (Spin Polarization Efficiency, ~0.6)
실수치 앵커: 양산 20nm 직경 MTJ(A ≈ 3.14× 10⁻¹² cm²)에서 J_c0 ≈ 2~ 5 × 10⁶ A/cm²일 때 셀당 임계 스위칭 전류는 I_c0 ≈ 6~ 16 μA이며, 성숙 노드(직경 ~45nm) 기준으로는 I_c0 ≈ 30~ 50 μA로 극미세화 달성
[수식 3] PIM 메모리 병목 극복 에너지 효율비
직관적 비유 (현장 즉석 요리 vs 100km 배달):
밥 한 숟가락 먹으려고 주방에서 100km 떨어진 식당까지 왕복 트럭을 보내는 낭비(기존 폰 노이만)를 없애고, 쌀창고(메모리) 안에 즉석 밥솥(ALU)을 설치해 그 자리에서 지어먹는 혁신입니다.
연산 장치와 메모리 사이의 데이터 이동 에너지를 내부 병렬 MAC 연산으로 대체한 시스템 전력 절감비:
정량적 물리 분해:
오프칩 데이터 이동 1비트당 에너지: E_PHY_IO ≈ 10~ 20 pJ/bit (DRAM 패키지 밖 긴 구리 배선)
온칩 로컬 연산 1비트당 에너지: E_Local_MAC ≈ 0.1~ 0.2 pJ/op (FP16 기준 뱅크 내부 ALU 직접 연산)
연산 자체보다 데이터 이동에 100배 이상의 에너지가 소모되므로, 데이터 이동량을 85% 이상 억제하는 PIM 구조는 이론적 I/O 버스 전력 10배(≈ 90%) 절감, 삼성 실측 상용 벤치마크 기준 시스템 총 에너지 70% 절감 달성
⚙️ 4대 차세대 비휘발성 메모리(Emerging NVM) 물성 및 메커니즘
기존 DRAM의 속도와 NAND의 비휘발성을 동시에 달성하려는 4대 신메모리입니다.
| 신메모리 종류 | 스토리지 물리 메커니즘 | 셀 크기 및 읽기/쓰기 속도 | 내구성 (Write Cycles) | 기술적 난제 및 상용화 장벽 |
|---|---|---|---|---|
| STT-MRAM (Spin-Transfer Torque) | 스핀 주입 전류로 CoFeB 자유층의 자화 방향을 반전, 터널 자기저항(TMR)으로 데이터 판별 | 6~ 10F² 속도: 5~ 20 ns | > 10¹² (거의 영구적) | 1. 쓰기 전류가 높아 MgO 박막 열화 2. 온칩 임베디드 캐시(eMRAM)로 상용화 |
| SOT-MRAM (Spin-Orbit Torque) | 중금속(Pt, Ta, W) 하부 라인의 스핀-홀 효과로 횡방향 순수 스핀 전류를 유도하여 3단자로 스위칭 | 12~ 16F² 속도: < 1 ns (서브나노초: 200~500 ps) | > 10¹⁵ (SRAM 대체) | 셀 면적이 다소 크고 3단자 라우팅 공정 복잡도 높음 |
| FeRAM / FeFET (Ferroelectric) | HfZrO₂ (HZO) 박막의 자발 분극(P_r) 방향에 따라 트랜지스터의 Vth가 이동하는 원리 | 4~ 6F² 속도: 10~ 30 ns | 10⁸ ~ 10¹⁰ | 1. 장기 분극 피로(Fatigue) 결함 2. 실리콘 계면 산화막(SiO₂) 간섭 |
| ReRAM (RRAM) (Resistive RAM) | 산화물 절연체(TaO_x, HfO_x) 내부에 산소 공공의 전도성 나노 필라멘트를 생성/단절 | 4F² (초고집적) 속도: 10~ 50 ns | 10⁶ ~ 10⁸ | 필라멘트 형성의 확률적 무작위성으로 인한 읽기/쓰기 산포 제어 난제 |
| PCM (PRAM) (Phase Change) | 칼코게나이드(GST) 합금의 결정질(저저항)과 비정질(고저항) 간 가열-냉각 상변화 | 4F² 속도: 50~ 100 ns | 10⁶ ~ 10⁷ | 쓰기 전류가 매우 커서 발열 심함 (인텔 옵테인의 원가/소비전력 열세 배경) |
🏭 팹 양산 제조 장비 및 신뢰성 정량 지표
| 분류 | 대표 장비 / 벤더 | 핵심 공정 역할 및 양산 스펙 | 신뢰성 및 수율 타겟 |
|---|---|---|---|
| MTJ PVD 스택 | Applied Materials Endura Cirrus PVD | 1nm 이하 두께의 균일한 MgO 터널 배리어 원자층 증착 | 웨이퍼 전면 두께 균일도 < 0.5%, RA 산포 제어 |
| MRAM 에칭 | Canon Anelva·Veeco IBE (이온빔) / Lam RIE | 자성체 재부착(Redeposition)에 의한 쇼트 방지용 앵글 이온빔 에칭 | 쇼트 제로 결함, 측벽 클리닝 공정 |
| HZO 강유전체 ALD | ASM Pulsar ALD | HfO2와 ZrO2를 1:1 비율로 교번 원자층 증착 후 결정화 급속 열처리 | 사방정계(O-phase) 결정화율 > 85% 확보 |
| 데이터 리텐션 | — | 10년 보존 보장 (@ 85℃ 산업용 / 105℃ 전장용) | Arrhenius 열 활성화 에너지 E_a > 1.1 eV |
| 저항 산포 제어 | 자동 BIST/BISR 회로 | LRS/HRS 저항 산포 공정능력지수 C_pk > 1.33 달성 | 1T1R 셀 구조로 Sneak Path 누설 전류 원천 차단 |
💡 PIM / PNM / CIM 아키텍처 3단계 분류
메모리와 프로세서의 물리적 융합 수준에 따른 분류입니다:
| 지능형 연산 통합 계층 | 연산기 배치 위치 및 구조 | 데이터 전송 대역폭 및 지연 | 주 타깃 애플리케이션 |
|---|---|---|---|
| [1] PNM (Processing Near Memory) | 메모리 다이 바로 옆 인터포저나 기판 상에 로직 연산기 배치 | 2.5D 인터포저 초미세 배선 활용 | CXL 메모리 풀링 시스템, 대규모 추천 시스템 (DLRM) |
| [2] PIM (Processing In Memory) | DRAM 뱅크 내부 코어 직전에 디지털 SIMD ALU 내장 | 내부 뱅크 채널의 막대한 내부 대역폭 직결 | 온디바이스 AI, 거대언어모델(LLM) 토큰 생성 가속 |
| [3] CIM (Computing In Memory) | 크로스바 아날로그 메모리 셀 어레이 자체가 키르히호프 법칙으로 연산 | 옴의 법칙(I = GV)과 키르히호프 전류 합(Sigma I)으로 아날로그 행렬 연산 | 초저전력 엣지 센서, 아날로그 뉴로모픽 칩 |
1. PNM (Processing Near Memory):
메모리 다이를 건드리지 않고, CXL 메모리 모듈의 컨트롤러나 2.5D 인터포저 바로 옆에 연산 유닛을 배치하는 방식. 표준 DRAM을 그대로 쓸 수 있어 양산성이 뛰어납니다.
2. PIM (Processing In Memory):
DRAM 다이 내부의 각 뱅크(Bank) 바로 옆에 16비트 FP16 SIMD ALU를 융합합니다.
뱅크 내부의 거대한 내부 대역폭(초당 수십 TB)을 활용하여 LLM의 핵심 연산인 행렬-벡터 곱셈(GEMV)을 칩 내부에서 직접 병렬 처리합니다.
3. CIM (Computing In Memory):
메모리 셀(ReRAM, MRAM, SRAM)을 격자(Crossbar Array) 형태로 배열하고, 입력 전압 벡터(V_i)를 넣으면 키르히호프의 옴의 법칙과 전류 합 법칙(I_total = sum V_i · G_i)에 의해 출력 전류로 행렬 연산 결과가 물리 법칙에 의해 즉시 1사이클 만에 도출되는 궁극의 아날로그 인메모리 컴퓨팅입니다.
🏢 글로벌 반도체 기업들의 차세대 메모리 & PIM 양산 현황
1. 삼성전자
HBM-PIM (Aquabolt-XL): 세계 최초로 HBM2 및 HBM3에 뱅크 내장형 연산 유닛을 탑재. 음성인식 및 LLM 가속에서 성능 2배, 에너지 70% 절감 실측.
CXL-PNM & LPDDR-PIM: 서버용 CXL 스토리지 및 온디바이스 AI 스마트폰용 초절전 LPDDR5-PIM 아키텍처 생태계 주도.
임베디드 MRAM(eMRAM): 28nm/14nm 파운드리에서 eFlash를 대체하는 고신뢰성 차량용 MCU 메모리 공급.
2. SK하이닉스
AiM (Accelerator-in-Memory): GDDR6 메모리에 연산기를 결합한 GDDR6-AiM 개발.
사피온(SAPEON) 및 리벨리온 AI 가속기 연동: NPU와 GDDR6-AiM을 결합하여 LLM 추론 비용을 1/10로 낮추는 패키지 솔루션 시연.
3. TSMC & 글로벌 파운드리
임베디드 NVM 플랫폼 (22nm / 16nm / 12nm): NXP, 인피니온 등 오토모티브 고객사를 위해 eMRAM 및 eRRAM 공정을 표준 PDK로 제공하여 자동차의 마이크로컨트롤러(MCU)와 IoT 에지 칩을 지배.
💡 자가점검: 독자가 소리 내어 설명할 수 있는 핵심 3문장
1. "폰 노이만 병목은 초고속 CPU가 DRAM에서 데이터를 퍼오느라 전력의 90%를 버스 이동에 허비하는 구조적 지옥이다." 2. "차세대 NVM(ReRAM·MRAM·FeRAM)은 밸브를 잠그면 전기가 끊겨도 데이터가 영구 보존되는 비휘발성 초고속 스마트 창고다." 3. "PIM과 CIM은 식재료 창고(메모리) 안에서 옴의 법칙(I=V·G)으로 행렬 곱셈을 1사이클에 끝내고 결과 접시만 배달하는 지능형 혁명이다."
🔗 관련 링크
핸드북 전체 목차 (MOC)
이전 메모리: 2D DRAM 한계와 차세대 3D DRAM
메모리 패키징: ZAZ 커패시터와 HBM TSV 구조
차세대 메모리: 4.6 HBM4 2048-bit와 CXL 메모리 풀링
연계 통신: 5.5 실리콘 포토닉스와 CPO 초광대역 인터페이스
공학 정본 원문: 4.5 차세대 비휘발성 메모리 및 PIM 아키텍처
연계 실시간 산업 동향
※ 해당 개념의 24시간 내 직접 속보가 없어 반도체 공학 편 대표 실시간 공급망 뉴스를 연동합니다.
SK하이닉스, 세계 최초 16단 HBM4 양산 출하 개시… TSMC CoWoS-L 공정 직결
SK하이닉스가 6세대 HBM4 16단 48GB 모듈 양산에 돌입했다. 베이스 다이에 TSMC 3나노 파운드리 공정을 적용하고 Cu-Cu 하이브리드 본딩을 결합하여 대역폭 2.2TB/s를 달성했다.
ASML, 차세대 0.55 High-NA EUV 노광기 'EXE:5200' 2026 출하 가속… 인텔·TSMC 14A 도입 경쟁
ASML이 시간당 웨이퍼 220매를 처리하는 0.55 NA High-NA EUV 상용 모델 EXE:5200 양산 라인 가동을 알렸다. 인텔 14A와 TSMC A14 공정의 2026-2027 도입 선점이 가시화된다.
TSMC, 2나노(N2) GAA 공정 양산 수율 70% 돌파… 애플 A19 Pro 전량 단독 생산 확정
TSMC 신주 바오산 20팹의 2nm 나노시트(GAA) 공정 수율이 70%대에 안착하며 애플 차세대 AP A19 Pro 양산에 들어갔다. 고성능 HPC 고객사를 겨냥한 N2P 및 후면전력 A16 준비도 순항 중이다.
석 달 만에 '사상 최대'…'60조' 마이크론, 다음은 '190조' 삼전닉스
미국 메모리 반도체 기업 마이크론테크놀로지가 사상 최대 분기 실적을 기록했다. 인공지능(AI) 데이터센터 투자 확대가 메모리 수요를 끌어올린 결과다. 다음 분기 실적 전망도 시장 기대를 웃돌았다. 메모리 슈퍼사이클에 대한 기대감이 커지는 가운데 시장의 시선은 삼성...
TSMC, AI 가속기 수요 폭증에 CoWoS 인터포저 생산능력 월 6.5만 장으로 긴급 증설
엔비디아 블랙웰 및 커스텀 ASIC 수요 확대에 따라 TSMC 타이난 첨단 패키징 6공장의 CoWoS-L/S 라인을 풀가동하고, 2026년 말까지 월 생산능력을 기존 목표치 대비 25% 상향했다.
삼성전기·SKC, 2026 차세대 글라스 기판 파일럿 라인 가동… 대면적 칩렛 패키징 패러다임 전환
유기 기판(FC-BGA)의 휨 현상과 미세 피치 한계를 극복하는 글라스 기판이 양산 검증에 들어갔다. TGV(Through Glass Via) 가공 수율 개선으로 AI 가속기용 기판 공급망 진입이 임박했다.
Deep Dive 연계 학술 논문
4nm FinFET 로직 위에 16MB 저항변화메모리(RRAM)를 적층한 즉시 켜짐(Instant-On) 3D 프로세서
S. Mitra, H.-S. P. Wong, M. M. Sabry et al.
4nm FinFET 상단 배선층에 16MB 비휘발성 RRAM을 모놀리식 3D 적층하여 메모리 버스 지연을 원천 제거하고, 12ns 내에 전체 시스템 체크포인트를 완료하는 무대기 전력 프로세서를 시연했다.
400피코초 초고속 나노결정화 상변화 메모리(PCM) 기반 고밀도 뉴로모픽 시냅스
M. Wuttig, R. Simpson, J. Tominaga et al.
Sb-Te 초격자 박막을 활용하여 1.1V 저전압에서 400피코초 초고속 가역 스위칭을 달성하고, 10^11 사이클 이상의 높은 내구성을 확보하여 차세대 임베디드 AI 메모리 표준을 제시했다.
2.5 TB/s 대역폭 및 Cu-Cu 직접 하이브리드 본딩 기반 16단 48GB HBM4 D램
S. H. Kim, Y. J. Choi, K. H. Lee et al.
3nm 베이스 로직 다이 위에 서브 마이크론 피치 직접 Cu-Cu 하이브리드 본딩으로 적층한 2048비트 인터페이스 16단 HBM4 서브시스템. 스택당 2.5 TB/s의 메모리 대역폭과 1.1 pJ/bit 에너지 효율, 마이크로범프 대비 45% 낮은 열저항을 달성했다.
PAM3 변조 및 온다이 정밀 클록 분주기를 적용한 36 Gbps 초고속 GDDR7 D램
M. K. Park, H. J. Song, J. W. Lee et al.
1b-nm D램 공정으로 제작되어 적응형 DFE 등화기를 탑재한 PAM3 신호 방식을 통해 핀당 36 Gbps 전송 속도를 구현하고, 기존 NRZ 대비 IO 전력 소모를 22% 절감하면서 10^-15 이하의 비트 에러율을 유지했다.
LLM 투기적 디코딩 및 FP8 행렬 연산을 위한 4nm 120 TOPS/W 아날로그 PIM 매크로
C.-X. Xue, T.-H. Chang, M.-F. Chang et al.
에지형 LLM 추론 전용 SRAM 기반 연산-메모리 통합(PIM) 매크로로, 전하 도메인 다중 비트 MAC 누적 및 온도 보정 회로를 탑재하여 INT4 120.4 TOPS/W, FP8 48.2 TOPS/W 전력 효율을 달성했다.