DP
DeepTech
목차: Ch 4.3 HBM4 2048-bit 인터페이스 & CXL 풀링
Ch 4.3난이도 L5공학 정본 백서

HBM4 2048-bit 인터페이스 & CXL 풀링

HBM4 2048-bit Interface & CXL Memory Pooling

정본 핸드북 원문

파운드리 선단 베이스 다이와 Cu-Cu 하이브리드 본딩을 적용한 6세대 HBM

[CTO 특강 팩트북 연계] 물리 수식 유도, 장비 파라미터 및 독점 밸류체인 로우 데이터 수록.
팩트북 열람
관련 개체:skhynixsamsungtsmc
연계 개념:rack_scale

4.6 HBM4 2048-bit 아키텍처, Cu-Cu 하이브리드 본딩 및 CXL 메모리

💡 3초 핵심 요약

1024차선 고속도로를 2048차선으로 뚫고, 땜납(접착제)을 버리고 구리끼리 직접 붙인다. HBM3E의 병목은 “핀을 더 빨리 흔드는 것”이었고, HBM4의 해법은 차선을 두 배로 늘리는 것이다. JEDEC JESD270-4(2025-04)는 인터페이스를 1024-bit → 2048-bit, 채널을 16 → 32로 고정했고, 스택당 바닥 대역폭은 약 2 TB/s(8 Gb/s × 2048-bit). 벤더는 이미 10~11+ Gb/s, 2.5~2.8 TB/s를 찍고 NVIDIA Rubin급 GPU는 스택 8개로 약 20 TB/s를 목표로 한다. 동시에 베이스 다이는 메모리 레거시 로직에서 1세대 TSMC 12nm/5nm(차세대 HBM4E: N3)·삼성 4nm로 넘어가 PHY·컨트롤러를 SoC급으로 끌어올렸고, 마이크로범프(~20 μm 피치)의 물리적 천장 너머에는 범프리스 Cu-Cu 하이브리드 본딩(1~수 μm) 이 대기한다. 패키지 안이 HBM4라면, 랙·클러스터 바깥의 용량 확장은 CXL 2.0/3.0 메모리 풀링이 맡는다. 한 문장으로: 온패키지는 광폭 나노 고속도로, 온랙은 공유 메모리 호수.

🎨 눈으로 보는 핵심 구조도

💡 [3D 공학 정밀 구조도] 차세대(16-Hi) 목표 구조: HBM4 16단 적층 큐브, 무범프 직접 Cu-Cu 하이브리드 본딩(1μm 피치), 2048비트 광대역 버스 및 CXL 3.1 컨트롤러 통합

💡 [3D 공학 정밀 구조도] 차세대(16-Hi) 목표 구조: HBM4 16단 적층 큐브, 무범프 직접 Cu-Cu 하이브리드 본딩(1μm 피치), 2048비트 광대역 버스 및 CXL 3.1 컨트롤러 통합

💡
[3D 공학 정밀 구조도] 차세대(16-Hi) 목표 구조: 16개 초박형 DRAM 코어 다이 수직 적층, TSV 관통 전극 및 1μm 피치 무범프 직접 Cu-Cu 하이브리드 본딩(DBI), 2048비트 인터페이스 및 CXL 3.1 / UCIe 통합 베이스 로직 다이

HBM4 16-Hi 큐브 + 하이브리드 본딩 (이상적 목표 구조)

실제 2026년 HVM HBM4는 대부분 마이크로범프 + MR-MUF/NCF다. 아래는 16-Hi + 범프리스 Cu-Cu가 양산에 안착했을 때의 목표 단면이다. 범프 갭이 사라지면 같은 높이 예산에 DRAM 코어를 더 넣을 수 있다.

flowchart TD
    NV["NVIDIA<br/>(HBM4 스펙 정의 · 품질 승인 · 물량 쿼터 배분)"]
    NV --> SK["SK하이닉스<br/>+ TSMC CoWoS 제휴<br/>1c nm HBM4 + TSMC 12nm(표준)/N5(커스텀) 베이스 다이 (차세대 HBM4E: N3)"]
    NV --> SEC["삼성전자<br/>올인원 턴키 솔루션<br/>1c nm DRAM + S.LSI 파운드리 4nm + AVP 첨단 패키징"]
    NV --> MU["마이크론 (Micron)<br/>1β nm 기반 12H/16H HVM<br/>차세대 커스텀 ASIC 생태계 제휴"]

SK하이닉스–TSMC 연합. HBM3E 사이클의 승자. HBM4도 개발 완료(2025-09) 후 램프. 베이스를 TSMC에 맡기면 CoWoS 정렬·PHY IP·NVIDIA 패키지 레시피가 한 줄로 이어진다. 대가는 파운드리·패키징 의존. 2026년 Rubin HBM4 물량에서 하이닉스 비중이 크다는 공급망 전언이 반복된다.

삼성 턴키. 메모리 + 4 nm 베이스 + 첨단 패키징을 한 지붕 아래. 장점: 커스텀 루프, HCB 투자, 속도 공칭(11.7~13 Gb/s, HBM4E 16 Gb/s 시연). 단점: 과거 HBM3E 퀄 지연의 트라우마, HCB 조기 수율. “한 회사가 다 한다”는 해자이자 단일 장애점.

엔비디아–마이크론. 마이크론은 3위 공급자에서 실제 제3 소스가 됐다. 36 GB 12H HVM, >11 Gb/s, >2.8 TB/s. NVIDIA는 공급 다변화와 가격 레버리지가 필요하고, 마이크론은 HBM 믹스를 올려 ASP를 Milky Way급으로 끌어올린다. 일부 보도는 특정 Rubin SKU에서 마이크론 비참여를 말하지만, GTC 2026 기준 마이크론은 Rubin용 HVM을 명시했다. SKU·분기별로 공급 맵이 바뀐다.

그 외. AMD, Broadcom, 클라우드 ASIC(Google/Amazon/Microsoft)도 HBM4·cHBM 수요자. 중국 가속기는 수출통제 하에서 HBM 접근이 제한되어 생태계가 더 서구·한국·대만 삼각으로 굳는다. 장비는 하이브리드 본더, CMP, 고단 몰드, CoWoS 인터포저가 메모리 캡엑스를 로직 패키징 캡엑스로 전염시킨다.

실무 체크리스트 (아키텍트·패키징·시스템)

GPU 보드: 스택 수 × 핀레이트 = 종이 BW. 전원 메시·SSN·CoWoS 열로 깎인 실측 BW를 요구할 것.

베이스 다이: 표준 JEDEC PHY인가, 커스텀 D2D인가. 후자면 멀티벤더 HBM 소싱이 어려워진다.

본딩: 16-Hi가 필요하면 오늘 하이닉스 MR-MUF vs 내일 삼성 HCB 일정을 따로 평가.

신뢰성: 워피지 스펙, 파워 사이클, HBM 리페어 맵, 큐브 중앙 온도.

시스템: 학습은 HBM4, 거대 KV 추론은 HBM + CXL 풀 계층. CXL을 HBM 대체로 쓰면 실패한다.

공급: 2026년 HBM4는 솔드아웃 언어가 반복된다. 설계 윈도는 패키징 슬롯이 닫는다.

🔗 관련 링크

핸드북 내부 연계 학습:

메모리 기초 및 적층 기술: 4.1 DRAM VCT · 4.2 ZAZ 커패시터 및 HBM 패키징

첨단 인터커넥트 및 로직 연계: 0.6 실리콘 관통 전극(TSV) · 3.5 후면 전력 공급망(BSPDN) · 6.2 첨단 패키징 독점 생태계

JEDEC HBM4: JESD270-4 공지 (High Bandwidth Memory DRAM, 2048-bit, 2025-04; 4A 2025-12)

SK hynix 16-Hi HBM4 (CES 2026): Tom’s Hardware

SemiAnalysis, HBM 로드맵·높이 완화: Scaling the Memory Wall

본딩 3트랙 (MR-MUF / NCF / HCB): SemiHub HBM Series #4

Samsung CXL 메모리 풀링 (CMM-D, KV cache): Breaking AI Memory Limits with CXL Memory Pooling

CXL Consortium: computeexpresslink.org

TSMC CoWoS / SoIC 기술 심포지엄 자료 (패키징 피치·수율)

OCP OAM / 데이터센터 가속기 모듈 스펙: opencompute.org

*이 챕터는 2026년 9월 기준 공개 표준·벤더 공칭·업계 보도를 교차했다. 핀레이트·수율·공급 지분은 NVIDIA 퀄 빈과 분기에 따라 움직인다. 설계 확정 전 JEDEC 문서와 해당 벤더 datasheet를 1차 소스로 확인할 것.*

📖
[[00_Handbook_Map|전체 반도체 핸드북 종합 목차(MOC)로 돌아가기]]

연계 실시간 산업 동향

총 6건

※ 해당 개념의 24시간 내 직접 속보가 없어 반도체 공학 편 대표 실시간 공급망 뉴스를 연동합니다.

디일렉10. 2.

SK하이닉스, 세계 최초 16단 HBM4 양산 출하 개시… TSMC CoWoS-L 공정 직결

SK하이닉스가 6세대 HBM4 16단 48GB 모듈 양산에 돌입했다. 베이스 다이에 TSMC 3나노 파운드리 공정을 적용하고 Cu-Cu 하이브리드 본딩을 결합하여 대역폭 2.2TB/s를 달성했다.

HBM4 16단 양산 및 베이스다이 로드맵원문
SemiAnalysis10. 2.

ASML, 차세대 0.55 High-NA EUV 노광기 'EXE:5200' 2026 출하 가속… 인텔·TSMC 14A 도입 경쟁

ASML이 시간당 웨이퍼 220매를 처리하는 0.55 NA High-NA EUV 상용 모델 EXE:5200 양산 라인 가동을 알렸다. 인텔 14A와 TSMC A14 공정의 2026-2027 도입 선점이 가시화된다.

High-NA 0.55NA 노광기 상용 출하원문
전자신문10. 1.

TSMC, 2나노(N2) GAA 공정 양산 수율 70% 돌파… 애플 A19 Pro 전량 단독 생산 확정

TSMC 신주 바오산 20팹의 2nm 나노시트(GAA) 공정 수율이 70%대에 안착하며 애플 차세대 AP A19 Pro 양산에 들어갔다. 고성능 HPC 고객사를 겨냥한 N2P 및 후면전력 A16 준비도 순항 중이다.

2nm GAA 나노시트 양산 수율원문
전자신문10. 1.

석 달 만에 '사상 최대'…'60조' 마이크론, 다음은 '190조' 삼전닉스

미국 메모리 반도체 기업 마이크론테크놀로지가 사상 최대 분기 실적을 기록했다. 인공지능(AI) 데이터센터 투자 확대가 메모리 수요를 끌어올린 결과다. 다음 분기 실적 전망도 시장 기대를 웃돌았다. 메모리 슈퍼사이클에 대한 기대감이 커지는 가운데 시장의 시선은 삼성...

반도체 공급망 관련원문
DIGITIMES Tech10. 1.

TSMC, AI 가속기 수요 폭증에 CoWoS 인터포저 생산능력 월 6.5만 장으로 긴급 증설

엔비디아 블랙웰 및 커스텀 ASIC 수요 확대에 따라 TSMC 타이난 첨단 패키징 6공장의 CoWoS-L/S 라인을 풀가동하고, 2026년 말까지 월 생산능력을 기존 목표치 대비 25% 상향했다.

CoWoS-L 2.5D 인터포저 증설원문
디일렉10. 1.

삼성전기·SKC, 2026 차세대 글라스 기판 파일럿 라인 가동… 대면적 칩렛 패키징 패러다임 전환

유기 기판(FC-BGA)의 휨 현상과 미세 피치 한계를 극복하는 글라스 기판이 양산 검증에 들어갔다. TGV(Through Glass Via) 가공 수율 개선으로 AI 가속기용 기판 공급망 진입이 임박했다.

TGV 글라스 기판 파일럿 양산원문

Deep Dive 연계 학술 논문

총 5편
arXiv:2603.098812026. 3.

4nm FinFET 로직 위에 16MB 저항변화메모리(RRAM)를 적층한 즉시 켜짐(Instant-On) 3D 프로세서

S. Mitra, H.-S. P. Wong, M. M. Sabry et al.

4nm FinFET 상단 배선층에 16MB 비휘발성 RRAM을 모놀리식 3D 적층하여 메모리 버스 지연을 원천 제거하고, 12ns 내에 전체 시스템 체크포인트를 완료하는 무대기 전력 프로세서를 시연했다.

도메인: 반도체 공학 편PDF 원문 열람
arXiv:2603.011802026. 3.

400피코초 초고속 나노결정화 상변화 메모리(PCM) 기반 고밀도 뉴로모픽 시냅스

M. Wuttig, R. Simpson, J. Tominaga et al.

Sb-Te 초격자 박막을 활용하여 1.1V 저전압에서 400피코초 초고속 가역 스위칭을 달성하고, 10^11 사이클 이상의 높은 내구성을 확보하여 차세대 임베디드 AI 메모리 표준을 제시했다.

도메인: 반도체 공학 편PDF 원문 열람
arXiv:2602.051012026. 2.

2.5 TB/s 대역폭 및 Cu-Cu 직접 하이브리드 본딩 기반 16단 48GB HBM4 D램

S. H. Kim, Y. J. Choi, K. H. Lee et al.

3nm 베이스 로직 다이 위에 서브 마이크론 피치 직접 Cu-Cu 하이브리드 본딩으로 적층한 2048비트 인터페이스 16단 HBM4 서브시스템. 스택당 2.5 TB/s의 메모리 대역폭과 1.1 pJ/bit 에너지 효율, 마이크로범프 대비 45% 낮은 열저항을 달성했다.

도메인: 반도체 공학 편PDF 원문 열람
arXiv:2602.051022026. 2.

PAM3 변조 및 온다이 정밀 클록 분주기를 적용한 36 Gbps 초고속 GDDR7 D램

M. K. Park, H. J. Song, J. W. Lee et al.

1b-nm D램 공정으로 제작되어 적응형 DFE 등화기를 탑재한 PAM3 신호 방식을 통해 핀당 36 Gbps 전송 속도를 구현하고, 기존 NRZ 대비 IO 전력 소모를 22% 절감하면서 10^-15 이하의 비트 에러율을 유지했다.

도메인: 반도체 공학 편PDF 원문 열람
arXiv:2602.051052026. 2.

LLM 투기적 디코딩 및 FP8 행렬 연산을 위한 4nm 120 TOPS/W 아날로그 PIM 매크로

C.-X. Xue, T.-H. Chang, M.-F. Chang et al.

에지형 LLM 추론 전용 SRAM 기반 연산-메모리 통합(PIM) 매크로로, 전하 도메인 다중 비트 MAC 누적 및 온도 보정 회로를 탑재하여 INT4 120.4 TOPS/W, FP8 48.2 TOPS/W 전력 효율을 달성했다.

도메인: 반도체 공학 편PDF 원문 열람