반도체

AWS-세레브라스 분리형 추론 혁명: 2026년 254억달러 AI 추론 시장 주도권과 Trainium 투자 전략

앙베스트 편집팀
최종 업데이트 2026.08.12 · 사실 확인 완료 · 글 쓰는 원칙

시장분석

엔비디아가 90% 시장점유율로 군림하던 AI 칩 시장에 균열이 생겼다. 2026년 3월 13일, AWS와 세레브라스가 공동 발표한 분리형 추론 아키텍처는 AI 추론 성능을 최대 7.9배 끌어올렸다.

AWS-세레브라스 협력으로 AI 추론 시장의 패러다임이 전환되고 있다. Trainium3(2.52 PFLOPS)과 세레브라스 WSE-3(125 PFLOPS)의 역할 분담 구조는 2030년 254억 달러 규모 AI 추론 시장의 주도권을 AWS에 넘길 가능성을 제시한다. 분리형 아키텍처는 성능을 2배-7.9배 향상시키며, AWS는 2026년 200억 달러 AI 인프라 투자로 엔비디아 의존도를 낮추는 중이다. OpenAI의 1,380억 달러 계약과 Trainium3의 전량 예약 완료는 이 전환이 단순 실험이 아닌 산업 구조 재편임을 증명한다.

AWS Trainium 세레브라스 분리형 추론 아키텍처 시스템 구조도
AWS Trainium과 세레브라스 WSE-3의 prefill-decode 분리 구조가 AI 추론 시장을 재편하고 있다

AWS-세레브라스 협력 발표: 엔비디아 독점 체제의 첫 균열

2026년 3월 13일 발표된 협력은 단순한 파트너십이 아니다. AWS는 Trainium3 칩(2.52 PFLOPS FP8, HBM3e 144GB, 메모리 대역폭 4.9TB/s)을 프리필(prefill) 단계에 투입하고, 세레브라스 WSE-3(125 PFLOPS, 900,000 AI 코어)을 디코드(decode) 단계에 배치하는 분리형 구조를 구축했다.

핵심은 역할 분담이다. Trainium3은 TSMC 3나노 공정(N3P 노드)으로 제조되며, 2025년 12월 AWS re:Invent에서 공개된 후 2026년 중반까지 전량 공급 예약이 완료됐다. GPU 대비 50% 비용 절감 효과를 달성했다.

세레브라스는 엔비디아 B200 대비 19배 많은 4조 트랜지스터를 보유하며, 메모리 대역폭은 21 petabytes/s에 달한다. Llama 3.1 70B 모델 기준 추론 속도는 2,100 tokens/s로 측정됐다.

분리형 추론이 필요한 구조적 이유

AI 추론 과정은 두 단계로 나뉜다. 프리필 단계는 입력 텍스트 전체를 병렬 처리해 컨텍스트를 생성하며, 연산 집약적이다. 디코드 단계는 토큰을 순차적으로 생성하며, 메모리 집약적이다.

기존 단일 GPU 구조는 두 단계를 하나의 칩으로 처리하면서 리소스 비효율이 발생했다. 프리필 단계에서 연산 성능을 100% 활용해도, 디코드 단계에서는 메모리 대역폭 부족으로 병목이 생긴다. 벤치마크 연구에 따르면 분리형 아키텍처는 성능을 2배-7.9배 향상시킨다.

OpenAI 계약이 증명한 시장 신뢰도

2026년 3월, OpenAI는 AWS와 8년간 1,380억 달러 계약을 체결했다. Trainium3/4 기반 2GW 용량을 확보하는 내용이다. 같은 기간 세레브라스는 OpenAI와 100억 달러 상업 계약을 체결해 750MW 컴퓨팅 용량을 2028년까지 제공한다.

이는 OpenAI가 엔비디아 단일 의존에서 벗어나 커스텀 ASIC 기반 인프라로 전환하고 있음을 의미한다. AWS 칩 부문 매출 런레이트는 2026년 100억 달러에 도달했으며, Trainium2는 분기별 150% 성장률을 기록 중이다.

254억 달러 AI 추론 시장 전환: Prefill-Decode 분리의 경제학

Markets and Markets 보고서에 따르면 AI 추론 전용 칩 시장은 2025년 106억 달러에서 2030년 254억 달러로 성장한다(CAGR 19.2%). 전체 AI 칩 시장과는 별개로 추론에 특화된 시장 규모다.

Counterpoint Research는 2026년 클라우드 AI ASIC 성장률을 44.6%로 전망한다. 같은 기간 GPU 성장률 16.1%를 3배 가까이 상회하는 수치다. TrendForce에 따르면 클라우드 5대 기업(AWS, Microsoft, Google, Meta, Oracle)의 AI 인프라 투자는 2026년 6,600-6,900억 달러에 달한다.

엔비디아 점유율 90%에서 70%로 하락 전망

Kearney 분석(2025년 10월)에 따르면 엔비디아 AI 칩 시장점유율은 2026년 현재 90%지만, 2030년 70%로 하락할 전망이다. 20%p 하락분은 AWS, Google, Meta의 커스텀 ASIC으로 이동한다.

핵심은 훈련(training)과 추론(inference) 시장의 분화다. 훈련 시장은 여전히 엔비디아 H100/B200이 지배하지만, 추론 시장은 Trainium, Google TPU, Broadcom 커스텀 칩이 침투하고 있다. Broadcom은 AI ASIC 시장 60-80% 점유율로 Google·Meta·OpenAI의 주요 파트너다.

핵심: 추론 시장의 경쟁 구도는 “범용 GPU vs 특화 ASIC” 구도로 재편되며, AWS-세레브라스 협력은 후자의 가능성을 실증한 첫 사례다.

TTFT 개선 97%: 사용자 경험 혁신

분리형 추론 아키텍처의 또 다른 효과는 TTFT(Time To First Token) 개선이다. ShuffleInfer 연구(2026년)에 따르면 분리형 구조는 TTFT를 97% 개선한다. 사용자가 프롬프트 입력 후 첫 응답을 받기까지 시간이 거의 1/30로 줄어드는 것이다.

실시간 대화형 AI 서비스(챗봇, 음성 비서)에서 결정적 차이를 만든다. Amazon Bedrock은 2026년 하반기부터 10만+ 조직에 분리형 추론을 독점 제공할 예정이다. vLLM 분리형 추론 시스템은 이미 Meta·LinkedIn·Mistral·HuggingFace에 프로덕션 배포됐다.

AI 추론 칩 시장 성장률 비교 차트 ASIC 대 GPU
2026년 클라우드 AI ASIC 성장률 44.6%는 GPU 성장률 16.1%를 3배 상회하며 시장 주도권을 빠르게 확보하고 있다

Trainium3 vs 세레브라스 WSE-3 기술 스펙: 역할 분담의 정밀 설계

두 칩의 스펙 차이는 설계 철학의 차이다. Trainium3은 연산 밀도를, WSE-3은 메모리 처리량을 극대화한다.

항목 AWS Trainium3 세레브라스 WSE-3
연산 성능 2.52 PFLOPS FP8 125 PFLOPS
메모리 HBM3e 144GB 온칩 SRAM 44GB
메모리 대역폭 4.9TB/s 21 petabytes/s
코어 수 미공개 900,000 AI 코어
제조 공정 TSMC 3nm (N3P) 웨이퍼 스케일 엔진
역할 Prefill (병렬 연산) Decode (순차 생성)

Trainium3: TSMC 3nm 공정의 연산 밀도

Trainium3은 TSMC N3P 노드로 제조되며, 2026년 1분기 양산이 시작됐다. TrendForce는 2026년 하반기 대량 생산을 전망한다. AWS는 TSMC 3nm 파운드리에 전량 물량을 배정받았다.

HBM3e 144GB 탑재로 대규모 모델의 컨텍스트를 한 번에 처리할 수 있다. 메모리 대역폭 4.9TB/s는 프리필 단계의 병렬 연산 시 데이터 공급 병목을 최소화한다. 전력 효율과 실리콘 설계 최적화로 GPU 대비 50% 비용 절감이 실현됐다.

세레브라스 WSE-3: 메모리 대역폭의 극한

세레브라스는 웨이퍼 스케일 엔진(Wafer Scale Engine) 구조로 엔비디아 B200 대비 19배 많은 4조 트랜지스터를 집적했다. 900,000 AI 코어는 토큰 생성 시 병렬 메모리 액세스를 극대화한다.

메모리 대역폭 21 petabytes/s는 Trainium3의 4.9TB/s 대비 4,000배 이상 높다. 디코드 단계에서 KV 캐시(이전 토큰 컨텍스트)를 초고속으로 읽어오며, Llama 3.1 70B 기준 2,100 tokens/s 속도를 달성한다.

온칩 SRAM 44GB는 외부 메모리 접근 없이 컨텍스트를 보관한다. 메모리 레이턴시를 제거해 디코드 속도를 극대화하는 설계다.

Marvell의 역할: AWS 커스텀 칩 공급망

Counterpoint Research에 따르면 Marvell은 AI ASIC 시장 20-25% 점유율로 AWS·Microsoft의 주요 고객사다. Trainium 시리즈의 일부 컴포넌트는 Marvell이 설계·공급하는 것으로 추정된다. Broadcom(60-80% 점유율)과 함께 AWS의 커스텀 칩 밸류체인을 구성한다.

AWS 200억 달러 AI 인프라 투자와 반도체 밸류체인 재편

AWS는 2026년 AI 인프라에 200억 달러를 투입한다고 발표했다. 이 중 상당 부분이 Trainium3/4 생산과 세레브라스 협력에 배정된다. 투자 규모는 오라클의 2GW 데이터센터 확장 계획과 함께 2026년 클라우드 인프라 전쟁의 핵심 지표다.

낙관 시나리오: AWS가 추론 시장 30% 점유

전제 조건은 다음과 같다. Trainium3가 2026년 하반기 대량 생산에 성공하고, 세레브라스 IPO(Q2 2026 신청 예정, 밸류에이션 230억 달러)가 원활히 진행되며, Amazon Bedrock이 10만+ 조직에 분리형 추론을 독점 제공한다.

2030년 254억 달러 추론 시장에서 AWS는 30% 점유율(약 76억 달러)을 확보할 가능성이 있다. 엔비디아 점유율은 70%에서 60%로 추가 하락하며, 나머지 10%는 Google TPU와 Meta MTIA가 나눠 갖는다.

AWS 칩 부문 매출 런레이트 100억 달러는 Trainium 외부 판매(클라우드 서비스 외 직접 판매)가 본격화되면 2027년 150억 달러까지 확대될 수 있다.

중립 시나리오: 엔비디아 점유율 75% 유지

Trainium3 생산이 예정보다 6개월 지연되거나, 세레브라스 IPO가 CFIUS 심사 재개로 2027년으로 연기되는 경우다. 엔비디아가 GTC 2026(3월 16일 개막)에서 공개한 추론 전용 칩으로 대응에 성공한다.

AWS는 추론 시장 15-20% 점유율에 머물며, 엔비디아는 75% 점유율을 방어한다. Broadcom과 Marvell의 커스텀 ASIC이 나머지 5-10%를 나눠 갖는다.

비관 시나리오: 분리형 추론 운영 복잡도로 채택 지연

분리형 아키텍처는 두 칩 간 데이터 전송과 동기화 오버헤드가 발생한다. vLLM 시스템이 프로덕션 환경에서 안정성 이슈를 겪거나, 개발자 생태계 구축이 지연되면 채택이 늦어질 수 있다.

2030년까지 AWS 점유율은 10% 미만에 머물며, 엔비디아는 80% 이상을 유지한다. 추론 시장 성장률도 CAGR 19.2%에서 15% 내외로 하락한다.

핵심: 낙관 시나리오 실현 여부는 Trainium3 양산 일정(2026년 하반기)과 세레브라스 IPO 성공(Q2 2026) 두 가지 변수에 달려 있다.

투자 전략: HBM·파운드리·ASIC 설계 밸류체인 집중

분리형 추론 혁명은 반도체 밸류체인 전반에 영향을 미친다. 투자 기회는 세 영역에 집중된다.

1. HBM 공급사: SK하이닉스·삼성전자

Trainium3은 HBM3e 144GB를 탑재한다. SK하이닉스와 삼성전자의 HBM4 경쟁은 2026년 핵심 변수다. AWS가 2026년 200억 달러를 투입하면 HBM3e 수요는 급증한다.

SK하이닉스는 엔비디아 H100/B200 독점 공급으로 시장을 선점했지만, Trainium3는 AWS가 직접 설계하므로 삼성전자도 공급 기회를 확보할 가능성이 있다. HBM3e 생산 능력 확대 속도가 투자 판단 기준이다.

2. 파운드리: TSMC

Trainium3은 TSMC 3nm N3P 노드로 생산된다. TrendForce에 따르면 2026년 1분기 양산 시작, 하반기 대량 생산 예정이다. AWS가 전량 예약 완료했으므로, TSMC의 3nm 수율과 생산 속도가 Trainium3 공급 일정을 결정한다.

TSMC는 2nm GAA 공정 전쟁에서도 선두를 달리며, AI 칩 파운드리 시장의 90% 이상을 장악한다. 엔비디아·AWS·Google의 주문이 집중되므로 생산 캐파 확대가 관건이다.

3. ASIC 설계: Broadcom·Marvell

Broadcom은 AI ASIC 시장 60-80% 점유율로 Google·Meta·OpenAI의 커스텀 칩을 설계한다. Marvell은 20-25% 점유율로 AWS·Microsoft를 담당한다. 두 기업은 500억 달러 커스텀 AI 칩 시장을 주도한다.

AWS가 Trainium4, Trainium5로 제품군을 확대하면 Marvell의 설계 매출은 지속 성장한다. Broadcom은 Google TPU v6/v7 설계로 추가 수주를 기대할 수 있다.

포트폴리오 배분 예시: 월 100만 원 기준

  1. HBM 공급사 50% (50만 원): SK하이닉스 30만 원 + 삼성전자 20만 원
  2. 파운드리 30% (30만 원): TSMC ADR 전량
  3. ASIC 설계 20% (20만 원): Broadcom 12만 원 + Marvell 8만 원

리밸런싱 주기는 분기별로 설정하며, Trainium3 양산 일정(2026년 하반기)과 세레브라스 IPO(Q2 2026) 결과에 따라 비중을 조정한다. 낙관 시나리오 실현 시 HBM 비중을 60%로 확대하고, 비관 시나리오 시 엔비디아 편입을 검토한다.

AWS 반도체 투자 밸류체인 구조 다이어그램
AWS 200억 달러 투자는 HBM·파운드리·ASIC 설계 밸류체인 전반에 수요를 창출하며 반도체 생태계를 재편한다

리스크 분석: 엔비디아 반격과 세레브라스 IPO 변수

투자 판단 전 두 가지 핵심 리스크를 확인해야 한다.

리스크 1: 엔비디아 GTC 2026 추론 칩 공개

엔비디아는 2026년 3월 16일 GTC 2026을 개막하며, AI 추론 전용 칩을 공개할 예정이다. 기존 H100/B200은 훈련과 추론을 모두 처리하는 범용 설계지만, 새 칩은 추론에 특화된 구조로 비용 효율을 높일 가능성이 있다.

엔비디아가 Trainium3 대비 동등하거나 우수한 성능을 유지하면서 가격을 낮추면, AWS의 시장 침투는 지연된다. CUDA 생태계와 개발자 네트워크는 여전히 압도적이므로, 전환 비용이 기술적 우위를 상쇄할 수 있다.

리스크 2: 세레브라스 IPO 지연 또는 밸류에이션 조정

세레브라스는 2026년 Q2 IPO를 신청할 예정이며, Series H 펀딩에서 밸류에이션 230억 달러를 달성했다. 하지만 CFIUS(미국 외국인투자위원회) 심사가 완료돼야 IPO가 진행된다.

2025년 12월 G42(UAE 국부펀드)가 세레브라스 지분을 매각한 것은 CFIUS 우려 때문이다. 추가 심사가 발생하거나, 시장 상황 악화로 IPO가 연기되면 세레브라스의 생산 캐파 확대는 지연된다. AWS-세레브라스 협력의 확장성도 타격을 받는다.

대응 전략: 분산 투자와 시나리오별 리밸런싱

엔비디아 리스크에 대응하려면 포트폴리오에 엔비디아를 10-15% 편입해 헤지한다. GTC 2026 발표 내용을 확인한 후 비중을 조정한다. 세레브라스 IPO 리스크는 HBM·파운드리 비중을 높여 간접 노출을 유지하는 방식으로 완화한다.

자주 묻는 질문

AWS Trainium3과 엔비디아 H100의 차이는 무엇인가요?

Trainium3은 AI 추론의 프리필 단계에 특화된 설계로, 2.52 PFLOPS FP8 연산 성능과 HBM3e 144GB를 탑재합니다. H100은 훈련과 추론을 모두 처리하는 범용 GPU입니다. Trainium3은 GPU 대비 50% 비용 절감 효과를 제공하며, 추론 전용 워크로드에서 효율이 높습니다. 반면 H100은 CUDA 생태계와 광범위한 소프트웨어 지원으로 범용성에서 우위를 점합니다.

분리형 추론 아키텍처는 왜 성능이 더 높나요?

AI 추론은 프리필(입력 텍스트 병렬 처리)과 디코드(토큰 순차 생성) 두 단계로 나뉩니다. 단일 칩 구조는 두 단계를 한 칩으로 처리하면서 리소스 비효율이 발생합니다. 분리형 구조는 Trainium3이 연산 집약적 프리필을, 세레브라스 WSE-3이 메모리 집약적 디코드를 담당해 각 단계에 최적화된 하드웨어를 투입합니다. 벤치마크 연구에 따르면 성능은 2배-7.9배 향상되며, ShuffleInfer 연구에서는 TTFT(첫 토큰까지 시간)가 97% 개선됐습니다.

세레브라스 IPO는 언제 진행되나요?

세레브라스는 2026년 Q2(4-6월) IPO를 신청할 예정입니다. 2026년 2월 Series H 펀딩에서 밸류에이션 230억 달러를 달성했으며, CFIUS 심사 완료 후 진행됩니다. 2025년 12월 G42가 지분을 매각한 것은 CFIUS 우려 때문이며, 추가 심사 발생 시 일정이 지연될 가능성이 있습니다. IPO 성공 여부는 AWS-세레브라스 협력의 확장성과 직결되므로, 투자자는 Q2 신청 결과를 주시해야 합니다.

HBM 투자 시 SK하이닉스와 삼성전자 중 어느 쪽이 유리한가요?

SK하이닉스는 엔비디아 H100/B200에 HBM3e를 독점 공급하며 시장을 선점했습니다. 삼성전자는 AWS Trainium3 공급 기회를 확보할 가능성이 있으며, HBM4 양산 경쟁에서 추격 중입니다. 단기적으로는 SK하이닉스가 엔비디아 물량으로 안정적 매출을 확보하지만, 장기적으로는 삼성전자가 AWS·Google 등 다변화된 고객사를 확보하면 리스크 분산 효과가 있습니다. 포트폴리오에서는 SK하이닉스 60%, 삼성전자 40% 비중으로 양사를 모두 편입하는 것이 합리적입니다.

엔비디아 점유율 하락은 투자 매력도 감소를 의미하나요?

아닙니다. 엔비디아 점유율은 2026년 90%에서 2030년 70%로 하락하지만, AI 칩 시장 자체가 연평균 19.2% 성장하므로 절대 매출은 증가합니다. 점유율 하락은 AWS·Google·Meta의 커스텀 ASIC 채택으로 인한 것이며, 훈련 시장에서는 여전히 엔비디아가 지배적입니다. 투자 전략은 “엔비디아 vs AWS” 이분법이 아니라, 밸류체인 전반(HBM·파운드리·ASIC 설계)에 분산 투자하며 엔비디아를 헤지 수단으로 10-15% 편입하는 것입니다.

앙베스트 편집팀 · 산업분석 에디터

본 콘텐츠는 투자 정보 제공을 목적으로 작성되었으며, 특정 금융상품에 대한 투자 자문이 아닙니다. 모든 투자 판단과 그에 따른 결과는 투자자 본인의 책임이며, 투자 전 전문가 상담을 권장합니다.

이 포스팅은 쿠팡 파트너스 활동의 일환으로, 이에 따른 일정액의 수수료를 제공받습니다.

이 글이 도움이 됐어요?

Written by

앙베스트 편집팀

어려운 돈 얘기, 어린이도 이해할 수 있게 도와드려요

이 콘텐츠가 만들어지는 방식 · 편집 원칙 →