H100 در برابر A100: مقایسهی مشخصات، حافظه و کاربرد
مقایسهی H100 و A100 با عددهای رسمی NVIDIA؛ Hopper و Ampere، حافظه و پهنای باند، FP8 و Transformer Engine، NVLink، توان، MIG و انتخاب برای هر کار.
در این صفحه
H100 (معماری Hopper، معرفی در ۲۰۲۲) نسل بعد از A100 (معماری Ampere، تولید انبوه از ۲۰۲۰) است. در نسخهی SXM، طبق datasheetهای NVIDIA، H100 حدود ۳.۲ برابر توان Tensor Core در FP16 و BF16، حدود ۱.۶ برابر پهنای باند حافظه (3.35 TB/s با HBM3 در برابر 2,039 GB/s با HBM2e) و حدود ۳.۵ برابر توان FP64 دارد. H100 از FP8 و Transformer Engine پشتیبانی میکند و A100 ندارد. در عوض A100 کم مصرفتر است (400 وات در برابر تا 700 وات در SXM). ظرفیت حافظه در نسخهی SXM هر دو 80 گیگابایت است، پس با دقت یکسان، مدلی که در A100 80GB جا نمیشود در H100 SXM هم جا نمیشود. برای خرید نو و آموزش یا استنتاج مدلهای زبانی، H100 انتخاب منطقی است؛ A100 وقتی معنی دارد که ناوگان موجود را گسترش میدهید، مدل در 80 گیگابایت جا میشود و به FP8 نیاز ندارید.
جدول مقایسهی H100 SXM و A100 SXM
برای مقایسهی منصفانه، نسخهی SXM هر دو را کنار هم گذاشتهایم؛ این نسخهها روی بردهای HGX نصب میشوند و سقف توان هر GPU را دارند.
| A100 80GB SXM | H100 SXM | |
|---|---|---|
| معماری | Ampere | Hopper |
| فرایند ساخت و ترانزیستور | TSMC 7nm، 54.2 میلیارد | TSMC 4N، 80 میلیارد |
| compute capability | 8.0 | 9.0 |
| حافظه | 80 GB HBM2e | 80 GB HBM3 |
| پهنای باند حافظه | 2,039 GB/s | 3.35 TB/s |
| L2 cache | 40 MB | 50 MB |
| FP64 | 9.7 TFLOPS | 34 TFLOPS |
| FP64 Tensor Core | 19.5 TFLOPS | 67 TFLOPS |
| FP32 | 19.5 TFLOPS | 67 TFLOPS |
| TF32 Tensor Core (dense / sparse) | 156 / 312 TFLOPS | حدود 495 / 989 TFLOPS |
| FP16 و BF16 Tensor Core (dense / sparse) | 312 / 624 TFLOPS | حدود 990 / 1,979 TFLOPS |
| FP8 Tensor Core (dense / sparse) | پشتیبانی نمیشود | حدود 1,979 / 3,958 TFLOPS |
| INT8 Tensor Core (dense / sparse) | 624 / 1,248 TOPS | حدود 1,979 / 3,958 TOPS |
| NVLink | نسل سوم، 600 GB/s | نسل چهارم، 900 GB/s |
| PCIe | Gen4، 64 GB/s | Gen5، 128 GB/s |
| حداکثر TDP | 400 W (نسخهی با خنک کنندگی سفارشی تا 500 W) | تا 700 W (قابل تنظیم) |
| MIG | تا 7 instance با 10 GB | تا 7 instance با 10 GB |
| پلتفرم | HGX A100 با 4، 8 یا 16 GPU؛ DGX A100 | HGX H100 با 4 یا 8 GPU؛ DGX H100 |
عددهای Tensor Core: dense یا sparse
NVIDIA در datasheet فعلی H100 عددهای TF32، FP16، BF16، FP8 و INT8 را با sparsity اعلام میکند (ستارهی زیر جدول). این عددها برای مدلی است که بخشی از وزنهایش با الگوی structured sparsity صفر شده باشد؛ NVIDIA از نسل Ampere این قابلیت را دارد و میگوید برای مدلهای sparse تا 2 برابر کارایی میدهد. بیشتر مدلهای زبانی که دانلود میکنید چنین ساختاری ندارند و عدد واقعی برای آنها عدد dense است که نصف عدد sparse است. در datasheet A100 هر دو عدد کنار هم آمده (مثلاً 312 / 624 برای FP16) و در جدول مقالهی فنی NVIDIA دربارهی Hopper هم عدد sparse دقیقاً دو برابر dense است. عددهای «حدود» در جدول بالا از همین قاعده به دست آمدهاند.
پس اگر در پیشنهاد فروش خواندید «H100 تقریباً 2 petaFLOPS در FP16»، این عدد sparse است. مقایسهی درست dense با dense است: حدود 990 در برابر 312 TFLOPS.
معماری Hopper در برابر Ampere
- Tensor Core نسل چهارم در H100 در برابر نسل سوم در A100، با پشتیبانی از FP8.
- Transformer Engine فقط در H100 (بخش بعد).
- دستورهای DPX در H100 الگوریتمهای برنامه نویسی پویا را طبق NVIDIA تا 7 برابر A100 سریعتر میکنند؛ کاربردش بیشتر در ژنومیک (Smith-Waterman) و مسیریابی است تا مدل زبانی.
- Tensor Memory Accelerator (TMA) در H100 بلوکهای بزرگ داده را بین حافظهی سراسری و shared memory با سربار آدرس دهی بسیار کمتر منتقل میکند.
- compute capability: A100 برابر 8.0 و H100 برابر 9.0. CUDA 13.0 همهی معماریها از Turing تا Grace Blackwell را پشتیبانی میکند، پس هر دو کارت در نسخههای فعلی CUDA پشتیبانی میشوند.
FP8 و Transformer Engine
مهمترین تفاوت نرم افزاری این دو کارت همین است. Transformer Engine ترکیبی از سخت افزار Tensor Core در Hopper و نرم افزار است که به گفتهی NVIDIA برای هر لایهی مدل بین FP8 و 16 بیت انتخاب میکند و تبدیل و مقیاس دهی بین این دو را خودکار انجام میدهد. نتیجه در عمل:
- آموزش: آموزش با FP8 روی H100 ممکن است و روی A100 نیست. A100 در بهترین حالت با BF16 یا TF32 آموزش میدهد.
- استنتاج: مدل FP8 نصف حافظهی مدل 16 بیتی را میگیرد و روی H100 با Tensor Core از نوع FP8 اجرا میشود. در جدول سخت افزار vLLM، روش FP8 W8A8 فقط روی Ada و Hopper پشتیبانی میشود و روی Ampere نه. روی A100، vLLM وزن FP8 را فقط با kernel از نوع Marlin (weight-only) اجرا میکند؛ حافظه صرفه جویی میشود، ولی محاسبه با FP8 انجام نمیشود.
اگر برنامه دارید مدلهایی را اجرا کنید که سازندهشان نسخهی FP8 منتشر کرده است، این تفاوت از هر عدد جدول مهمتر است. مقایسهی ابزارهای سرویس دهی را در Ollama، vLLM و llama.cpp ببینید.
حافظه و پهنای باند
ظرفیت در نسخههای اصلی یکی است: 80 گیگابایت. پس با دقت یکسان، اندازهی مدلی که روی یک GPU جا میشود فرقی نمیکند. تفاوت در پهنای باند است:
- H100 SXM با HBM3 به 3.35 TB/s میرسد و A100 80GB SXM با HBM2e به 2,039 GB/s؛ حدود 1.6 برابر.
- در مرحلهی تولید توکن (decode) که به پهنای باند حافظه محدود است، سرعت تقریباً به همین نسبت بالا میرود. در مرحلهی پردازش prompt (prefill) که به توان محاسباتی وابسته است، فاصله بیشتر است.
روش حساب حافظهی مدل و KV cache و رابطهی پهنای باند با سرعت تولید توکن در سخت افزار لازم برای اجرای LLM روی سرور آمده است. اگر 80 گیگابایت کم است، H200 همان تراشهی Hopper با 141 گیگابایت HBM3e است (مقایسهی H100 و H200).
فرم فکتورها: SXM، PCIe و NVL
| A100 40GB PCIe | A100 80GB PCIe | H100 PCIe | H100 NVL | |
|---|---|---|---|---|
| حافظه | 40 GB HBM2 | 80 GB HBM2e | 80 GB HBM2e | 94 GB HBM3 |
| پهنای باند | 1,555 GB/s | 1,935 GB/s | 2,000 GB/s | 3.9 TB/s |
| حداکثر TDP | 250 W | 300 W | 350 W | 350 تا 400 W |
| NVLink | bridge برای دو کارت، 600 GB/s | bridge برای دو کارت، 600 GB/s | bridge برای دو کارت، 600 GB/s | 600 GB/s |
| MIG | 7 × 5 GB | 7 × 10 GB | تا 7 instance | 7 × 12 GB |
- SXM: ماژولی است که فقط روی برد HGX و در سرورهای مخصوص آن نصب میشود. سقف توان و NVLink کامل را دارد.
- PCIe: کارت برای سرورهای معمولی. H100 PCIe طبق product brief شرکت NVIDIA کارت دو اسلات تمام قد (FHFL) با هیت سینک passive است که به جریان هوای سرور وابسته است؛ حافظهی HBM2e و کانکتور برق 16-pin از نوع PCIe CEM 5.0 دارد و bridgeهای NVLink آن همان bridgeهای A100 PCIe است. در datasheet فعلی H100، این نسخه جای خود را به H100 NVL داده است.
- H100 NVL: کارت PCIe دو اسلات با خنک کنندگی هوا، 94 گیگابایت HBM3 و پهنای باند 3.9 TB/s، یعنی حتی بیشتر از نسخهی SXM (3.35 TB/s). توان FP16 آن حدود 835 TFLOPS به صورت dense (1,671 با sparsity) است. NVIDIA آن را برای استنتاج مدلهای زبانی تا حدود 70 میلیارد پارامتر در سرورهای معمولی معرفی میکند و با اشتراک پنج سالهی NVIDIA AI Enterprise عرضه میشود.
NVLink و چند GPU
H100 هجده لینک NVLink نسل چهارم با مجموع 900 GB/s دارد و A100 دوازده لینک نسل سوم با 600 GB/s. در بردهای HGX، GPUها روی خود برد با NVLink به هم وصلاند. در نسخههای PCIe، NVLink فقط با bridge و فقط بین دو کارت برقرار میشود. NVIDIA برای H100 PCIe توصیه میکند دو کارتی که با bridge به هم وصل میشوند زیر یک CPU یا یک سوییچ PCIe باشند.
این پهنای باند وقتی اهمیت پیدا میکند که مدل را با tensor parallelism بین چند GPU تقسیم کنید، چون در هر لایه داده بین کارتها جابجا میشود. مستندات vLLM برای کارتهای بدون NVLink، pipeline parallelism را پیشنهاد میکند.
MIG و Confidential Computing
هر دو کارت تا ۷ instance ایزولهی MIG میسازند؛ یعنی یک GPU را بین چند کاربر یا سرویس تقسیم میکنید و هر instance حافظه، cache و هستههای جداگانه دارد. تفاوتها:
- اندازهی هر instance: در A100 40GB پنج گیگابایت، در A100 80GB و H100 SXM ده گیگابایت و در H100 NVL دوازده گیگابایت.
- طبق NVIDIA، MIG نسل دوم در H100 برای هر instance حدود 3 برابر توان محاسباتی و نزدیک 2 برابر پهنای باند حافظهی A100 را میدهد.
- Confidential Computing فقط در H100 وجود دارد: محیط اجرای امن (TEE) سخت افزاری که داده و مدل را هنگام پردازش محافظت میکند و در سطح هر instance از MIG هم کار میکند. اگر GPU را بین چند مشتری یا واحد سازمانی با دادهی محرمانه تقسیم میکنید، A100 این لایهی محافظت را ندارد.
توان مصرفی و زیرساخت
- SXM: یک برد HGX با ۸ GPU فقط برای GPUها در A100 حدود 3.2 kW (8 × 400 W) و در H100 تا 5.6 kW (8 × 700 W) مصرف میکند؛ پردازندهها، شبکه و فنها جداست. اگر رک برای A100 طراحی شده، برق و سرمایش آن را برای H100 SXM از نو حساب کنید.
- PCIe: A100 80GB PCIe با 300 W و H100 NVL با 350 تا 400 W. تفاوت کمتر است، ولی سازندهی سرور باید همان کارت را برای همان مدل سرور تأیید کرده باشد.
- کانکتور و جریان هوا: کارتهای PCIe دیتاسنتری passive هستند. کابل برق و شاسی را از سازندهی سرور بگیرید و کارت را فقط در سروری بگذارید که در فهرست پشتیبانی سازنده برای همان کارت آمده است.
وضعیت A100 در ۱۴۰۵
- تولید انبوه A100 در اردیبهشت ۱۳۹۹ (مه ۲۰۲۰) شروع شد و از آن زمان دو نسل Hopper و Blackwell جانشینش شدهاند.
- صفحهی محصول A100 هنوز در سایت NVIDIA هست و A100 (40 و 80 گیگابایت) در NVIDIA AI Enterprise Infra 8 جزو GPUهای پشتیبانی شده است. پشتیبانی V100، نسل قبل از A100، در همین نسخه حذف شد.
- طبق راهنمای پشتیبانی سازمانی NVIDIA، بعد از اعلام پایان فروش (End of Sales) یک محصول، تعهد معمول سرویس دهی NVIDIA پنج سال است، مگر خلافش اعلام شود. تاریخ پایان فروش و پایان پشتیبانی (EOSL) هر مدل را پیش از خرید، کتبی از NVIDIA یا وندور سرور بگیرید.
کدام را انتخاب کنیم
| سناریو | انتخاب | دلیل |
|---|---|---|
| خرید نو برای آموزش یا fine-tune مدل زبانی | H100 SXM | FP8، حدود ۳ برابر توان dense در BF16، NVLink 900 GB/s |
| استنتاج مدلهای جدید با وزن FP8 | H100 (SXM یا NVL) | اجرای FP8 روی Tensor Core؛ A100 فقط weight-only |
| سرور PCIe معمولی، سقف توان حدود 400 W برای هر کارت | H100 NVL | پهنای باند 3.9 TB/s و 94 GB در شاسی PCIe |
| گسترش کلاستر A100 موجود با همان نرم افزار و شبکه | A100 | سخت افزار، image و تنظیمات کلاستر یکسان میماند |
| محاسبات علمی FP64 (شبیه سازی، CFD) | H100 | 67 در برابر 19.5 TFLOPS در FP64 Tensor Core |
| استنتاج مدلهای کوچک و متوسط BF16 یا INT8 با بودجهی محدود و رک کم توان | A100 80GB | مدل در 80 GB جا میشود و هر کارت 300 تا 400 W میگیرد |
| سرویس GPU چند مستأجری با دادهی محرمانه | H100 | Confidential Computing در سطح MIG |
| مدلی که در 80 GB جا نمیشود | H200 یا چند GPU | ظرفیت حافظهی H100 و A100 یکی است |
پیش از تصمیم نهایی، مدل واقعی خودتان را با همان نرم افزار سرویس دهی و طول context واقعی روی هر دو کارت (مثلاً در یک سرویس ابری یا سرور آزمایشی) اجرا کنید و توکن بر ثانیه در هر وات را کنار هم بگذارید. نسبتهای جدول بالا سقف نظریاند و نتیجهی واقعی به مدل، دقت، اندازهی batch و نرم افزار بستگی دارد.
منابع
- NVIDIA H100 Tensor Core GPU www.nvidia.com
- NVIDIA H100 Tensor Core GPU Datasheet (Sep 2024) resources.nvidia.com
- NVIDIA H100 PCIe GPU Product Brief (PB-11133-001_v02) www.nvidia.com
- NVIDIA A100 Tensor Core GPU www.nvidia.com
- NVIDIA A100 Tensor Core GPU Datasheet www.nvidia.com
- NVIDIA Hopper Architecture In-Depth (NVIDIA Technical Blog) developer.nvidia.com
- NVIDIA — CUDA GPU Compute Capability developer.nvidia.com
- CUDA Toolkit 13.0 Release Notes docs.nvidia.com
- NVIDIA AI Enterprise Lifecycle Policy — End of Life Notices docs.nvidia.com
- NVIDIA Enterprise Support and Services User Guide — References and Guidelines docs.nvidia.com
- NVIDIA's New Ampere Data Center GPU in Full Production (NVIDIA, May 2020) www.nvidia.com
- vLLM Documentation — Quantization (Supported Hardware) docs.vllm.ai