پردازنده‌ی گرافیکی / NVIDIA

H100 در برابر A100: مقایسه‌ی مشخصات، حافظه و کاربرد

مقایسه‌ی H100 و A100 با عددهای رسمی NVIDIA؛ Hopper و Ampere، حافظه و پهنای باند، FP8 و Transformer Engine، NVLink، توان، MIG و انتخاب برای هر کار.

نوشته‌ی تیم پیکوگاید ۱۰ دقیقه مطالعه
در این صفحه
  1. جدول مقایسه‌ی H100 SXM و A100 SXM
  2. عددهای Tensor Core: dense یا sparse
  3. معماری Hopper در برابر Ampere
  4. FP8 و Transformer Engine
  5. حافظه و پهنای باند
  6. فرم فکتورها: SXM، PCIe و NVL
  7. NVLink و چند GPU
  8. MIG و Confidential Computing
  9. توان مصرفی و زیرساخت
  10. وضعیت A100 در ۱۴۰۵
  11. کدام را انتخاب کنیم

H100 (معماری Hopper، معرفی در ۲۰۲۲) نسل بعد از A100 (معماری Ampere، تولید انبوه از ۲۰۲۰) است. در نسخه‌ی SXM، طبق datasheetهای NVIDIA، H100 حدود ۳.۲ برابر توان Tensor Core در FP16 و BF16، حدود ۱.۶ برابر پهنای باند حافظه (3.35 TB/s با HBM3 در برابر 2,039 GB/s با HBM2e) و حدود ۳.۵ برابر توان FP64 دارد. H100 از FP8 و Transformer Engine پشتیبانی می‌کند و A100 ندارد. در عوض A100 کم مصرف‌تر است (400 وات در برابر تا 700 وات در SXM). ظرفیت حافظه در نسخه‌ی SXM هر دو 80 گیگابایت است، پس با دقت یکسان، مدلی که در A100 80GB جا نمی‌شود در H100 SXM هم جا نمی‌شود. برای خرید نو و آموزش یا استنتاج مدل‌های زبانی، H100 انتخاب منطقی است؛ A100 وقتی معنی دارد که ناوگان موجود را گسترش می‌دهید، مدل در 80 گیگابایت جا می‌شود و به FP8 نیاز ندارید.

جدول مقایسه‌ی H100 SXM و A100 SXM

برای مقایسه‌ی منصفانه، نسخه‌ی SXM هر دو را کنار هم گذاشته‌ایم؛ این نسخه‌ها روی بردهای HGX نصب می‌شوند و سقف توان هر GPU را دارند.

A100 80GB SXM H100 SXM
معماری Ampere Hopper
فرایند ساخت و ترانزیستور TSMC 7nm، 54.2 میلیارد TSMC 4N، 80 میلیارد
compute capability 8.0 9.0
حافظه 80 GB HBM2e 80 GB HBM3
پهنای باند حافظه 2,039 GB/s 3.35 TB/s
L2 cache 40 MB 50 MB
FP64 9.7 TFLOPS 34 TFLOPS
FP64 Tensor Core 19.5 TFLOPS 67 TFLOPS
FP32 19.5 TFLOPS 67 TFLOPS
TF32 Tensor Core (dense / sparse) 156 / 312 TFLOPS حدود 495 / 989 TFLOPS
FP16 و BF16 Tensor Core (dense / sparse) 312 / 624 TFLOPS حدود 990 / 1,979 TFLOPS
FP8 Tensor Core (dense / sparse) پشتیبانی نمی‌شود حدود 1,979 / 3,958 TFLOPS
INT8 Tensor Core (dense / sparse) 624 / 1,248 TOPS حدود 1,979 / 3,958 TOPS
NVLink نسل سوم، 600 GB/s نسل چهارم، 900 GB/s
PCIe Gen4، 64 GB/s Gen5، 128 GB/s
حداکثر TDP 400 W (نسخه‌ی با خنک کنندگی سفارشی تا 500 W) تا 700 W (قابل تنظیم)
MIG تا 7 instance با 10 GB تا 7 instance با 10 GB
پلتفرم HGX A100 با 4، 8 یا 16 GPU؛ DGX A100 HGX H100 با 4 یا 8 GPU؛ DGX H100

عددهای Tensor Core: dense یا sparse

NVIDIA در datasheet فعلی H100 عددهای TF32، FP16، BF16، FP8 و INT8 را با sparsity اعلام می‌کند (ستاره‌ی زیر جدول). این عددها برای مدلی است که بخشی از وزن‌هایش با الگوی structured sparsity صفر شده باشد؛ NVIDIA از نسل Ampere این قابلیت را دارد و می‌گوید برای مدل‌های sparse تا 2 برابر کارایی می‌دهد. بیشتر مدل‌های زبانی که دانلود می‌کنید چنین ساختاری ندارند و عدد واقعی برای آن‌ها عدد dense است که نصف عدد sparse است. در datasheet A100 هر دو عدد کنار هم آمده (مثلاً 312 / 624 برای FP16) و در جدول مقاله‌ی فنی NVIDIA درباره‌ی Hopper هم عدد sparse دقیقاً دو برابر dense است. عددهای «حدود» در جدول بالا از همین قاعده به دست آمده‌اند.

پس اگر در پیشنهاد فروش خواندید «H100 تقریباً 2 petaFLOPS در FP16»، این عدد sparse است. مقایسه‌ی درست dense با dense است: حدود 990 در برابر 312 TFLOPS.

معماری Hopper در برابر Ampere

  • Tensor Core نسل چهارم در H100 در برابر نسل سوم در A100، با پشتیبانی از FP8.
  • Transformer Engine فقط در H100 (بخش بعد).
  • دستورهای DPX در H100 الگوریتم‌های برنامه نویسی پویا را طبق NVIDIA تا 7 برابر A100 سریع‌تر می‌کنند؛ کاربردش بیشتر در ژنومیک (Smith-Waterman) و مسیریابی است تا مدل زبانی.
  • Tensor Memory Accelerator (TMA) در H100 بلوک‌های بزرگ داده را بین حافظه‌ی سراسری و shared memory با سربار آدرس دهی بسیار کمتر منتقل می‌کند.
  • compute capability: A100 برابر 8.0 و H100 برابر 9.0. CUDA 13.0 همه‌ی معماری‌ها از Turing تا Grace Blackwell را پشتیبانی می‌کند، پس هر دو کارت در نسخه‌های فعلی CUDA پشتیبانی می‌شوند.

FP8 و Transformer Engine

مهم‌ترین تفاوت نرم افزاری این دو کارت همین است. Transformer Engine ترکیبی از سخت افزار Tensor Core در Hopper و نرم افزار است که به گفته‌ی NVIDIA برای هر لایه‌ی مدل بین FP8 و 16 بیت انتخاب می‌کند و تبدیل و مقیاس دهی بین این دو را خودکار انجام می‌دهد. نتیجه در عمل:

  • آموزش: آموزش با FP8 روی H100 ممکن است و روی A100 نیست. A100 در بهترین حالت با BF16 یا TF32 آموزش می‌دهد.
  • استنتاج: مدل FP8 نصف حافظه‌ی مدل 16 بیتی را می‌گیرد و روی H100 با Tensor Core از نوع FP8 اجرا می‌شود. در جدول سخت افزار vLLM، روش FP8 W8A8 فقط روی Ada و Hopper پشتیبانی می‌شود و روی Ampere نه. روی A100، vLLM وزن FP8 را فقط با kernel از نوع Marlin (weight-only) اجرا می‌کند؛ حافظه صرفه جویی می‌شود، ولی محاسبه با FP8 انجام نمی‌شود.

اگر برنامه دارید مدل‌هایی را اجرا کنید که سازنده‌شان نسخه‌ی FP8 منتشر کرده است، این تفاوت از هر عدد جدول مهم‌تر است. مقایسه‌ی ابزارهای سرویس دهی را در Ollama، vLLM و llama.cpp ببینید.

حافظه و پهنای باند

ظرفیت در نسخه‌های اصلی یکی است: 80 گیگابایت. پس با دقت یکسان، اندازه‌ی مدلی که روی یک GPU جا می‌شود فرقی نمی‌کند. تفاوت در پهنای باند است:

  • H100 SXM با HBM3 به 3.35 TB/s می‌رسد و A100 80GB SXM با HBM2e به 2,039 GB/s؛ حدود 1.6 برابر.
  • در مرحله‌ی تولید توکن (decode) که به پهنای باند حافظه محدود است، سرعت تقریباً به همین نسبت بالا می‌رود. در مرحله‌ی پردازش prompt (prefill) که به توان محاسباتی وابسته است، فاصله بیشتر است.

روش حساب حافظه‌ی مدل و KV cache و رابطه‌ی پهنای باند با سرعت تولید توکن در سخت افزار لازم برای اجرای LLM روی سرور آمده است. اگر 80 گیگابایت کم است، H200 همان تراشه‌ی Hopper با 141 گیگابایت HBM3e است (مقایسه‌ی H100 و H200).

فرم فکتورها: SXM، PCIe و NVL

A100 40GB PCIe A100 80GB PCIe H100 PCIe H100 NVL
حافظه 40 GB HBM2 80 GB HBM2e 80 GB HBM2e 94 GB HBM3
پهنای باند 1,555 GB/s 1,935 GB/s 2,000 GB/s 3.9 TB/s
حداکثر TDP 250 W 300 W 350 W 350 تا 400 W
NVLink bridge برای دو کارت، 600 GB/s bridge برای دو کارت، 600 GB/s bridge برای دو کارت، 600 GB/s 600 GB/s
MIG 7 × 5 GB 7 × 10 GB تا 7 instance 7 × 12 GB
  • SXM: ماژولی است که فقط روی برد HGX و در سرورهای مخصوص آن نصب می‌شود. سقف توان و NVLink کامل را دارد.
  • PCIe: کارت برای سرورهای معمولی. H100 PCIe طبق product brief شرکت NVIDIA کارت دو اسلات تمام قد (FHFL) با هیت سینک passive است که به جریان هوای سرور وابسته است؛ حافظه‌ی HBM2e و کانکتور برق 16-pin از نوع PCIe CEM 5.0 دارد و bridgeهای NVLink آن همان bridgeهای A100 PCIe است. در datasheet فعلی H100، این نسخه جای خود را به H100 NVL داده است.
  • H100 NVL: کارت PCIe دو اسلات با خنک کنندگی هوا، 94 گیگابایت HBM3 و پهنای باند 3.9 TB/s، یعنی حتی بیشتر از نسخه‌ی SXM (3.35 TB/s). توان FP16 آن حدود 835 TFLOPS به صورت dense (1,671 با sparsity) است. NVIDIA آن را برای استنتاج مدل‌های زبانی تا حدود 70 میلیارد پارامتر در سرورهای معمولی معرفی می‌کند و با اشتراک پنج ساله‌ی NVIDIA AI Enterprise عرضه می‌شود.

H100 هجده لینک NVLink نسل چهارم با مجموع 900 GB/s دارد و A100 دوازده لینک نسل سوم با 600 GB/s. در بردهای HGX، GPUها روی خود برد با NVLink به هم وصل‌اند. در نسخه‌های PCIe، NVLink فقط با bridge و فقط بین دو کارت برقرار می‌شود. NVIDIA برای H100 PCIe توصیه می‌کند دو کارتی که با bridge به هم وصل می‌شوند زیر یک CPU یا یک سوییچ PCIe باشند.

این پهنای باند وقتی اهمیت پیدا می‌کند که مدل را با tensor parallelism بین چند GPU تقسیم کنید، چون در هر لایه داده بین کارت‌ها جابجا می‌شود. مستندات vLLM برای کارت‌های بدون NVLink، pipeline parallelism را پیشنهاد می‌کند.

MIG و Confidential Computing

هر دو کارت تا ۷ instance ایزوله‌ی MIG می‌سازند؛ یعنی یک GPU را بین چند کاربر یا سرویس تقسیم می‌کنید و هر instance حافظه، cache و هسته‌های جداگانه دارد. تفاوت‌ها:

  • اندازه‌ی هر instance: در A100 40GB پنج گیگابایت، در A100 80GB و H100 SXM ده گیگابایت و در H100 NVL دوازده گیگابایت.
  • طبق NVIDIA، MIG نسل دوم در H100 برای هر instance حدود 3 برابر توان محاسباتی و نزدیک 2 برابر پهنای باند حافظه‌ی A100 را می‌دهد.
  • Confidential Computing فقط در H100 وجود دارد: محیط اجرای امن (TEE) سخت افزاری که داده و مدل را هنگام پردازش محافظت می‌کند و در سطح هر instance از MIG هم کار می‌کند. اگر GPU را بین چند مشتری یا واحد سازمانی با داده‌ی محرمانه تقسیم می‌کنید، A100 این لایه‌ی محافظت را ندارد.

توان مصرفی و زیرساخت

  • SXM: یک برد HGX با ۸ GPU فقط برای GPUها در A100 حدود 3.2 kW (8 × 400 W) و در H100 تا 5.6 kW (8 × 700 W) مصرف می‌کند؛ پردازنده‌ها، شبکه و فن‌ها جداست. اگر رک برای A100 طراحی شده، برق و سرمایش آن را برای H100 SXM از نو حساب کنید.
  • PCIe: A100 80GB PCIe با 300 W و H100 NVL با 350 تا 400 W. تفاوت کمتر است، ولی سازنده‌ی سرور باید همان کارت را برای همان مدل سرور تأیید کرده باشد.
  • کانکتور و جریان هوا: کارت‌های PCIe دیتاسنتری passive هستند. کابل برق و شاسی را از سازنده‌ی سرور بگیرید و کارت را فقط در سروری بگذارید که در فهرست پشتیبانی سازنده برای همان کارت آمده است.

وضعیت A100 در ۱۴۰۵

  • تولید انبوه A100 در اردیبهشت ۱۳۹۹ (مه ۲۰۲۰) شروع شد و از آن زمان دو نسل Hopper و Blackwell جانشینش شده‌اند.
  • صفحه‌ی محصول A100 هنوز در سایت NVIDIA هست و A100 (40 و 80 گیگابایت) در NVIDIA AI Enterprise Infra 8 جزو GPUهای پشتیبانی شده است. پشتیبانی V100، نسل قبل از A100، در همین نسخه حذف شد.
  • طبق راهنمای پشتیبانی سازمانی NVIDIA، بعد از اعلام پایان فروش (End of Sales) یک محصول، تعهد معمول سرویس دهی NVIDIA پنج سال است، مگر خلافش اعلام شود. تاریخ پایان فروش و پایان پشتیبانی (EOSL) هر مدل را پیش از خرید، کتبی از NVIDIA یا وندور سرور بگیرید.

کدام را انتخاب کنیم

سناریو انتخاب دلیل
خرید نو برای آموزش یا fine-tune مدل زبانی H100 SXM FP8، حدود ۳ برابر توان dense در BF16، NVLink 900 GB/s
استنتاج مدل‌های جدید با وزن FP8 H100 (SXM یا NVL) اجرای FP8 روی Tensor Core؛ A100 فقط weight-only
سرور PCIe معمولی، سقف توان حدود 400 W برای هر کارت H100 NVL پهنای باند 3.9 TB/s و 94 GB در شاسی PCIe
گسترش کلاستر A100 موجود با همان نرم افزار و شبکه A100 سخت افزار، image و تنظیمات کلاستر یکسان می‌ماند
محاسبات علمی FP64 (شبیه سازی، CFD) H100 67 در برابر 19.5 TFLOPS در FP64 Tensor Core
استنتاج مدل‌های کوچک و متوسط BF16 یا INT8 با بودجه‌ی محدود و رک کم توان A100 80GB مدل در 80 GB جا می‌شود و هر کارت 300 تا 400 W می‌گیرد
سرویس GPU چند مستأجری با داده‌ی محرمانه H100 Confidential Computing در سطح MIG
مدلی که در 80 GB جا نمی‌شود H200 یا چند GPU ظرفیت حافظه‌ی H100 و A100 یکی است

پیش از تصمیم نهایی، مدل واقعی خودتان را با همان نرم افزار سرویس دهی و طول context واقعی روی هر دو کارت (مثلاً در یک سرویس ابری یا سرور آزمایشی) اجرا کنید و توکن بر ثانیه در هر وات را کنار هم بگذارید. نسبت‌های جدول بالا سقف نظری‌اند و نتیجه‌ی واقعی به مدل، دقت، اندازه‌ی batch و نرم افزار بستگی دارد.

منابع

  1. NVIDIA H100 Tensor Core GPU www.nvidia.com
  2. NVIDIA H100 Tensor Core GPU Datasheet (Sep 2024) resources.nvidia.com
  3. NVIDIA H100 PCIe GPU Product Brief (PB-11133-001_v02) www.nvidia.com
  4. NVIDIA A100 Tensor Core GPU www.nvidia.com
  5. NVIDIA A100 Tensor Core GPU Datasheet www.nvidia.com
  6. NVIDIA Hopper Architecture In-Depth (NVIDIA Technical Blog) developer.nvidia.com
  7. NVIDIA — CUDA GPU Compute Capability developer.nvidia.com
  8. CUDA Toolkit 13.0 Release Notes docs.nvidia.com
  9. NVIDIA AI Enterprise Lifecycle Policy — End of Life Notices docs.nvidia.com
  10. NVIDIA Enterprise Support and Services User Guide — References and Guidelines docs.nvidia.com
  11. NVIDIA's New Ampere Data Center GPU in Full Production (NVIDIA, May 2020) www.nvidia.com
  12. vLLM Documentation — Quantization (Supported Hardware) docs.vllm.ai