Web Analytics Made Easy - Statcounter

راهنمای کامل معماری دیتاسنترهای هوش مصنوعی؛ HBM، خنک‌سازی و شبکه چگونه کنار هم کار می‌کنند؟

دیتاسنترهای هوش مصنوعی دیگر شباهت زیادی به سرورروم‌های سنتی ندارند. در یک زیرساخت AI مدرن، GPU، حافظه HBM، شبکه پرسرعت، خنک‌سازی مایع، برق و ذخیره‌سازی باید مانند یک سیستم واحد طراحی شوند. در معماری‌های جدید NVIDIA، برای نمونه، یک رک NVL72 می‌تواند ۷۲ GPU را با NVLink به هم متصل کند، از صدها گیگابایت تا بیش از یک ترابایت HBM در هر مجموعه پردازشی استفاده کند و به شبکه‌های ۸۰۰Gb/s مجهز شود.

AI data center architecture
AI data center architecture

دیتاسنتر AI دقیقاً چه تفاوتی با دیتاسنتر معمولی دارد؟

یک دیتاسنتر سنتی ممکن است برای میزبانی وب، پایگاه داده، فایل، مجازی‌سازی یا سرویس‌های سازمانی طراحی شود.

اما در یک دیتاسنتر AI، بخش بزرگی از محاسبات روی GPU یا شتاب‌دهنده‌های اختصاصی انجام می‌شود.

این تغییر یک اثر زنجیره‌ای ایجاد می‌کند:

GPU بیشتر → مصرف برق بیشتر → گرمای بیشتر → نیاز به خنک‌سازی قوی‌تر → شبکه سریع‌تر → طراحی رک متفاوت

به همین دلیل دیگر نمی‌توان فقط چند سرور را داخل رک قرار داد و انتظار داشت یک AI Cluster قدرتمند شکل بگیرد.

در معماری‌های جدید، حتی خود رک به یک واحد محاسباتی بزرگ تبدیل شده است.

برای نمونه، NVIDIA در معماری NVL72 یک رک کامل را به‌عنوان یک واحد محاسباتی با ۷۲ GPU Blackwell Ultra و شبکه داخلی NVLink طراحی کرده است. (docs.nvidia.com)

اجزای اصلی یک AI Data Center

برای اینکه معماری را ساده کنیم، می‌توانیم دیتاسنتر AI را به چند لایه تقسیم کنیم:

۱. Compute

پردازنده‌های CPU و GPU که عملیات اصلی را انجام می‌دهند.

۲. Memory

حافظه‌های سریع مانند HBM در کنار GPU و حافظه اصلی سیستم.

۳. Networking

اتصال GPUها به یکدیگر، اتصال سرورها به Storage و ارتباط با شبکه بیرونی.

۴. Storage

ذخیره مدل‌ها، Datasetها، Checkpointها و داده‌های عملیاتی.

۵. Cooling

سیستم دفع گرمای تولیدشده توسط GPU، CPU، شبکه و سایر تجهیزات.

۶. Power

توزیع برق، UPS، PDU، Power Shelf و سایر زیرساخت‌های انرژی.

اگر یکی از این لایه‌ها گلوگاه شود، ظرفیت واقعی کل دیتاسنتر محدود خواهد شد.

HBM چیست و چرا برای AI اهمیت دارد؟

یکی از مهم‌ترین تفاوت‌های سرورهای AI، استفاده گسترده از HBM یا High Bandwidth Memory است.

GPU فقط به قدرت محاسباتی نیاز ندارد؛ باید بتواند حجم بزرگی از داده را با سرعت بسیار بالا از حافظه دریافت کند.

اگر محاسبات بسیار سریع باشند اما حافظه نتواند داده را به‌موقع تأمین کند، بخشی از توان پردازشی GPU بلااستفاده می‌ماند.

HBM برای همین مسئله طراحی شده است.

در نمونه‌های NVIDIA HGX B300، هر GPU به ۲۸۸ گیگابایت HBM3e و پهنای باند حافظه تا ۸TB/s می‌رسد و مجموع حافظه HBM در یک سیستم هشت‌GPU به حدود ۲.۳۰ ترابایت می‌رسد. (docs.nvidia.com)

به زبان ساده:

GPU = موتور

HBM = انبار بسیار نزدیک و بسیار سریع

اگر موتور قدرتمند باشد ولی سوخت با سرعت کافی نرسد، تمام قدرت موتور قابل استفاده نیست.

چرا HBM با RAM معمولی یکی نیست؟

HBM را نباید صرفاً نسخه سریع‌تر DDR5 تصور کنیم.

این نوع حافظه برای قرار گرفتن در نزدیکی GPU و انتقال حجم بسیار زیادی از داده با پهنای باند بالا طراحی شده است.

در معماری AI، معمولاً چند نوع حافظه در کنار هم قرار می‌گیرند:

HBM روی GPU/شتاب‌دهنده → حافظه اصلی CPU → NVMe Storage → Storage Cluster

هر لایه سرعت، ظرفیت و هزینه متفاوتی دارد.

به همین دلیل طراحی حافظه در AI Data Center یک مسئله معماری است، نه صرفاً انتخاب مقدار RAM.

GPUها چگونه با یکدیگر صحبت می‌کنند؟

فرض کنید یک مدل AI برای اجرای یک درخواست به چندین GPU نیاز داشته باشد.

اگر GPU شماره ۱ بخواهد داده‌ای را به GPU شماره ۲ منتقل کند، سرعت این ارتباط اهمیت زیادی دارد.

اینجاست که NVLink وارد معماری می‌شود.

در نسل پنجم NVLink، NVIDIA امکان ارتباط بسیار پرسرعت بین GPUها را ایجاد کرده و معماری NVL72 می‌تواند یک دامنه ۷۲-GPU را با NVLink و NVSwitch به شکل یک سیستم چندGPU یکپارچه‌تر مدیریت کند. (docs.nvidia.com)

این مسئله برای مدل‌های بزرگ بسیار مهم است؛ زیرا زمان صرف‌شده برای جابه‌جایی داده بین GPUها می‌تواند روی عملکرد کلی سیستم اثر مستقیم داشته باشد.

NVLink با Ethernet یکی نیست

این دو فناوری نقش یکسانی ندارند.

در یک معماری AI:

NVLink بیشتر برای ارتباط پرسرعت داخل دامنه GPUها و ارتباط Scale-up استفاده می‌شود.

در مقابل، شبکه‌های Ethernet یا InfiniBand برای ارتباط بین گره‌ها، Storage و بخش‌های مختلف Cluster استفاده می‌شوند.

NVIDIA در معماری AI خود حتی شبکه‌ها را به چند بخش تقسیم می‌کند؛ از جمله شبکه دسترسی، مدیریت و شبکه ارتباطی GPUها. (docs.nvidia.com)

این تفکیک باعث می‌شود ترافیک‌های مختلف یکدیگر را مختل نکنند.

شبکه AI Data Center چرا این‌قدر مهم شده است؟

فرض کنید صدها GPU داریم.

اگر شبکه بین آنها کند باشد، GPUها مجبور می‌شوند منتظر رسیدن داده بمانند.

در نتیجه:

GPU گران‌تر ≠ الزاماً AI سریع‌تر

اگر شبکه، حافظه یا Storage گلوگاه باشند، افزایش تعداد GPUها ممکن است بازده مورد انتظار را ایجاد نکند.

به همین دلیل شبکه‌های AI به سمت:

  • 400GbE
  • 800GbE
  • InfiniBand
  • RDMA
  • NVLink

حرکت کرده‌اند.

در معماری HGX B300، برای هر GPU امکان ارتباط شبکه ۸۰۰Gb/s با ConnectX-8 SuperNIC در نظر گرفته شده است. (docs.nvidia.com)

East-West و North-South در دیتاسنتر AI یعنی چه؟

این دو اصطلاح برای فهم شبکه Cluster بسیار مهم‌اند.

North-South

ترافیک میان کاربران، سرویس‌ها و دیتاسنتر.

مثلاً:

کاربر → API → سرور AI

East-West

ارتباط میان خود تجهیزات داخل دیتاسنتر.

مثلاً:

GPU → GPU → Storage → GPU

در AI Cluster، East-West Traffic اهمیت بسیار زیادی پیدا می‌کند؛ چون مقدار زیادی داده بین GPUها و گره‌های مختلف جابه‌جا می‌شود.

به همین دلیل شبکه AI فقط یک اتصال اینترنت سریع نیست.

چرا خنک‌سازی دیتاسنتر AI متفاوت است؟

GPUهای قدرتمند گرمای زیادی تولید می‌کنند.

وقتی چندین GPU در یک رک قرار می‌گیرند، تراکم حرارتی به‌شدت افزایش پیدا می‌کند.

در معماری‌های نسل جدید، به همین دلیل Liquid Cooling اهمیت بیشتری پیدا کرده است.

برای نمونه، NVIDIA در معماری NVL72 از طراحی Liquid-Cooled استفاده می‌کند و همچنین سیستم‌های تشخیص نشت مایع را در سطح رک در نظر گرفته است. (docs.nvidia.com)

چرا Air Cooling همیشه کافی نیست؟

هوا ظرفیت محدودی برای انتقال گرما دارد.

وقتی تعداد زیادی GPU با فاصله کم در یک رک قرار گرفته‌اند، حجم هوای بسیار زیادی لازم است تا گرما را از سطح تجهیزات دفع کند.

در نتیجه:

تراکم بیشتر → نیاز به جریان هوای بیشتر → فن بزرگ‌تر → مصرف انرژی بیشتر

در یک نقطه، استفاده از مایع از نظر انتقال حرارت منطقی‌تر می‌شود.

Liquid Cooling چگونه کار می‌کند؟

در سیستم‌های Liquid Cooling، مایع خنک‌کننده از مسیرهای مشخص در نزدیکی اجزای داغ عبور می‌کند و گرما را از آنها می‌گیرد.

یک معماری ساده می‌تواند این‌گونه باشد:

GPU → Cold Plate → Coolant → CDU → Heat Rejection System

مزیت مهم این روش، انتقال مؤثرتر گرما نسبت به هوا در سناریوهای با چگالی بالا است.

اما Liquid Cooling فقط خرید یک سیستم خنک‌کننده نیست.

باید مواردی مانند:

  • لوله‌کشی
  • CDU
  • پمپ
  • تشخیص نشت
  • کیفیت مایع
  • نگهداری
  • افزونگی

از ابتدا در طراحی دیتاسنتر در نظر گرفته شوند.

چرا Rack دیگر فقط یک محفظه فلزی نیست؟

در دیتاسنترهای سنتی، رک بیشتر محل قرار گرفتن سرورها، سوئیچ‌ها و کابل‌هاست.

اما در AI Data Center، رک می‌تواند تبدیل به یک واحد کامل محاسباتی و انرژی شود.

برای مثال، NVIDIA برای NVL72 یک رک شامل ۷۲ GPU را همراه با NVSwitch، شبکه، Power Shelf و سیستم خنک‌سازی مایع تعریف کرده است.

حتی توان مورد نیاز یک رک کامل NVL72 می‌تواند تا حدود ۱۴۲kW برسد. (docs.nvidia.com)

این عدد نشان می‌دهد چرا طراحی دیتاسنتر AI دیگر شبیه طراحی یک اتاق سرور معمولی نیست.

برق دیتاسنتر AI چه تفاوتی دارد؟

وقتی توان هر رک افزایش پیدا می‌کند، طراحی برق نیز باید تغییر کند.

در یک معماری AI باید مواردی مثل:

  • Busbar
  • Power Shelf
  • PDU
  • UPS
  • ژنراتور
  • توزیع DC/AC
  • افزونگی
  • ظرفیت تابلوها

هم‌زمان بررسی شوند.

در نمونه NVL72، NVIDIA از Power Shelfهای 33kW استفاده کرده است و هر رک به چندین Power Shelf مجهز می‌شود. (docs.nvidia.com)

پس وقتی درباره «یک رک GPU» صحبت می‌کنیم، در واقع درباره یک زیرساخت انرژی بسیار بزرگ نیز صحبت می‌کنیم.

Storage در AI Data Center چه نقشی دارد؟

GPUها باید دائماً داده دریافت کنند.

مدل، Dataset، Checkpoint و فایل‌های آموزشی می‌توانند حجم بسیار بزرگی داشته باشند.

به همین دلیل Storage نیز باید بتواند داده را با سرعت کافی به Cluster برساند.

در معماری‌های NVIDIA، علاوه بر Storage اصلی، NVMe Data Cache نیز برای نزدیک کردن داده به Compute استفاده می‌شود. (docs.nvidia.com)

این یعنی معماری Storage نیز شبیه حافظه چندلایه عمل می‌کند:

HBM → RAM → NVMe Cache → Shared Storage

هرچه داده به Compute نزدیک‌تر باشد، دسترسی سریع‌تر می‌شود؛ البته هزینه هر لایه نیز افزایش پیدا می‌کند.

یک AI Data Center را چگونه تصور کنیم؟

اگر بخواهیم کل معماری را بسیار ساده کنیم:

کاربر

Front-End / Tenant Network

AI Cluster

CPU + GPU

HBM

NVLink

High-Speed Network

Storage

Cooling

Power Infrastructure

این اجزا جدا از هم نیستند.

معماری موفق یعنی همه آنها بتوانند هم‌زمان متناسب با یکدیگر رشد کنند.

بزرگ‌ترین اشتباه در طراحی AI Data Center چیست؟

اینکه فقط روی GPU تمرکز کنیم.

فرض کنید یک شرکت هزاران GPU خریداری کرده است، اما:

  • برق کافی ندارد،
  • شبکه مناسب ندارد،
  • خنک‌سازی کافی ندارد،
  • Storage کند است،
  • یا Rack Density با ساختمان سازگار نیست.

در چنین شرایطی بخشی از سرمایه سخت‌افزاری عملاً بلااستفاده می‌ماند.

به همین دلیل در طراحی AI Data Center باید به Performance per Watt، Performance per Rack و Performance per Dollar هم‌زمان توجه کرد.

آینده معماری دیتاسنترهای AI به کدام سمت می‌رود؟

روند فعلی را می‌توان در چند کلمه خلاصه کرد:

تراکم بیشتر

GPU بیشتری در فضای کمتر.

حافظه سریع‌تر

HBM با ظرفیت و پهنای باند بالاتر.

شبکه سریع‌تر

400GbE، 800GbE و نسل‌های بعدی.

خنک‌سازی مایع

برای مقابله با افزایش چگالی حرارتی.

رک‌های Rack-Scale

رک دیگر یک محفظه ساده نیست؛ یک واحد محاسباتی یکپارچه است.

معماری مشترک سخت‌افزار و انرژی

طراحی برق، خنک‌سازی و Compute باید از همان ابتدا با هم انجام شود.

جدول مقایسه معماری سنتی و AI Data Center

ویژگیدیتاسنتر سنتیAI Data Center
ComputeCPU محورGPU/Accelerator محور
حافظهRAM و StorageHBM + RAM + NVMe Cache
شبکه10/25/100GbE در سناریوهای رایج400/800GbE و InfiniBand در مقیاس‌های بالا
ارتباط ComputeEthernet/PCIeNVLink + High-Speed Fabric
خنک‌سازیعمدتاً Air CoolingAir + Liquid Cooling
تراکم رکمتوسطبسیار بالا
برق هر رکمعمولاً پایین‌ترمی‌تواند بسیار بالا باشد
معماری رکسرورمحورRack-Scale
گلوگاه رایجCPU/StorageCompute + Memory + Network + Power + Cooling

جدول امتیاز اختصاصی ITJOO

این بار برای مقاله، امتیاز را روی بلوغ معماری AI Data Center می‌گذاریم:

معیارامتیاز ITJOO
قدرت پردازشی⭐⭐⭐⭐⭐
پهنای باند حافظه⭐⭐⭐⭐⭐
مقیاس‌پذیری⭐⭐⭐⭐⭐
سرعت شبکه⭐⭐⭐⭐⭐
بهره‌وری انرژی⭐⭐⭐⭐
خنک‌سازی⭐⭐⭐⭐
پیچیدگی طراحی⭐⭐
هزینه زیرساخت⭐⭐
آمادگی برای AI بزرگ‌مقیاس⭐⭐⭐⭐⭐
آینده‌پذیریپ⭐⭐⭐⭐⭐

نظر ITJOO:

دیتاسنتر AI دیگر مجموعه‌ای از سرورهای قدرتمند نیست؛ یک سیستم یکپارچه از محاسبات، HBM، شبکه، انرژی و خنک‌سازی است.

جمع‌بندی

معماری دیتاسنترهای هوش مصنوعی با دیتاسنترهای سنتی تفاوتی بنیادی پیدا کرده است.

در معماری‌های جدید، GPUها باید به حافظه‌ای بسیار سریع مانند HBM3e دسترسی داشته باشند، از طریق فناوری‌هایی مانند NVLink با یکدیگر ارتباط برقرار کنند و از شبکه‌هایی با ظرفیت صدها گیگابیت بر ثانیه برای ارتباط بین گره‌ها استفاده کنند. در همین حال، افزایش تراکم پردازشی باعث شده Liquid Cooling و طراحی دقیق زیرساخت برق به بخش مهمی از معماری تبدیل شود. (docs.nvidia.com)

بنابراین اگر بخواهیم معماری یک AI Data Center را در یک جمله خلاصه کنیم:

GPU فقط قلب سیستم است؛ HBM، شبکه، برق و خنک‌سازی سیستم گردش خون آن هستند.

و هرچه مدل‌های AI بزرگ‌تر شوند، اهمیت این اجزا نیز بیشتر خواهد شد.

سوالات متداول

HBM چیست؟

HBM یا High Bandwidth Memory نوعی حافظه با پهنای باند بسیار بالا است که برای تغذیه سریع شتاب‌دهنده‌ها و GPUها در بارهای سنگین استفاده می‌شود.

چرا AI Data Center به Liquid Cooling نیاز دارد؟

زیرا افزایش تراکم GPU باعث افزایش شدید گرمای تولیدشده در رک می‌شود و در بسیاری از معماری‌های متراکم، خنک‌سازی مایع راهکار مؤثرتری برای دفع این حرارت است. (docs.nvidia.com)

NVLink چیست؟

NVLink یک فناوری interconnect پرسرعت برای ارتباط GPUهاست که در معماری‌های بزرگ AI امکان ارتباط بسیار سریع بین شتاب‌دهنده‌ها را فراهم می‌کند.

چرا شبکه در AI Cluster اهمیت زیادی دارد؟

چون GPUها دائماً داده را میان یکدیگر و Storage جابه‌جا می‌کنند و شبکه کند می‌تواند کل Cluster را محدود کند.

آیا AI Data Center فقط مخصوص NVIDIA است؟

خیر. NVIDIA فقط یکی از نمونه‌های معماری AI Data Center را ارائه می‌کند؛ شرکت‌های دیگر نیز معماری‌ها و شتاب‌دهنده‌های متفاوتی دارند.