دیتاسنتر AI دقیقاً چه تفاوتی با دیتاسنتر معمولی دارد؟
یک دیتاسنتر سنتی ممکن است برای میزبانی وب، پایگاه داده، فایل، مجازیسازی یا سرویسهای سازمانی طراحی شود.
اما در یک دیتاسنتر AI، بخش بزرگی از محاسبات روی GPU یا شتابدهندههای اختصاصی انجام میشود.
این تغییر یک اثر زنجیرهای ایجاد میکند:
GPU بیشتر → مصرف برق بیشتر → گرمای بیشتر → نیاز به خنکسازی قویتر → شبکه سریعتر → طراحی رک متفاوت
به همین دلیل دیگر نمیتوان فقط چند سرور را داخل رک قرار داد و انتظار داشت یک AI Cluster قدرتمند شکل بگیرد.
در معماریهای جدید، حتی خود رک به یک واحد محاسباتی بزرگ تبدیل شده است.
برای نمونه، NVIDIA در معماری NVL72 یک رک کامل را بهعنوان یک واحد محاسباتی با ۷۲ GPU Blackwell Ultra و شبکه داخلی NVLink طراحی کرده است. (docs.nvidia.com)
اجزای اصلی یک AI Data Center
برای اینکه معماری را ساده کنیم، میتوانیم دیتاسنتر AI را به چند لایه تقسیم کنیم:
۱. Compute
پردازندههای CPU و GPU که عملیات اصلی را انجام میدهند.
۲. Memory
حافظههای سریع مانند HBM در کنار GPU و حافظه اصلی سیستم.
۳. Networking
اتصال GPUها به یکدیگر، اتصال سرورها به Storage و ارتباط با شبکه بیرونی.
۴. Storage
ذخیره مدلها، Datasetها، Checkpointها و دادههای عملیاتی.
۵. Cooling
سیستم دفع گرمای تولیدشده توسط GPU، CPU، شبکه و سایر تجهیزات.
۶. Power
توزیع برق، UPS، PDU، Power Shelf و سایر زیرساختهای انرژی.
اگر یکی از این لایهها گلوگاه شود، ظرفیت واقعی کل دیتاسنتر محدود خواهد شد.
HBM چیست و چرا برای AI اهمیت دارد؟
یکی از مهمترین تفاوتهای سرورهای AI، استفاده گسترده از HBM یا High Bandwidth Memory است.
GPU فقط به قدرت محاسباتی نیاز ندارد؛ باید بتواند حجم بزرگی از داده را با سرعت بسیار بالا از حافظه دریافت کند.
اگر محاسبات بسیار سریع باشند اما حافظه نتواند داده را بهموقع تأمین کند، بخشی از توان پردازشی GPU بلااستفاده میماند.
HBM برای همین مسئله طراحی شده است.
در نمونههای NVIDIA HGX B300، هر GPU به ۲۸۸ گیگابایت HBM3e و پهنای باند حافظه تا ۸TB/s میرسد و مجموع حافظه HBM در یک سیستم هشتGPU به حدود ۲.۳۰ ترابایت میرسد. (docs.nvidia.com)
به زبان ساده:
GPU = موتور
HBM = انبار بسیار نزدیک و بسیار سریع
اگر موتور قدرتمند باشد ولی سوخت با سرعت کافی نرسد، تمام قدرت موتور قابل استفاده نیست.
چرا HBM با RAM معمولی یکی نیست؟
HBM را نباید صرفاً نسخه سریعتر DDR5 تصور کنیم.
این نوع حافظه برای قرار گرفتن در نزدیکی GPU و انتقال حجم بسیار زیادی از داده با پهنای باند بالا طراحی شده است.
در معماری AI، معمولاً چند نوع حافظه در کنار هم قرار میگیرند:
HBM روی GPU/شتابدهنده → حافظه اصلی CPU → NVMe Storage → Storage Cluster
هر لایه سرعت، ظرفیت و هزینه متفاوتی دارد.
به همین دلیل طراحی حافظه در AI Data Center یک مسئله معماری است، نه صرفاً انتخاب مقدار RAM.
GPUها چگونه با یکدیگر صحبت میکنند؟
فرض کنید یک مدل AI برای اجرای یک درخواست به چندین GPU نیاز داشته باشد.
اگر GPU شماره ۱ بخواهد دادهای را به GPU شماره ۲ منتقل کند، سرعت این ارتباط اهمیت زیادی دارد.
اینجاست که NVLink وارد معماری میشود.
در نسل پنجم NVLink، NVIDIA امکان ارتباط بسیار پرسرعت بین GPUها را ایجاد کرده و معماری NVL72 میتواند یک دامنه ۷۲-GPU را با NVLink و NVSwitch به شکل یک سیستم چندGPU یکپارچهتر مدیریت کند. (docs.nvidia.com)
این مسئله برای مدلهای بزرگ بسیار مهم است؛ زیرا زمان صرفشده برای جابهجایی داده بین GPUها میتواند روی عملکرد کلی سیستم اثر مستقیم داشته باشد.
NVLink با Ethernet یکی نیست
این دو فناوری نقش یکسانی ندارند.
در یک معماری AI:
NVLink بیشتر برای ارتباط پرسرعت داخل دامنه GPUها و ارتباط Scale-up استفاده میشود.
در مقابل، شبکههای Ethernet یا InfiniBand برای ارتباط بین گرهها، Storage و بخشهای مختلف Cluster استفاده میشوند.
NVIDIA در معماری AI خود حتی شبکهها را به چند بخش تقسیم میکند؛ از جمله شبکه دسترسی، مدیریت و شبکه ارتباطی GPUها. (docs.nvidia.com)
این تفکیک باعث میشود ترافیکهای مختلف یکدیگر را مختل نکنند.
شبکه AI Data Center چرا اینقدر مهم شده است؟
فرض کنید صدها GPU داریم.
اگر شبکه بین آنها کند باشد، GPUها مجبور میشوند منتظر رسیدن داده بمانند.
در نتیجه:
GPU گرانتر ≠ الزاماً AI سریعتر
اگر شبکه، حافظه یا Storage گلوگاه باشند، افزایش تعداد GPUها ممکن است بازده مورد انتظار را ایجاد نکند.
به همین دلیل شبکههای AI به سمت:
- 400GbE
- 800GbE
- InfiniBand
- RDMA
- NVLink
حرکت کردهاند.
در معماری HGX B300، برای هر GPU امکان ارتباط شبکه ۸۰۰Gb/s با ConnectX-8 SuperNIC در نظر گرفته شده است. (docs.nvidia.com)
East-West و North-South در دیتاسنتر AI یعنی چه؟
این دو اصطلاح برای فهم شبکه Cluster بسیار مهماند.
North-South
ترافیک میان کاربران، سرویسها و دیتاسنتر.
مثلاً:
کاربر → API → سرور AI
East-West
ارتباط میان خود تجهیزات داخل دیتاسنتر.
مثلاً:
GPU → GPU → Storage → GPU
در AI Cluster، East-West Traffic اهمیت بسیار زیادی پیدا میکند؛ چون مقدار زیادی داده بین GPUها و گرههای مختلف جابهجا میشود.
به همین دلیل شبکه AI فقط یک اتصال اینترنت سریع نیست.
چرا خنکسازی دیتاسنتر AI متفاوت است؟
GPUهای قدرتمند گرمای زیادی تولید میکنند.
وقتی چندین GPU در یک رک قرار میگیرند، تراکم حرارتی بهشدت افزایش پیدا میکند.
در معماریهای نسل جدید، به همین دلیل Liquid Cooling اهمیت بیشتری پیدا کرده است.
برای نمونه، NVIDIA در معماری NVL72 از طراحی Liquid-Cooled استفاده میکند و همچنین سیستمهای تشخیص نشت مایع را در سطح رک در نظر گرفته است. (docs.nvidia.com)
چرا Air Cooling همیشه کافی نیست؟
هوا ظرفیت محدودی برای انتقال گرما دارد.
وقتی تعداد زیادی GPU با فاصله کم در یک رک قرار گرفتهاند، حجم هوای بسیار زیادی لازم است تا گرما را از سطح تجهیزات دفع کند.
در نتیجه:
تراکم بیشتر → نیاز به جریان هوای بیشتر → فن بزرگتر → مصرف انرژی بیشتر
در یک نقطه، استفاده از مایع از نظر انتقال حرارت منطقیتر میشود.
Liquid Cooling چگونه کار میکند؟
در سیستمهای Liquid Cooling، مایع خنککننده از مسیرهای مشخص در نزدیکی اجزای داغ عبور میکند و گرما را از آنها میگیرد.
یک معماری ساده میتواند اینگونه باشد:
GPU → Cold Plate → Coolant → CDU → Heat Rejection System
مزیت مهم این روش، انتقال مؤثرتر گرما نسبت به هوا در سناریوهای با چگالی بالا است.
اما Liquid Cooling فقط خرید یک سیستم خنککننده نیست.
باید مواردی مانند:
- لولهکشی
- CDU
- پمپ
- تشخیص نشت
- کیفیت مایع
- نگهداری
- افزونگی
از ابتدا در طراحی دیتاسنتر در نظر گرفته شوند.
چرا Rack دیگر فقط یک محفظه فلزی نیست؟
در دیتاسنترهای سنتی، رک بیشتر محل قرار گرفتن سرورها، سوئیچها و کابلهاست.
اما در AI Data Center، رک میتواند تبدیل به یک واحد کامل محاسباتی و انرژی شود.
برای مثال، NVIDIA برای NVL72 یک رک شامل ۷۲ GPU را همراه با NVSwitch، شبکه، Power Shelf و سیستم خنکسازی مایع تعریف کرده است.
حتی توان مورد نیاز یک رک کامل NVL72 میتواند تا حدود ۱۴۲kW برسد. (docs.nvidia.com)
این عدد نشان میدهد چرا طراحی دیتاسنتر AI دیگر شبیه طراحی یک اتاق سرور معمولی نیست.
برق دیتاسنتر AI چه تفاوتی دارد؟
وقتی توان هر رک افزایش پیدا میکند، طراحی برق نیز باید تغییر کند.
در یک معماری AI باید مواردی مثل:
- Busbar
- Power Shelf
- PDU
- UPS
- ژنراتور
- توزیع DC/AC
- افزونگی
- ظرفیت تابلوها
همزمان بررسی شوند.
در نمونه NVL72، NVIDIA از Power Shelfهای 33kW استفاده کرده است و هر رک به چندین Power Shelf مجهز میشود. (docs.nvidia.com)
پس وقتی درباره «یک رک GPU» صحبت میکنیم، در واقع درباره یک زیرساخت انرژی بسیار بزرگ نیز صحبت میکنیم.
Storage در AI Data Center چه نقشی دارد؟
GPUها باید دائماً داده دریافت کنند.
مدل، Dataset، Checkpoint و فایلهای آموزشی میتوانند حجم بسیار بزرگی داشته باشند.
به همین دلیل Storage نیز باید بتواند داده را با سرعت کافی به Cluster برساند.
در معماریهای NVIDIA، علاوه بر Storage اصلی، NVMe Data Cache نیز برای نزدیک کردن داده به Compute استفاده میشود. (docs.nvidia.com)
این یعنی معماری Storage نیز شبیه حافظه چندلایه عمل میکند:
HBM → RAM → NVMe Cache → Shared Storage
هرچه داده به Compute نزدیکتر باشد، دسترسی سریعتر میشود؛ البته هزینه هر لایه نیز افزایش پیدا میکند.
یک AI Data Center را چگونه تصور کنیم؟
اگر بخواهیم کل معماری را بسیار ساده کنیم:
کاربر
↓
Front-End / Tenant Network
↓
AI Cluster
↓
CPU + GPU
↔ HBM
↔ NVLink
↔ High-Speed Network
↔ Storage
↓
Cooling
↓
Power Infrastructure
این اجزا جدا از هم نیستند.
معماری موفق یعنی همه آنها بتوانند همزمان متناسب با یکدیگر رشد کنند.
بزرگترین اشتباه در طراحی AI Data Center چیست؟
اینکه فقط روی GPU تمرکز کنیم.
فرض کنید یک شرکت هزاران GPU خریداری کرده است، اما:
- برق کافی ندارد،
- شبکه مناسب ندارد،
- خنکسازی کافی ندارد،
- Storage کند است،
- یا Rack Density با ساختمان سازگار نیست.
در چنین شرایطی بخشی از سرمایه سختافزاری عملاً بلااستفاده میماند.
به همین دلیل در طراحی AI Data Center باید به Performance per Watt، Performance per Rack و Performance per Dollar همزمان توجه کرد.
آینده معماری دیتاسنترهای AI به کدام سمت میرود؟
روند فعلی را میتوان در چند کلمه خلاصه کرد:
تراکم بیشتر
GPU بیشتری در فضای کمتر.
حافظه سریعتر
HBM با ظرفیت و پهنای باند بالاتر.
شبکه سریعتر
400GbE، 800GbE و نسلهای بعدی.
خنکسازی مایع
برای مقابله با افزایش چگالی حرارتی.
رکهای Rack-Scale
رک دیگر یک محفظه ساده نیست؛ یک واحد محاسباتی یکپارچه است.
معماری مشترک سختافزار و انرژی
طراحی برق، خنکسازی و Compute باید از همان ابتدا با هم انجام شود.
جدول مقایسه معماری سنتی و AI Data Center
| ویژگی | دیتاسنتر سنتی | AI Data Center |
|---|---|---|
| Compute | CPU محور | GPU/Accelerator محور |
| حافظه | RAM و Storage | HBM + RAM + NVMe Cache |
| شبکه | 10/25/100GbE در سناریوهای رایج | 400/800GbE و InfiniBand در مقیاسهای بالا |
| ارتباط Compute | Ethernet/PCIe | NVLink + High-Speed Fabric |
| خنکسازی | عمدتاً Air Cooling | Air + Liquid Cooling |
| تراکم رک | متوسط | بسیار بالا |
| برق هر رک | معمولاً پایینتر | میتواند بسیار بالا باشد |
| معماری رک | سرورمحور | Rack-Scale |
| گلوگاه رایج | CPU/Storage | Compute + Memory + Network + Power + Cooling |
جدول امتیاز اختصاصی ITJOO
این بار برای مقاله، امتیاز را روی بلوغ معماری AI Data Center میگذاریم:
| معیار | امتیاز ITJOO |
| قدرت پردازشی | ⭐⭐⭐⭐⭐ |
| پهنای باند حافظه | ⭐⭐⭐⭐⭐ |
| مقیاسپذیری | ⭐⭐⭐⭐⭐ |
| سرعت شبکه | ⭐⭐⭐⭐⭐ |
| بهرهوری انرژی | ⭐⭐⭐⭐ |
| خنکسازی | ⭐⭐⭐⭐ |
| پیچیدگی طراحی | ⭐⭐ |
| هزینه زیرساخت | ⭐⭐ |
| آمادگی برای AI بزرگمقیاس | ⭐⭐⭐⭐⭐ |
| آیندهپذیری | پ⭐⭐⭐⭐⭐ |
نظر ITJOO:
دیتاسنتر AI دیگر مجموعهای از سرورهای قدرتمند نیست؛ یک سیستم یکپارچه از محاسبات، HBM، شبکه، انرژی و خنکسازی است.
جمعبندی
معماری دیتاسنترهای هوش مصنوعی با دیتاسنترهای سنتی تفاوتی بنیادی پیدا کرده است.
در معماریهای جدید، GPUها باید به حافظهای بسیار سریع مانند HBM3e دسترسی داشته باشند، از طریق فناوریهایی مانند NVLink با یکدیگر ارتباط برقرار کنند و از شبکههایی با ظرفیت صدها گیگابیت بر ثانیه برای ارتباط بین گرهها استفاده کنند. در همین حال، افزایش تراکم پردازشی باعث شده Liquid Cooling و طراحی دقیق زیرساخت برق به بخش مهمی از معماری تبدیل شود. (docs.nvidia.com)
بنابراین اگر بخواهیم معماری یک AI Data Center را در یک جمله خلاصه کنیم:
GPU فقط قلب سیستم است؛ HBM، شبکه، برق و خنکسازی سیستم گردش خون آن هستند.
و هرچه مدلهای AI بزرگتر شوند، اهمیت این اجزا نیز بیشتر خواهد شد.
سوالات متداول
HBM یا High Bandwidth Memory نوعی حافظه با پهنای باند بسیار بالا است که برای تغذیه سریع شتابدهندهها و GPUها در بارهای سنگین استفاده میشود.
زیرا افزایش تراکم GPU باعث افزایش شدید گرمای تولیدشده در رک میشود و در بسیاری از معماریهای متراکم، خنکسازی مایع راهکار مؤثرتری برای دفع این حرارت است. (docs.nvidia.com)
NVLink یک فناوری interconnect پرسرعت برای ارتباط GPUهاست که در معماریهای بزرگ AI امکان ارتباط بسیار سریع بین شتابدهندهها را فراهم میکند.
چون GPUها دائماً داده را میان یکدیگر و Storage جابهجا میکنند و شبکه کند میتواند کل Cluster را محدود کند.
خیر. NVIDIA فقط یکی از نمونههای معماری AI Data Center را ارائه میکند؛ شرکتهای دیگر نیز معماریها و شتابدهندههای متفاوتی دارند.









ارسال دیدگاه
مشاهده دیدگاهها