یکی از پرتکرارترین چالشهای مهندسان یادگیری ماشین و علاقهمندان به هوش مصنوعی، محاسبه دقیق VRAM برای هوش مصنوعی است. در این راهنما، فرمول دقیق محاسبه حافظه کارت گرافیک، جدول مرجع برای مدلهای محبوب (از 7B تا 70B) و تاثیر طول کانتکست (Context Window) را بررسی میکنیم.
فهرست مطالب
فرمول ریاضی محاسبه حجم VRAM مورد نیاز برای استنتاج
حافظه کل مورد نیاز برای اجرای مدل بر روی GPU از مجموع سه بخش تشکیل میشود:
Total VRAM = Model Weights Memory + KV Cache Memory + CUDA Runtime Overhead
- حافظه وزنهای مدل: به ازای هر ۱ میلیارد پارامتر در دقت FP16 به ۲ گیگابایت VRAM نیاز است. در دقت ۸ بیت (INT8) به ۱ گیگابایت و در دقت ۴ بیت (INT4) به ۰.۵ گیگابایت VRAM نیاز خواهید داشت.
- سربار رانتایم CUDA: کتابخانههای PyTorch و درایور انویدیا حدود ۱ الی ۲ گیگابایت حافظه ثابت رزرو میکنند.
جدول مرجع VRAM برای مدلهای 7B، 14B، 32B و 70B
| اندازه مدل (Parameters) | دقت اصلی (FP16 / ۱۶-bit) | کوانتایز ۸-bit (Q8) | کوانتایز ۴-bit (Q4_K_M) | حداقل کارت گرافیک پیشنهادی |
|---|---|---|---|---|
| 7B / 8B (Llama 3.1, Qwen 2.5) | ۱۶ الی ۱۸ GB | ۱۰ الی ۱۲ GB | ۶ الی ۸ GB | NVIDIA RTX ۳۰۶۰ یا RTX ۴۰۹۰ |
| 14B (Qwen 2.5 14B) | ۳۰ الی ۳۲ GB | ۱۸ الی ۲۰ GB | ۱۰ الی ۱۲ GB | NVIDIA L40S یا RTX ۴۰۹۰ |
| 32B (Qwen 2.5 32B) | ۶۸ الی ۷۲ GB | ۳۶ الی ۴۰ GB | ۲۰ الی ۲۴ GB | NVIDIA L40S (48GB) یا H100 |
| 70B (Llama 3.3 70B) | ۱۴۵ الی ۱۶۰ GB | ۷۵ الی ۸۵ GB | ۴۲ الی ۴۸ GB | NVIDIA H100 (80GB) یا ۲ کارت L40S |
محاسبه مصرف حافظه KV Cache در کانتکستهای طولانی
بسیاری از افراد فراموش میکنند که با افزایش طول مکالمه (مثلاً از ۸ هزار توکن به ۳۲ هزار یا ۱۲۸ هزار توکن)، مصرف حافظه به شدت جهش پیدا میکند. برای یک مدل ۷۰ میلیارد پارامتری با طول کانتکست ۳۲K، حافظه KV Cache میتواند به تنهایی بیش از ۲۰ گیگابایت VRAM اضافه مصرف کند. فریمورکهایی نظیر vLLM با الگوریتم PagedAttention این مصرف را تا حد زیادی بهینه میکنند.
تاثیر کوانتایزیشن (GGUF و AWQ) بر کاهش مصرف VRAM
با تکنیک کوانتایزیشن، وزنهای مدل بدون افت محسوس هوش و کیفیت پاسخ، فشرده میشوند. برای مطالعه عمیقتر، مقاله Quantization چیست را مطالعه فرمایید.
راهنمای انتخاب کارت گرافیک انویدیا بر اساس نیاز پروژه
کارتهای با حافظه ۲۴ گیگابایت برای مدلهای کوچک تا متوسط عالی هستند، اما برای مدلهای سنگین و سازمانی نیازمند دسترسی به کارتهای دیتاسنتری با پهنای باند بالا نظیر NVIDIA H100 80GB HBM3 خواهید بود. مقاله تخصصی GPU Server چیست تفاوتهای ساختاری این سرورها را بازگو میکند.
دسترسی به قدرتمندترین سرورهای GPU در تراست هاست
دیگر نیازی به خرید سختافزارهای گرانقیمت میلیاردی ندارید. در سرورهای GPU تراست هاست مجهز به کارتهای انترپرایز H100 و L40S، بارهای کاری هوش مصنوعی خود را با حداکثر سرعت و پایداری اجرا کنید.
سوالات متداول
آیا رم معمولی سیستم (System RAM) میتواند جایگزین VRAM شود؟
تنها در فریمورکهای مبتنی بر پردازنده مرکزی (CPU) مانند اولاما میتوان از رم سیستم استفاده کرد، اما سرعت پاسخگویی دهها برابر کندتر از VRAM کارت گرافیک خواهد بود.
کدام کارت گرافیک برای مدل Llama ۳.۳ 70B اقتصادیتر است؟
استفاده از یک سرور مجهز به کارت انترپرایز L40S 48GB با نسخه ۴ بیتی مدل، یا یک کارت H100 80GB برای بالاترین کیفیت و سرعت پاسخدهی، بهترین گزینهها هستند.