کد تخفیف افتتاحیه: TH20

به مناسبت افتتاحیه، با کد تخفیف TH20 از ۲۰٪ تخفیف روی همه سرویس‌ها بهره‌مند شوید. کد را در مرحله پرداخت وارد کنید.

برای اجرای مدل‌های هوش مصنوعی چقدر VRAM نیاز داریم؟ راهنمای مدل‌های ۷B تا ۷۰B

محاسبه VRAM برای هوش مصنوعی و مدل های زبانی بزرگ

جدول محتوا 👇

یکی از پرتکرارترین چالش‌های مهندسان یادگیری ماشین و علاقه‌مندان به هوش مصنوعی، محاسبه دقیق VRAM برای هوش مصنوعی است. در این راهنما، فرمول دقیق محاسبه حافظه کارت گرافیک، جدول مرجع برای مدل‌های محبوب (از 7B تا 70B) و تاثیر طول کانتکست (Context Window) را بررسی می‌کنیم.

فرمول ریاضی محاسبه حجم VRAM مورد نیاز برای استنتاج

حافظه کل مورد نیاز برای اجرای مدل بر روی GPU از مجموع سه بخش تشکیل می‌شود:

Total VRAM = Model Weights Memory + KV Cache Memory + CUDA Runtime Overhead
  • حافظه وزن‌های مدل: به ازای هر ۱ میلیارد پارامتر در دقت FP16 به ۲ گیگابایت VRAM نیاز است. در دقت ۸ بیت (INT8) به ۱ گیگابایت و در دقت ۴ بیت (INT4) به ۰.۵ گیگابایت VRAM نیاز خواهید داشت.
  • سربار ران‌تایم CUDA: کتابخانه‌های PyTorch و درایور انویدیا حدود ۱ الی ۲ گیگابایت حافظه ثابت رزرو می‌کنند.

جدول مرجع VRAM برای مدل‌های 7B، 14B، 32B و 70B

اندازه مدل (Parameters) دقت اصلی (FP16 / ۱۶-bit) کوانتایز ۸-bit (Q8) کوانتایز ۴-bit (Q4_K_M) حداقل کارت گرافیک پیشنهادی
7B / 8B (Llama 3.1, Qwen 2.5) ۱۶ الی ۱۸ GB ۱۰ الی ۱۲ GB ۶ الی ۸ GB NVIDIA RTX ۳۰۶۰ یا RTX ۴۰۹۰
14B (Qwen 2.5 14B) ۳۰ الی ۳۲ GB ۱۸ الی ۲۰ GB ۱۰ الی ۱۲ GB NVIDIA L40S یا RTX ۴۰۹۰
32B (Qwen 2.5 32B) ۶۸ الی ۷۲ GB ۳۶ الی ۴۰ GB ۲۰ الی ۲۴ GB NVIDIA L40S (48GB) یا H100
70B (Llama 3.3 70B) ۱۴۵ الی ۱۶۰ GB ۷۵ الی ۸۵ GB ۴۲ الی ۴۸ GB NVIDIA H100 (80GB) یا ۲ کارت L40S

محاسبه مصرف حافظه KV Cache در کانتکست‌های طولانی

بسیاری از افراد فراموش می‌کنند که با افزایش طول مکالمه (مثلاً از ۸ هزار توکن به ۳۲ هزار یا ۱۲۸ هزار توکن)، مصرف حافظه به شدت جهش پیدا می‌کند. برای یک مدل ۷۰ میلیارد پارامتری با طول کانتکست ۳۲K، حافظه KV Cache می‌تواند به تنهایی بیش از ۲۰ گیگابایت VRAM اضافه مصرف کند. فریم‌ورک‌هایی نظیر vLLM با الگوریتم PagedAttention این مصرف را تا حد زیادی بهینه می‌کنند.

تاثیر کوانتایزیشن (GGUF و AWQ) بر کاهش مصرف VRAM

با تکنیک کوانتایزیشن، وزن‌های مدل بدون افت محسوس هوش و کیفیت پاسخ، فشرده می‌شوند. برای مطالعه عمیق‌تر، مقاله Quantization چیست را مطالعه فرمایید.

راهنمای انتخاب کارت گرافیک انویدیا بر اساس نیاز پروژه

کارت‌های با حافظه ۲۴ گیگابایت برای مدل‌های کوچک تا متوسط عالی هستند، اما برای مدل‌های سنگین و سازمانی نیازمند دسترسی به کارت‌های دیتاسنتری با پهنای باند بالا نظیر NVIDIA H100 80GB HBM3 خواهید بود. مقاله تخصصی GPU Server چیست تفاوت‌های ساختاری این سرورها را بازگو می‌کند.

دسترسی به قدرتمندترین سرورهای GPU در تراست هاست

دیگر نیازی به خرید سخت‌افزارهای گران‌قیمت میلیاردی ندارید. در سرورهای GPU تراست هاست مجهز به کارت‌های انترپرایز H100 و L40S، بارهای کاری هوش مصنوعی خود را با حداکثر سرعت و پایداری اجرا کنید.

سوالات متداول

آیا رم معمولی سیستم (System RAM) می‌تواند جایگزین VRAM شود؟

تنها در فریم‌ورک‌های مبتنی بر پردازنده مرکزی (CPU) مانند اولاما می‌توان از رم سیستم استفاده کرد، اما سرعت پاسخگویی ده‌ها برابر کندتر از VRAM کارت گرافیک خواهد بود.

کدام کارت گرافیک برای مدل Llama ۳.۳ 70B اقتصادی‌تر است؟

استفاده از یک سرور مجهز به کارت انترپرایز L40S 48GB با نسخه ۴ بیتی مدل، یا یک کارت H100 80GB برای بالاترین کیفیت و سرعت پاسخ‌دهی، بهترین گزینه‌ها هستند.

سرور مجازی ابری تراست هاست

مشاوره تراست‌هاست​

با متخصصان و کارشناسان به صورت رایگان!

دیدگاهتان را بنویسید

نشانی ایمیل شما منتشر نخواهد شد. بخش‌های موردنیاز علامت‌گذاری شده‌اند *