در دنیای مدلهای زبانی بزرگ، دو مرحله اساسی وجود دارد: استنتاج (Inference) که به معنای پاسخدهی به پرامپتهاست، و فاینتیونینگ (Fine-Tuning) که به معنای آموزش تکمیلی مدل روی دادههای اختصاصی است. هر کدام از این مراحل نیازهای سختافزاری متفاوتی دارند.
فهرست مطالب
تعریف Inference و Fine-Tuning
استنتاج صرفاً شامل یک گذر مستقیم (Forward Pass) در شبکه عصبی است، در حالی که فاینتیونینگ نیازمند محاسبه گرادیانها، بهروزرسانی وزنها و گذر معکوس (Backward Pass) است.
تفاوت مصرف VRAM و پردازش
فاینتیونینگ کامل به ۳ تا ۴ برابر VRAM بیشتری نسبت به استنتاج همان مدل نیاز دارد، زیرا حالتهای بهینهساز (Optimizer States) و گرادیانها باید در حافظه ذخیره شوند.
تکنیکهای بهینه LoRA و QLoRA
با تکنیکهای مدرن PEFT نظیر LoRA و QLoRA، تنها درصد بسیار کمی از پارامترها آموزش داده میشوند و میتوان مدلهای بزرگ را روی یک یا دو کارت گرافیک ۲۴ گیگابایتی فاینتیون کرد.
سوالات متداول
آیا برای فاینتیونینگ مدل 8B یک کارت ۲۴ گیگابایتی کافی است؟
با استفاده از QLoRA و دقت ۴ بیتی، بله، یک کارت RTX ۳۰۹۰ یا RTX ۴۰۹۰ با ۲۴ گیگابایت حافظه کاملاً کافی است.
آموزش مدلهای هوش مصنوعی روی سرورهای قدرتمند
برای دسترسی به کارتهای کلاس انترپرایز به بخش سرورهای GPU تراست هاست مراجعه کنید.