پلتفرم هاگینگ فیس (Hugging Face) مرکز اصلی اشتراکگذاری مدلهای هوش مصنوعی متنباز است. در این راهنمای تخصصی، نحوه اجرای مدلهای Hugging Face روی سرور مجهز به کارت گرافیک انویدیا با استفاده از کتابخانه Transformers و فریمورکهای بهینهسازی PyTorch را به صورت گامبهگام بررسی میکنیم.
فهرست مطالب آموزش
آمادهسازی محیط پایتون، PyTorch و درایورهای CUDA
برای شروع به یک محیط ایزوله پایتون بر روی سیستمعامل لینوکس نیاز دارید. دستورات زیر را برای نصب کتابخانههای کلیدی اجرا کنید:
python3 -m venv ai_env
source ai_env/bin/activate
pip install --upgrade pip
pip install torch torchvision torchaudio --index-url https://download.pytorch.org/whl/cu121
pip install transformers accelerate bitsandbytes sentencepiece
دریافت توکن دسترسی Hugging Face و دانلود امن مدلها
برخی مدلهای پیشرفته (مانند سری Llama ۳ یا Gemma) نیازمند تایید لایسنس هستند. با اجرای دستور زیر در ترمینال توکن کاربری خود را لاگین کنید:
huggingface-cli login
کد پایتون برای اجرای مدل با خط لوله pipeline و تسریع GPU
نمونه کد استاندارد و بهینهشده برای اجرای مدل Qwen/Qwen2.5-7B-Instruct بر روی کارت گرافیک:
import torch
from transformers import AutoModelForCausalLM, AutoTokenizer, pipeline
model_id = "Qwen/Qwen2.5-7B-Instruct"
tokenizer = AutoTokenizer.from_pretrained(model_id)
model = AutoModelForCausalLM.from_pretrained(
model_id,
torch_dtype=torch.bfloat16,
device_map="auto"
)
pipe = pipeline(
"text-generation",
model=model,
tokenizer=tokenizer,
max_new_tokens=512,
temperature=0.7
)
prompt = "تفاوت معماری پردازنده CPU و GPU را برای پردازش هوش مصنوعی در دو پاراگراف توضیح بده."
messages = [{"role": "user", "content": prompt}]
formatted_prompt = tokenizer.apply_chat_template(messages, tokenize=False, add_generation_prompt=True)
outputs = pipe(formatted_prompt)
print(outputs[0]["generated_text"])
تکنیکهای بهینهسازی حافظه (device_map=”auto” و bfloat16)
پارامتر device_map="auto" از کتابخانه Accelerate به طور خودکار لایههای مدل را بین حافظه VRAM و در صورت لزوم رم سیستم تقسیم میکند تا از خطای Out of Memory جلوگیری شود. همچنین بارگذاری با دقت torch.bfloat16 مصرف حافظه را به نصف کاهش داده و پایداری عددی بهتری نسبت به FP16 ارائه میدهد. برای محاسبه حجم مورد نیاز کارت گرافیک، مقاله VRAM برای هوش مصنوعی را بخوانید.
افزایش سرعت تولید توکن با FlashAttention-۲
با نصب پکیج FlashAttention، سرعت محاسبات لایه توجه در پردازندههای گرافیکی آمپر و هاپر تا ۳ برابر افزایش مییابد. برای استقرارهای عملیاتی با ترافیک بالا، انتقال مدل از کتابخانه Transformers به موتورهای پرسرعتی مانند vLLM یا Ollama بهترین راهکار است (مقایسه کامل در Ollama یا vLLM).
سرورهای GPU اختصاصی هاگینگ فیس در تراست هاست
اجرای بدون تاخیر مدلهای بزرگ هاگینگ فیس نیازمند سختافزار مدرن با پهنای باند حافظه بالاست. در سرورهای GPU تراست هاست مجهز به کارتهای انترپرایز H100 و L40S، مدلهای هوش مصنوعی خود را با بالاترین سرعت و دسترسی روت کامل اجرا نمایید.
سوالات متداول
آیا دانلود مدلهای هاگینگ فیس از داخل سرور ایران با محدودیت مواجه است؟
به دلیل تحریمهای بینالمللی، دسترسی به دامنههای Hugging Face گاهی با اختلال مواجه میشود. سرورهای GPU تراست هاست با ترافیک مستقیم اینترنت و روتینگ بهینه، دانلود سریع کلیه ریپازیتوریهای AI را بدون محدودیت تضمین میکنند.
برای مدلهای سنگین ۷۰B چگونه میتوان با رم گرافیک کمتر اجرا کرد؟
با استفاده از کوانتایزیشن ۴ بیتی BitsAndBytes یا لود فرمتهای AWQ و GGUF، میتوانید مصرف VRAM را تا ۷۰ درصد کاهش دهید (جزئیات در Quantization چیست).