کد تخفیف افتتاحیه: TH20

به مناسبت افتتاحیه، با کد تخفیف TH20 از ۲۰٪ تخفیف روی همه سرویس‌ها بهره‌مند شوید. کد را در مرحله پرداخت وارد کنید.

آموزش اجرای مدل‌های Hugging Face روی GPU Server

آموزش اجرای مدل های Hugging Face روی سرور GPU

جدول محتوا 👇

پلتفرم هاگینگ فیس (Hugging Face) مرکز اصلی اشتراک‌گذاری مدل‌های هوش مصنوعی متن‌باز است. در این راهنمای تخصصی، نحوه اجرای مدل‌های Hugging Face روی سرور مجهز به کارت گرافیک انویدیا با استفاده از کتابخانه Transformers و فریم‌ورک‌های بهینه‌سازی PyTorch را به صورت گام‌به‌گام بررسی می‌کنیم.

آماده‌سازی محیط پایتون، PyTorch و درایورهای CUDA

برای شروع به یک محیط ایزوله پایتون بر روی سیستم‌عامل لینوکس نیاز دارید. دستورات زیر را برای نصب کتابخانه‌های کلیدی اجرا کنید:

python3 -m venv ai_env
source ai_env/bin/activate
pip install --upgrade pip
pip install torch torchvision torchaudio --index-url https://download.pytorch.org/whl/cu121
pip install transformers accelerate bitsandbytes sentencepiece

دریافت توکن دسترسی Hugging Face و دانلود امن مدل‌ها

برخی مدل‌های پیشرفته (مانند سری Llama ۳ یا Gemma) نیازمند تایید لایسنس هستند. با اجرای دستور زیر در ترمینال توکن کاربری خود را لاگین کنید:

huggingface-cli login

کد پایتون برای اجرای مدل با خط لوله pipeline و تسریع GPU

نمونه کد استاندارد و بهینه‌شده برای اجرای مدل Qwen/Qwen2.5-7B-Instruct بر روی کارت گرافیک:

import torch
from transformers import AutoModelForCausalLM, AutoTokenizer, pipeline

model_id = "Qwen/Qwen2.5-7B-Instruct"

tokenizer = AutoTokenizer.from_pretrained(model_id)
model = AutoModelForCausalLM.from_pretrained(
    model_id,
    torch_dtype=torch.bfloat16,
    device_map="auto"
)

pipe = pipeline(
    "text-generation",
    model=model,
    tokenizer=tokenizer,
    max_new_tokens=512,
    temperature=0.7
)

prompt = "تفاوت معماری پردازنده CPU و GPU را برای پردازش هوش مصنوعی در دو پاراگراف توضیح بده."
messages = [{"role": "user", "content": prompt}]
formatted_prompt = tokenizer.apply_chat_template(messages, tokenize=False, add_generation_prompt=True)

outputs = pipe(formatted_prompt)
print(outputs[0]["generated_text"])

تکنیک‌های بهینه‌سازی حافظه (device_map=”auto” و bfloat16)

پارامتر device_map="auto" از کتابخانه Accelerate به طور خودکار لایه‌های مدل را بین حافظه VRAM و در صورت لزوم رم سیستم تقسیم می‌کند تا از خطای Out of Memory جلوگیری شود. همچنین بارگذاری با دقت torch.bfloat16 مصرف حافظه را به نصف کاهش داده و پایداری عددی بهتری نسبت به FP16 ارائه می‌دهد. برای محاسبه حجم مورد نیاز کارت گرافیک، مقاله VRAM برای هوش مصنوعی را بخوانید.

افزایش سرعت تولید توکن با FlashAttention-۲

با نصب پکیج FlashAttention، سرعت محاسبات لایه توجه در پردازنده‌های گرافیکی آمپر و هاپر تا ۳ برابر افزایش می‌یابد. برای استقرارهای عملیاتی با ترافیک بالا، انتقال مدل از کتابخانه Transformers به موتورهای پرسرعتی مانند vLLM یا Ollama بهترین راهکار است (مقایسه کامل در Ollama یا vLLM).

سرورهای GPU اختصاصی هاگینگ فیس در تراست هاست

اجرای بدون تاخیر مدل‌های بزرگ هاگینگ فیس نیازمند سخت‌افزار مدرن با پهنای باند حافظه بالاست. در سرورهای GPU تراست هاست مجهز به کارت‌های انترپرایز H100 و L40S، مدل‌های هوش مصنوعی خود را با بالاترین سرعت و دسترسی روت کامل اجرا نمایید.

سوالات متداول

آیا دانلود مدل‌های هاگینگ فیس از داخل سرور ایران با محدودیت مواجه است؟

به دلیل تحریم‌های بین‌المللی، دسترسی به دامنه‌های Hugging Face گاهی با اختلال مواجه می‌شود. سرورهای GPU تراست هاست با ترافیک مستقیم اینترنت و روتینگ بهینه، دانلود سریع کلیه ریپازیتوری‌های AI را بدون محدودیت تضمین می‌کنند.

برای مدل‌های سنگین ۷۰B چگونه می‌توان با رم گرافیک کمتر اجرا کرد؟

با استفاده از کوانتایزیشن ۴ بیتی BitsAndBytes یا لود فرمت‌های AWQ و GGUF، می‌توانید مصرف VRAM را تا ۷۰ درصد کاهش دهید (جزئیات در Quantization چیست).

سرور مجازی ابری تراست هاست

مشاوره تراست‌هاست​

با متخصصان و کارشناسان به صورت رایگان!

دیدگاهتان را بنویسید

نشانی ایمیل شما منتشر نخواهد شد. بخش‌های موردنیاز علامت‌گذاری شده‌اند *