نرمافزار اولاما به محبوبترین ابزار اجرای محلی مدلهای زبانی تبدیل شده است. در این آموزش جامع، نحوه نصب Ollama روی سرور GPU مبتنی بر سیستمعامل اوبونتو، فعالسازی شتابدهنده سختافزاری NVIDIA CUDA، راهاندازی با کانتینر Docker و ایمنسازی پورت ارتباطی را مرحلهبهمرحله یاد میگیرید.
فهرست مطالب آموزش
گام ۱: نصب درایور انویدیا و NVIDIA Container Toolkit
پیش از هر اقدامی، سرور باید کارت گرافیک را شناسایی کند. برای نصب درایورهای پایدار در Ubuntu دستورات زیر را اجرا کنید:
sudo apt update && sudo apt install -y ubuntu-drivers-common
sudo ubuntu-drivers autoinstall
sudo reboot
پس از ریبوت، با دستور nvidia-smi وضعیت کارت، حافظه VRAM و نسخه درایور را بررسی کنید. سپس تولکیت داکر انویدیا را نصب نمایید:
distribution=$(. /etc/os-release;echo $ID$VERSION_ID)
curl -s -L https://nvidia.github.io/nvidia-docker/gpgkey | sudo apt-key add -
curl -s -L https://nvidia.github.io/nvidia-docker/$distribution/nvidia-docker.list | sudo tee /etc/apt/sources.list.d/nvidia-docker.list
sudo apt update && sudo apt install -y nvidia-container-toolkit
sudo systemctl restart docker
گام ۲: نصب و راهاندازی Ollama روی سرور
سادهترین شیوه برای نصب Ollama روی سرور GPU، اجرای اسکریپت رسمی لینوکس است:
curl -fsSL https://ollama.com/install.sh | sh
این اسکریپت سرویس اولاما را به عنوان یک سرویس پسزمینه systemd فعال میکند که با بالا آمدن سرور به طور خودکار شروع به کار مینماید.
گام ۳: اجرای Ollama با داکر و دسترسی مستقیم به GPU
اگر قصد دارید اولاما را در محیط ایزوله داکر مستقر کنید، از دستور زیر برای ارسال تمام توان GPU به کانتینر استفاده کنید:
docker run -d --gpus=all -v ollama_data:/root/.ollama -p 11434:11434 --name ollama --restart always ollama/ollama
گام ۴: دانلود و اجرای مدلهای فارسی و قدرتمند
اکنون میتوانید مدلهای مدنظر خود را با سرعت دانلود نمایید:
# دانلود مدل سبک و فوق العاده باهوش Llama 3.1
ollama pull llama3.1:8b
# دانلود مدل فوقالعاده Qwen 2.5 با درک عالی زبان فارسی
ollama pull qwen2.5:14b
گام ۵: تنظیم ریورس پروکسی Nginx و اعمال پسورد API
اولاما به صورت پیشفرض احراز هویت ندارد. برای جلوگیری از دسترسی غیرمجاز اینترنت، یک ریورس پروکسی ساده در Nginx با Bearer Token یا Basic Auth پیکربندی کنید. برای مطالعه استانداردهای امنیتی، مقاله امنیت VPS را مطالعه کنید.
سرورهای آماده هوش مصنوعی و GPU در تراست هاست
با سرورهای GPU تراست هاست، درایورهای انویدیا و محیطهای استقرار هوش مصنوعی از پیش پیکربندی شده و آماده تحویل هستند تا بدون دغدغه فنی، مستقیماً به توسعه محصولات خود بپردازید.
سوالات متداول
چگونه مطمئن شویم اولاما از GPU استفاده میکند؟
هنگام ارسال پرامپت، دستور nvidia-smi را در پنجره دیگری اجرا کنید. درصد استفاده از GPU و میزان اشغال VRAM باید افزایش یابد.
آیا اولاما از پردازش چند کلاینت همزمان پشتیبانی میکند؟
اولاما به صورت پیشفرض درخواستها را در صف قرار میدهد. برای ترافیک بالا، فریمورک vLLM گزینه بهتری است (مقایسه کامل در مقاله Ollama یا vLLM).