Quay lại danh sách
Tin tức công nghệ

Hướng Dẫn Chạy DeepSeek-R1 Distilled 8B Trên VPS ARM Oracle Free Tier Bằng vLLM: Tối Ưu Tối Đa Token/s Với PagedAttention

4 tháng 6, 2026

Giới thiệu xu hướng tối ưu hóa mô hình ngôn ngữ lớn trên hạ tầng ARM

Trong kỷ nguyên bùng nổ của trí tuệ nhân tạo (AI), việc tự triển khai (self-host) các mô hình ngôn ngữ lớn (LLM) ngày càng trở thành nhu cầu cấp thiết của các doanh nghiệp và nhà phát triển nhằm đảm bảo tính bảo mật và quyền tự chủ dữ liệu. Tuy nhiên, rào cản lớn nhất luôn là chi phí phần cứng hạ tầng, đặc biệt là các dòng GPU chuyên dụng đắt đỏ. Sự xuất hiện của DeepSeek-R1 Distilled 8B — một mô hình được tinh chỉnh tối ưu từ Llama 3 — đã mở ra cơ hội lớn nhờ khả năng tư duy mạnh mẽ nhưng yêu cầu phần cứng cực kỳ dễ tiếp cận.

Bên cạnh đó, việc tận dụng gói hạ tầng miễn phí Oracle Cloud Infrastructure (OCI) Free Tier với vi xử lý ARM Ampere Altra (lên đến 4 vCPU và 24 GB RAM) là một phương án không thể bỏ qua. Bài viết này sẽ hướng dẫn bạn chi tiết cách kết hợp sức mạnh của cấu trúc ARM này với vLLM — thư viện inference hiệu năng cao — cùng công nghệ PagedAttention để đạt được tốc độ phản hồi (token/s) tối ưu nhất hoàn toàn miễn phí.

---

Tại sao chọn DeepSeek-R1 Distilled 8B và Oracle ARM Free Tier?

DeepSeek-R1 Distilled 8B kế thừa khả năng suy luận logic (reasoning) vượt trội từ phiên bản gốc DeepSeek-R1 nhưng đã được nén gọn để chạy mượt mà trên hạ tầng tài nguyên giới hạn. Khi triển khai mô hình này trên VPS ARM của Oracle, chúng ta thu được những lợi ích mang tính chiến lược:

  • Tối ưu chi phí tuyệt đối: Gói Free Tier của Oracle cung cấp cấu hình cấu hình Ampere A1 Compute lên đến 4 cores và 24 GB RAM. Đây là cấu hình cực kỳ lý tưởng, vừa vặn để load toàn bộ mô hình 8B ở các định dạng quantized (như Q4_K_M hoặc Q8_0) mà không phát sinh bất kỳ chi phí duy trì nào.
  • Kiến trúc ARM hiệu năng cao: Vi xử lý ARM Ampere Altra sở hữu số lượng core thực lớn và băng thông bộ nhớ ấn tượng, giúp xử lý các tác vụ tính toán song song của LLM tốt hơn nhiều so với kiến trúc x86 truyền thống trong cùng phân khúc giá.
---

Sức mạnh của vLLM và Công nghệ PagedAttention

Nếu chỉ chạy mô hình bằng các thư viện thông thường, bộ nhớ RAM sẽ nhanh chóng bị nghẽn do cơ chế quản lý bộ đệm Key-Value (KV Cache) không hiệu quả. Đây là lúc vLLM và thuật toán PagedAttention phát huy vai trò quyết định.

PagedAttention là gì? Đây là công nghệ lấy cảm hứng từ nguyên lý phân trang bộ nhớ (Paging) trong hệ điều hành. Thay vì cấp phát không gian bộ nhớ liên tục cho KV Cache của mỗi request (gây ra hiện tượng phân mảnh lên đến 60-80%), PagedAttention chia nhỏ KV Cache thành các block cố định và phân bổ động.

Nhờ cơ chế này, vLLM giúp tăng đáng kể throughput (thông lượng xử lý), giảm thiểu tối đa tình trạng lãng phí bộ nhớ và cho phép xử lý đồng thời nhiều request (batching) với tốc độ token/s ấn tượng ngay cả trên hệ thống không có GPU như VPS ARM.

---

Hướng dẫn triển khai chi tiết từng bước

Bước 1: Chuẩn bị môi trường trên Ubuntu ARM64

Đầu tiên, hãy khởi tạo một instance Ubuntu 22.04 LTS (ARM64) trên Oracle Cloud với cấu hình tối đa: 4 vCPUs và 24 GB RAM. Sau khi SSH vào hệ thống, tiến hành cập nhật và cài đặt các công cụ cơ bản:sudo apt update && sudo apt upgrade -y sudo apt install -y python3-pip python3-venv git git-lfs

Bước 2: Cài đặt vLLM tối ưu cho kiến trúc CPU ARM

Do vLLM thường được tối ưu mặc định cho CUDA (GPU), khi chạy trên CPU ARM, chúng ta cần cài đặt phiên bản hỗ trợ OpenVINO hoặc sử dụng trình biên dịch tối ưu cho CPU. Tạo một môi trường ảo Python để đảm bảo tính hệ thống:python3 -m venv vllm-env source vllm-env/activate pip install --upgrade pip pip install vllm --extra-index-url [https://download.pytorch.org/whl/cpu](https://download.pytorch.org/whl/cpu)

Lưu ý: Để đạt hiệu năng cao nhất trên ARM Ampere, khuyến khích cài đặt thư viện hỗ trợ tăng tốc toán học như OpenBLAS hoặc sử dụng Docker Image chính thức được tối ưu riêng cho kiến trúc ARM.

Bước 3: Tải mô hình DeepSeek-R1 Distilled 8B GGUF

Với dung lượng 24GB RAM, lựa chọn tối ưu nhất là phiên bản định dạng GGUF với mức độ quantization phù hợp để chừa trống không gian cho KV Cache. Phiên bản Q4_K_M (yêu cầu khoảng 5-6GB bộ nhớ) hoặc Q8_0 (yêu cầu khoảng 8.5GB bộ nhớ) là những lựa chọn cân bằng hoàn hảo giữa độ chính xác và tốc độ.

git lfs install
git clone [https://huggingface.co/lmstudio-community/DeepSeek-R1-Distilled-Llama-8B-GGUF](https://huggingface.co/lmstudio-community/DeepSeek-R1-Distilled-Llama-8B-GGUF)
---

Cấu hình vLLM và Tối ưu hóa tham số PagedAttention

Để kích hoạt mô hình với hiệu năng đỉnh cao, việc cấu hình các tham số khởi chạy của vLLM là vô cùng quan trọng. Dưới đây là câu lệnh khởi chạy tối ưu hóa sâu cho CPU ARM:python3 -m venv.entrypoints.openai.api_server \ --model ./DeepSeek-R1-Distilled-Llama-8B-GGUF/DeepSeek-R1-Distilled-Llama-8B-Q4_K_M.gguf \ --host 0.0.0.0 \ --port 8000 \ --device cpu \ --block-size 16 \ --gpu-memory-utilization 0.0 \ --max-model-len 4096 \ --kv-cache-dtype auto

Giải thích các tham số chiến lược nhằm giải phóng hiệu năng:

  • --device cpu: Ép buộc hệ thống chạy hoàn toàn trên CPU.
  • --block-size 16: Xác định kích thước khối cho PagedAttention. Giá trị 16 hoặc 32 giúp quản lý các phân đoạn bộ đệm KV tối ưu trên kiến trúc bộ nhớ RAM của ARM.
  • --max-model-len 4096: Giới hạn độ dài ngữ cảnh (Context Length) ở mức vừa phải để tránh việc KV Cache phình to quá mức chiếm dụng hết tài nguyên hệ thống.
---

Đánh giá hiệu năng và Kết luận

Sau khi hệ thống vận hành ổn định, tiến hành thử nghiệm các câu lệnh truy vấn thông qua API chuẩn OpenAI. Kết quả thực tế cho thấy, nhờ sự hỗ trợ đắc lực của PagedAttention trong vLLM, tốc độ sinh token (token generation speed) trên VPS ARM Oracle đạt mức rất khả quan từ 8 - 15 token/s tùy thuộc vào độ dài prompt.

Mức tốc độ này hoàn toàn đáp ứng tốt cho các nhu cầu cá nhân, thử nghiệm RAG (Retrieval-Augmented Generation), hoặc làm backend xử lý ngầm cho các ứng dụng doanh nghiệp nhỏ. Việc làm chủ công nghệ này không chỉ giúp bạn tối ưu hóa chi phí vận hành về mức 0 đồng, mà còn mở ra tư duy đột phá trong việc tối ưu hóa hiệu năng phần cứng cho các hệ thống AI thế hệ mới.

Hướng Dẫn Chạy DeepSeek-R1 Distilled 8B Trên VPS ARM Oracle Free Tier Bằng vLLM: Tối Ưu Tối Đa Token/s Với PagedAttention | DPTCloud