Hướng Dẫn Tự Dựng Private Hugging Face Space Mirror Trên VPS Việt Nam Với Gitea LFS Và Ollama
Giới thiệu xu hướng tối ưu hóa hạ tầng AI doanh nghiệp
Trong kỷ nguyên bùng nổ của trí tuệ nhân tạo (AI), việc khai thác các mô hình ngôn ngữ lớn (LLM) và các ứng dụng AI mã nguồn mở đã trở thành chiến lược cốt lõi của nhiều doanh nghiệp. Hugging Face Spaces hiện là một trong những nền tảng phổ biến nhất để chia sẻ và thử nghiệm các ứng dụng AI. Tuy nhiên, đối với các doanh nghiệp Việt Nam, việc phụ thuộc hoàn toàn vào hạ tầng đám mây quốc tế đặt ra ba thách thức lớn: độ trễ đường truyền quốc tế (bandwidth latency), nguy cơ đứt cáp quang biển liên tục, và đặc biệt là vấn đề bảo mật dữ liệu nội bộ (data privacy).
Để giải quyết triệt để bài toán này, giải pháp xây dựng một Private Hugging Face Space Mirror ngay trên hạ tầng VPS Việt Nam là một lựa chọn tối ưu. Bài viết này sẽ hướng dẫn chi tiết cách thiết lập hệ thống lưu trữ mã nguồn và mô hình với Gitea LFS, kết hợp cùng Ollama để vận hành và suy luận (inference) các mô hình AI một cách độc lập, an toàn và tốc độ cực cao.
Tại sao nên chọn Gitea LFS và Ollama trên VPS Việt Nam?
Trước khi đi vào các bước triển khai kỹ thuật, chúng ta cần hiểu rõ lý do tại sao bộ đôi công cụ này lại kiến tạo nên một hệ thống Mirror hoàn hảo:
- Gitea & Git LFS (Large File Storage): Gitea là một Git service cực kỳ nhẹ, tiêu tốn rất ít tài nguyên phần cứng (CPU/RAM) so với GitLab nhưng vẫn cung cấp đầy đủ tính năng quản trị. Khi kết hợp với Git LFS, Gitea có khả năng quản lý và lưu trữ các file cấu hình mô hình AI nặng hàng chục Gigabyte một cách mượt mà.
- Ollama: Công cụ quản lý và chạy các mô hình LLM cục bộ (local) tối ưu nhất hiện nay. Ollama giúp đơn giản hóa việc đóng gói, tăng tốc phần cứng (GPU/CPU) và cung cấp API chuẩn xác để các ứng dụng front-end tương tác trực tiếp.
- Ưu thế VPS Việt Nam: Đảm bảo băng thông nội địa luôn ổn định ở mức Gbps, không bị ảnh hưởng bởi sự cố cáp quang quốc tế, đáp ứng các tiêu chuẩn nghiêm ngặt về chủ quyền dữ liệu theo Luật An ninh mạng Việt Nam.
Kiến trúc hệ thống và chuẩn bị tài nguyên
Một hệ thống Private Space Mirror tiêu chuẩn sẽ bao gồm các thành phần luân chuyển dữ liệu như sau:
Hạ tầng mạng nội bộ → VPS Việt Nam → Gitea (Quản lý mã nguồn & Weights mô hình LFS) → Ollama Service (Thực thi suy luận AI) → Web UI / API Gateway.
Để hệ thống vận hành ổn định với các mô hình phổ biến hiện nay như Llama 3 (8B) hoặc Qwen 2.5, doanh nghiệp cần chuẩn bị cấu hình VPS tối thiểu như sau:
- CPU: Tối thiểu 4 Cores (Ưu tiên các dòng chip có xung nhịp cao nếu không có GPU).
- RAM: Tối thiểu 16GB (Để đảm bảo không bị tràn bộ nhớ khi load model).
- Ổ cứng: Tối thiểu 100GB SSD/NVMe (Nên chọn ổ đĩa có tốc độ đọc/ghi cao để load model nhanh hơn).
- Hệ điều hành: Ubuntu Server 22.04 LTS hoặc 24.04 LTS.
Quy trình triển khai chi tiết
Bước 1: Cài đặt và cấu hình Gitea hỗ trợ Git LFS
Cách nhanh nhất và sạch sẽ nhất để triển khai Gitea là sử dụng Docker Compose. Hãy tạo file docker-compose.yml với nội dung cấu hình kích hoạt tính năng LFS như sau:
version: "3"
services:
server:
image: gitea/gitea:latest
container_name: gitea
environment:
- USER_UID=1000
- USER_GID=1000
- GITEA__repository__ENABLE_LFS=true
- GITEA__lfs__PATH=/data/git/lfs
restart: always
volumes:
- ./gitea:/data
- /etc/timezone:/etc/timezone:ro
- /etc/localtime:/etc/localtime:ro
ports:
- "3000:3000"
- "2222:22"
Khởi chạy container bằng lệnh docker compose up -d. Sau đó, truy cập vào cổng 3000 của VPS để hoàn tất các thiết lập cơ bản giao diện web. Hãy chắc chắn rằng bạn đã tích hợp cấu hình lưu trữ LFS chính xác để sẵn sàng đẩy các file Model Weights lên.
Bước 2: Cài đặt Ollama và cấu hình tối ưu hóa CPU/GPU
Cài đặt Ollama trực tiếp trên VPS Việt Nam bằng script chính thức từ nhà phát triển:
curl -fsSL [https://ollama.com/install.sh](https://ollama.com/install.sh) | sh
Sau khi cài đặt xong, hệ thống cần cấu hình để Ollama có thể lắng nghe các kết nối từ bên ngoài thay vì mặc định chỉ ở localhost. Tiến hành chỉnh sửa file dịch vụ systemd của Ollama:
sudo systemctl edit ollama.service
Thêm các dòng sau vào cấu hình:
[Service]
Environment="OLLAMA_HOST=0.0.0.0"
Lưu lại và khởi động lại dịch vụ: sudo systemctl daemon-reload && sudo systemctl restart ollama.
Bước 3: Đồng bộ mô hình từ Hugging Face về Gitea Private
Để tạo ra một bản "Mirror" thực sự, chúng ta sẽ clone repository từ Hugging Face Space về máy cục bộ, sau đó push ngược lại lên hệ thống Gitea vừa thiết lập.
- Khởi tạo một repository mới trên Gitea với tùy chọn kích hoạt LFS.
- Sử dụng lệnh Git để clone repo mục tiêu từ Hugging Face:
git clone [https://huggingface.co/spaces/user/repo-name](https://huggingface.co/spaces/user/repo-name). - Thay đổi URL remote hướng về VPS của bạn:
git remote set-url origin http://your-vps-ip:3000/username/repo-name.git. - Thực hiện push dữ liệu:
git push origin main. Hệ thống Gitea LFS sẽ tự động nhận diện và lưu trữ các file mô hình lớn vào phân vùng ổ cứng riêng biệt.
Bước 4: Kết nối ứng dụng Space với Ollama backend
Các ứng dụng Hugging Face Space (thường viết bằng Gradio hoặc Streamlit) cần được thay đổi phần cấu hình gọi API. Thay vì gọi đến các API tốn phí của OpenAI hoặc Hugging Face Inference Endpoint, hãy cấu hình endpoint trỏ về địa chỉ Ollama của VPS:
import openai
client = openai.OpenAI(
base_url="http://your-vps-ip:11434/v1",
api_key="ollama" # Ollama không yêu cầu key mặc định
)
Những lưu ý quan trọng về bảo mật và hiệu năng
Khi tự vận hành một hệ thống AI Space Mirror độc lập, doanh nghiệp cần đặc biệt lưu ý các điểm sau:
- Bảo mật API Endpoint: Không bao giờ mở toang port 11434 của Ollama ra internet công cộng mà không có lớp bảo vệ. Nên sử dụng Nginx làm Reverse Proxy và cấu hình Basic Authentication hoặc giới hạn IP truy cập bằng Firewall (UFW).
- Tối ưu hóa RAM swap: Đối với VPS sử dụng thuần CPU, tốc độ xử lý sẽ phụ thuộc rất nhiều vào RAM. Hãy tạo thêm phân vùng Swap space khoảng 8GB đến 16GB để tránh tình trạng hệ thống bị crash (Out of Memory) khi xử lý các prompt dài.
- Cơ chế tự động cập nhật (Automation CI/CD): Bạn có thể cấu hình Gitea Actions để mỗi khi có sự thay đổi mã nguồn ở nhánh chính, hệ thống sẽ tự động deploy lại ứng dụng Space, đồng bộ hóa trải nghiệm giống hệt như trên nền tảng Hugging Face gốc.
Kết luận
Việc tự dựng Private Hugging Face Space Mirror bằng Gitea LFS và Ollama trên hạ tầng VPS Việt Nam là một giải pháp mang tính chiến lược dài hạn. Nó không chỉ giúp doanh nghiệp làm chủ hoàn toàn công nghệ, bảo mật tuyệt đối dữ liệu khách hàng mà còn tối ưu hóa chi phí vận hành một cách đáng kể. Trong bối cảnh hạ tầng internet quốc tế có nhiều biến động, đây chính là chiếc "bảo hiểm" công nghệ giúp các ứng dụng AI của doanh nghiệp luôn hoạt động thông suốt và đạt hiệu năng cao nhất.
