Quay lại danh sách
Tin tức công nghệ

Hướng dẫn build hệ thống AI Code Assistant offline chạy trên VPS 4GB RAM: CodeGPT, CodeLlama với Ollama + VS Code extension

25 tháng 5, 2026

Giới thiệu

Trong thời đại AI phát triển mạnh mẽ như hiện nay, việc sử dụng các công cụ hỗ trợ lập trình thông minh đã trở thành nhu cầu thiết yếu đối với các developer. Tuy nhiên, việc sử dụng các giải pháp AI coding như GitHub Copilot hay ChatGPT có nhược điểm lớn về chi phí và bảo mật dữ liệu. Nhiều doanh nghiệp không thể đưa code nội bộ lên cloud vì lý do bảo mật.

Bài viết này sẽ hướng dẫn bạn cách tự build một hệ thống AI Code Assistant offline chạy hoàn hảo trên VPS chỉ với 4GB RAM, sử dụng Ollama làm nền tảng, tích hợp các model như CodeLlama, CodeGPT và kết nối với VS Code thông qua extension.

Tại sao nên chọn giải pháp AI Code Assistant offline?

Trước khi đi vào chi tiết kỹ thuật, hãy cùng phân tích những lợi ích mà giải pháp này mang lại:

  • Tiết kiệm chi phí: Không cần trả phí subscription hàng tháng cho các công cụ AI coding thương mại
  • Bảo mật dữ liệu: Toàn bộ code và dữ liệu được xử lý local, không gửi ra ngoài internet
  • Kiểm soát hoàn toàn: Bạn có thể tùy chỉnh model, cấu hình theo nhu cầu riêng
  • Hoạt động offline: Không phụ thuộc vào kết nối internet sau khi đã tải model về
  • Phù hợp với doanh nghiệp: Đáp ứng các yêu cầu về compliance và data sovereignty

Chuẩn bị môi trường VPS

Để chạy hệ thống AI Code Assistant offline với hiệu suất tốt nhất trên VPS 4GB RAM, bạn cần chuẩn bị như sau:

Yêu cầu cấu hình tối thiểu

  • RAM: 4GB (khuyến nghị 8GB để chạy mượt hơn)
  • CPU: 2 cores trở lên (khuyến nghị 4 cores)
  • Disk: Tối thiểu 20GB SSD để lưu trữ model và hệ thống
  • OS: Ubuntu 20.04 LTS hoặc cao hơn

Cài đặt Ubuntu và các package cần thiết

Đầu tiên, hãy SSH vào VPS và cập nhật hệ thống:

sudo apt update && sudo apt upgrade -y
curl -fsSL https://deb.nodesource.com/setup_18.x | sudo -E bash -
sudo apt install -y nodejs git curl wget

Cài đặt Ollama - Nền tảng AI Model Runtime

Ollama là một runtime mã nguồn mở cho phép chạy các large language models (LLMs) trực tiếp trên máy local. Đây là lựa chọn lý tưởng cho việc deploy AI assistant trên VPS với tài nguyên hạn chế.

Bước 1: Cài đặt Ollama

Cài đặt Ollama bằng câu lệnh sau:

curl -fsSL https://ollama.com/install.sh | sh

Bư�2c 2: Kiểm tra Ollama đã cài đặt thành công

Sau khi cài đặt, hãy kiểm tra phiên bản:

ollama --version

Bước 3: Khởi động Ollama service

Ollama có thể chạy như một service hoặc trực tiếp. Để chạy service:

ollama serve

Để Ollama khởi động cùng hệ thống, bạn nên tạo systemd service:

sudo nano /etc/systemd/system/ollama.service

Thêm nội dung sau:

[Unit]
Description=Ollama Service
After=network-online.target

[Service]
Type=spawn
ExecStart=/usr/local/bin/ollama serve
User=ubuntu
Restart=always

[Install]
WantedBy=multi-user.target

Lựa chọn và cài đặt AI Models

Ollama hỗ trợ nhiều model phù hợp cho việc coding. Dưới đây là những model được khuyến nghị:

CodeLlama - Model chuyên về coding

CodeLlama là model được Meta phát triển dựa trên Llama 2, tối ưu cho việc sinh code. Đây là lựa chọn hàng đầu cho developer:

ollama pull codellama

Model này có nhiều phiên bản với kích thước khác nhau:

  • codellama:7b - Nhẹ, phù hợp VPS 4GB RAM
  • codellama:13b - Cân bằng, cần 8GB RAM
  • codellama:34b - Mạnh nhất, cần 16GB RAM

CodeGPT - Model tiếng Việt

Nếu bạn cần hỗ trợ tiếng Việt, có thể tham khảo các model từ cộng đồng:

ollama list

Để xem danh sách các model có sẵn, truy cập Ollama Library.

Starcoder - Model từ BigCode

Starcoder là model open-source từ BigCode project, rất tốt cho việc hoàn thiện code:

ollama pull starcoder

Tích hợp với VS Code

Để sử dụng AI assistant trực tiếp trong VS Code, bạn có thể sử dụng extension Continue hoặc các extension hỗ trợ Ollama khác.

Cài đặt Continue Extension

Continue là VS Code extension mã nguồn mở, hỗ trợ kết nối với Ollama:

  1. Mở VS Code, vào Extensions (Ctrl+Shift+X)
  2. Tìm kiếm "Continue"
  3. Nhấn Install để cài đặt

Cấu hình Continue kết nối với Ollama

Sau khi cài đặt, mở file cấu hình bằng cách:

  • Nhấn Ctrl+Shift+P
  • Gõ "Continue: Open Config"
  • Chỉnh sửa file config.json

Cấu hình như sau:

{
  "models": [
    {
      "provider": "ollama",
      "model": "codellama",
      "api_base": "http://YOUR_VPS_IP:11434"
    }
  ]
}

Thay YOUR_VPS_IP bằng địa chỉ IP thực tế của VPS.

Cấu hình SSH Tunnel (Bảo mật)

Để kết nối an toàn từ máy local đến VPS, sử dụng SSH tunnel:

ssh -L 11434:localhost:11434 -N -f user@your-vps-ip

Sau đó, đổi api_base thành http://localhost:11434.

Tối ưu hóa hiệu suất trên VPS 4GB RAM

Với chỉ 4GB RAM, bạn cần tối ưu cấu hình để đạt hiệu suất tốt nhất:

Sử dụng mô hình Model nhẹ

Chọn model có kích thước phù hợp với RAM:

  • codellama:7b - Cần khoảng 4GB RAM để load
  • coding专用 model - Thường nhẹ hơn các model general

Cấu hình Ollama với environment variables

Tạo file cấu hình tại ~/.ollama/config.toml:

OLLAMA_NUM_PARALLEL=1
OLLAMA_MAX_LOADED_MODELS=1
OLLAMA_FLASH_ATTENTION=1

Sử dụng Swap memory

Nếu RAM không đủ, cấu hình swap để tránh out of memory:

sudo fallocate -l 4G /swapfile
sudo chmod 600 /swapfile
sudo mkswap /swapfile
sudo swapon /swapfile

Sử dụng AI Code Assistant

Sau khi hoàn tất cài đặt, bạn có thể sử dụng AI assistant theo nhiều cách:

Sử dụng trực tiếp trong VS Code

  • Sử dụng Ctrl+L để mở chat với AI
  • Sử dụng Ctrl+Shift+I để highlight code và hỏi AI
  • Sử dụng Ctrl+Shift+Enter để autocomplete code

Sử dụng qua API

Ollama cung cấp REST API để tích hợp vào ứng dụng khác:

curl http://localhost:11434/api/generate -d '{
  "model": "codellama",
  "prompt": "Viết hàm tính fibonacci trong Python",
  "stream": false
}'

Tích hợp với các IDE khác

Ngoài VS Code, bạn có thể tích hợp với:

  • IntelliJ IDEA - Qua plugin Ollama
  • Neovim - Qua plugin code
  • JetBrains - Qua extension riêng

So sánh với các giải pháp cloud

Để hiểu rõ hơn giá trị của giải pháp này, hãy so sánh với các lựa chọn cloud:

Tiêu chí Giải pháp Offline (Ollama) GitHub Copilot ChatGPT API
Chi phí Thấp (chỉ tiền VPS) Cao ($10/tháng) Trung bình
Bảo mật Rất cao Cloud Cloud
Offline Có Không Không
Customizable Cao Thấp Trung bình

Kết luận

Việc xây dựng hệ thống AI Code Assistant offline trên VPS với 4GB RAM là hoàn toàn khả thi và mang lại nhiều lợi ích vượt trội. Với Ollama và các model như CodeLlama, bạn có thể:

  • Tiết kiệm đáng kể chi phí so với các giải pháp subscription
  • Đảm bảo bảo mật tuyệt đối cho code nội bộ
  • Hoạt động hoàn toàn offline mà vẫn có AI assistant mạnh mẽ
  • Tùy chỉnh và kiểm soát hoàn toàn hệ thống

Đây là giải pháp lý tưởng cho các doanh nghiệp startup, team development nhỏ hoặc các dự án cần bảo mật cao. Hãy bắt đầu xây dựng hệ thống của riêng bạn ngay hôm nay!