Hướng dẫn build hệ thống AI Code Assistant offline chạy trên VPS 4GB RAM: CodeGPT, CodeLlama với Ollama + VS Code extension
Giới thiệu
Trong thời đại AI phát triển mạnh mẽ như hiện nay, việc sử dụng các công cụ hỗ trợ lập trình thông minh đã trở thành nhu cầu thiết yếu đối với các developer. Tuy nhiên, việc sử dụng các giải pháp AI coding như GitHub Copilot hay ChatGPT có nhược điểm lớn về chi phí và bảo mật dữ liệu. Nhiều doanh nghiệp không thể đưa code nội bộ lên cloud vì lý do bảo mật.
Bài viết này sẽ hướng dẫn bạn cách tự build một hệ thống AI Code Assistant offline chạy hoàn hảo trên VPS chỉ với 4GB RAM, sử dụng Ollama làm nền tảng, tích hợp các model như CodeLlama, CodeGPT và kết nối với VS Code thông qua extension.
Tại sao nên chọn giải pháp AI Code Assistant offline?
Trước khi đi vào chi tiết kỹ thuật, hãy cùng phân tích những lợi ích mà giải pháp này mang lại:
- Tiết kiệm chi phí: Không cần trả phí subscription hàng tháng cho các công cụ AI coding thương mại
- Bảo mật dữ liệu: Toàn bộ code và dữ liệu được xử lý local, không gửi ra ngoài internet
- Kiểm soát hoàn toàn: Bạn có thể tùy chỉnh model, cấu hình theo nhu cầu riêng
- Hoạt động offline: Không phụ thuộc vào kết nối internet sau khi đã tải model về
- Phù hợp với doanh nghiệp: Đáp ứng các yêu cầu về compliance và data sovereignty
Chuẩn bị môi trường VPS
Để chạy hệ thống AI Code Assistant offline với hiệu suất tốt nhất trên VPS 4GB RAM, bạn cần chuẩn bị như sau:
Yêu cầu cấu hình tối thiểu
- RAM: 4GB (khuyến nghị 8GB để chạy mượt hơn)
- CPU: 2 cores trở lên (khuyến nghị 4 cores)
- Disk: Tối thiểu 20GB SSD để lưu trữ model và hệ thống
- OS: Ubuntu 20.04 LTS hoặc cao hơn
Cài đặt Ubuntu và các package cần thiết
Đầu tiên, hãy SSH vào VPS và cập nhật hệ thống:
sudo apt update && sudo apt upgrade -y curl -fsSL https://deb.nodesource.com/setup_18.x | sudo -E bash - sudo apt install -y nodejs git curl wget
Cài đặt Ollama - Nền tảng AI Model Runtime
Ollama là một runtime mã nguồn mở cho phép chạy các large language models (LLMs) trực tiếp trên máy local. Đây là lựa chọn lý tưởng cho việc deploy AI assistant trên VPS với tài nguyên hạn chế.
Bước 1: Cài đặt Ollama
Cài đặt Ollama bằng câu lệnh sau:
curl -fsSL https://ollama.com/install.sh | sh
Bư�2c 2: Kiểm tra Ollama đã cài đặt thành công
Sau khi cài đặt, hãy kiểm tra phiên bản:
ollama --version
Bước 3: Khởi động Ollama service
Ollama có thể chạy như một service hoặc trực tiếp. Để chạy service:
ollama serve
Để Ollama khởi động cùng hệ thống, bạn nên tạo systemd service:
sudo nano /etc/systemd/system/ollama.service
Thêm nội dung sau:
[Unit] Description=Ollama Service After=network-online.target [Service] Type=spawn ExecStart=/usr/local/bin/ollama serve User=ubuntu Restart=always [Install] WantedBy=multi-user.target
Lựa chọn và cài đặt AI Models
Ollama hỗ trợ nhiều model phù hợp cho việc coding. Dưới đây là những model được khuyến nghị:
CodeLlama - Model chuyên về coding
CodeLlama là model được Meta phát triển dựa trên Llama 2, tối ưu cho việc sinh code. Đây là lựa chọn hàng đầu cho developer:
ollama pull codellama
Model này có nhiều phiên bản với kích thước khác nhau:
- codellama:7b - Nhẹ, phù hợp VPS 4GB RAM
- codellama:13b - Cân bằng, cần 8GB RAM
- codellama:34b - Mạnh nhất, cần 16GB RAM
CodeGPT - Model tiếng Việt
Nếu bạn cần hỗ trợ tiếng Việt, có thể tham khảo các model từ cộng đồng:
ollama list
Để xem danh sách các model có sẵn, truy cập Ollama Library.
Starcoder - Model từ BigCode
Starcoder là model open-source từ BigCode project, rất tốt cho việc hoàn thiện code:
ollama pull starcoder
Tích hợp với VS Code
Để sử dụng AI assistant trực tiếp trong VS Code, bạn có thể sử dụng extension Continue hoặc các extension hỗ trợ Ollama khác.
Cài đặt Continue Extension
Continue là VS Code extension mã nguồn mở, hỗ trợ kết nối với Ollama:
- Mở VS Code, vào Extensions (Ctrl+Shift+X)
- Tìm kiếm "Continue"
- Nhấn Install để cài đặt
Cấu hình Continue kết nối với Ollama
Sau khi cài đặt, mở file cấu hình bằng cách:
- Nhấn Ctrl+Shift+P
- Gõ "Continue: Open Config"
- Chỉnh sửa file
config.json
Cấu hình như sau:
{
"models": [
{
"provider": "ollama",
"model": "codellama",
"api_base": "http://YOUR_VPS_IP:11434"
}
]
}
Thay YOUR_VPS_IP bằng địa chỉ IP thực tế của VPS.
Cấu hình SSH Tunnel (Bảo mật)
Để kết nối an toàn từ máy local đến VPS, sử dụng SSH tunnel:
ssh -L 11434:localhost:11434 -N -f user@your-vps-ip
Sau đó, đổi api_base thành http://localhost:11434.
Tối ưu hóa hiệu suất trên VPS 4GB RAM
Với chỉ 4GB RAM, bạn cần tối ưu cấu hình để đạt hiệu suất tốt nhất:
Sử dụng mô hình Model nhẹ
Chọn model có kích thước phù hợp với RAM:
- codellama:7b - Cần khoảng 4GB RAM để load
- coding专用 model - Thường nhẹ hơn các model general
Cấu hình Ollama với environment variables
Tạo file cấu hình tại ~/.ollama/config.toml:
OLLAMA_NUM_PARALLEL=1 OLLAMA_MAX_LOADED_MODELS=1 OLLAMA_FLASH_ATTENTION=1
Sử dụng Swap memory
Nếu RAM không đủ, cấu hình swap để tránh out of memory:
sudo fallocate -l 4G /swapfile sudo chmod 600 /swapfile sudo mkswap /swapfile sudo swapon /swapfile
Sử dụng AI Code Assistant
Sau khi hoàn tất cài đặt, bạn có thể sử dụng AI assistant theo nhiều cách:
Sử dụng trực tiếp trong VS Code
- Sử dụng Ctrl+L để mở chat với AI
- Sử dụng Ctrl+Shift+I để highlight code và hỏi AI
- Sử dụng Ctrl+Shift+Enter để autocomplete code
Sử dụng qua API
Ollama cung cấp REST API để tích hợp vào ứng dụng khác:
curl http://localhost:11434/api/generate -d '{
"model": "codellama",
"prompt": "Viết hàm tính fibonacci trong Python",
"stream": false
}'
Tích hợp với các IDE khác
Ngoài VS Code, bạn có thể tích hợp với:
- IntelliJ IDEA - Qua plugin Ollama
- Neovim - Qua plugin code
- JetBrains - Qua extension riêng
So sánh với các giải pháp cloud
Để hiểu rõ hơn giá trị của giải pháp này, hãy so sánh với các lựa chọn cloud:
| Tiêu chí | Giải pháp Offline (Ollama) | GitHub Copilot | ChatGPT API |
|---|---|---|---|
| Chi phí | Thấp (chỉ tiền VPS) | Cao ($10/tháng) | Trung bình |
| Bảo mật | Rất cao | Cloud | Cloud |
| Offline | Có | Không | Không |
| Customizable | Cao | Thấp | Trung bình |
Kết luận
Việc xây dựng hệ thống AI Code Assistant offline trên VPS với 4GB RAM là hoàn toàn khả thi và mang lại nhiều lợi ích vượt trội. Với Ollama và các model như CodeLlama, bạn có thể:
- Tiết kiệm đáng kể chi phí so với các giải pháp subscription
- Đảm bảo bảo mật tuyệt đối cho code nội bộ
- Hoạt động hoàn toàn offline mà vẫn có AI assistant mạnh mẽ
- Tùy chỉnh và kiểm soát hoàn toàn hệ thống
Đây là giải pháp lý tưởng cho các doanh nghiệp startup, team development nhỏ hoặc các dự án cần bảo mật cao. Hãy bắt đầu xây dựng hệ thống của riêng bạn ngay hôm nay!
