Quay lại danh sách
Tin tức công nghệ

Hướng Dẫn Tự Host 'Bolt.new' Cục Bộ Với Open-WebUI Và Ollama Trên VPS ARM Để Dev App Không Tốn Chi Phí API

29 tháng 5, 2026

Giới Thiệu: Kỷ Nguyên Mới Của Lập Trình Ứng Dụng Với AI Tự Host

Trong năm qua, các công cụ hỗ trợ lập trình dạng AI Agent như Bolt.new đã thay đổi hoàn toàn cách chúng ta phát triển phần mềm. Chỉ với vài câu lệnh bằng ngôn ngữ tự nhiên, bạn có thể tạo ra một ứng dụng web hoàn chỉnh từ giao diện đến logic xử lý. Tuy nhiên, đối với các doanh nghiệp và nhà phát triển độc lập, việc phụ thuộc vào các dịch vụ đám mây bên thứ ba đi kèm với hai thách thức lớn: chi phí API đắt đỏ khi scale và nguy cơ rò rỉ dữ liệu nhạy cảm.

Giải pháp tối ưu hiện nay là tự host (self-host) một hệ sinh thái tương tự trên hạ tầng riêng. Bài viết này sẽ hướng dẫn bạn chi tiết cách thiết lập một môi trường dev app tương tự Bolt.new bằng cách kết hợp Open-WebUI và Ollama trên nền tảng VPS ARM. Cấu hình này không chỉ giúp bạn cắt giảm hoàn toàn chi phí API mà còn tận dụng tối đa hiệu năng/giá thành vượt trội của kiến trúc chip ARM.

---

Tại Sao Nên Chọn VPS ARM, Open-WebUI Và Ollama?

Trước khi đi vào chi tiết kỹ thuật, hãy cùng phân tích lý do vì sao sự kết hợp của bộ ba công nghệ này lại là cấu hình tối ưu nhất cho các kỹ sư phần mềm hiện nay:

  • VPS ARM (Ampere Altra): Các nhà cung cấp đám mây lớn như Oracle Cloud, AWS, hay Azure hiện đều cung cấp các instance dựa trên kiến trúc ARM với hiệu năng xử lý đa luồng cực tốt nhưng giá thành chỉ bằng một nửa so với chip x86 truyền thống. Thậm chí, bạn có thể tận dụng gói Always Free của Oracle Cloud để có cấu hình lên tới 4 vCPU và 24GB RAM hoàn toàn miễn phí.
  • Ollama: Công cụ quản lý và chạy các mô hình ngôn ngữ lớn (LLM) cục bộ tối ưu nhất hiện nay. Ollama hỗ trợ nén (quantization) các mô hình mạnh mẽ như Llama 3, Qwen 2.5, hay DeepSeek-R1 để chạy mượt mà ngay cả khi không có GPU chuyên dụng, chỉ tận dụng sức mạnh phần cứng của CPU ARM.
  • Open-WebUI: Giao diện người dùng tiên tiến, không chỉ đóng vai trò là một chatbot mà còn tích hợp các tính năng cao cấp như Pipelines, Web Search, và đặc biệt là khả năng hiển thị/thực thi mã nguồn trực quan (Web Preview) giống như cơ chế hoạt động của Bolt.new.
---

Quy Trình Thiết Lập Hệ Thống Trên VPS ARM

Để bắt đầu, bạn cần chuẩn bị một VPS chạy hệ điều hành Ubuntu (khuyến nghị phiên bản 22.04 LTS hoặc 24.04 LTS) kiến trúc ARM64 và đã mở các cổng mạng cần thiết (80, 443, 3000).

Bước 1: Cài Đặt Docker Và Docker Compose

Hầu hết các dịch vụ của chúng ta sẽ được triển khai qua Docker để đảm bảo tính đóng gói và dễ dàng quản lý. Chạy các lệnh sau để cài đặt Docker trên VPS ARM:

sudo apt update && sudo apt upgrade -y
sudo apt install -y curl apt-transport-https ca-certificates gnupg lsb-release
curl -fsSL [https://download.docker.com/linux/ubuntu/gpg](https://download.docker.com/linux/ubuntu/gpg) | sudo gpg --dearmor -o /usr/share/keyrings/docker-archive-keyring.gpg
echo "deb [arch=arm64 signed-by=/usr/share/keyrings/docker-archive-keyring.gpg] [https://download.docker.com/linux/ubuntu](https://download.docker.com/linux/ubuntu) $(lsb_release -cs) stable" | sudo tee /etc/apt/sources.list.d/docker.list > /dev/null
sudo apt update && sudo apt install -y docker-ce docker-ce-cli containerd.io

Bước 2: Cài Đặt Ollama Và Tải Các Mô Hình Lập Trình (LLM)

Ollama có phiên bản hỗ trợ chính thức cho kiến trúc ARM. Bạn có thể cài đặt trực tiếp lên host để tận dụng tối đa hiệu năng CPU thay vì chạy qua Docker layer:

curl -fsSL [https://ollama.com/install.sh](https://ollama.com/install.sh) | sh

Sau khi cài đặt thành công, chúng ta cần tải về các mô hình chuyên dụng cho tác vụ code. Đối với VPS ARM có cấu hình từ 16GB-24GB RAM, Qwen2.5-Coder (7B hoặc 14B) hoặc DeepSeek-R1-Distill-Llama-8B là những lựa chọn xuất sắc nhất nhờ khả năng hiểu cấu trúc code và tư vấn logic vượt trội:

ollama run qwen2.5-coder:7b

Bước 3: Triển Khai Open-WebUI Tích Hợp Tính Năng Khởi Tạo Code

Để có được trải nghiệm tương tự Bolt.new, nơi AI có thể viết mã và bạn có thể xem trước giao diện trực quan, chúng ta sẽ deploy Open-WebUI phiên bản mới nhất kết hợp kết nối đến endpoint của Ollama.

Tạo một file docker-compose.yml với nội dung sau:

version: '3.8'
services:
open-webui:
image: ghcr.io/open-webui/open-webui:main
container_name: open-webui
restart: always
ports:
- "3000:8080"
environment:
- OLLAMA_BASE_URL=[http://host.docker.internal:11434](http://host.docker.internal:11434)
- WEBUI_AUTH=true
volumes:
- open-webui:/app/backend/data
extra_hosts:
- "host.docker.internal:host-gateway"
volumes:
open-webui:

Khởi chạy container bằng lệnh: sudo docker compose up -d. Giờ đây, bạn có thể truy cập vào giao diện web qua địa chỉ http://IP_CUA_VPS:3000.

---

Cấu Hình Giao Diện 'Bolt-Like' Cho Trải Nghiệm Lập Trình Tối Ưu

Sau khi đăng nhập vào Open-WebUI, để biến giao diện chat thông thường thành một không gian phát triển ứng dụng chuyên nghiệp, bạn cần thực hiện hai tùy chỉnh quan trọng sau:

1. Kích Hoạt Tính Năng HTML/Code Preview

Vào mục Settings (Cài đặt) > Interface (Giao diện), tìm và bật tính năng "Enable Code Preview / Web Artifacts". Tính năng này cho phép khi LLM sinh ra các đoạn mã HTML, CSS, JS hoặc React, một cửa sổ phụ sẽ xuất hiện bên cạnh màn hình chat để render trực tiếp ứng dụng đó, giúp bạn kiểm tra kết quả ngay lập tức mà không cần copy code về máy cục bộ.

2. Cấu Hình Hệ Thống Prompt (System Prompt)

Để ép mô hình Ollama hành xử như một AI Agent chuyên nghiệp của Bolt.new, hãy tạo một Model Preset hoặc tùy chỉnh System Prompt mặc định với nội dung:

"Bạn là một kỹ sư phần mềm cao cấp. Khi người dùng yêu cầu xây dựng ứng dụng, hãy chia nhỏ quy trình thành cấu trúc thư mục rõ ràng. Xuất mã nguồn trong các block code có định danh ngôn ngữ cụ thể. Ưu tiên viết mã nguồn hoàn chỉnh, có thể chạy được ngay và tích hợp giao diện đẹp mắt sử dụng Tailwind CSS."
---

Đánh Giá Hiệu Năng Và Tối Ưu Chi Phí

Việc chuyển dịch từ các nền tảng trả phí sang mô hình tự host mang lại những lợi ích kinh tế và kỹ thuật không thể phủ nhận:

Tiêu chí so sánhSử dụng Cloud API thương mại (Bolt.new, Claude 3.5 Sonnet)Giải pháp Tự Host (VPS ARM + Open-WebUI + Ollama)
Chi phí hàng tháng$20 - $100+ (Tùy thuộc lượng token sử dụng)$0 (Gói free tier) hoặc $5-$12 (Thuê VPS ARM riêng)
Bảo mật dữ liệuDữ liệu gửi lên server bên thứ baDữ liệu nằm trọn vẹn trong VPS của bạn
Tốc độ xử lýPhụ thuộc vào băng thông quốc tế và hàng chờ APIXử lý trực tiếp trên RAM/CPU của VPS, độ trễ cực thấp
Giới hạn lượt dùngBị giới hạn số lượng request mỗi giờ/ngàyKhông giới hạn, chạy liên tục 24/7

Đối với chip ARM Ampere Altra, tốc độ xử lý (token/s) của các model 7B hoặc 8B tinh chỉnh cho code đạt mức 15-25 tokens/s. Đây là tốc độ hoàn hảo, đáp ứng tốt nhu cầu đọc hiểu và gen code theo thời gian thực của các lập trình viên.

---

Kết Luận

Tự host một phiên bản 'Bolt.new' thu nhỏ bằng Open-WebUI và Ollama trên VPS ARM là phương án hoàn hảo để các nhà phát triển tự do tối ưu hóa quy trình làm việc, làm chủ công nghệ mà không bị gánh nặng chi phí API đè nặng. Chỉ với một vài bước thiết lập cơ bản, bạn đã sở hữu trong tay một trợ lý lập trình AI đắc lực, bảo mật tuyệt đối và hoàn toàn miễn phí hành trình phát triển sản phẩm của mình.

Hãy bắt tay vào cài đặt ngay hôm nay để trải nghiệm sự tự do tối đa trong kỷ nguyên lập trình AI!

Hướng Dẫn Tự Host 'Bolt.new' Cục Bộ Với Open-WebUI Và Ollama Trên VPS ARM Để Dev App Không Tốn Chi Phí API | DPTCloud