Quay lại danh sách
Tin tức công nghệ

Xây dựng hạ tầng Serverless AI Agent Workers tự host trên VPS giá rẻ với Bun Runtime và Ollama

25 tháng 5, 2026

Giới thiệu xu hướng AI độc lập và bài toán chi phí hạ tầng

Trong kỷ nguyên bùng nổ của trí tuệ nhân tạo, việc tích hợp AI Agents vào quy trình vận hành doanh nghiệp không còn là điều xa lạ. Tuy nhiên, phần lớn các giải pháp hiện nay đều phụ thuộc vào bên thứ ba như OpenAI, Anthropic với mô hình trả phí theo lượng sử dụng (pay-as-you-go). Đối với các doanh nghiệp vừa và nhỏ (SMEs) hoặc các startup đang trong giai đoạn thử nghiệm, chi phí API này có thể nhanh chóng trở thành một gánh nặng tài chính lớn. Bên cạnh đó, vấn đề bảo mật dữ liệu nội bộ và quyền riêng tư luôn là rào cản lớn khi gửi dữ liệu lên đám mây công cộng.

Giải pháp thay thế khả thi nhất chính là Tự host (Self-hosting) các mô hình ngôn ngữ lớn (LLM) mã nguồn mở. Nhưng làm thế nào để chạy các mô hình này trên một hạ tầng có chi phí thấp như VPS (Virtual Private Server) giá rẻ mà vẫn đảm bảo hiệu năng và khả năng mở rộng? Câu trả lời nằm ở sự kết hợp đột phá giữa Bun Runtime, Ollama và kiến trúc Serverless AI Agent Workers. Bài viết này sẽ hướng dẫn chi tiết cách bạn có thể tự tay xây dựng một hệ thống như vậy từ con số 0.

Tại sao lại chọn VPS giá rẻ, Bun Runtime và Ollama?

Để hiểu tại sao bộ ba này lại tạo nên một cấu hình hoàn hảo cho hệ thống AI Worker, chúng ta cần phân tích sâu vào từng thành phần cấu tạo nên kiến trúc:

  • VPS Giá Rẻ (CPU-based): Thay vì thuê các instance GPU đắt đỏ trên AWS hay Google Cloud tốn hàng trăm USD mỗi tháng, chúng ta tận dụng các gói VPS phổ thông (chỉ từ $5 - $10/tháng) có cấu hình khoảng 2-4 vCPU và 4GB-8GB RAM.
  • Ollama: Công cụ quản lý và chạy LLM local cực kỳ tối ưu. Ollama cho phép chạy các mô hình nén (quantized) như Llama 3 (8B) hoặc Mistral (7B) trên CPU một cách mượt mà nhờ tối ưu hóa phần cứng và quản lý bộ nhớ thông minh.
  • Bun Runtime: Trình thực thi JavaScript/TypeScript thế hệ mới, thay thế cho Node.js. Bun sở hữu tốc độ khởi động (startup time) nhanh gấp nhiều lần, tiêu tốn ít tài nguyên RAM hơn và tích hợp sẵn HTTP server hiệu năng cao, rất phù hợp cho mô hình Serverless vốn đòi hỏi thời gian phản hồi tức thì.

Kiến trúc tổng quan của hệ thống Serverless AI Worker

Hệ thống được thiết kế theo nguyên lý hướng sự kiện (event-driven) và chia nhỏ thành các tác vụ độc lập (Workers). Khi có một yêu cầu xử lý từ phía client, hệ thống sẽ thực hiện theo các bước sau:

  1. API Gateway (Bun Server): Tiếp nhận request HTTP từ phía client, thực hiện xác thực (Authentication) và phân phối tác vụ.
  2. Worker Queue / Task Router: Bun Server sẽ định tuyến yêu cầu đến các Worker script tương ứng để xử lý chuyên biệt (ví dụ: Worker dịch thuật, Worker tóm tắt văn bản, Worker trích xuất dữ liệu).
  3. Ollama Inference Engine: Worker gọi API nội bộ đến Ollama để xử lý prompt bằng LLM phù hợp, sau đó nhận kết quả và trả về cho API Gateway.
Kiến trúc này giúp cô lập các tiến trình. Nếu một Worker gặp sự cố hoặc quá tải, nó không làm ảnh hưởng đến toàn bộ hệ thống, đồng thời tối ưu hóa bộ nhớ RAM của VPS một cách tối đa nhờ cơ chế giải phóng tài nguyên sau khi Worker hoàn thành nhiệm vụ.

Các bước triển khai chi tiết trên VPS

Bước 1: Chuẩn bị môi trường và cài đặt Ollama

Đầu tiên, bạn cần kết nối SSH vào VPS của mình. Tiến hành cập nhật hệ thống và cài đặt Ollama bằng câu lệnh chính thức từ nhà phát hành:

curl -fsSL [https://ollama.com/install.sh](https://ollama.com/install.sh) | sh

Sau khi cài đặt xong, hãy tải về một mô hình tối ưu cho CPU, ví dụ như llama3:8b-instruct-q4_K_M (phiên bản đã được quantized để tiết kiệm RAM mà vẫn giữ được chất lượng câu trả lời ổn định):

ollama run llama3:8b

Kiểm tra xem API của Ollama đã hoạt động chưa bằng cách gửi một request thử nghiệm đến cổng mặc định 11434.

Bước 2: Cài đặt Bun Runtime và khởi tạo dự án

Cài đặt Bun trên VPS vô cùng đơn giản và nhanh chóng với lệnh:

curl -fsSL [https://bun.sh/install](https://bun.sh/install) | bash
source ~/.bashrc

Tạo một thư mục mới cho dự án AI Worker của bạn và khởi tạo cấu trúc:

mkdir serverless-ai-workers && cd serverless-ai-workers
bun init -y

Bước 3: Lập trình API Gateway và Agent Workers bằng TypeScript

Với Bun, chúng ta có thể viết code bằng TypeScript trực tiếp mà không cần cấu hình Babel hay Webpack phức tạp. Dưới đây là đoạn mã nguồn cốt lõi để xây dựng một index.ts đóng vai trò điều phối hệ thống:

import { serve } from "bun";

const OLLAMA_API = "[http://127.0.0.1:11434/api/generate](http://127.0.0.1:11434/api/generate)";

serve({
  port: 3000,
  async fetch(req) {
    const url = new URL(req.url);
    
    // Định tuyến cho Worker xử lý Tóm tắt văn bản
    if (url.pathname === "/api/worker/summarize" && req.method === "POST") {
      try {
        const body = await req.json();
        const prompt = `Hãy tóm tắt văn bản sau một cách ngắn gọn, chuyên nghiệp: ${body.text}`;
        
        const response = await fetch(OLLAMA_API, {
          method: "POST",
          headers: { "Content-Type": "application/json" },
          body: JSON.stringify({
            model: "llama3",
            prompt: prompt,
            stream: false
          })
        });
        
        const data = await response.json();
        return new Response(JSON.stringify({ success: true, result: data.response }), {
          headers: { "Content-Type": "application/json" }
        });
      } catch (error) {
        return new Response(JSON.stringify({ error: "Internal Server Error" }), { status: 500 });
      }
    }
    
    return new Response("Worker Not Found", { status: 404 });
  }
});
console.log("Serverless AI Gateway đang chạy trên port 3000...");

Chiến lược tối ưu hóa hiệu năng AI trên CPU

Khi vận hành LLM trên VPS không có GPU, hiệu năng (tốc độ sinh từ - tokens per second) là thách thức lớn nhất. Để giải quyết bài toán này, doanh nghiệp cần áp dụng các chiến lược tối ưu chuyên sâu sau:

  1. Sử dụng Mô hình Kích thước Nhỏ: Đối với các tác vụ cụ thể như phân loại dữ liệu, trích xuất thực thể hoặc gắn thẻ (tagging), hãy sử dụng các mô hình nhỏ như Phi-3 (3.8B) hoặc Qwen2 (1.5B) thay vì các mô hình lớn. Chúng khởi động cực nhanh và phản hồi gần như ngay lập tức trên CPU.
  2. Cấu hình Context Window hợp lý: Giới hạn độ dài ngữ cảnh (Context Window) trong khoảng 2048 hoặc 4096 tokens. Việc cấu hình ngữ cảnh quá lớn sẽ khiến RAM của VPS bị tràn, dẫn đến tình trạng Swap và làm treo hệ thống.
  3. Bật tính năng Streaming: Thay vì bắt người dùng đợi toàn bộ văn bản được tạo xong (non-stream), hãy tận dụng cơ chế Stream của Bun và Ollama để trả về từng từ ngay khi nó được tạo ra, giúp cải thiện đáng kể trải nghiệm người dùng (UX).

Đánh giá chi phí và khả năng ứng dụng thực tế

Về mặt kinh tế, giải pháp này mang lại một hiệu suất chi phí vô cùng ấn tượng:

Tiêu chí so sánh Sử dụng Cloud API (OpenAI/Anthropic) Tự Host với Bun & Ollama trên VPS
Chi phí cố định $0 (Tính theo lượng dùng) $5 - $15 / tháng (Cố định)
Chi phí biến đổi Tăng tuyến tính theo số lượng Request $0 (Không giới hạn số lượng request)
Bảo mật dữ liệu Rủi ro rò rỉ dữ liệu bên thứ ba An toàn tuyệt đối (Dữ liệu nằm trên VPS riêng)
Khả năng tùy biến Bị giới hạn bởi chính sách nhà cung cấp Toàn quyền tinh chỉnh Prompt và Mô hình

Hạ tầng này cực kỳ phù hợp để ứng dụng vào các hệ thống nội bộ của doanh nghiệp như: Hệ thống phân loại Email khách hàng tự động, Bot hỗ trợ kỹ thuật nội bộ (Slack/Discord Bot), hoặc Hệ thống quét và tóm tắt tin tức thị trường tự động chạy theo lịch trình (Cronjob).

Lời kết

Xây dựng hệ thống Serverless AI Agent Workers tự host trên VPS giá rẻ là một giải pháp thông minh, cân bằng hoàn hảo giữa yếu tố chi phí, hiệu năng và tính bảo mật. Bằng cách làm chủ công nghệ và tận dụng tối đa sức mạnh của mã nguồn mở thông qua Bun Runtime và Ollama, doanh nghiệp của bạn không chỉ tiết kiệm hàng ngàn USD chi phí vận hành mà còn tự do sáng tạo và triển khai các giải pháp AI độc quyền mà không bị ràng buộc bởi bất kỳ ông lớn công nghệ nào. Hãy bắt tay vào xây dựng hạ tầng AI độc lập của riêng bạn ngay hôm nay!

Xây dựng hạ tầng Serverless AI Agent Workers tự host trên VPS giá rẻ với Bun Runtime và Ollama | DPTCloud