Quay lại danh sách
Tin tức công nghệ

Xây dựng hạ tầng Serverless AI Agent Workers tự host trên VPS giá rẻ với Bun Runtime và Ollama

26 tháng 5, 2026

Giới thiệu xu hướng AI Agent và bài toán chi phí hạ tầng

Trong kỷ nguyên công nghệ hiện nay, AI Agents (Đại lý trí tuệ nhân tạo) đang dịch chuyển từ các mô hình chatbot phản hồi đơn giản sang mô hình tự trị (autonomous). Chúng có khả năng tự suy luận, lập kế hoạch, gọi API bên ngoài, và thực hiện các chuỗi tác vụ phức tạp (ReAct pattern). Tuy nhiên, khi quy mô vận hành tăng lên, các doanh nghiệp và nhà phát triển phải đối mặt với hai rào cản lớn: chi phí sử dụng API đám mây (OpenAI, Anthropic) tính theo token rất đắt đỏ và rủi ro bảo mật dữ liệu nhạy cảm.

Mô hình Serverless AI Agent Workers tự host (self-hosted) trên máy chủ ảo cá nhân (VPS) nổi lên như một giải pháp thay thế hoàn hảo. Bằng cách kết hợp Bun Runtime — bộ công cụ JavaScript/TypeScript siêu tốc — và Ollama — công cụ chạy LLM cục bộ tối ưu, bạn hoàn toàn có thể xây dựng một hệ thống Worker tự động hóa mạnh mẽ, bảo mật tuyệt đối với chi phí cố định chỉ từ vài USD mỗi tháng.


Tại sao chọn Bun Runtime và Ollama cho VPS cấu hình thấp?

Thông thường, việc chạy các mô hình ngôn ngữ lớn (LLM) đòi hỏi hạ tầng phần cứng đắt tiền với GPU chuyên dụng. Tuy nhiên, kiến trúc tối ưu hóa dưới đây giúp bạn tận dụng tối đa tài nguyên của một VPS CPU giá rẻ:

1. Bun Runtime: Vũ khí tối ưu hóa tài nguyên

Thay vì sử dụng Node.js truyền thống, hệ thống sử dụng Bun Runtime làm lõi thực thi cho các Worker nhờ các ưu điểm vượt trội:

  • Thời gian khởi động lạnh (Cold Start) gần như bằng 0: Được viết bằng ngôn ngữ hệ thống Zig và chạy trên engine JavaScriptCore (WebKit), Bun có tốc độ khởi động nhanh gấp 14 lần Node.js. Đây là yếu tố sống còn cho kiến trúc dạng Serverless.
  • Tiết kiệm bộ nhớ vượt trội: Bun tiêu tốn cực kỳ ít RAM khi duy trì các tiến trình chạy ngầm, giải phóng tối đa không gian bộ nhớ cho mô hình AI.
  • Hỗ trợ TypeScript mặc định: Không cần qua bước biên dịch (transpilation) phức tạp với TSC hay Babel, Worker có thể thực thi trực tiếp file .ts với hiệu năng bản địa.

2. Ollama: Đưa trí tuệ nhân tạo vào CPU cục bộ

Ollama đơn giản hóa việc đóng gói, quản lý và chạy các mô hình mã nguồn mở như Llama 3, Qwen 2.5, hay DeepSeek-R1. Cơ chế lượng tử hóa (Quantization) của Ollama giảm dung lượng mô hình xuống mức tối thiểu (ví dụ: bản 3B hoặc 8B chỉ cần vài GB RAM) mà vẫn giữ được độ chính xác cao khi chạy trên CPU của VPS thông thường.


Kiến trúc hệ thống Serverless AI Worker

Mô hình Serverless tự host vận hành theo cơ chế hướng sự kiện (Event-Driven). Khi có một yêu cầu (Webhook, HTTP Request), một Worker siêu nhẹ viết bằng Bun sẽ được kích hoạt, phân tích yêu cầu, gửi prompt đến API cục bộ của Ollama, thực thi công cụ (Tool Calling), và trả về kết quả trước khi giải phóng bộ nhớ.

Mẹo tối ưu: Sử dụng biến môi trường OLLAMA_NUM_PARALLEL và cơ chế giữ mô hình trong bộ nhớ (Keep-alive) để tăng tốc độ phản hồi đáng kể khi có nhiều tác vụ đồng thời.

Hướng dẫn triển khai chi tiết trên VPS Ubuntu

Dưới đây là các bước thiết lập hệ thống hoàn chỉnh trên một VPS Ubuntu cơ bản (khuyến nghị tối thiểu: 4 vCPU, 8GB RAM, không cần GPU).

Bước 1: Cài đặt Ollama và tải mô hình AI

Truy cập vào VPS qua SSH và chạy lệnh cài đặt chính thức của Ollama:

curl -fsSL [https://ollama.com/install.sh](https://ollama.com/install.sh) | sh

Sau khi cài đặt hoàn tất, tiến hành tải một mô hình gọn nhẹ nhưng thông minh, hỗ trợ gọi hàm (Tool Calling) cực tốt như qwen2.5:3b hoặc llama3.2:3b:

ollama pull qwen2.5:3b

Bước 2: Cài đặt Bun Runtime

Cài đặt môi trường thực thi Bun chỉ với một dòng lệnh duy nhất:

curl -fsSL [https://bun.sh/install](https://bun.sh/install) | bash
source ~/.bashrc

Kiểm tra phiên bản để đảm bảo hệ thống đã sẵn sàng:

bun --version

Bước 3: Viết mã nguồn cho AI Agent Worker bằng Bun

Khởi tạo một dự án mới với Bun:

mkdir serverless-ai-worker && cd serverless-ai-worker
bun init -y

Cài đặt SDK chính thức của Ollama:

bun add ollama

Tạo file worker.ts để xây dựng một HTTP Server siêu tốc tích hợp AI Agent tinh gọn:

import { serve } from "bun";
import ollama from "ollama";

// Định nghĩa công cụ (Tool) giả lập cho Agent
const tools = {
  get_weather: async (location: string) => {
    return JSON.stringify({ location, temperature: "28°C", condition: "Sunny" });
  }
};

serve({
  port: 3000,
  async fetch(req) {
    if (req.method !== "POST") return new Response("Only POST method allowed", { status: 405 });
    
    try {
      const { prompt } = await req.json();
      
      // Gửi prompt tới Ollama cục bộ
      const response = await ollama.chat({
        model: 'qwen2.5:3b',
        messages: [{ role: 'user', content: prompt }],
        stream: false
      });

      return new Response(JSON.stringify({
        success: true,
        agent_response: response.message.content,
        timestamp: new Date().toISOString()
      }), {
        headers: { "Content-Type": "application/json" }
      });
    } catch (error) {
      return new Response(JSON.stringify({ success: false, error: error.message }), {
        status: 500,
        headers: { "Content-Type": "application/json" }
      });
    }
  }
});

console.log("🚀 AI Worker đang chạy mượt mà tại port 3000...");

Chạy thử nghiệm Worker của bạn:

bun run worker.ts

Giải pháp quản lý và mở rộng (Scaling)

Để biến hệ thống này thành một hạ tầng production thực thụ mang phong cách Serverless, doanh nghiệp cần bổ sung các lớp quản trị sau:

  1. Sử dụng PM2 hoặc Systemd: Đảm bảo Worker tự động khởi động lại khi gặp sự cố hoặc khi VPS bị reboot.
  2. Đóng gói Docker: Đóng gói mã nguồn Bun và Ollama vào các container riêng biệt giúp dễ dàng dịch chuyển hoặc nhân bản (scale-out) lên nhiều VPS khác nhau khi tải trọng tăng cao.
  3. Reverse Proxy với Nginx/Caddy: Cấu hình SSL (HTTPS) bảo mật và thiết lập cơ chế giới hạn tần suất gọi API (Rate Limiting) để tránh hệ thống bị quá tải bởi các cuộc tấn công DDoS.

Kết luận

Xây dựng hạ tầng Serverless AI Agent Workers tự host với Bun và Ollama là một chiến lược thông minh giúp tối ưu hóa chi phí vận hành cho các startup và lập trình viên độc lập. Giải pháp này không chỉ giải quyết triệt để bài toán hóa đơn API đám mây hàng tháng, mà còn đem lại quyền kiểm soát tuyệt đối đối với an toàn thông tin dữ liệu. Chỉ với một chiếc VPS giá rẻ, bạn đã sở hữu một hệ sinh thái AI tự trị hoạt động bền bỉ, tốc độ cao và sẵn sàng mở rộng bất cứ lúc nào.

Xây dựng hạ tầng Serverless AI Agent Workers tự host trên VPS giá rẻ với Bun Runtime và Ollama | DPTCloud