Back to articles
Technology Insight

Xây dựng hệ thống phân tích ý kiến khách hàng (Sentiment Analysis) thời gian thực bằng cách host Qwen2.5-Audio trên VPS

June 4, 2026

Giới thiệu xu hướng phân tích ý kiến khách hàng qua giọng nói

Trong kỷ nguyên số hóa mạnh mẽ hiện nay, việc thấu hiểu khách hàng không còn bó hẹp trong các bài khảo sát hay bình luận bằng văn bản (text). Dữ liệu âm thanh từ các cuộc gọi tổng đài, voice chat của khách hàng chứa đựng kho báu thông tin vô giá từ ngữ điệu, cảm xúc cho đến thái độ trực tiếp. Phân tích ý kiến khách hàng (Sentiment Analysis) từ âm thanh thời gian thực đang trở thành vũ khí chiến lược giúp các doanh nghiệp cải thiện chất lượng dịch vụ ngay trong cuộc gọi.

Thay vì sử dụng các dịch vụ Cloud API đắt đỏ và phụ thuộc vào bên thứ ba, việc tự triển khai (self-host) các mô hình ngôn ngữ lớn chuyên dụng về âm thanh (Large Audio-Language Models) trên máy chủ riêng (VPS) đang là giải pháp tối ưu. Bài viết này sẽ hướng dẫn bạn đọc cách xây dựng hệ thống này một cách toàn diện bằng mô hình Qwen2.5-Audio kết hợp với framework tối ưu hiệu năng vLLM.

---

Tại sao chọn Qwen2.5-Audio cho hệ thống doanh nghiệp?

Dòng mô hình Qwen2.5-Audio sở hữu những nâng cấp vượt bậc so với các thế hệ tiền nhiệm, đặc biệt phù hợp cho các kịch bản vận hành thực tế của doanh nghiệp nhờ vào các đặc tính cốt lõi sau:

  • Khả năng xử lý đa chế độ (Multi-mode Interaction): Mô hình không chỉ thực hiện tốt tác vụ nhận diện giọng nói (ASR) mà còn tích hợp sâu khả năng phân tích âm thanh (Audio Analysis). Nó có thể nhận biết trực tiếp cảm xúc (vui, buồn, giận dữ, thất vọng), tiếng ồn môi trường, và ngữ cảnh cuộc thoại mà không cần qua bước chuyển văn bản trung gian.
  • Kiến trúc xử lý thời gian thực nâng cao: Nhờ tối ưu hóa cơ chế streaming và xử lý dữ liệu theo dạng phân đoạn (chunked input), mô hình giảm thiểu tối đa độ trễ (latency), đáp ứng hoàn hảo yêu cầu phân tích ngay khi khách hàng đang nói.
  • Tối ưu hóa tài nguyên phần cứng: Định dạng lượng tử hóa (Quantization) như AWQ hay GPTQ-Int4/Int8 cho phép mô hình chạy mượt mà trên các cấu hình GPU phổ thông của VPS mà vẫn giữ nguyên độ chính xác cao.
---

Chuẩn bị hạ tầng VPS và môi trường hệ thống

Để đảm bảo hệ thống phân tích vận hành ổn định với độ trễ thấp nhất, việc lựa chọn cấu hình máy chủ ảo VPS có trang bị GPU tăng tốc là điều kiện bắt buộc.

Cấu hình phần cứng khuyến nghị

Mô hình Qwen2.5-Audio thường được triển khai hiệu quả nhất ở phiên bản cấu hình tầm trung. Dưới đây là thông số tối thiểu và khuyến nghị:

Thành phầnCấu hình tối thiểuCấu hình khuyến nghị
Hệ điều hànhUbuntu 22.04 LTSUbuntu 22.04 / 24.04 LTS
Bộ xử lý (CPU)4 Cores vCPU8 Cores vCPU trở lên
Bộ nhớ (RAM)16 GB32 GB trở lên
Lưu trữ (SSD)50 GB dung lượng trống100 GB NVMe SSD
Đồ họa (GPU)1x NVIDIA RTX 3090 / 4090 (24GB VRAM)1x NVIDIA A100 / H100 hoặc RTX 5090
Môi trường CUDACUDA 12.1 trở lênCUDA 12.4+ kết hợp Flash Attention

Cài đặt các gói thư viện phụ thuộc

Tru cập vào VPS qua SSH và tiến hành cập nhật hệ thống, cài đặt môi trường Python cùng các driver cần thiết:sudo apt-get update && sudo apt-get upgrade -y sudo apt-get install python3-pip python3-venv ffmpeg -y---

Triển khai Qwen2.5-Audio bằng vLLM Engine

Sử dụng framework vLLM giúp tăng tốc độ phản hồi (throughput) lên gấp nhiều lần so với cách chạy Transformers thông thường nhờ cơ chế quản lý bộ nhớ PagedAttention.

Bước 1: Khởi tạo không gian làm việc ảo và cài đặt thư viện

python3 -m venv qwen_env
source qwen_env/activate
pip install --upgrade pip
pip install vllm vllm-omni flash-attn --no-build-isolation

Bước 2: Kích hoạt dịch vụ máy chủ API

Chúng ta sẽ khởi chạy mô hình dưới dạng một OpenAI-compatible API server. Lệnh dưới đây cấu hình tối ưu hóa bộ nhớ và thiết lập cổng kết nối:vllm serve Qwen/Qwen2.5-Audio-7B-Instruct \ --port 8091 \ --max-model-len 32768 \ --gpu-memory-utilization 0.90 \ --enforce-eager False

Lưu ý bảo mật: Mặc định tham số --host nếu không khai báo sẽ trỏ về localhost (127.0.0.1). Điều này giúp bảo vệ cổng API nội bộ không bị rò rỉ ra môi trường Internet bên ngoài khi chưa qua hệ thống tường lửa hoặc Gateway.

---

Xây dựng Pipeline phân tích ý kiến thời gian thực với Python

Sau khi máy chủ mô hình đã sẵn sàng, chúng ta viết một đoạn mã ứng dụng client bằng Python sử dụng giao thức truyền tải hoặc gọi API dạng Streaming để gửi file âm thanh hoặc luồng âm thanh trực tiếp và nhận kết quả phân tích sắc thái.

import requests
import base64

API_URL = "http://localhost:8091/v1/chat/completions"

def encode_audio_to_base64(audio_path):
    with open(audio_path, "rb") as audio_file:
        return base64.b64encode(audio_file.read()).decode('utf-8')

def analyze_sentiment(audio_file_path):
    audio_base64 = encode_audio_to_base64(audio_file_path)
    
    payload = {
        "model": "Qwen/Qwen2.5-Audio-7B-Instruct",
        "messages": [
            {
                "role": "user",
                "content": [
                    {
                        "type": "audio",
                        "audio_url": f"data:audio/wav;base64,{audio_base64}"
                    },
                    {
                        "type": "text",
                        "text": "Hãy phân tích kỹ sắc thái biểu cảm, tâm trạng của khách hàng trong đoạn âm thanh này. Cho biết họ đang hài lòng, bình thường, hay giận dữ và đưa ra giải thích lý do ngắn gọn."
                    }
                ]
            }
        ],
        "temperature": 0.2
    }
    
    response = requests.post(API_URL, json=payload)
    return response.json()['choices'][0]['message']['content']

# Thực thi thử nghiệm hệ thống
if __name__ == "__main__":
    audio_path = "customer_call_01.wav"
    print("--- Đang phân tích luồng dữ liệu khách hàng ---")
    result = analyze_sentiment(audio_path)
    print("Kết quả từ hệ thống:", result)
---

Các giải pháp tối ưu hóa vận hành cho doanh nghiệp

Để đưa hệ thống vào môi trường sản xuất (Production) phục vụ hàng ngàn cuộc gọi đồng thời, doanh nghiệp cần chú ý hai yếu tố then chốt:

  1. Áp dụng mô hình lượng tử hóa (Quantization): Nếu tài nguyên GPU của VPS hạn chế (ví dụ chỉ có 16GB VRAM), hãy chuyển sang sử dụng phiên bản Qwen2.5-Audio-7B-Instruct-AWQ hoặc sử dụng cờ lượng tử hóa trực tiếp trên vLLM để giảm dung lượng RAM tiêu thụ xuống còn một nửa mà tốc độ xử lý tăng đáng kể.
  2. Quản lý tiến trình bằng PM2 hoặc Systemd: Đảm bảo script khởi chạy API server luôn hoạt động liên tục, tự động khởi động lại khi gặp sự cố sập nguồn hoặc tràn bộ nhớ bằng cách đóng gói câu lệnh vào dịch vụ hệ thống của Linux.

Tóm lại, việc tự chủ hạ tầng phân tích ý kiến khách hàng bằng Qwen2.5-Audio trên VPS không chỉ mang lại sự an toàn tuyệt đối về bảo mật thông tin cuộc gọi mà còn giúp doanh nghiệp linh hoạt tùy chỉnh, tối ưu chi phí vận hành lâu dài cho hệ thống tổng đài thông minh AI Call Center.

Xây dựng hệ thống phân tích ý kiến khách hàng (Sentiment Analysis) thời gian thực bằng cách host Qwen2.5-Audio trên VPS | DPTCloud